Plan AI for IT·SaaS
100개 이상 소스를 자동 수집하는 트렌드 큐레이션 커뮤니티, 체류 시간 60% 증가
뉴스·SNS·커뮤니티 등 100개 이상 소스에서 트렌드 데이터를 자동 수집하고 카테고리별로 큐레이션하는 웹 커뮤니티를 구축해 사용자 체류 시간을 60% 이상 늘렸습니다.
- 01 · Challenge문제 정의
- 02 · Approach접근 설계
- 03 · Build구축·검증
- 04 · Results성과 측정
핵심 성과
문제
인터넷의 핫 토픽과 트렌드를 자동 수집해 사용자에게 큐레이션하는 커뮤니티 서비스를 기획한 IT 기업. 기존에는 에디터가 수작업으로 콘텐츠를 선별해 게시하는 방식이라 속도와 커버리지에 한계가 있었다. 뉴스 사이트, SNS, 온라인 커뮤니티 등 이기종 소스의 HTML 구조가 수시로 바뀌어 크롤러 안정성 확보가 최우선 관건이었고, 일부 소스는 봇 접근을 제한해 합법적이고 안정적인 수집 방법을 강구해야 했다. 하루 수천 건씩 수집되는 콘텐츠에서 중복을 제거하고 카테고리별로 자동 분류하는 정교한 로직, 수집부터 게시까지 지연을 최소화하는 실시간 처리 파이프라인, 저품질·부적절 콘텐츠를 자동 필터링하는 품질 관리 체계도 함께 구축해야 했다. 트렌드 소비를 넘어 사용자들이 의견을 나누는 커뮤니티 공간도 함께 제공하고자 했다.
접근
소스별 어댑터 패턴으로 크롤러를 모듈화해 특정 소스 구조가 변경되어도 해당 어댑터만 수정하면 되는 유연한 아키텍처를 설계했다. 자연어 처리 기반 키워드 추출과 문서 유사도 분석으로 중복 콘텐츠를 자동 필터링하는 파이프라인을 구축했고, 머신러닝 텍스트 분류 모델을 학습시켜 수집 콘텐츠를 카테고리별로 자동 배분했다. 크롤러 상태를 모니터링하는 헬스체크 시스템으로 수집 오류 시 즉시 알림이 발송되게 했으며, 수집 데이터의 품질 점수를 자동 산출해 기준 이하 콘텐츠는 노출에서 제외하는 품질 관리 로직을 적용했다. 실시간 트렌드 피드, 카테고리별 큐레이션, 인기 키워드 랭킹, 시간대별·주제별 급상승 키워드 시각화를 갖춘 웹 커뮤니티로 구축하고, 사용자 투표·댓글과 개인별 관심 카테고리 맞춤 피드, 관리자용 크롤러 운영 대시보드까지 구현했다.
진행 과정
- 01소스별 어댑터 패턴 크롤러 아키텍처 설계
- 02자연어 처리 기반 중복 필터링 파이프라인 구축
- 03머신러닝 텍스트 분류 모델 학습·적용
- 04품질 점수 산출과 저품질 콘텐츠 자동 제외 로직 구현
- 05트렌드 피드·키워드 랭킹·커뮤니티 기능 개발
- 06헬스체크 모니터링과 관리자 대시보드 구축 후 론칭
결과
- 100개 이상 소스의 트렌드 데이터 자동 수집·분류 체계 확보
- 론칭 이후 사용자 체류 시간 60% 이상 증가
- 사용자 투표·댓글 등 참여형 기능의 활발한 이용
- 에디터의 수작업 큐레이션이 대폭 줄어 콘텐츠 기획 등 고부가가치 업무에 집중
- 신규 소스 추가에 빠르게 대응할 수 있는 확장성 확보
인계물
소스별 크롤링 어댑터, 중복 제거·자동 분류 파이프라인, 실시간 트렌드 피드와 키워드 랭킹, 개인화 피드, 커뮤니티 기능, 관리자용 크롤러 운영 대시보드를 갖춘 웹 플랫폼.
트렌드 데이터가 자동으로 정리되어 올라오니 사용자 체류 시간이 크게 늘었습니다.
서비스기획자, 국내 IT 기업
기술 스택
- 크롤링 어댑터
- 자연어 처리
- 머신러닝 분류 모델
사례 정보
| 업종 | IT·SaaS |
|---|---|
| 부서 | 서비스기획팀 |
| 기간 | 3개월 |
| 구축 범위 | 데이터·크롤링 |
| 상태 | 구축 완료 |
실제 사례 기반이며 사명은 마스킹 처리했습니다.