← 포트폴리오로

SK텔레콤 · 2022.05 – 2023.12

큐피드 유사 질문 답변 추천

역할 · 모델 개발, 추천·평가 파이프라인 구축

16→31%AI 자동 답변율중복 질문 기준, 2022.08.01 → 2022.08.21
38→57%긍정 피드백AI 답변에 대한 "도움이 됐어요" 비율

01배경 및 목표

  • 큐피드는 위치를 기반으로 사용자끼리 질문하고 답하는 커뮤니티 서비스입니다.
  • 비슷한 질문에 이미 달린 답변을 찾아 주는 AI 기능으로 사용자 편의를 높이고자 했습니다.

02핵심 과제

  • C1 주제·지역별 질문-답변 매칭 정확도
  • C2 주요 모델의 성능 평가 자동화

03기여 내용

콘텐츠 기반 추천 파이프라인 구축C1
  1. 분류·추출: 질문에서 위치와 카테고리 추출 (BERT 계열 분류·NER 모델)
  2. 필터: 위치, 카테고리, 불용어 기준으로 매칭 후보 필터링
  3. 변환: 장소 정보를 마스킹하고 임베딩 모델로 벡터 변환
  4. 검색: Elasticsearch에서 BM25 + 코사인 유사도로 유사 질문 후보 추출
  5. 재순위화: 질문 간 포함 관계와 질문-답변 정합성을 판단해 순위를 매기고 상위 N개 제공
추천 파이프라인에 쓰인 모델 개발C1
  1. 임베딩 모델: 유사한 문장이 가깝게 놓이도록 Siamese Network 방식으로 BERT 계열 모델 학습
  2. 계층형 다중 분류 모델: 계층 구조의 주제 분류 데이터를 만들고 BERT 계열 모델 학습
  3. NER 모델: 질문에서 장소·키워드를 추출하도록 BIO 태깅 방식으로 학습
모델 평가 파이프라인 구축C2
  1. 카테고리가 바뀐 데이터와 전체 중 N개 샘플을 외부 업체에 맡겨 정답(Ground Truth) 라벨링
  2. F1·Accuracy 기준으로 평가하고 예측 정확도가 낮은 데이터 추출
  3. 재학습 후 Golden Set 평가를 거쳐 배포 결정
신규 데이터 배치 처리C1
  1. 새로 올라온 질문-답변이 추천 후보에 반영되도록 Airflow 배치로 벡터 변환·저장과 Vector DB 재색인 자동화

04기술 스택

프레임워크 · 플랫폼
PyTorch, Transformers, Elasticsearch, Airflow
방법론
Siamese Network, Hierarchical Multi-class Classification, BIO NER

05성과

  • 중복 질문에 대한 AI 자동 답변율 16% → 31% (2022.08.01 → 2022.08.21)
  • AI 답변의 긍정 피드백("도움이 됐어요") 비율 38% → 57%

06참고 자료