← 포트폴리오로

arXiv 2021 · 2저자 · 2021.07

Back-Translated Task Adaptive Pretraining

역할 · 2저자 · 데이터 증강 구현, 실험, 논문 작성

01배경 및 목표

  • 적은 데이터로 BERT 계열 모델의 성능을 높이기 위해, 번역기를 활용한 데이터 증강과 Task-Adaptive Pre-training을 결합한 연구입니다.

02기여 내용

데이터 증강과 실험
  1. 원문을 다른 언어로 번역한 뒤 원래 언어로 되돌려 새 문장을 만드는 역번역 증강 구현 (Nucleus Sampling으로 다양성 확보)
  2. EDA·TF-IDF·Embedding Swapping 등 여러 증강 기법 구현과 비교 실험
  3. 데이터 증강 세미나 영상 제작과 논문 작성

03기술 스택

프레임워크 · 플랫폼
PyTorch, Fairseq, Hydra
방법론
Back-Translation, Task-Adaptive Pre-training, Data Augmentation

04성과

  • arXiv 프리프린트 공개 (2021, 2저자)

05참고 자료