arXiv 2021 · 2저자 · 2021.07
Back-Translated Task Adaptive Pretraining
01배경 및 목표
- 적은 데이터로 BERT 계열 모델의 성능을 높이기 위해, 번역기를 활용한 데이터 증강과 Task-Adaptive Pre-training을 결합한 연구입니다.
02기여 내용
데이터 증강과 실험
- 원문을 다른 언어로 번역한 뒤 원래 언어로 되돌려 새 문장을 만드는 역번역 증강 구현 (Nucleus Sampling으로 다양성 확보)
- EDA·TF-IDF·Embedding Swapping 등 여러 증강 기법 구현과 비교 실험
- 데이터 증강 세미나 영상 제작과 논문 작성
03기술 스택
- 프레임워크 · 플랫폼
- PyTorch, Fairseq, Hydra
- 방법론
- Back-Translation, Task-Adaptive Pre-training, Data Augmentation
04성과
- arXiv 프리프린트 공개 (2021, 2저자)