Interspeech 2022 · 1저자 · 2022.09
K-Wav2vec 2.0: 자소·음절 Joint Decoding 기반 한국어 음성인식
01배경 및 목표
- Wav2vec 2.0의 여러 요소를 한국어에 맞게 탐색·최적화한 K-Wav2vec 2.0을 제안한 연구입니다.
- 한국어는 음절이 자소의 조합이므로, 두 단위를 함께 활용하면 인식 정확도와 어휘 커버리지를 함께 높일 수 있습니다.
02기여 내용
자소·음절 Multi-task 구조와 Joint Decoder
- 사전학습 Wav2vec 2.0 위에 자소 출력과 음절 출력을 함께 학습하는 Multi-task 구조 설계
- 두 출력의 Beam Search 점수를 함께 쓰는 Joint Decoding으로 음절·자소 관계를 반영
추가 사전학습과 실험
- 영어 비표지 데이터로 사전학습된 모델을 한국어 비표지 데이터로 추가 사전학습
- Fairseq·ESPnet으로 실험 환경을 구축하고 KsponSpeech·ClovaCall에서 평가
03기술 스택
- 프레임워크 · 플랫폼
- PyTorch, Fairseq, ESPnet
- 방법론
- Self-supervised Learning, Multi-task Learning, Joint Decoding
04성과
- Interspeech 2022 게재 (1저자), 코드 공개
- NAVER CLOVA AI Tech Talk 발표 (2021.11)