← 포트폴리오로

Interspeech 2022 · 1저자 · 2022.09

K-Wav2vec 2.0: 자소·음절 Joint Decoding 기반 한국어 음성인식

역할 · 1저자 · 모델 설계, 실험, 논문 작성

01배경 및 목표

  • Wav2vec 2.0의 여러 요소를 한국어에 맞게 탐색·최적화한 K-Wav2vec 2.0을 제안한 연구입니다.
  • 한국어는 음절이 자소의 조합이므로, 두 단위를 함께 활용하면 인식 정확도와 어휘 커버리지를 함께 높일 수 있습니다.

02기여 내용

자소·음절 Multi-task 구조와 Joint Decoder
  1. 사전학습 Wav2vec 2.0 위에 자소 출력과 음절 출력을 함께 학습하는 Multi-task 구조 설계
  2. 두 출력의 Beam Search 점수를 함께 쓰는 Joint Decoding으로 음절·자소 관계를 반영
추가 사전학습과 실험
  1. 영어 비표지 데이터로 사전학습된 모델을 한국어 비표지 데이터로 추가 사전학습
  2. Fairseq·ESPnet으로 실험 환경을 구축하고 KsponSpeech·ClovaCall에서 평가

03기술 스택

프레임워크 · 플랫폼
PyTorch, Fairseq, ESPnet
방법론
Self-supervised Learning, Multi-task Learning, Joint Decoding

04성과

  • Interspeech 2022 게재 (1저자), 코드 공개
  • NAVER CLOVA AI Tech Talk 발표 (2021.11)

05참고 자료