On-Policy Self-Distillation for Multi-Dialect ASR: Mastering Dialects, Retaining Mandarin

발행일
출처
arXiv
논문 번호
889
분야
Research
arXiv 번호
2608.11898

이 논문은 중국어 방언 인식률을 높이면서 표준 중국어 성능을 유지하기 위해, 학생 모델이 실제로 생성한 경로에서 고정된 교사 모델의 안내를 받는 음성 인식 학습법을 제안했다.

이 논문은 한마디로 방언 음성 인식을 개선할 때 표준 중국어를 잊는 문제를 줄이는 방법을 제안한다. Qwen3-ASR-1.7B에 연속 사전 학습, 방언 지도 학습, 온폴리시 자가증류를 차례로 적용한다. 마지막 단계에서 학생 모델은 자신이 생성한 앞부분을 입력으로 쓰고, 고정된 교사 모델은 정답 문장을 추가로 참고해 다음 출력 후보의 확률을 알려준다. 이 방식은 학습 때 정답 앞부분만 보던 모델이 실제 사용 때 자기 출력에 의존해야 하는 차이를 줄인다.

핵심 요약

  • 전체 학습 자료는 표준 중국어와 방언 약 10만 시간이며, 마지막 자가증류에는 오류율이 높은 방언 음성 약 5,000시간을 사용했다.
  • 학생은 자신이 생성한 앞부분을 입력으로 쓰고, 교사는 정답 문장을 추가로 참고해 다음 출력 후보마다 확률을 제공한다. 실제 배포할 때는 학생 모델만 사용한다.
  • 평가는 표준 중국어 공개 자료 8개, 방언 공개 자료 5개와 내부 방언 자료 18개에서 진행됐다.
  • 기본 모델과 비교해 평균 문자 오류율은 표준 중국어 3.46%에서 3.27%, 공개 방언 15.37%에서 12.79%, 내부 방언 21.01%에서 12.42%로 줄었다.
  • 같은 자료로 일반 지도 학습을 계속하면 표준 중국어 오류율이 4.43%로 높아졌지만 자가증류는 3.27%였고, 전체 평균 오류율도 10.74%보다 낮은 10.12%였다.

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)