SN-WER: Script-Normalized WER for Multi-Script Indic ASR Evaluation

발행일
출처
arXiv
논문 번호
303
분야
LLMs / NLP
arXiv 번호
2606.02548

단어 오류율(WER)은 자동 음성 인식(ASR)의 지배적 지표이지만, 참조와 가설이 동일한 단어를 다른 문자 체계로 표기할 경우 오류를 과대평가할 수 있다.

일반 단어 오류율은 같은 단어를 서로 다른 문자로 쓴 경우도 오류로 세어 다언어 음성 인식 성능 차이를 부풀릴 수 있다. SN-WER은 정답과 모델 출력을 언어별 기준 문자로 음역한 뒤 오류율을 계산하는 학습 없는 평가 지표다. 다섯 인도 언어, 두 데이터셋, 세 음성 인식 모델에서 깨끗한 FLEURS 자료의 과장된 모델 차이를 최대 12% 줄였다. 인위적인 로마자 표기 실험에서는 오류율 부풀림을 67% 완화하면서 실제 단어 치환 오류에 대한 민감도는 거의 그대로 유지했다. 이 지표는 검색과 색인처럼 문자 모양보다 단어가 중요한 용도에서 WER·CER과 함께 써야 하며, 사용자에게 보이는 글자 자체가 중요한 경우 기존 지표를 대신해서는 안 된다.

핵심 요약

  • 이 논문은 WER을 계산하기 전에 참조 텍스트와 가설 텍스트를 모두 언어별 표준 문자 체계로 음역하는, 학습이 필요 없고 평가 전용인 채점 방법 Script-Normalized WER(SN-WER)을 제안한다.
  • 통제된 스트레스 테스트에서 인위적 로마자화로 유발된 WER 부풀림이 67% 완화되었으며, 어휘 치환 통제 실험에서는 의미 오류에 대한 민감도가 거의 동일하게 유지되어 Delta SN-WER 대 Delta WER이 약 1.09로 나타났다.
  • SN-WER은 음역기 선택과 정규화 변경에 견고하며, 평가한 인도어 환경에서 토큰 충돌률이 0.1% 미만으로 낮게 나타났다.

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)