Scalable Keyword Spotting via Modular Network Expansion

발행일
출처
arXiv
논문 번호
697
분야
Research
arXiv 번호
2607.19918

임베디드 기기 키워드 인식 모델에서 기존 키워드를 망가뜨리지 않고 새 키워드를 추가하는 모듈식 확장 방법을 제안한 논문이다.

이 논문은 한마디로 소형 음성 인식 모델에 새 키워드를 추가할 때 기존 인식을 완벽히 보존하는 경량 확장 방법을 제안한 것이다. 베이스 네트워크를 완전히 얼리고 10K 매개변수 이하의 확장 브랜치만 추가해서 학습한다. 새 키워드 오류율(FRR)을 6.46%에서 4.37%로 낮추면서, 기존 키워드의 로짓과 임계값은 100% 동일하게 유지된다.

핵심 요약

  • 베이스 네트워크 전체(배치 정규화 통계 포함)를 얼려서 기존 키워드 성능이 픽셀 단위로 보존된다.
  • 10K 매개변수(베이스 150K의 6.7%) 추가만으로 새 키워드 FRR을 6.46%에서 4.37%로 개선했다.
  • Adapter나 LoRA보다 적은 MACs(16.34M vs 18.45M/20.52M)로 더 좋은 성능을 달성했다.
  • 코어 우선 판정 규칙으로 기존 키워드 임계값 동작이 정확히 유지된다.
  • 기존 학습 데이터 접근 없이 새 키워드 데이터만으로 확장이 가능하다.

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)