Scalable Keyword Spotting via Modular Network Expansion
- 발행일
- 출처
- arXiv
- 논문 번호
- 697
- 분야
- Research
- arXiv 번호
- 2607.19918
임베디드 기기 키워드 인식 모델에서 기존 키워드를 망가뜨리지 않고 새 키워드를 추가하는 모듈식 확장 방법을 제안한 논문이다.
이 논문은 한마디로 소형 음성 인식 모델에 새 키워드를 추가할 때 기존 인식을 완벽히 보존하는 경량 확장 방법을 제안한 것이다. 베이스 네트워크를 완전히 얼리고 10K 매개변수 이하의 확장 브랜치만 추가해서 학습한다. 새 키워드 오류율(FRR)을 6.46%에서 4.37%로 낮추면서, 기존 키워드의 로짓과 임계값은 100% 동일하게 유지된다.
핵심 요약
- 베이스 네트워크 전체(배치 정규화 통계 포함)를 얼려서 기존 키워드 성능이 픽셀 단위로 보존된다.
- 10K 매개변수(베이스 150K의 6.7%) 추가만으로 새 키워드 FRR을 6.46%에서 4.37%로 개선했다.
- Adapter나 LoRA보다 적은 MACs(16.34M vs 18.45M/20.52M)로 더 좋은 성능을 달성했다.
- 코어 우선 판정 규칙으로 기존 키워드 임계값 동작이 정확히 유지된다.
- 기존 학습 데이터 접근 없이 새 키워드 데이터만으로 확장이 가능하다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.