AuK Technical Report: An Open-Source Foundational Model for Speech Generation and Editing
- 발행일
- 출처
- arXiv
- 논문 번호
- 1076
- 분야
- LLMs / NLP
- arXiv 번호
- 2609.08936
AuK는 자연어 지시와 오디오 문맥으로 음성 생성부터 내용과 음향 편집까지 수행하는 통합 모델이다.
AuK는 새로운 음성을 만드는 작업과 기존 음성의 내용이나 소리를 바꾸는 작업을 하나의 입력 방식으로 통합한다. 사용자는 자연어로 원하는 변화를 설명하고 필요하면 참고 오디오를 함께 제공한다. 모델은 언어 기반 의미 정보와 압축된 오디오 표현을 결합하며 생성과 편집을 공동 학습한 뒤 사람의 선호와 보상 신호로 보완된다. 경량화한 AuK-Flash는 네 단계 추론을 사용하며 논문이 비교한 동일 조건에서 전체 모델보다 실제 실행 시간이 4.5배 빨랐다. 다만 복합적인 지시를 정확히 이해하는 능력은 더 개선해야 하며 명시적인 작업 분류와 지시문 보완의 도움을 여전히 받는다.
핵심 요약
- 자연어 지시와 오디오 문맥을 공통 입력으로 사용해 음성 생성, 내용 편집, 복원과 분리, 발화 특성 및 음향 편집을 다룬다.
- 멀티모달 언어 모델의 의미 조건과 오디오 VAE의 음향 조건을 결합하고 생성 중심 준비 학습 이후 생성과 편집을 공동 학습한다.
- 생성과 편집에 서로 다른 후속 학습 신호를 적용하며 AuK-Flash는 네 단계 추론으로 비교 조건에서 4.5배의 실행 속도 향상을 보고했다.
- 서로 다른 오디오 작업을 통합된 인터페이스로 다룰 수 있어 음성 제작과 편집 도구를 구성하는 기반으로 활용할 수 있다.
- 복합 지시의 이해와 새로운 지시 조합으로의 일반화는 미해결 과제이며 현재 시스템은 작업 분류와 지시문 보완에 일부 의존한다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.