KVAE: Family of Tokenizers for Multimodal Generative Models
- 발행일
- 출처
- arXiv
- 논문 번호
- 843
- 분야
- Computer Vision
- arXiv 번호
- 2608.05798
오디오·이미지·비디오용 통합 토크나이저(KVAE)를 만들어, 기존 최고 수준 오픈소스 토크나이저와 동급이거나 더 나은 성능을 달성했다.
이 논문은 한마디로 텍스트 조건부 생성(예: 텍스트를 받아 비디오·오디오를 만드는 모델)에 쓰는 '압축기'를 여러 영역(영상, 이미지, 소리)에서 통합적으로 개선한 연구다. 핵심은 토크나이저(데이터를 압축된 표현으로 바꾸는 부품)의 품질이 생성 품질을 좌우한다는 점을 보여주고, KVAE라는 새 토크나이저 시리즈를 제안한다. 비디오·이미지·오디오 모두에서 기존 최고 수준 오픈소스(Wan-2.2, FLUX.2, MMAudio 등)와 동급이거나 더 나은 결과를 얻었고, 특히 오디오는 더 적은 파라미터(166.9M)로 더 좋은 품질을 달성했다.
핵심 요약
- 비디오는 두 압축 비율, 이미지는 여덟 배 압축, 오디오는 48kHz·50Hz 잠재 표현을 쓰는 KVAE 토크나이저 묶음을 설계했다.
- 영상과 이미지 복원·생성 평가에서 Wan-2.2와 HunyuanVideo-1.5, FLUX.2 등 공개 토크나이저와 같거나 더 나은 결과를 보고했다.
- 오디오 모델은 1억6690만 매개변수로 더 큰 비교 모델들보다 작으면서 사람의 나란히 듣기 평가에서 여러 영역의 선호 우위를 보였다.
- 복원 품질만이 아니라 생성 모델이 배우기 쉬운 잠재 공간인지를 뜻하는 확산 가능성을 설계 기준으로 다뤘고 코드와 모델을 MIT 허가로 공개했다.
- 오디오 FAD 평가기는 내부적으로 16~32kHz만 처리해 16kHz 위의 전대역 품질을 재지 못하고, 모델 기반 미감 점수도 평가기의 편향에서 자유롭지 않다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.