KVAE: Family of Tokenizers for Multimodal Generative Models

발행일
출처
arXiv
논문 번호
843
분야
Computer Vision
arXiv 번호
2608.05798

오디오·이미지·비디오용 통합 토크나이저(KVAE)를 만들어, 기존 최고 수준 오픈소스 토크나이저와 동급이거나 더 나은 성능을 달성했다.

이 논문은 한마디로 텍스트 조건부 생성(예: 텍스트를 받아 비디오·오디오를 만드는 모델)에 쓰는 '압축기'를 여러 영역(영상, 이미지, 소리)에서 통합적으로 개선한 연구다. 핵심은 토크나이저(데이터를 압축된 표현으로 바꾸는 부품)의 품질이 생성 품질을 좌우한다는 점을 보여주고, KVAE라는 새 토크나이저 시리즈를 제안한다. 비디오·이미지·오디오 모두에서 기존 최고 수준 오픈소스(Wan-2.2, FLUX.2, MMAudio 등)와 동급이거나 더 나은 결과를 얻었고, 특히 오디오는 더 적은 파라미터(166.9M)로 더 좋은 품질을 달성했다.

핵심 요약

  • 비디오는 두 압축 비율, 이미지는 여덟 배 압축, 오디오는 48kHz·50Hz 잠재 표현을 쓰는 KVAE 토크나이저 묶음을 설계했다.
  • 영상과 이미지 복원·생성 평가에서 Wan-2.2와 HunyuanVideo-1.5, FLUX.2 등 공개 토크나이저와 같거나 더 나은 결과를 보고했다.
  • 오디오 모델은 1억6690만 매개변수로 더 큰 비교 모델들보다 작으면서 사람의 나란히 듣기 평가에서 여러 영역의 선호 우위를 보였다.
  • 복원 품질만이 아니라 생성 모델이 배우기 쉬운 잠재 공간인지를 뜻하는 확산 가능성을 설계 기준으로 다뤘고 코드와 모델을 MIT 허가로 공개했다.
  • 오디오 FAD 평가기는 내부적으로 16~32kHz만 처리해 16kHz 위의 전대역 품질을 재지 못하고, 모델 기반 미감 점수도 평가기의 편향에서 자유롭지 않다.

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)