Chimera: Designing and Chinchilla-Scaling Hybrid Visual Diffusion Transformers

발행일
출처
arXiv
논문 번호
775
분야
Computer Vision
arXiv 번호
2607.28611

텍스트·이미지·비디오를 하나의 스트림으로 처리하는 하이브리드 확산 트랜스포머. 7.3배 연산 효율 향상.

이 논문은 한마디로 고해상도 이미지와 긴 비디오를 효율적으로 생성하기 위해 어텐션 구조를 하이브리드로 설계한 새로운 비주얼 확산 모델이라는 이야기다. 선형 복잡도의 KDA 어텐션, 주기적 MLA 글로벌 어텐션, 모달리티 인식 단합성을 결합했고, MoE로 용량을 늘렸다. HeteroP라는 스케일링 방법으로 59M~19.3B까지 일관된 하이퍼파라미터를 유지하며 Chinchilla 스케일링 법칙을 도출했다. 11B 모델이 2B 활성 파라미터로 7.3배 연산 효율을 달성했다.

핵심 요약

  • KDA(선형 복잯도) + MLA(글로벌 어텐션) + 단합성(국소 패턴)을 결합한 하이브리드 확산 백본을 설계했다.
  • 위치 임베딩 없이 래스터 순서만으로 텍스트·이미지·비디오를 단일 스트림으로 처리한다.
  • HeteroP: 텐서별 기능적 팬인을 기반으로 스케일 간 하이퍼파라미터를 자동 전송한다.
  • 11B 총 파라미터(2B 활성)로 기존 Wan-2.1(2B) 대비 7.3배 연산 효율을 달성했다. 학습은 약 600 H100일 소요.
  • 5초 클립으로 학습하고 30초 비디오를 제로샷으로 생성(길이 외삽), FID 6.5% 저하만으로 6배 확장했다.

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)