Unified Multimodal Autoregressive Modeling with Shared Context-Visual Tokenizer is Key to Unification
- 발행일
- 출처
- arXiv
- 논문 번호
- 440
- 분야
- Computer Vision
- arXiv 번호
- 2606.18249
단일 bitwise visual tokenizer로 이해와 생성을 통합한 UniAR 프레임워크로, SOTA 이미지 생성 + 경쟁력 있는 멀티모달 이해를 동시에 달성한다.
UniAR은 기존 통합 멀티모달 모델들이 두 개의 다른 visual tokenizer를 쓰던 한계를 극복하기 위해, 단일 lookup-free bitwise visual tokenizer를 제안한다. Multi-level feature fusion으로 고수준 의미와 저수준 디테일을 동시에 보존하며, parallel bitwise prediction으로 시퀀스 길이를 대폭 줄여 32× 압축률을 달성한다. 사전학습→SFT→RL 3단계 훈련 후, 이미지 생성(text rendering, instruction following)에서 SOTA를 달성하면서도 멀티모달 이해 벤치마크에서 경쟁력을 유지한다.
핵심 요약
- 단일 bitwise visual tokenizer로 이해와 생성의 representation space를 처음으로 진정하게 통합
- Multi-level feature fusion: 얕은 층(저수준 디테일)과 깊은 층(고수준 의미) 동시 활용
- Lookup-free BSQ 양자화로 2^64 코드북 효과—명시적 코드북 없이 어휘 크기 지수적 확장
- Parallel bitwise prediction으로 32× 시각적 압축률, 1024×1024 이미지에 토큰 256개만 예측
- 이미지 생성(GenEval, ImgEdit) SOTA 달성 + 멀티모odal 이해 벤치마크에서 경쟁력 유지
- 총 ~33k GPU hours로 효율적 훈련—시각 토큰화기 400M, 디코더 2.5B로 경량 설계
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.