UniDDT: Unifying Multimodal Understanding and Generation with Decoupled Diffusion Transformer
- 발행일
- 출처
- arXiv
- 논문 번호
- 434
- 분야
- Computer Vision
- arXiv 번호
- 2606.16255
멀티모달 이해와 생성을 단일 프레임워크로 통합하는 UniDDT를 제안한다. Noisy ViT encoder + LLM + 분리된 diffusion decoder 구조로 GenEval 0.87, MME 1699.5를 달성한다.
UniDDT는 시각 이해와 생성의 충돌을 해결하기 위해 Noisy ViT encoder와 LLM backbone으로 semantic encoding을 통일하고, 별도의 diffusion decoder로 생성을 분리한다. Latent space를 unified visual space로 채택해 확장성과 표현력을 균형 있게 확보한다. 동일 image-text pair에서 이해-생성 dual data를 구성해 두 작업 간 시너지를 극대화한다.
핵심 요약
- Noisy ViT encoder가 이해(깨끗한 입력)와 생성(noisy 입력) 모두에 사용되는 unified semantic encoder 역할 수행
- 별도의 diffusion decoder로 text decoding과 visual generation을 분리하여 modality 간섭 최소화
- 동일 image-text pair에서 dual data structure를 구성하여 이해-생성 duality 활용
- GenEval 0.87, DPG 86.9, MME 1699.5, SEEDbench 76.5 달성으로 이해와 생성 모두에서 경쟁력 입증
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.