RepFusion: Leveraging Multimodal Priors for Denoising in Representation Space

발행일
출처
arXiv
논문 번호
417
분야
Computer Vision
arXiv 번호
2606.14700

사전학습된 MLLM을 noisy representation encoder로 재활용하여 T2I diffusion 모델의 조건부 신호로 활용하는 새로운 아키텍처다.

RepFusion은 Representation Autoencoder(RAE)의 semantic latent 공간이 MLLM과 호환된다는 점을 이용해, 동결된 MLLM이 noisy RAE latent를 입력받아 DiT를 조건화하는 구조를 제안한다. 유사 추론 예산에서 8B DiT를 새로 학습하는 TextEmbed나 8B Transfusion보다 1.3B DiT만 미세조정한 RepFusion이 더 뛰어난 성능을 보이며, MLLM 사전학습 사전지식이 노이즈 제거에 강력한 prior로 작용함을 입증한다. GenEval 0.70으로 VAE 대비 30% 향상을 달성했다.

핵심 요약

  • RAE latent 공간에서 MLLM의 MLP projector를 noisy 입력으로 확장, 동결 LLM 백본으로 DiT 조건화
  • 유사 추론 FLOPs에서 TextEmbed(8B DiT)·Transfusion(8B joint) 대비 RepFusion(1.3B DiT)이 우수
  • VAE→RAE 전환 시 RepFusion이 +30% 절대 향상(0.54→0.70), TextEmbed(+21%), Transfusion(+11%)보다 큰 폭
  • MLLM을 동결할 때가 미세조정할 때보다 더 좋음 → 사전학습 prior 보존이 중요
  • Test-time compute를 단계별 MLLM 재조건화에 효율적으로 활용 가능
  • RepFusion-SFT는 GenEval 0.87, GenEval2 34.9, DPG 85.11로 SOTA 수준 달성

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)