Representation Forcing for Bottleneck-Free Unified Multimodal Models

발행일
출처
arXiv
논문 번호
276
분야
Computer Vision
arXiv 번호
2605.31604

병목 없는 통합 멀티모달 모델을 위한 Representation Forcing이다.

통합 멀티모달 모델(UMM)은 인식과 생성을 단일 모델에서 처리하는 것을 목표로 한다. 그러나 기존 UMM은 여전히 이미지 생성을 위해 동결된, 별도로 사전학습된 VAE에 의존하며 이는 구조적 병목을 초래한다. 이를 단순히 제거하면 모델이 고수준 구조와 저수준 세부를 모두 원시 픽셀로부터 학습해야 하므로 품질 격차가 생긴다. 이 논문은 표현 예측을 모델의 고유 기능으로 만들어 이 격차를 메우는 기법인 Representation Forcing(RF)을 제안한다. 구체적으로 RF는 디코더가 픽셀에 앞서 시각적 표현을 중간 토큰으로 자기회귀적으로 예측하도록 강제하며, 이 토큰들은 이후 동일한 백본 내에서 픽셀 확산을 안내하기 위해 컨텍스트에 유지된다. 표현을 인식의 출력에서 생성의 타깃으로 전환함으로써, RF는 외부 생성 잠재 공간의 필요성을 제거한다. RF는 이해와 생성 모두에 이롭다. 이미지 생성에서 RF를 적용한 픽셀 공간 모델은 최신 VAE 기반 통합 모델에 필적한다. 이미지 이해에서 픽셀 공간 RF는 일반적으로 그 VAE 기반 변형을 능가한다. 종합하면, 이러한 결과는 종단간의 병목 없는 UMM을 향한 효과적인 한 걸음을 제시한다.

핵심 요약

  • 이 논문은 표현 예측을 모델의 고유 기능으로 만들어 이 격차를 메우는 기법인 Representation Forcing(RF)을 제안한다.
  • 이를 단순히 제거하면 모델이 고수준 구조와 저수준 세부를 모두 원시 픽셀로부터 학습해야 하므로 품질 격차가 생긴다.
  • 구체적으로 RF는 디코더가 픽셀에 앞서 시각적 표현을 중간 토큰으로 자기회귀적으로 예측하도록 강제하며, 이 토큰들은 이후 동일한 백본 내에서 픽셀 확산을 안내하기 위해 컨텍스트에 유지된다.

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)