Read It Back: Pretrained MLLMs Are Zero-Shot Reward Models for Text-to-Image Generation

발행일
출처
arXiv
논문 번호
608
분야
Computer Vision
arXiv 번호
2607.11886

SpectraReward는 사전학습된 MLLM을 학습 없이 이미지 생성 RL의 보상 모델로 활용하는 기법. 생성 이미지에서 원래 프롬프트를 복원하는 likelihood를 보상으로 사용한다. Self-SpectraReward로 자가 개선도 가능.

SpectraReward는 사전학습된 MLLM을 학습 추가 없이 이미지 생성 강화학습의 보상 모델로 전환하는 기법으로, 생성된 이미지에서 원본 프롬프트를 teacher-forced forward pass로 복원하는 평균 log-likelihood를 보상으로 사용한다. Self-SpectraReward는 통합 멀티모달 모델에서 정책의 이해 브랜치가 생성 브랜치의 보상으로 작동해 외부 모델 없이 자가 개선하는 프레임워크를 제공한다.

핵심 요약

  • MLLM의 image-conditioned prompt log-likelihood를 보상으로 사용하여 선호 라벨·파인튜닝 불필요
  • Self-SpectraReward: 통합 모델(UMM)의 이해 브랜치가 자체 생성 브랜치를 평가하는 폐루프 자가개선
  • 9개 MLLM 백본(4B~235B), 4개 모델 패밀리, 3개 RL 알고리즘, 2개 diffusion 모델로 대규모 검증
  • 더 큰 보상 MLLM이 항상 더 좋은 것은 아님; 보상-정책 정합이 보상 모델 크기보다 중요
  • Self-SpectraReward가 235B 외부 모델보다 우수한 성능을 보이며 정책-보상 정합의 중요성 입증
  • 5개 OOD 텍스트-이미지 벤치마크에서 기존 MLLM 파생 보상 방법들을 일관되게 능가

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)