Read It Back: Pretrained MLLMs Are Zero-Shot Reward Models for Text-to-Image Generation
- 발행일
- 출처
- arXiv
- 논문 번호
- 608
- 분야
- Computer Vision
- arXiv 번호
- 2607.11886
SpectraReward는 사전학습된 MLLM을 학습 없이 이미지 생성 RL의 보상 모델로 활용하는 기법. 생성 이미지에서 원래 프롬프트를 복원하는 likelihood를 보상으로 사용한다. Self-SpectraReward로 자가 개선도 가능.
SpectraReward는 사전학습된 MLLM을 학습 추가 없이 이미지 생성 강화학습의 보상 모델로 전환하는 기법으로, 생성된 이미지에서 원본 프롬프트를 teacher-forced forward pass로 복원하는 평균 log-likelihood를 보상으로 사용한다. Self-SpectraReward는 통합 멀티모달 모델에서 정책의 이해 브랜치가 생성 브랜치의 보상으로 작동해 외부 모델 없이 자가 개선하는 프레임워크를 제공한다.
핵심 요약
- MLLM의 image-conditioned prompt log-likelihood를 보상으로 사용하여 선호 라벨·파인튜닝 불필요
- Self-SpectraReward: 통합 모델(UMM)의 이해 브랜치가 자체 생성 브랜치를 평가하는 폐루프 자가개선
- 9개 MLLM 백본(4B~235B), 4개 모델 패밀리, 3개 RL 알고리즘, 2개 diffusion 모델로 대규모 검증
- 더 큰 보상 MLLM이 항상 더 좋은 것은 아님; 보상-정책 정합이 보상 모델 크기보다 중요
- Self-SpectraReward가 235B 외부 모델보다 우수한 성능을 보이며 정책-보상 정합의 중요성 입증
- 5개 OOD 텍스트-이미지 벤치마크에서 기존 MLLM 파생 보상 방법들을 일관되게 능가
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.