Learning Native Reflection in Unified Models with Interleaved Reinforcement Learning

발행일
출처
arXiv
논문 번호
1135
분야
Computer Vision
arXiv 번호
2609.35767

이미지를 보고 만들 수 있는 통합 멀티모달 모델에게 '내 그림을 스스로 진단하고 고치는 반복'을 강화학습으로 통째로 훈련시킨 논문이다.

이 논문은 한마디로 통합 멀티모달 모델(UMM)의 자기 반성 루프를 궤적 전체에 강화학습을 걸어 학습시켰다. 그림을 그린 뒤 스스로 문제를 진단하고 수정하고, 결과를 다시 보는 여러 라운드 전체를 하나의 궤적으로 보고 그룹 비교 기반 강화학습(GRPO)으로 텍스트 진단과 이미지 수정 양쪽을 함께 업데이트한다. 형제 궤적이 같은 초기 그림에서 출발해 반성 전략끼리 비교되고, 라운드별 크레딧 분해 없이 궤적 단위 하나로 학습한다. 그 결과 GenEval에서 SFT 대비 +12.05점, 학습에 안 쓴 WISE에서도 +10.97점이 올랐고 추론 시 검증기가 필요 없다.

핵심 요약

  • 진단 텍스트와 이미지 수정이 같은 모델 안에서 일어나는 '자기 반성 루프' 전체를 RL로 학습시켰다.
  • 같은 초기 그림에서 시작하는 형제 궤적끼리 비교하는 그룹 상대 우위로, 운이 좋은 첫 그림이 아니라 반성 전략의 차이를 학습하게 했다.
  • 궤적 하나에 상금 신호 하나를 써서 라운드별 크레딧 분해의 조합 폭발을 피했다.
  • GenEval +12.05, WISE +10.97, OneIG-Bench +3.48 등 학습에 안 쓴 벤치마크에서도 향상이 옮겨갔다.
  • SFT도 78%의 실패 그림에 대해 옳은 수정을 '가지고' 있었으나 한 번의 궤적으로는 20.59%만 고쳤고, RL 후 64.94%까지 올랐다.

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)