MeanFlowNFT: Bringing Forward-Process RL to Average-Velocity Generators

발행일
출처
arXiv
논문 번호
646
분야
Computer Vision
arXiv 번호
2607.15273

MeanFlow(빠른 생성기)에 강화학습을 결합해, 적은 스텝으로도 RL 튜닝된 품질을 내는 프레임워크.

이 논문은 한마디로 빠른 이미지/비디오 생성기인 MeanFlow에 강화학습(RL)을 적용하는 방법을 처음으로 제안했다. 핵심은 MeanFlow의 평균 속도와 순간 속도를 잇는 수식을 이용해, DiffusionNFT(순간 속도 기반 RL)의 목표를 MeanFlow에 적용하는 것이다. 4스텝만으로도 50스텝 RL 모델을 능가하는 결과를 보여준다.

핵심 요약

  • MeanFlow(구간 평균 속도 예측으로 1~4스텝 생성)에 forward-process RL을 처음으로 결합했다.
  • MeanFlow identity에서 유도한 순간 속도 예측기를 경유해 DiffusionNFT 목표를 적용했다. 샘플링은 여전히 평균 속도 기반이다.
  • 이론적으로 DiffusionNFT의 정책 개선 보장을 상속함을 증명했다.
  • SD3.5-M에서 8개 지표 중 6개에서 SOTA 능가, Wan2.1 비디오에서 4스텝으로 50스텝 LongCat-Video RL(82.57)을 84.33 VBench로 능가했다.
  • 테스트 타임 스케일링(스텝 수 증가)에서도 일관된 향상을 보였다.

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)