Test-Time Gradient Guidance of Flow Policies in Reinforcement Learning
- 발행일
- 출처
- arXiv
- 논문 번호
- 387
- 분야
- Machine Learning
- arXiv 번호
- 2606.11087
행동 복제로 학습된 flow 정책을 테스트 시간에 critic gradient로 가이드하는 QGF(Q-Guided Flow). 학습 시간 RL의 불안정성 없이 경쟁력 있는 성능을 달성한다.
QGF는 flow 정책의 denoising 과정에서 가치 함수의 gradient를 활용해 높은 가치의 행동을 생성하는 테스트 시간 RL 알고리즘이다. 행동 복제로 학습된 참조 정책과 TD 학습으로 학습된 critic을 별도로 준비한 뒤, 추론 시 critic의 gradient로 정책의 denoising 단계를 가이드한다. noisy action에 대한 backpropagation이나 학습 시간 actor-critic의 불안정성을 피하면서, offline RL 벤치마크에서 기존 테스트 시간 방법들을 능가하고 state-of-the-art 학습 시간 알고리즘과 경쟁력 있는 성능을 보여준다.
핵심 요약
- 테스트 시간에만 정책 최적화를 수행하는 QGF(Q-Guided Flow) 알고리즘 제안
- 단일 Euler step 근사로 clean action의 critic gradient를 denoising에 활용, BPTT 불필요
- 학습 시간 actor-critic의 불안정성 회피, 모델 크기 증가에 따른 유리한 스케일링
- Best-of-N 대비 훨씬 적은 FLOPs로 더 나은 성능 달성
- goal-conditioned RL에서 어려운 태스크일수록 기존 방법 대비 일관된 우위
- QAM critic 사용 시 QAM 자체보다도 우수한 정책 추출 성능
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.