Reversal Q-Learning

발행일
출처
arXiv
논문 번호
453
분야
Machine Learning
arXiv 번호
2606.17551

흐름 정책을 역방향으로 학습하는 오프라인 RL 알고리즘 RQL을 제안. 50개 로봇 과제에서 기존 최고 성능 대비 최고 평균 성능을 달성했다.

RQL은 flow matching 기반 정책을 오프라인 강화학습으로 훈련하는 새로운 알고리즘이다. 확장된 MDP 프레임워크에서 개별 디노이징 스텝을 별도 액션으로 처리하고, 역방향 흐름을 통해 가상의 온폴리시 궤적을 생성하여 horizon 문제를 해결한다. BPTT 문제 없이 값 함수의 그래디언트를 적극 활용하며, OGBench 50개 로봇 시뮬레이션 과제에서 18개 baseline 대비 최고 평균 성능을 기록했다. 특히 장시간 manipulation 및 locomotion 환경에서 강력한 성능을 보인다.

핵심 요약

  • 확장된 MDP 프레임워크를 오프라인 RL에 적용, 역방향 흐름으로 가상 온폴리시 궤적 생성
  • 다중 스텝 리턴으로 유효 horizon을 T×F에서 T로 감소시켜 curse of horizon 해결
  • BPTT 없이 값 함수 1차 그래디언트 활용 → 회귀 기반 방법론(FAWAC, IFQL 등) 대비 우수
  • OGBench 50개 로봇 과제에서 18개 baseline 대비 최고 평균 성능 달성
  • antmaze-giant, humanoidmaze-large 등 장시간 과제에서 특히 강력한 성능

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)