AgentOPSD: Recursive Self-Distillation for Agentic Reinforcement Learning

발행일
출처
arXiv
논문 번호
833
분야
AI / General
arXiv 번호
2608.05987

긴 호라이즌 에이전트 RL에서 각 턴의 기여도를 베이지안 신념 갱신으로 정밀하게 분배하는 방법을 제안했다.

이 논문은 한마디로 에이전트 강화학습에서 '어떤 행동이 성공에 결정적이었는지'를 찾아내는 문제를 푼 것이다. 기존 GRPO는 궤적 전체에 같은 보상을 나눠주지만, 이 방법(AgentOPSD)은 각 턴마다 베이지안 업데이트(사후확률 갱신)로 신념을 누적하면서 핵심 턴에 더 큰 학습 신호를 준다. 추가 롤아웃이나 비평자(critic) 없이도 ALFWorld에서 89.1% 성공률을 달성했다.

핵심 요약

  • 토큰 단위 증류 격차를 턴 단위로 모아서 환경 전환점과 정렬시켰다.
  • 순환 베이지안 신념 갱신으로, 앞선 턴들의 누적 맥락을 반영한 크레딧을 계산한다.
  • ALFWorld Qwen2.5-7B에서 89.1% 성공률로 GRPO와 기존 자기증류 기법들을 뛰어넘었다.
  • 긴 호라이즐일수록 성능 격차가 커지며, 짧은 태스크에서는 효과가 줄어든다.
  • 추가 롤아웃이나 학습된 비평자 없이 표준 정책 최적화와 완전 호환된다.

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)