AgentOPSD: Recursive Self-Distillation for Agentic Reinforcement Learning
- 발행일
- 출처
- arXiv
- 논문 번호
- 833
- 분야
- AI / General
- arXiv 번호
- 2608.05987
긴 호라이즌 에이전트 RL에서 각 턴의 기여도를 베이지안 신념 갱신으로 정밀하게 분배하는 방법을 제안했다.
이 논문은 한마디로 에이전트 강화학습에서 '어떤 행동이 성공에 결정적이었는지'를 찾아내는 문제를 푼 것이다. 기존 GRPO는 궤적 전체에 같은 보상을 나눠주지만, 이 방법(AgentOPSD)은 각 턴마다 베이지안 업데이트(사후확률 갱신)로 신념을 누적하면서 핵심 턴에 더 큰 학습 신호를 준다. 추가 롤아웃이나 비평자(critic) 없이도 ALFWorld에서 89.1% 성공률을 달성했다.
핵심 요약
- 토큰 단위 증류 격차를 턴 단위로 모아서 환경 전환점과 정렬시켰다.
- 순환 베이지안 신념 갱신으로, 앞선 턴들의 누적 맥락을 반영한 크레딧을 계산한다.
- ALFWorld Qwen2.5-7B에서 89.1% 성공률로 GRPO와 기존 자기증류 기법들을 뛰어넘었다.
- 긴 호라이즐일수록 성능 격차가 커지며, 짧은 태스크에서는 효과가 줄어든다.
- 추가 롤아웃이나 학습된 비평자 없이 표준 정책 최적화와 완전 호환된다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.