OPID: On-Policy Skill Distillation for Agentic Reinforcement Learning
- 발행일
- 출처
- arXiv
- 논문 번호
- 505
- 분야
- LLMs / NLP
- arXiv 번호
- 2606.26790
완료된 on-policy 궤적에서 hindsight skill을 추출해 dense한 토큰 수준 감독을 제공하는 agentic RL 프레임워크. ALFWorld 58.9, WebShop 74.2로 기존 GRPO 대비 큰 폭 향상.
OPID는 outcome-based RL의 sparse reward 문제를 해결하기 위해, 완료된 on-policy 궤적에서 episode-level과 step-level의 계층적 skill을 추출하고 이를 self-distillation 신호로 활용한다. Critical-first routing으로 중요 의사결定时점에는 step-level skill을, 그 외에는 episode-level skill을 주입하여 old policy가 같은 response를 재평가하게 한다. ALFWorld 58.9(GRPO 46.1 대비 +12.8), WebShop 74.2(GRPO 63.3 대비 +10.9)를 달성했으며, 추론 시 추가 인프라가 불필요하다.
핵심 요약
- 완료된 on-policy 궤적에서 hindsight skill을 직접 추출하므로 external skill library나 retrieval이 불필요하다.
- episode-level skill(전역 워크플로/실패 회피 규칙)과 step-level skill(국소 의사결정)의 2단계 계층 구조를 도입했다.
- critical-first routing: 중요 시점에는 step-level skill 사용, 나머지는 episode-level skill으로 fallback한다.
- ALFWorld 58.9%(GRPO 46.1% 대비 +12.8pt), WebShop 74.2%(GRPO 63.3% 대비 +10.9pt)를 달성했다.
- GRPO 학습 에이전트의 'hallucinated target' 오류(존재하지 않는 객체 탐색)를 skill 주입으로 해결하는 정성 분석을 제공한다.
- 추론 시 analyzer, external skill retrieval, privileged context가 전혀 필요 없는 training-time-only 프레임워크다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.