OPID: On-Policy Skill Distillation for Agentic Reinforcement Learning

발행일
출처
arXiv
논문 번호
505
분야
LLMs / NLP
arXiv 번호
2606.26790

완료된 on-policy 궤적에서 hindsight skill을 추출해 dense한 토큰 수준 감독을 제공하는 agentic RL 프레임워크. ALFWorld 58.9, WebShop 74.2로 기존 GRPO 대비 큰 폭 향상.

OPID는 outcome-based RL의 sparse reward 문제를 해결하기 위해, 완료된 on-policy 궤적에서 episode-level과 step-level의 계층적 skill을 추출하고 이를 self-distillation 신호로 활용한다. Critical-first routing으로 중요 의사결定时점에는 step-level skill을, 그 외에는 episode-level skill을 주입하여 old policy가 같은 response를 재평가하게 한다. ALFWorld 58.9(GRPO 46.1 대비 +12.8), WebShop 74.2(GRPO 63.3 대비 +10.9)를 달성했으며, 추론 시 추가 인프라가 불필요하다.

핵심 요약

  • 완료된 on-policy 궤적에서 hindsight skill을 직접 추출하므로 external skill library나 retrieval이 불필요하다.
  • episode-level skill(전역 워크플로/실패 회피 규칙)과 step-level skill(국소 의사결정)의 2단계 계층 구조를 도입했다.
  • critical-first routing: 중요 시점에는 step-level skill 사용, 나머지는 episode-level skill으로 fallback한다.
  • ALFWorld 58.9%(GRPO 46.1% 대비 +12.8pt), WebShop 74.2%(GRPO 63.3% 대비 +10.9pt)를 달성했다.
  • GRPO 학습 에이전트의 'hallucinated target' 오류(존재하지 않는 객체 탐색)를 skill 주입으로 해결하는 정성 분석을 제공한다.
  • 추론 시 analyzer, external skill retrieval, privileged context가 전혀 필요 없는 training-time-only 프레임워크다.

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)