RetireOPD: Self-Retiring On-Policy Distillation for Agentic Reinforcement Learning
- 발행일
- 출처
- arXiv
- 논문 번호
- 1103
- 분야
- AI Agents
- arXiv 번호
- 2609.20784
멀티턴 RL 에이전트를 위한 자기 은퇴형 온폴리시 증류법. 학생 정책이 성숙해지면 교사 감독을 단계적으로 제거해 지속적 증류 편향을 방지하고 샘플 효율과 최종 성능을 모두 개선했다.
멀티턴 강화학습 에이전트를 위한 새로운 온폴리시 증류 방법인 RetireOPD를 제안한다. 학생 정책이 성숙해짐에 따라 자기 교사(self-teacher)의 감독을 동적으로 단계적 제거(self-retiring)하는 것이 핵심이다. 지속적인 증류로 인한 편향을 방지하고 샘플 효율성과 최종 태스크 성능을 모두 개선한다.
핵심 요약
- 학생 정책 성숙도에 따라 교사 감독을 동적으로 제거하는 self-retiring 메커니즘
- 지속적 증류의 편향 문제를 해결해 샘플 효율성과 최종 성능 동시 개선
- 멀티턴 RL 에이전트의 자기개선 루프 설계에 직접 적용 가능
- 에이전트가 스스로 언제 '독립'할지 결정하는 메타러닝 구조
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.