SEED: Self-Evolving On-Policy Distillation for Agentic Reinforcement Learning
- 발행일
- 출처
- arXiv
- 논문 번호
- 639
- 분야
- LLMs / NLP
- arXiv 번호
- 2607.14777
에이전트 RL에서 자신의 과거 궤적을 '후향 스킬'로 바꿔 정책에 다시 주입하는 자기진화 프레임워크.
이 논문은 한마디로 에이전트 강화학습에서 '후회(힌드사이트)'를 자동으로 뽑아내 정책에 주입하는 자기진화 학습법이다. RL로 모은 궤적을 분석해 재사용 가능한 스킬(자연어)을 뽑아내고, 이 스킬이 정책의 행동 확률을 어떻게 바꾸는지를 밀집 감독 신호로 쓴다. 결과적으로 ALFWorld 91.8%, WebShop 68.0% 등 기존 대비 큰 폭 향상을 보였으며, 적은 데이터로도 강한 일반화를 달성했다.
핵심 요약
- 완료된 궤적에서 자연어 스킬을 자동 추출해 정책에 다시 주입하는 자기진화 루프를 만들었다.
- 스킬 유무에 따른 행동 확률 변화를 밀집 토큰 단위 감독 신호(OPD)로 변환해 RL과 결합했다.
- ALFWorld에서 91.8% 달성으로 기존 최고 대비 +7.4%p, 데이터 40%만 써도 GRPO 전체 데이터보다 높았다.
- 새로운 환경(안 본 테스크)에도 강하게 일반화되어, 단순 암기가 아닌 실제 전략 학습을 확인했다.
- 추론 시 추가 프롬프트나 외부 메모리 없이, 학습된 정책만으로 성능 향상을 달성했다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.