The Physics of Multi-Turn Long-Horizon Planning: From Pre-training to Post-training via Single- and Multi-Teacher On-Policy Agentic Distillation
- 발행일
- 출처
- arXiv
- 논문 번호
- 733
- 분야
- LLMs / NLP
- arXiv 번호
- 2607.24720
에이전트의 장기 계획 능력을 훈련 단계별로 분해한 실전 지침서.
다회차 장기 계획을 통제된 합성 환경에서 뜯어봤다. 사전학습에서는 생각의 사슬로 세계 모델을 심는 게 핵심이고, 소량의 장기 데이터가 큰 도움이 된다. 후학습에서는 온폴리시 증류가 강화학습보다 장기, 저품질 조건에서 유리하다. 여러 교사를 합치는 다교사 증류는 공유 패턴으로 수렴하되, 패턴이 충돌하면 망각이 심하다.
핵심 요약
- 세계 모델을 생각의 사슬로 명시하면 장기 일반화가 크게 좋아진다 (93.1 대 0.3).
- 원자 기술만으로는 조합 일반화가 안 되지만 장기 데이터를 5%만 섞어도 급상승한다.
- 나쁜 궤적을 섞으면 오류가 누적되어 장기 성능이 무너진다.
- 온폴리시 증류가 GRPO보다 장기, 저품질 조건에서 유효 영역이 넓다.
- 다교사 증류는 공유 계획 패턴으로 수렴하고, 충돌 패턴은 심한 망각을 부른다.
- 실험은 Qwen2.5-100M 기반 전체 파라미터 지도학습으로 진행했다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.