The Physics of Multi-Turn Long-Horizon Planning: From Pre-training to Post-training via Single- and Multi-Teacher On-Policy Agentic Distillation

발행일
출처
arXiv
논문 번호
733
분야
LLMs / NLP
arXiv 번호
2607.24720

에이전트의 장기 계획 능력을 훈련 단계별로 분해한 실전 지침서.

다회차 장기 계획을 통제된 합성 환경에서 뜯어봤다. 사전학습에서는 생각의 사슬로 세계 모델을 심는 게 핵심이고, 소량의 장기 데이터가 큰 도움이 된다. 후학습에서는 온폴리시 증류가 강화학습보다 장기, 저품질 조건에서 유리하다. 여러 교사를 합치는 다교사 증류는 공유 패턴으로 수렴하되, 패턴이 충돌하면 망각이 심하다.

핵심 요약

  • 세계 모델을 생각의 사슬로 명시하면 장기 일반화가 크게 좋아진다 (93.1 대 0.3).
  • 원자 기술만으로는 조합 일반화가 안 되지만 장기 데이터를 5%만 섞어도 급상승한다.
  • 나쁜 궤적을 섞으면 오류가 누적되어 장기 성능이 무너진다.
  • 온폴리시 증류가 GRPO보다 장기, 저품질 조건에서 유효 영역이 넓다.
  • 다교사 증류는 공유 계획 패턴으로 수렴하고, 충돌 패턴은 심한 망각을 부른다.
  • 실험은 Qwen2.5-100M 기반 전체 파라미터 지도학습으로 진행했다.

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)