Multi-Turn On-Policy Distillation with Prefix Replay

발행일
출처
arXiv
논문 번호
578
분야
Machine Learning
arXiv 번호
2607.04763

ReOPD는 사전 수집된 교사 궤적을 prefix replay로 재사용하여, 환경 상호작용 없이도 멀티턴 에이전트 증류를 수행하는 효율적인 방법이다.

ReOPD(Replayed-Prefix On-Policy Distillation)는 멀티턴 에이전트 환경에서 교사의 사전 수집 궤적을 prefix로 재생하여 학생을 학습시키는 off-environment 증류법이다. 핵심은 prefix trap(시간적 오류 누적 + 양측 분포 이동)을 신뢰도 인식 샘플링 스케줄로 해결하는 것이다. 수학 추론(Python)과 검색 환경에서 OPD 수준의 정확도를 유지하면서 학습 단계당 4배 이상 빠르고, 학생 학습 중 도구 호출이 전혀 필요 없다.

핵심 요약

  • 환경 상호작용 없이 교사 RL 롤아웃을 재사용하여 비용을 0으로: 별도 수집 불필요(free by-product)
  • prefix trap 식별: 시간적(오류 누적) + 분포적(학생 occupancy 이동 vs 교사 신뢰도 이동) 양측 문제
  • step-decay 샘플링: 초기 step(낮은 이동)에 가중치를 두어 신뢰도 높은 구간 우선 학습
  • 수학(Python)에서 교사-학생 격차가 클 때 ReOPD가 OPD 초과 달성, 검색 환경에서는 OPD와 동등
  • 학습 단계당 OPD 대비 4배 이상 빠르고 도구 호출 0회, 이질적 환경 통합도 용이
  • 교사 자체 모델에서 생성한 prefix가 가장 좋으며, 더 강한 모델의 prefix는 오히려 성능 저하

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)