Multi-Turn On-Policy Distillation with Prefix Replay
- 발행일
- 출처
- arXiv
- 논문 번호
- 578
- 분야
- Machine Learning
- arXiv 번호
- 2607.04763
ReOPD는 사전 수집된 교사 궤적을 prefix replay로 재사용하여, 환경 상호작용 없이도 멀티턴 에이전트 증류를 수행하는 효율적인 방법이다.
ReOPD(Replayed-Prefix On-Policy Distillation)는 멀티턴 에이전트 환경에서 교사의 사전 수집 궤적을 prefix로 재생하여 학생을 학습시키는 off-environment 증류법이다. 핵심은 prefix trap(시간적 오류 누적 + 양측 분포 이동)을 신뢰도 인식 샘플링 스케줄로 해결하는 것이다. 수학 추론(Python)과 검색 환경에서 OPD 수준의 정확도를 유지하면서 학습 단계당 4배 이상 빠르고, 학생 학습 중 도구 호출이 전혀 필요 없다.
핵심 요약
- 환경 상호작용 없이 교사 RL 롤아웃을 재사용하여 비용을 0으로: 별도 수집 불필요(free by-product)
- prefix trap 식별: 시간적(오류 누적) + 분포적(학생 occupancy 이동 vs 교사 신뢰도 이동) 양측 문제
- step-decay 샘플링: 초기 step(낮은 이동)에 가중치를 두어 신뢰도 높은 구간 우선 학습
- 수학(Python)에서 교사-학생 격차가 클 때 ReOPD가 OPD 초과 달성, 검색 환경에서는 OPD와 동등
- 학습 단계당 OPD 대비 4배 이상 빠르고 도구 호출 0회, 이질적 환경 통합도 용이
- 교사 자체 모델에서 생성한 prefix가 가장 좋으며, 더 강한 모델의 prefix는 오히려 성능 저하
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.