Latent On-Policy Self-Distillation
- 발행일
- 출처
- arXiv
- 논문 번호
- 907
- 분야
- Machine Learning
- arXiv 번호
- 2608.13040
자기증류에서 선생에게 줄 '특권 정보'(정답·성공 궤적 등 사람이 설계하던 입력)를 잠재 벡터로 직접 학습하게 만든 LOPD — 롤아웃 예산 30% 미만으로 GRPO·Skill-SD를 이겼다.
이 논문은 한마디로 '스스로를 가르치는 AI 선생에게 줄 특권 정보'조차 AI가 직접 학습하게 만든 자기진화 기법이다. 기존 자기증류(OPSD)는 정답·꿀팁·성공 궤적 같은 특전을 사람이 설계해 선생에게 줬다면, LOPD는 과거 경험을 검색해 잠재 토큰(모델이 쓰는 압축된 기억 벡터)으로 바꾸고, 그것을 받은 선생이 학생에게 토큰 단위의 촘촘한 지도를 준다. 학습이 끝나면 학생 모델만 남고 검색 장치·기억 압축기는 전부 버려도 성능이 유지된다. 도구 사용·코드 생성 7개 벤치마크에서 기존 강화학습(RLVR)과 자기증류 계열을 모두 이겼고, GRPO보다 30%도 안 되는 롤아웃 예산으로 앞섰다.
핵심 요약
- '선생에게 무엇을 보여줄지' 사람이 정하지 않고 학습이 알아서 정한다 — 경험 표현 자체를 end-to-end으로 최적화한 설계 전환.
- 학습 후에는 학생 모델만 남고 검색 DB·압축기·잠재 토큰을 전부 삭제해도 성능이 유지된다(경험이 정책 안으로 내면화됨).
- GRPO·Skill-SD보다 30% 미만의 롤아웃 예산으로 승리 — 자기진화의 계산 비용 문제를 크게 줄였다.
- 선생이 학생과 똑같아지는 붕괴를 막는 '특전 마진' 제약이 핵심이며, 제약을 빼면 지도 신호가 사라진다는 것을 소거 실험으로 증명했다.
- 학생의 행동도 바뀐다: 도구를 한 번에 마구 호출하던 습관에서 순서대로 계획을 실행하는 스타일(스텝당 호출 3.50→1.11)로 이동했다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.