DAPD: Dual-Anchored Policy Distillation
- 발행일
- 출처
- arXiv
- 논문 번호
- 818
- 분야
- AI / General
- arXiv 번호
- 2608.01735
이 논문은 정책 증류에서 특권 정보 의존 문제(privilege illusion)를 정보 비대칭 관점에서 진단하고 해결하는 DAPD를 제안했다.
이 논문은 한마디로 정책 증류(선생이 특권 정보를 쓰고 학생은 못 쓰는 문제)의 근본 원인을 찾고 해결했다. 학생이 선생의 특권 정보 없이도 같은 수준으로 추론하도록 양방향 정렬을 적용하는 DAPD를 제안했다. Qwen3 4B에서 OPSD 대비 평균 +2.00점, 32B까지 스케일 효과가 유지된다.
핵심 요약
- 특권 의존 행동(privilege illusion)의 근본 원인이 선생과 학생 간 정보 비대칭임을 구조적으로 진단했다.
- 자기 조건부 분포를 브리지로 사용해 참조와 롤아웃 행동을 정보가 맞춰진 두 경로로 정렬했다.
- 참조→롤아웃, 롤아웃→참조 양방향으로 지도해 특권 정보 의존을 줄이면서 정확성은 유지했다.
- OPSD 대비 잘못된 주장(wrong claims)을 45% 줄이면서 추론 성능은 일관되게 올렸다.
- 1.7B부터 32B까지 스케일이 커질수록 개선 폭이 유지되는 것을 확인했다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.