DAPD: Dual-Anchored Policy Distillation

발행일
출처
arXiv
논문 번호
818
분야
AI / General
arXiv 번호
2608.01735

이 논문은 정책 증류에서 특권 정보 의존 문제(privilege illusion)를 정보 비대칭 관점에서 진단하고 해결하는 DAPD를 제안했다.

이 논문은 한마디로 정책 증류(선생이 특권 정보를 쓰고 학생은 못 쓰는 문제)의 근본 원인을 찾고 해결했다. 학생이 선생의 특권 정보 없이도 같은 수준으로 추론하도록 양방향 정렬을 적용하는 DAPD를 제안했다. Qwen3 4B에서 OPSD 대비 평균 +2.00점, 32B까지 스케일 효과가 유지된다.

핵심 요약

  • 특권 의존 행동(privilege illusion)의 근본 원인이 선생과 학생 간 정보 비대칭임을 구조적으로 진단했다.
  • 자기 조건부 분포를 브리지로 사용해 참조와 롤아웃 행동을 정보가 맞춰진 두 경로로 정렬했다.
  • 참조→롤아웃, 롤아웃→참조 양방향으로 지도해 특권 정보 의존을 줄이면서 정확성은 유지했다.
  • OPSD 대비 잘못된 주장(wrong claims)을 45% 줄이면서 추론 성능은 일관되게 올렸다.
  • 1.7B부터 32B까지 스케일이 커질수록 개선 폭이 유지되는 것을 확인했다.

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)