Flux-OPD: On-Policy Distillation with Evolving Contexts

발행일
출처
arXiv
논문 번호
783
분야
Machine Learning
arXiv 번호
2607.28022

정답이 없는 영역(open-ended)에서 진화하는 컨텍스트를 활용하는 새 증류 패러다임 Flux-OPD 제안.

이 논문은 한마디로 정답을 명확히 판정하기 어려운 작업(비디오 생성 프롬프트, 의료 QA)에서 학생 모델을 더 잘 가르치는 방법을 제안했다. 기존 온폴리시 증류(OPD)는 교사 모델을 그대로 따라 하게 하는데, 정답이 모호한 영역에서는 한계가 있다. Flux-OPD는 학생의 성과에 따라 '컨텍스트(힌트)'를 계속 업데이트하면서, 교사의 안정적인 기준점에 컨텍스트 보정 신호를 주입한다. 충돌하는 컨텍스트 신호는 자동으로 가중치를 낮춘다. 의료 QA(HealthBench)와 비디오 생성 프롬프트 최적화(VBench)에서 기존 방법들을 능가했다.

핵심 요약

  • 오픈엔디드 도메인에서 '진화하는 컨텍스트'를 훈련 내 감독 신호로 활용하는 Flux-OPD를 제안했다.
  • reverse KL 분해를 통해 학생이 기하평균 교사로 증류됨을 보이고, 충돌 항(conflict term)을 정의했다.
  • 컨텍스트 보정 전략: 불안정한 컨텍스트 교사를 직접 타겟으로 안 쓰고, 안정적인 기준 교사에 차이 신호만 주입한다.
  • 충돌 항을 가중치 지표로 써서, 컨텍스트 간 일치할 땐 강하게, 충돌할 땐 약하게 교정한다.
  • HealthBench 19.63→20.61, VBench(1.3B) 81.48→82.26 달성. 3회 독립 실행에서 일관된 우위 확인.

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)