TREK: Distill to Explore, Reinforce to Refine

발행일
출처
arXiv
논문 번호
580
분야
Machine Learning
arXiv 번호
2607.05339

TREK은 증류를 모방이 아닌 탐색 영역 확장으로 재정의하여, GRPO가 막히는 어려운 프롬프트에서 검증된 해법을 학생 지원에 편입시킨다.

TREK은 GRPO가 학생 정책의 지원 밖에 정답 모드가 있을 때 한계를 보이는 문제를 해결하기 위해, 증류를 '탐색 지원 확장'으로 활용한다. 학생 통과율이 매우 낮은 프롬프트를 식별하고, 외부 교사나 동일 모델의 문맥 증강으로 검증된 해법을 생성한 뒤, 학생 likelihood 기준 상위 r개를 선별해 forward-KL로 학생 지원에 편입시킨다. 그 후 표준 GRPO로 돌아간다. DeepSeek-V4 제안으로 Qwen3-8B AIME 2025 36.9→40.3, 2024 47.9→51.1을 달성했다.

핵심 요약

  • GRPO의 한계 진단: 학생이 보상 궤적을 전혀 샘플링하지 못하는 어려운 프롬프트가 병목
  • 출력 전용 인터페이스: 교사의 logits/내부 상태 없이 검증된 궤적만 필요→블랙박스 교사 호환
  • 프롬프트 라우팅: 학생 통과율 pS(x)≤τ_low인 프롬프트만 교사 쿼리, 상위 r개 학생 근접 궤적 선별
  • 수학: Qwen3-8B AIME 2025 36.9→40.3, AIME 2024 47.9→51.1 (avg@16); self-context 변형도 유의미 향상
  • 에이전트 태스크: ALFWorld 75.8→82.8, ScienceWorld 12.5→26.7; 특히 어려운 태스크에서 초기 학습 대폭 가속
  • forward-KL 통합 단계 후 표준 GRPO로 복귀하여 검증된 모드를 정제·강화

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)