Proxy Exploration and Reusable Guidance: A Modular LLM Post-Training Paradigm via Proxy-Guided Update Signals

발행일
출처
arXiv
논문 번호
605
분야
Machine Learning
arXiv 번호
2607.11505

LLM post-training에서 탐색과 정렬을 분리하는 PUST 프레임워크. 가벼운 proxy 모델로 탐색 후 상대적 개선 신호를 추출해 stronger primary 모델에 전이한다. 약한 proxy에서 강한 모델로의 향상을 입증.

PUST(Post-training framework)는 LLM post-training에서 비싼 정책 탐색을 proxy 모델로 위임하고, proxy의 초기·최적화 상태 간 상대적 개선 신호를 추출해 primary 모델에 전이하는 새로운 패러다임이다. Qwen3 모델 패밀리에서 수학·코드 도메인으로 검증하여, 상당히 약한 proxy의 신호도 stronger primary 모델을 견고하게 향상시킴을 보였다.

핵심 요약

  • 탐색(proxy)과 정렬(primary)의 분리로 post-training을 모듈화·비동기화·재사용 가능한 파이프라인으로 재구성
  • proxy의 절대 분포가 아닌 상대적 개선 신호를 전이하여 weak-to-strong improvement 지원
  • Qwen3-1.7B 등 소형 proxy의 탐색 신호가 더 큰 primary 모델의 성능을 조절 가능하게 향상
  • GRPO 대비 OPD 기반 분포 정렬이 70 스텝 이내에 수렴하여 탐색 효율성 입증
  • 전이 강도를 스케일링 계수로 조절 가능하여 다양한 설정에서 견고한 성능
  • 탐색 신호의 캐싱·재사용·크로스모델 전이가 가능하여 비용 효율성 크게 향상

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)