Proxy Exploration and Reusable Guidance: A Modular LLM Post-Training Paradigm via Proxy-Guided Update Signals
- 발행일
- 출처
- arXiv
- 논문 번호
- 605
- 분야
- Machine Learning
- arXiv 번호
- 2607.11505
LLM post-training에서 탐색과 정렬을 분리하는 PUST 프레임워크. 가벼운 proxy 모델로 탐색 후 상대적 개선 신호를 추출해 stronger primary 모델에 전이한다. 약한 proxy에서 강한 모델로의 향상을 입증.
PUST(Post-training framework)는 LLM post-training에서 비싼 정책 탐색을 proxy 모델로 위임하고, proxy의 초기·최적화 상태 간 상대적 개선 신호를 추출해 primary 모델에 전이하는 새로운 패러다임이다. Qwen3 모델 패밀리에서 수학·코드 도메인으로 검증하여, 상당히 약한 proxy의 신호도 stronger primary 모델을 견고하게 향상시킴을 보였다.
핵심 요약
- 탐색(proxy)과 정렬(primary)의 분리로 post-training을 모듈화·비동기화·재사용 가능한 파이프라인으로 재구성
- proxy의 절대 분포가 아닌 상대적 개선 신호를 전이하여 weak-to-strong improvement 지원
- Qwen3-1.7B 등 소형 proxy의 탐색 신호가 더 큰 primary 모델의 성능을 조절 가능하게 향상
- GRPO 대비 OPD 기반 분포 정렬이 70 스텝 이내에 수렴하여 탐색 효율성 입증
- 전이 강도를 스케일링 계수로 조절 가능하여 다양한 설정에서 견고한 성능
- 탐색 신호의 캐싱·재사용·크로스모델 전이가 가능하여 비용 효율성 크게 향상
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.