The First Few Tokens Are All You Need: An Efficient and Effective Unsupervised Prefix Fine-Tuning Method for Reasoning Models
- 발행일
- 출처
- arXiv
- 논문 번호
- 039
- 분야
- Training Efficiency
- arXiv 번호
- 2503.02875
Tencent AI Lab 연구진은 해법 경로의 처음 몇 개 토큰에만 집중하는 새로운 접근인 Unsupervised Prefix Fine-Tuning(UPFT)을 제안한다. 최신 기법에 필적하는 결과를 달성하면서 학습 시간을 75퍼센트, 샘플링 비용을 99퍼센트 절감해 언어 모델의 추론 능력을 크게 끌어올린다.
Tencent AI Lab 연구진은 해법 경로의 처음 몇 개 토큰에만 집중하는 새로운 접근인 Unsupervised Prefix Fine-Tuning(UPFT)을 제안한다. 최신 기법에 필적하는 결과를 달성하면서 학습 시간을 75퍼센트, 샘플링 비용을 99퍼센트 절감해 언어 모델의 추론 능력을 크게 끌어올린다.
핵심 요약
- LLM 추론을 개선하는 기존 방법은 방대한 레이블 데이터나 연산 비용이 큰 샘플링을 요구한다.
- 전통적 파인튜닝 접근은 복잡한 추론 작업에서 효율성과 확장성에 어려움을 겪는다.
- 서로 다른 해법 경로가 공통의 초기 추론 단계를 공유하는 'Prefix Self-Consistency' 현상을 활용한다.
- 추출된 prefix 부분 문자열로 모델을 파인튜닝하면서 추론 구조를 유지하는 UPFT 방법을 개발한다.
- 추론 능력의 파국적 망각을 방지하기 위해 구조 튜닝을 통합한다.
- 추론 과정의 초기 토큰은 핵심 정보를 담고 있으며 서로 다른 해법 전반에서 높은 일관성을 보인다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.