The First Few Tokens Are All You Need: An Efficient and Effective Unsupervised Prefix Fine-Tuning Method for Reasoning Models

발행일
출처
arXiv
논문 번호
039
분야
Training Efficiency
arXiv 번호
2503.02875

Tencent AI Lab 연구진은 해법 경로의 처음 몇 개 토큰에만 집중하는 새로운 접근인 Unsupervised Prefix Fine-Tuning(UPFT)을 제안한다. 최신 기법에 필적하는 결과를 달성하면서 학습 시간을 75퍼센트, 샘플링 비용을 99퍼센트 절감해 언어 모델의 추론 능력을 크게 끌어올린다.

Tencent AI Lab 연구진은 해법 경로의 처음 몇 개 토큰에만 집중하는 새로운 접근인 Unsupervised Prefix Fine-Tuning(UPFT)을 제안한다. 최신 기법에 필적하는 결과를 달성하면서 학습 시간을 75퍼센트, 샘플링 비용을 99퍼센트 절감해 언어 모델의 추론 능력을 크게 끌어올린다.

핵심 요약

  • LLM 추론을 개선하는 기존 방법은 방대한 레이블 데이터나 연산 비용이 큰 샘플링을 요구한다.
  • 전통적 파인튜닝 접근은 복잡한 추론 작업에서 효율성과 확장성에 어려움을 겪는다.
  • 서로 다른 해법 경로가 공통의 초기 추론 단계를 공유하는 'Prefix Self-Consistency' 현상을 활용한다.
  • 추출된 prefix 부분 문자열로 모델을 파인튜닝하면서 추론 구조를 유지하는 UPFT 방법을 개발한다.
  • 추론 능력의 파국적 망각을 방지하기 위해 구조 튜닝을 통합한다.
  • 추론 과정의 초기 토큰은 핵심 정보를 담고 있으며 서로 다른 해법 전반에서 높은 일관성을 보인다.

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)