Test-Time Scaling in Reasoning LLMs: Inference Regimes, Evaluation, and Reproducibility
- 발행일
- 출처
- arXiv
- 논문 번호
- 825
- 분야
- Machine Learning
- arXiv 번호
- 2608.04001
테스트 타임 스케일링(추론 시 더 많이 생각해서 정확도를 높이는 기법)을 3가지 구조로 체계적으로 분류하고, 공정한 평가 방법과 20억 이상의 추론 트레이스 데이터를 공개했다.
이 논문은 한마디로 '추론 시 더 많이 생각하기'라는 기술을 체계적으로 정리하고, 어떻게公平하게 비교해야 하는지 기준을 세운 연구다. 단일 경로 심화, 후보 다수 샘플링+투표, 부분 상태 탐색이라는 3가지 구조로 분류했다. 같은 예산이라도 방법이 다르면 결과가 완전히 달라지고, 심지어 샘플을 더 뽑을수록 정확도가 떨어지는 경우도 있음을 보였다. 20억 개 이상의 추론 트레이스를 공개해 재현 가능한 연구의 기반을 마련했다.
핵심 요약
- 테스트 타임 스케일링을 단일 경로, 리프 레벨, 프리픽스 레벨의 3가지 구조적 체계로 정식화했다.
- 평가 대상이 모델 가중치가 아니라 전체 추론 시스템(프롬프트, 디코더, 검증기, 중단 규칙 등)임을 강조했다.
- mean log probability 선택은 샘플이 많아질수록 정확도가 75.6%→65.8%로 하락하는 등 잘못된 선택 기준의 위험성을 입증했다.
- 20억 개 이상의 추론 트레이스(수학, 과학, 경시대회)를 공개하여 재현 가능한 연구 기반을 마련했다.
- 오픈 웨이트 추론 모델 생태계를 학습 방식과 인터페이스 제어 기준으로 정리했다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.