s1: Simple test-time scaling
- 발행일
- 출처
- arXiv
- 논문 번호
- 025
- 분야
- Reasoning / Efficiency
- arXiv 번호
- 2501.19393
Stanford, UW, AI2 연구진은 단 1,000개의 고품질 추론 샘플로 미세조정하고 간단한 '예산 강제' 추론 기법을 적용하여, 까다로운 벤치마크에서 SOTA 추론 성능과 명확한 테스트 시점 스케일링을 달성하는 오픈소스 모델 s1-32B를 개발했다.
Stanford, UW, AI2 연구진은 단 1,000개의 고품질 추론 샘플로 미세조정하고 간단한 '예산 강제' 추론 기법을 적용하여, 까다로운 벤치마크에서 SOTA 추론 성능과 명확한 테스트 시점 스케일링을 달성하는 오픈소스 모델 s1-32B를 개발했다.
핵심 요약
- OpenAI의 o1 같은 폐쇄형 모델에서 '테스트 시점 스케일링'이 등장했음에도, 명확하고 접근 가능한 테스트 시점 스케일링 행동을 보이는 오픈소스 모델이 부족했다.
- 전통적인 대규모 언어 모델(LLM) 성능 향상은 주로 연산 집약적인 '학습 시점 스케일링'에 의존하여, 최첨단 연구를 많은 이에게 접근 불가능하게 만들었다.
- 테스트 시점 스케일링을 재현하려는 기존 오픈소스 시도는 흔히 복잡하거나(예: 몬테카를로 트리 탐색, 멀티 에이전트 시스템) 여전히 상당한 자원을 요구했다(예: 수백만 개의 RL 샘플).
- 품질·난이도·다양성을 기준으로 59,000개 이상의 예시에서 면밀히 선별한 1,000개 샘플의 고품질 추론 데이터셋 s1K를 큐레이션했다.
- s1K 데이터셋으로 Qwen2.5-32B-Instruct 베이스 모델을 지도 미세조정(SFT)하되, 추론 트레이스와 해법에만 손실 계산을 집중했다.
- 생성을 강제로 종료하거나 사고 종료 토큰을 억제해 'Wait'를 덧붙여 추가 추론을 유도함으로써 사고 토큰을 직접 제어하는, 새롭고 간단한 디코딩 시점 개입인 '예산 강제'를 개발했다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.