Z1: Efficient Test-time Scaling with Code
- 발행일
- 출처
- arXiv
- 논문 번호
- 052
- 분야
- Reasoning / Efficiency
- arXiv 번호
- 2504.00810
Tsinghua 대학과 Yale 대학 연구진은 코드 기반 학습과, 문제 복잡도에 따라 추론 깊이를 조정하는 새로운 'Shifted Thinking Window' 메커니즘을 통해, 성능을 유지하면서도 언어 모델 추론의 토큰 소비를 70% 줄이는 테스트 시점 스케일링 프레임워크 Z1을 도입한다.
Tsinghua 대학과 Yale 대학 연구진은 코드 기반 학습과, 문제 복잡도에 따라 추론 깊이를 조정하는 새로운 'Shifted Thinking Window' 메커니즘을 통해, 성능을 유지하면서도 언어 모델 추론의 토큰 소비를 70% 줄이는 테스트 시점 스케일링 프레임워크 Z1을 도입한다.
핵심 요약
- 대규모 언어 모델은 추론 과제 중에 과도한 토큰을 소비하는데, 특히 정교한 사고 단계가 필요 없는 단순한 문제에서도 그렇다.
- 기존 접근법은 토큰 사용을 제어하면서 테스트 시점에 추론 능력을 확장하는 효율적인 방법이 부족하다.
- 균형 잡힌 짧은 궤적과 긴 궤적으로 신중하게 선별한 코드 추론 데이터셋(107K개 예시)으로 모델을 미세 조정한다.
- 추론 토큰 수를 제한하고 임계값 초과 시 직접 답변을 강제하는 'Shifted Thinking Window'를 구현한다.
- 문맥 구분자를 제거하여 추론 깊이를 유연하게 조정할 수 있게 한다.
- 더 긴 추론 궤적과 더 큰 데이터셋 규모가 효과적인 추론 유도에 핵심적이다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.