VibeThinker-3B: Exploring the Frontier of Verifiable Reasoning in Small Language Models

발행일
출처
arXiv
논문 번호
429
분야
AI / General
arXiv 번호
2606.16140

3B 파라미터 소형 dense 모델로 수학·코딩 추론의 한계를 탐구한 VibeThinker-3B 기술 보고서다. curriculum SFT, 다영역 RL, 자기 증류를 통해 first-tier 대형 모델에 필적하는 추론 성능을 달성했다.

Qwen2.5-Coder-3B 베이스에 curriculum SFT, 다영역 RL(MGPO), 오프라인 자기 증류를 적용하여 AIME26 94.3점(CLR 적용 시 97.1점), LiveCodeBench v6 80.2 Pass@1을 기록했다. LeetCode 최신 대회에서 96.1% acceptance rate를 달성하며 GPT-5.2, Kimi K2.5 등을 능가했다. 이를 통해 검증 가능한 추론은 소형 parameter에 압축 가능하지만, 개방형 지식은 광범위 parameter coverage가 필요하다는 'Parametric Compression-Coverage Hypothesis'를 제안했다.

핵심 요약

  • 3B 파라미터로 AIME26 94.3점, CLR 적용 시 97.1점 달성 (DeepSeek V3.2 671B, GLM-5 744B 수준)
  • LeetCode 2026.04~05 최신 대회 96.1% acceptance rate로 GPT-5.2(95.3%), Kimi K2.5(90.6%) 능가
  • Curriculum SFT + MGPO RL + 오프라인 자기 증류 + Instruct RL의 단계적 post-training 파이프라인 제안
  • 검증 가능한 추론은 압축 가능, 개방형 지식은 coverage 필요라는 Parametric Compression-Coverage Hypothesis 도입

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)