Learning When to Think: Adaptive Reasoning for Test-Time Compute Allocation

발행일
출처
arXiv
논문 번호
977
분야
AI / General
arXiv 번호
2608.20256

추론 모델이 답의 첫 토큰으로 '안 생각/짧게/길게' 모드를 스스로 골라, 쉬운 문제에선 토큰을 아끼고 어려운 문제에만 길게 생각하게 만든 논문이다.

이 논문은 한마디로 추론 AI가 문제 난이도에 맞춰 스스로 '생각할 양'을 정하게 만든 연구다. 모델은 답의 첫 토큰으로 NoThink(바로 답하기)/Short(짧게 생각)/Long(길게 생각) 중 하나를 고르고, 이 선택 자체가 강화학습(GRPO) 안에서 배운다. 별도 라우터 없이 모드별 토큰 상한선과 균형 보상만으로 한쪽 모드로 쏠리는 붕괴를 막았다. 1.5B 모델 기준 MATH500 정확도는 기존과 비슷(0.782 vs 0.796)한데 평균 답 길이는 41% 줄었고, 학습하지 않은 GSM8K에서는 토큰 76%를 절약했다.

핵심 요약

  • 모델이 답의 첫 토큰으로 NoThink/Short/Long 세 모드를 직접 고르고, 이 라우팅이 강화학습(GRPO) 안에서 별도 라우터 없이 끝까지 함께 학습된다.
  • 모드별 토큰 상한(1,024/3,000/무제한)과 모드 균형 보상을 함께 써서, 한 모드가 나머지를 몰아내는 '라우팅 붕괴'를 막았다.
  • 짧은 모드의 정확도가 Long보다 높게 나오는 것을 보여, 라우터가 문제를 난이도순으로 제대로 배분하고 있음을 증명했다.
  • MATH500에서 정확도 0.782(기존 0.796)를 유지하면서 평균 응답 길이를 4,796에서 2,811 토큰으로 41% 줄였다.
  • 재학습 없이 GSM8K에서는 토큰 76%를 절약했고, 어려운 AIME에서는 예산을 줄이지 않고 동등 정확도를 유지해 난이도별 배분이 제대로 작동함을 보였다.

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)