Learning When to Think: Adaptive Reasoning for Test-Time Compute Allocation
- 발행일
- 출처
- arXiv
- 논문 번호
- 977
- 분야
- AI / General
- arXiv 번호
- 2608.20256
추론 모델이 답의 첫 토큰으로 '안 생각/짧게/길게' 모드를 스스로 골라, 쉬운 문제에선 토큰을 아끼고 어려운 문제에만 길게 생각하게 만든 논문이다.
이 논문은 한마디로 추론 AI가 문제 난이도에 맞춰 스스로 '생각할 양'을 정하게 만든 연구다. 모델은 답의 첫 토큰으로 NoThink(바로 답하기)/Short(짧게 생각)/Long(길게 생각) 중 하나를 고르고, 이 선택 자체가 강화학습(GRPO) 안에서 배운다. 별도 라우터 없이 모드별 토큰 상한선과 균형 보상만으로 한쪽 모드로 쏠리는 붕괴를 막았다. 1.5B 모델 기준 MATH500 정확도는 기존과 비슷(0.782 vs 0.796)한데 평균 답 길이는 41% 줄었고, 학습하지 않은 GSM8K에서는 토큰 76%를 절약했다.
핵심 요약
- 모델이 답의 첫 토큰으로 NoThink/Short/Long 세 모드를 직접 고르고, 이 라우팅이 강화학습(GRPO) 안에서 별도 라우터 없이 끝까지 함께 학습된다.
- 모드별 토큰 상한(1,024/3,000/무제한)과 모드 균형 보상을 함께 써서, 한 모드가 나머지를 몰아내는 '라우팅 붕괴'를 막았다.
- 짧은 모드의 정확도가 Long보다 높게 나오는 것을 보여, 라우터가 문제를 난이도순으로 제대로 배분하고 있음을 증명했다.
- MATH500에서 정확도 0.782(기존 0.796)를 유지하면서 평균 응답 길이를 4,796에서 2,811 토큰으로 41% 줄였다.
- 재학습 없이 GSM8K에서는 토큰 76%를 절약했고, 어려운 AIME에서는 예산을 줄이지 않고 동등 정확도를 유지해 난이도별 배분이 제대로 작동함을 보였다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.