On the Overthinking of LLMs
- 발행일
- 출처
- arXiv
- 논문 번호
- 004
- 분야
- Reasoning / Efficiency
- arXiv 번호
- 2412.21187
추론 모델은 습관이 아니라 문제 난이도에 따라 토큰을 소비해야 한다.
이 논문은 o1 계열 추론 모델의 과잉 사고를 연구한다. 즉, 추가 추론이 거의 도움이 되지 않는 단순한 문제에 과도한 사고 사슬과 테스트 시점 연산을 소비하는 경향이다. 저자들은 최종 결과와 추론 과정을 모두 평가하는 효율 지표를 도입한 다음, 자기 학습 패러다임을 사용해 정확도를 유지하면서 추론을 더 간결하게 만든다. GSM8K, MATH500, GPQA, AIME 및 기타 다양한 난이도에 걸친 실험은 성능 저하 없이 불필요한 추론을 줄일 수 있음을 보여준다. 이 논문은 추론 시점 사고를 자원 할당 문제로 규정하기 때문에 유용하다. 즉, 모델은 작업에 필요할 때 사고를 확장하고 그렇지 않을 때는 일찍 멈춰야 한다.
핵심 요약
- 문제는 o1 계열 모델이 단순한 작업에 긴 추론 흔적을 할당하는 경우가 많아, 정확도 향상은 제한적이면서 지연 시간과 비용은 증가시킨다는 것이다.
- 평가 측면에서 이 논문은 추론 연산이 합리적으로 사용되고 있는지 측정하기 위해 결과 수준 및 과정 수준의 효율 지표를 제안한다.
- 방법으로는 자기 학습 전략이 서로 다른 난이도의 작업 전반에서 답변 품질을 유지하면서 추론을 간소화하도록 모델을 학습시킨다.
- 시사점은 미래의 추론 시스템에 모든 질의에 대해 장황한 사고 사슬을 고정적으로 사용하는 습관이 아니라, 적응형 테스트 시점 연산 정책이 필요하다는 것이다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.