The Danger of Overthinking: Examining the Reasoning-Action Dilemma in Agentic Tasks
- 발행일
- 출처
- arXiv
- 논문 번호
- 037
- 분야
- Reasoning / Agents
- arXiv 번호
- 2502.08235
UC Berkeley, ETH Zurich를 비롯한 기관의 주요 AI 연구진은 대규모 추론 모델(LRM)의 중대한 성능 한계를 밝혔다. 즉 작업을 과도하게 숙고하는 경향이 43% 더 높은 연산 비용과 효과 저하로 이어지며, 간단한 완화 전략을 도입하면 상호작용 환경에서 성능을 30% 향상시킨다.
UC Berkeley, ETH Zurich를 비롯한 기관의 주요 AI 연구진은 대규모 추론 모델(LRM)의 중대한 성능 한계를 밝혔다. 즉 작업을 과도하게 숙고하는 경향이 43% 더 높은 연산 비용과 효과 저하로 이어지며, 간단한 완화 전략을 도입하면 상호작용 환경에서 성능을 30% 향상시킨다.
핵심 요약
- LRM은 환경과의 상호작용보다 확장된 내부 추론을 선호하는 경향이 있어, 비효율적인 성능으로 이어진다.
- AI 시스템에서 과도한 숙고 행동을 분석하고 정량화하기 위한 체계적 프레임워크가 존재하지 않는다.
- 상호작용 환경에서 추론과 행동 사이의 균형에 대한 이해가 부족하다.
- LRM의 과도한 숙고를 연구하고 측정하기 위한 포괄적 프레임워크를 개발했다.
- SWE Bench Verified를 사용해 4,018개의 궤적을 분석해 패턴을 식별했다.
- 인간 전문가 평가에 대조해 검증된 점수화 시스템을 도입했다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.