The Danger of Overthinking: Examining the Reasoning-Action Dilemma in Agentic Tasks

발행일
출처
arXiv
논문 번호
037
분야
Reasoning / Agents
arXiv 번호
2502.08235

UC Berkeley, ETH Zurich를 비롯한 기관의 주요 AI 연구진은 대규모 추론 모델(LRM)의 중대한 성능 한계를 밝혔다. 즉 작업을 과도하게 숙고하는 경향이 43% 더 높은 연산 비용과 효과 저하로 이어지며, 간단한 완화 전략을 도입하면 상호작용 환경에서 성능을 30% 향상시킨다.

UC Berkeley, ETH Zurich를 비롯한 기관의 주요 AI 연구진은 대규모 추론 모델(LRM)의 중대한 성능 한계를 밝혔다. 즉 작업을 과도하게 숙고하는 경향이 43% 더 높은 연산 비용과 효과 저하로 이어지며, 간단한 완화 전략을 도입하면 상호작용 환경에서 성능을 30% 향상시킨다.

핵심 요약

  • LRM은 환경과의 상호작용보다 확장된 내부 추론을 선호하는 경향이 있어, 비효율적인 성능으로 이어진다.
  • AI 시스템에서 과도한 숙고 행동을 분석하고 정량화하기 위한 체계적 프레임워크가 존재하지 않는다.
  • 상호작용 환경에서 추론과 행동 사이의 균형에 대한 이해가 부족하다.
  • LRM의 과도한 숙고를 연구하고 측정하기 위한 포괄적 프레임워크를 개발했다.
  • SWE Bench Verified를 사용해 4,018개의 궤적을 분석해 패턴을 식별했다.
  • 인간 전문가 평가에 대조해 검증된 점수화 시스템을 도입했다.

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)