Do AI Agents Know When a Task Is Simple? Toward Complexity-Aware Reasoning and Execution
- 발행일
- 출처
- arXiv
- 논문 번호
- 636
- 분야
- AI / General
- arXiv 번호
- 2607.13034
LLM 에이전트가 작업 복잡도를 판단하지 못하고 과도한 컨텍스트를 수집하는 문제를 해결하기 위한 E3 프레임워크.
본 연구는 LLM 에이전트가 단순 작업에도 최대 컨텍스트를 동원하는 비효율을 지적하고, 작업 복잡도를 사전 판단하는 E3(Estimate, Execute, Expand) 프레임워크를 제안한다. 에이전트가 최소 실행 경로를 추정하고 검증 실패 시에만 범위를 확장하는 전략으로, MSE-Bench 121개 작업에서 최강 기준과 동일한 100% 성공률을 유지하면서도 비용 85%, 토큰 91%, 파일 탐색 92%를 절감했다.
핵심 요약
- 에이전트의 불필요한 작업량을 재는 ACRR을 정의하고, 범위를 추정한 뒤 최소 경로를 실행하며 검증 실패 때만 넓히는 E3를 제안했다.
- 통제된 시뮬레이터의 MSE-Bench 121개 편집에서 가장 강한 기준선과 같은 100% 성공률을 유지했다.
- E3는 비용을 85%, 토큰을 91%, 확인한 파일을 92% 줄였고 적응형 검색 기준선보다도 16% 나았다.
- 작은 수정에 전체 저장소를 읽는 에이전트의 낭비를 줄이면서 검증을 안전장치로 유지하는 실행 정책으로 적용할 수 있다.
- 주요 수치는 실제 배포 에이전트가 아닌 통제된 시뮬레이터에서 나왔고 실제 모델 검증도 gpt-4o 사례 연구에 그쳐 더 넓은 검증이 필요하다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.