Is Grep All You Need? How Agent Harnesses Reshape Agentic Search
- 발행일
- 출처
- arXiv
- 논문 번호
- 181
- 분야
- Agents / Coding / RAG
- arXiv 번호
- 2605.15184
PricewaterhouseCoopers의 연구자들은 LLM 에이전트의 검색 전략 효과를 실증적으로 조사하여, 어휘적 검색(grep)과 의미적 검색(벡터)이 서로 다른 에이전트 구조 및 도구 출력 전달 방식과 어떻게 상호작용하는지에 초점을 맞췄다.
PricewaterhouseCoopers의 연구자들은 LLM 에이전트의 검색 전략 효과를 실증적으로 조사하여, 어휘적 검색(grep)과 의미적 검색(벡터)이 서로 다른 에이전트 구조 및 도구 출력 전달 방식과 어떻게 상호작용하는지에 초점을 맞췄다. 이 연구는 도구 결과가 인라인으로 전달될 때 grep이 종종 더 높은 정확도를 달성하며, 전반적인 에이전트 성능이 에이전트의 특정 오케스트레이션 계층에 크게 좌우됨을 밝힌다.
핵심 요약
- 기존 연구는 LLM 에이전트의 검색 전략을 완전한 반복적 에이전트 워크플로 안에서가 아니라 고립된 상태로 평가하는 경우가 많다.
- 검색 전략, 에이전트 구조(맞춤형 대 공급자 네이티브 CLI), 도구 호출 패러다임(인라인 대 파일 기반 결과 전달) 간의 상호작용은 대체로 충분히 탐구되지 않은 채 남아 있었다.
- 검색 전략이 코퍼스 노이즈가 증가할 때 어떻게 작동하는지에 대한 이해가 제한적이었는데, 이는 실세계 에이전트 배치에서 중요한 측면이다.
- 어휘적 검색(grep)과 의미적 검색(벡터)을 다양한 에이전트 하네스와 도구 호출 구조 전반에서 비교하는 다면적 실증 연구를 수행했다.
- 평가에는 LongMemEval 벤치마크의 116문항 부분집합을 사용했으며, 무관한 교란 콘텐츠의 수준이 다양한 다중 세션 대화에 초점을 맞췄다.
- 다섯 개의 다양한 LLM을 평가했으며, 보조 LLM 채점기를 통해 모든 실험 조건에서 에이전트 정확도를 일관되고 객관적으로 평가하도록 보장했다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.