Is Grep All You Need? How Agent Harnesses Reshape Agentic Search

발행일
출처
arXiv
논문 번호
181
분야
Agents / Coding / RAG
arXiv 번호
2605.15184

PricewaterhouseCoopers의 연구자들은 LLM 에이전트의 검색 전략 효과를 실증적으로 조사하여, 어휘적 검색(grep)과 의미적 검색(벡터)이 서로 다른 에이전트 구조 및 도구 출력 전달 방식과 어떻게 상호작용하는지에 초점을 맞췄다.

PricewaterhouseCoopers의 연구자들은 LLM 에이전트의 검색 전략 효과를 실증적으로 조사하여, 어휘적 검색(grep)과 의미적 검색(벡터)이 서로 다른 에이전트 구조 및 도구 출력 전달 방식과 어떻게 상호작용하는지에 초점을 맞췄다. 이 연구는 도구 결과가 인라인으로 전달될 때 grep이 종종 더 높은 정확도를 달성하며, 전반적인 에이전트 성능이 에이전트의 특정 오케스트레이션 계층에 크게 좌우됨을 밝힌다.

핵심 요약

  • 기존 연구는 LLM 에이전트의 검색 전략을 완전한 반복적 에이전트 워크플로 안에서가 아니라 고립된 상태로 평가하는 경우가 많다.
  • 검색 전략, 에이전트 구조(맞춤형 대 공급자 네이티브 CLI), 도구 호출 패러다임(인라인 대 파일 기반 결과 전달) 간의 상호작용은 대체로 충분히 탐구되지 않은 채 남아 있었다.
  • 검색 전략이 코퍼스 노이즈가 증가할 때 어떻게 작동하는지에 대한 이해가 제한적이었는데, 이는 실세계 에이전트 배치에서 중요한 측면이다.
  • 어휘적 검색(grep)과 의미적 검색(벡터)을 다양한 에이전트 하네스와 도구 호출 구조 전반에서 비교하는 다면적 실증 연구를 수행했다.
  • 평가에는 LongMemEval 벤치마크의 116문항 부분집합을 사용했으며, 무관한 교란 콘텐츠의 수준이 다양한 다중 세션 대화에 초점을 맞췄다.
  • 다섯 개의 다양한 LLM을 평가했으며, 보조 LLM 채점기를 통해 모든 실험 조건에서 에이전트 정확도를 일관되고 객관적으로 평가하도록 보장했다.

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)