How Well Do Agentic Skills Work in the Wild: Benchmarking LLM Skill Usage in Realistic Settings

발행일
출처
arXiv
논문 번호
141
분야
Agents / Skills
arXiv 번호
2604.04323

이 연구는 기술 선택, 대규모 저장소로부터의 검색, 적응 같은 도전을 포함시켜 점진적으로 현실적인 조건에서 LLM 에이전트 기술의 효능을 체계적으로 벤치마킹한다.

이 연구는 기술 선택, 대규모 저장소로부터의 검색, 적응 같은 도전을 포함시켜 점진적으로 현실적인 조건에서 LLM 에이전트 기술의 효능을 체계적으로 벤치마킹한다. 이러한 환경에서 기술의 이점이 크게 줄어들지만, 질의별 기술 정교화 전략을 통해 상당 부분 회복될 수 있음을 밝힌다.

핵심 요약

  • 기존 LLM 에이전트 기술 벤치마크는 흔히 이상화된 조건에 의존해, 사전 선택되고 수작업으로 제작된 기술을 에이전트에게 직접 제공했다.
  • 에이전트는 실세계 시나리오에서 많은 선택지 중 관련 기술을 독자적으로 선택하고, 크고 정리되지 않은 저장소에서 기술을 검색하며, 범용 기술을 특정 질의에 적응시키는 등의 도전에 직면한다.
  • 실용적이고 이상적이지 않은 상황에서 에이전트 기술의 진정한 유용성과 한계는 대체로 정량화되지 않은 채 남아 있었다.
  • LLM 에이전트의 현실적인 검색 및 적응 조건을 시뮬레이션하기 위해 34,198개의 실세계 기술로 구성된 대규모 데이터셋을 구축했다.
  • 기술 검색 엔진을 개발하고 다양한 검색 전략(키워드, 의미 기반, 하이브리드, 에이전트 검색)을 평가해 효과적인 기술 발견 방법을 식별했다.
  • SKILLSBENCH와 TERMINAL-BENCH 2.0에서 점진적으로 현실적인 여섯 가지 평가 설정에 걸쳐 LLM 에이전트 성능을 평가하며, 선택, 검색, 적응의 도전을 도입했다.

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)