The Bitter Lesson of Tool Calling

발행일
출처
arXiv
논문 번호
849
분야
LLMs / NLP
arXiv 번호
2608.06370

LLM에서 JSON 방식 대신 파이썬 코드로 도구를 호출하는 방식(PTC)이 14개 모델에서 더 정확하고 견고했다는 실험 논문이다.

이 논문은 한마디로 LLM이 도구를 호출할 때 JSON 구조 대신 파이썬 코드를 직접 짜서 실행하게 하는 방식이 기존 방식보다 더 정확하고 튼튼하다는 것을 보인 실험 연구다. 14개 모델로 BFCL v4 벤치마크에서 비교한 결과, 11개 모델에서 파이썬 코드 방식이 JSON 방식과 같거나 더 좋았다. 특히 여러 도구를 동시에 호출하거나 연쇄적으로 호출할 때 코드 방식이 압도적으로 유리했다. 컨텍스트가 오염되는 조건에서도 코드 방식은 안정적인 반면 JSON 방식은 성능이 떨어졌다.

핵심 요약

  • 14개 모델 중 11개에서 파이썬 코드 방식(PTC)이 JSON 방식과 같거나 더 좋은 정확도를 보였다. GPT-5.6 family는 10.6%까지 향상됐다.
  • 도구를 연쇄적으로 호출(chaining)할 때 코드 방식이 압도적으로 유리했다. chain 길이 12 이상에서는 JSON 대비 18.8% 높은 정확도를 기록했다.
  • JSON 방식은 한 번에 70개 이상 도구를 호출하면 호출 누락이 생기지만, 코드 방식은 100개까지도 100% 정확도를 유지했다.
  • 컨텍스트가 오염되는 조건(context rot)에서 코드 방식은 안정적이었지만 JSON 방식은 평균 2.3% 하락했고, 파일시스템 방식은 32%나 추락했다.
  • PTC 성능은 모델 패밀리보다 모델 세대(출시 시기)에 따라 결정되는 패턴을 보였다.

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)