Scaling Laws for Agent Harnesses via Effective Feedback Compute

발행일
출처
arXiv
논문 번호
273
분야
LLMs / NLP
arXiv 번호
2605.29682

하얼빈 공업대학의 연구진은 에이전트 하니스에서 폐루프 피드백의 유용성을 정량화하는 트레이스 수준 스칼라 척도인 Effective Feedback Compute(EFC)를 개발했다.

이 연구는 에이전트 하니스가 쓴 토큰이나 도구 호출 수 대신 실제로 도움이 된 피드백의 양을 재는 Effective Feedback Compute를 제안한다. 이 지표는 피드백이 유효하고 중복되지 않으며 이후 상태에 보존됐는지를 궤적 수준에서 계산하고, 현실적인 로그를 위한 추정형 지표와 과제 난이도 정규화도 함께 제공한다. 통제 실험에서 과제 난이도로 나눈 Oracle-EFC는 성능 변동을 0.99의 결정계수로 설명했고, 실제 궤적의 정규화 지표도 원시 계산량보다 훨씬 높은 0.93을 기록했다. EFC를 기존 하니스의 피드백 선택·메모리 갱신·중단 제어에 붙인 어댑터는 평균 통과율을 61.2%에서 68.2%로 높이면서 평균 원시 비용을 213.8에서 85.1로 줄였다. 결과는 에이전트 확장이 무조건 더 오래 실행하는 문제가 아니라 과제에 충분한 유용한 피드백을 남기는 효율의 문제임을 보여준다.

핵심 요약

  • 단계 복잡도(L): 필요한 추론 또는 행동 단계의 최소 개수다.
  • 라우터: 더 높은 품질의 라우터는 모델이 적절한 시점에 적절한 도구를 호출하도록 보장함으로써 η를 크게 증가시킨다.
  • 메모리 충실도: 더 나은 상태 관리는 유용한 정보가 보존되고 활용되도록 보장하여, 중복적인 상호작용을 방지한다.

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)