Long-Horizon-Terminal-Bench: Testing the Limits of Agents on Long-Horizon Terminal Tasks with Dense Reward-Based Grading

발행일
출처
arXiv
논문 번호
600
분야
AI / General
arXiv 번호
2607.08964

에이전트의 장기 horizon 터미널 태스크 수행 능력을 밀집 보상 기반 부분 점수로 평가하는 Long-Horizon-Terminal-Bench를 제안한다.

Long-Horizon-Terminal-Bench(LHTB)는 9개 카테고리 46개의 장기 horizon 터미널 태스크로 구성된 벤치마크로, 각 태스크를 세분화된 서브태스크로 분해해 밀집 중간 보상과 부분 점수를 제공한다. 15개 프론티어 모델을 평가한 결과, 태스크당 평균 9.9M 토큰, 231 에피소드, 85.3분이 소요되었으며, 가장 강력한 GPT-5.5도 0.95 임계값에서 15.2% pass@1에 그쳤다. 주요 실패 패턴은 시간 초과 후 부분 진행과 조기 종료로 인한 약한 자기 검증이었으며, 밀집 보상이 이러한 차이를 드러내는 데 필수적임을 보였다.

핵심 요약

  • 46개 장기 horizon 터미널 태스크(9카테고리): 실험 재현, 소프트웨어 엔지니어링, 멀티모달 분석, 게임, 과학 계산 등
  • 서브태스크 기반 밀집 보상: binary pass/fail이 아닌 부분 점수로 중간 진행도 가시화
  • 태스크당 평균 9.9M 토큰, 231 에피소드, 85.3분 실행 — 기존 Terminal-Bench/SWE-Bench보다 훨씬 더 요구적
  • 최강 모델 GPT-5.5도 15.2% pass@1(R≥0.95), 평균 pass@1은 4.3% — 큰 개선 여지 존재
  • 주요 실패: 시간 초과 후 부분 진행 + 조기 종료(false finish) — 약한 자기 검증이 핵심 병목
  • 밀집 보상이 false finish 패턴을 드러내는 데 필수 — binary 평가는 이를 놓침

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)