LongHorizon-Harness: Advancing Long-Horizon Agents for Real-World Tasks

발행일
출처
arXiv
논문 번호
800
분야
Computer Vision
arXiv 번호
2608.01964

긴 작업을 하나의 커지는 대화로 굴리지 말고, 작업 상태를 실행 밖에 따로 두고 감사로만 갱신하자는 에이전트 하네스다. 매니저와 실행자와 감사자로 역할을 쪼갠 MEA 루프를 제안했다.

긴 호흡의 작업에서 기존 에이전트 하네스는 실행과 상태 관리와 완료 판정을 같은 대화 안에서 처리해, 상태 추적이 어려워지고 잘못된 자기 판정이 뒤 단계로 번진다. 저자들은 긴 작업 수행을 작업 상태 관리 문제로 다시 정의하고, 상태를 실행 밖에 명시적으로 두고 환경에서 독립 검증된 사실로만 갱신하는 LongHorizon-Harness를 제안한다. 매니저가 상태를 읽고 다음 하위작업 계약을 만들고, 새 문맥의 실행자가 그것만 수행하고, 읽기 전용 감사자가 환경을 직접 확인해 보고서를 낸다. 실행자의 대화 기록은 라운드마다 버리고 감사 보고서만 라운드를 넘어 남는다. Qwen 3.7-Plus 기준으로 WeaveBench가 51.8퍼센트에서 80.7퍼센트로, Terminal-Bench 2.1이 69.7퍼센트에서 77.2퍼센트로, OSWorld 2.0이 2.8퍼센트에서 8.3퍼센트로 올랐다.

핵심 요약

  • 긴 작업의 실패 원인을 세 가지로 정리했다. 오류가 쌓이며 목표가 어긋나는 문제, 기록이 길어져 필요한 정보를 못 찾는 문제, 지금까지 무엇을 했는지 상태를 잃어버리는 문제다.
  • 핵심 구조는 Manage-Execute-Audit 루프다. 매니저는 환경에 직접 접근하지 못하고 상태와 감사 보고서만 보며, 실행자는 매번 새 문맥에서 하위작업 하나만 하고, 감사자는 읽기 전용 도구로 환경을 직접 확인한다.
  • 라운드 사이에 넘어가는 기억은 감사 보고서뿐이고 실행자의 원본 기록은 버린다. 종료 조건은 감사된 상태가 원래 목표를 만족하거나, 더 진행할 하위작업이 없거나, 사용자 입력이 필요하거나, 라운드 예산이 소진된 경우다.
  • AgentAdapter라는 얇은 어댑터로 기존 시스템의 원래 에이전트 루프를 건드리지 않고 백엔드를 갈아끼운다. Claude Code, Codex CLI, OpenClaw, Hermes Agent 같은 하네스와 Claude Opus, GPT, Qwen 같은 모델을 세 역할에 섞어 쓸 수 있다.
  • Qwen 3.7-Plus와 Claude Code 조합에서 WeaveBench 통과율이 51.8퍼센트에서 80.7퍼센트로 올랐다. 이는 공식 보고 최고치인 Claude Opus 4.7 조합의 41.2퍼센트의 거의 두 배다.
  • OSWorld 2.0 전체에서 이진 완료율(과제를 다 끝냈는지만 0과 1로 매기는 성공률)이 2.8퍼센트에서 8.3퍼센트로 약 3배가 됐고, 34개 하위집합에서 Claude Opus 4.7 기준 20.0퍼센트에서 34.3퍼센트로 올랐다.
  • 사례 분석에서 기준 방식은 문서 XML을 직접 고쳐 겉보기만 맞춘 탓에 0.00점을 받았지만, 제안 방식은 지정된 GUI 절차를 따르고 감사자가 XML을 다시 파싱해 15개 제목 서식을 확인해 0.89점을 받았다.

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)