Argus: A General-Purpose Agentic Runtime for Long-Horizon Reasoning
- 발행일
- 출처
- arXiv
- 논문 번호
- 826
- 분야
- AI / General
- arXiv 번호
- 2608.05144
장기 과제에서 증거 기반으로 방향을 바꾸고(self-evolve), 검증 없이는 변경을 승인하지 않는 자율 에이전트 런타임을 만들었다. SWE-Bench Pro 78% 달성.
이 논문은 한마디로 복잡한 장기 과제를 혼자 처리하면서도, 증거 없이 목표를 바꾸지 않는 자율 에이전트 시스템이다. Argus는 Manager, Planner, Engineer, Reviewer 역할이 검증 게이트를 통해 변경을 승인하는 구조다. 모델 가중치는 고정하고 런타임 상태(메모리, 스킬, 검증기)만 진화시킨다. SWE-Bench Pro 78%, 수학 캠페인에서 6개의 증명된 새 결과를 내는 등 다양한 영역에서 검증되었다.
핵심 요약
- 검증 게이트를 통해서만 목표/접근법 변경을 승인하는 'verification-gated runtime self-evolution' 구조를 제안했다.
- Manager, Planner, Engineer, Reviewer 4역할이 durable project state 위에서 bounded mission을 수행한다.
- SWE-Bench Pro에서 Direct Copilot(59%) 대비 78%로 크게 앞서며 1.41x 토큰을 사용했다.
- 성숙 단계에서는 신규 Wave 대비 solve 토큰 21% 절감, 워크플로우 시간 15% 단축을 관찰했다.
- 7개 GPT-5.5 벤치마크에서 검증되었고, 실제 RWKV6 커널이 upstream에 머지되는 등 실용적 산출물을 만들었다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.