SoL-Pi: Recursively Scaling Auto-Research Loops for Efficient Agent Harness
- 발행일
- 출처
- arXiv
- 논문 번호
- 1093
- 분야
- AI Agents
- arXiv 번호
- 2609.20519
NVIDIA가 자동 연구 루프(RSI)로 에이전트 하네스의 토큰 효율을 개선하는 시스템. 4가지 메커니즘이 살아남아 Codex/Claude Code 대비 토큰 44.7~49.0% 절감, API 비용 약 1/3 절감을 달성했다.
NVIDIA/NTU/MIT 팀이 재귀적 자기개선(RSI)에서 영감을 받아, AI가 에이전트 하네스 자체를 자동으로 최적화하는 SoL-Pi 시스템을 제안한다. 약 150개 방향과 500개 실행 환경에서 3,000회 이상의 실행과 60,000회 이상의 상호작용을 거쳐 4가지 메커니즘(Action Fusion, Online Context Compaction, ObservationPack, Evidence-Preserving Delegated Reading)이 선발됐다. EdgeBench 51과제에서 GPT-5.6 Sol과 Opus 5 모두 기존 Pi 하네스와 동등한 성능을 유지하면서 토큰 트래픽 44.7~49.0% 감소, API 비용 약 1/3 절감을 달성했다. Codex 대비 시간당 $8.75~13.50, Pi 대비 $4.36~5.71 절약 효과가 있다.
핵심 요약
- RSI(재귀적 자기개선)를 하네스 계층에 적용 — AI가 실행 트레이스를 관찰하고 하네스 코드를 자동 개선
- 광역→심화 단계별 탐색: 152개 제안 방향 → 500개 실행 환경 → 3,000+ 실행 → 4개 메커니즘 생존
- 생존한 4개: Action Fusion(명령 병합), Online Context Compaction(컨텍스트 압축), ObservationPack(관찰 묶음), Evidence-Preserving Delegated Reading(위임 읽기)
- EdgeBench 51과제에서 Pi와 동등한 성능(42.0 vs 44.8) + 토큰 44.7~49.0% 감소 + API 비용 약 1/3 절감
- GPT-5.6 Sol과 Opus 5 양쪽에서 일관된 개선 — 모델 간 일반화 확인
- '하네스 사전학습' 개념 제시 — 더 효율적인 하네스가 다음 연구 사이클의 비용을 낮추는 재귀적 효율 개선 비전
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.