SoL-Pi: Recursively Scaling Auto-Research Loops for Efficient Agent Harness

발행일
출처
arXiv
논문 번호
1093
분야
AI Agents
arXiv 번호
2609.20519

NVIDIA가 자동 연구 루프(RSI)로 에이전트 하네스의 토큰 효율을 개선하는 시스템. 4가지 메커니즘이 살아남아 Codex/Claude Code 대비 토큰 44.7~49.0% 절감, API 비용 약 1/3 절감을 달성했다.

NVIDIA/NTU/MIT 팀이 재귀적 자기개선(RSI)에서 영감을 받아, AI가 에이전트 하네스 자체를 자동으로 최적화하는 SoL-Pi 시스템을 제안한다. 약 150개 방향과 500개 실행 환경에서 3,000회 이상의 실행과 60,000회 이상의 상호작용을 거쳐 4가지 메커니즘(Action Fusion, Online Context Compaction, ObservationPack, Evidence-Preserving Delegated Reading)이 선발됐다. EdgeBench 51과제에서 GPT-5.6 Sol과 Opus 5 모두 기존 Pi 하네스와 동등한 성능을 유지하면서 토큰 트래픽 44.7~49.0% 감소, API 비용 약 1/3 절감을 달성했다. Codex 대비 시간당 $8.75~13.50, Pi 대비 $4.36~5.71 절약 효과가 있다.

핵심 요약

  • RSI(재귀적 자기개선)를 하네스 계층에 적용 — AI가 실행 트레이스를 관찰하고 하네스 코드를 자동 개선
  • 광역→심화 단계별 탐색: 152개 제안 방향 → 500개 실행 환경 → 3,000+ 실행 → 4개 메커니즘 생존
  • 생존한 4개: Action Fusion(명령 병합), Online Context Compaction(컨텍스트 압축), ObservationPack(관찰 묶음), Evidence-Preserving Delegated Reading(위임 읽기)
  • EdgeBench 51과제에서 Pi와 동등한 성능(42.0 vs 44.8) + 토큰 44.7~49.0% 감소 + API 비용 약 1/3 절감
  • GPT-5.6 Sol과 Opus 5 양쪽에서 일관된 개선 — 모델 간 일반화 확인
  • '하네스 사전학습' 개념 제시 — 더 효율적인 하네스가 다음 연구 사이클의 비용을 낮추는 재귀적 효율 개선 비전

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)