ENPIRE: Agentic Robot Policy Self-Improvement in the Real World
- 발행일
- 출처
- arXiv
- 논문 번호
- 466
- 분야
- AI / General
- arXiv 번호
- 2606.19980
NVIDIA가 코딩 에이전트로 실제 로봇의 정책을 자율 개선하는 'ENPIRE' 프레임워크를 발표, 핀 삽입·PushT 등에서 99% 성공률 달성.
ENPIRE는 코딩 에이전트가 실제 물리 세계에서 로봇 정책을 자율적으로 개선하는 하네스 프레임워크다. 환경 구축(EN)·정책 개선(PI)·롤아웃(R)·진화(E) 4단계로 구성되며, 인간의 1회 셋업 이후 모든 정책 개선이 무인으로 진행된다. Pin Insertion 태스크에서 100% 성공률에 도달했고, PushT·지프타이 절단 등 다양한 정밀 조작 태스크에서 99%를 달성했다. 다중 로봇 병렬 실행 시 wall-clock 시간이 단축되지만 토큰 비용은 초선형 증가하는 트레이드오프도 분석했다.
핵심 요약
- 코딩 에이전트(Codex, GPT-5.5, Claude Code, Kimi K2.6 등)가 실제 로봇 환경에서 자율적으로 정책을 개선하는 최초의 통합 프레임워크
- 4단계 구조: Environment(자동 리셋·검증) → Policy Improvement(휴리스틱·BC·RL) → Rollout(실물 로봇) → Evolution(에이전트가 로그 분석·코드 개선)
- Pin Insertion에서 인간 개입 기반 최첨단 방법보다 빠르게 100% 성공률 도달, PushT·지프타이 절단 등에서 99% 달성
- 다중 로봇 플릿(1→8에이전트) 확장 시 wall-clock 단축 효과 입증, BUT 토큰 비용은 초선형 증가(MTU 8에이전트에서 급등)
- Mean Robot Utilization(MRU)·Mean Token Utilization(MTU) 두 가지 물리 자원 효율 메트릭 최초 제안
- VLA(GR00T)와 절차적 툴 콜의 시너지 자동 발견 — RoboCasa 시뮬레이터에서 VLA 정확도 향상 후 실제 환경으로 전이 성공
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.