Embodied Turing Machines: Stateful Code for Robot Recursive Self-Improvement
- 발행일
- 출처
- arXiv
- 논문 번호
- 1175
- 분야
- Robotics
- arXiv 번호
- 2610.12369
로봇 제어에서 VLM·VLA 모델을 완전히 빼고, '상태 측정 + 판단'을 전부 코드로만 짜는 Code-Only-as-Policy(COAP) 방식을 제안해 로봇 벤치마크 최고 성능을 38.9%p 앞질렀다.
이 논문은 한마디로 로봇의 모든 판단을 모델 없이 코드만으로 하게 하자는 제안이다. 저자들은 로봇과 환경을 하나의 튜링 기계(상태를 읽고 규칙대로 쓰는 계산 장치)로 보고, 카메라 이미지와 로봇 자체 센서에서 코드가 직접 상태를 측정·추적하며 모든 결정을 내리는 '코드만으로 하는 정책(COAP)'을 만들었다. 코딩 에이전트가 사람 개입 없이 라이브러리를 반복 개선하는 자기개선 루프를 돌린 결과, RoboDojo의 양팔 42개 과제에서 70.24% 성공률로 기존 최고 기록보다 38.9%p 높았다. 실행 시점엔 모델이 하나도 없어서 빠르고 싸며, 코드라서 검사·수정·재사용이 쉽다는 게 강점이다.
핵심 요약
- VLA나 VLM 없이 코드만으로 로봇을 제어하는 새 패러다임(COAP)을 제안했다.
- 상태를 코드 변수에 직접 저장하니 판단 근거가 투명해지고, 실패 시 되돌아가 재시도하는 복구도 자유로웠다.
- 코딩 에이전트(Opus 5.5 Max)가 사람 개입 없이 코드 라이브러리를 반복 개선하는 자기개선(RSI) 루프를 설계했다.
- RoboDojo 양팔 42개 과제에서 테스트 시점 모델 없이 70.24% 성공률을 달성해 최고 기록보다 38.9%p 앞섰다.
- 새 과제 코드의 83%를 기존 공유 라이브러리에서 재사용해, 과제가 쌓일수록 역량이 누적되는 구조를 보였다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.