Zetta $ζ$: An Efficient Closed-Loop Embodied Harness for Self-Evolving Physical Intelligence
- 발행일
- 출처
- arXiv
- 논문 번호
- 927
- 분야
- Robotics
- arXiv 번호
- 2608.16590
로봇 정책 자체는 고정하고, 실행 중 실패를 감시하는 코드와 복구 동작을 경험으로 계속 고치는 체계다.
이 논문은 한마디로 로봇 기본 정책을 다시 학습하지 않고도 실패 감시와 복구 기술을 계속 개선하는 Zetta를 제안한다. 영상과 지시를 받아 행동을 내는 VLA 모델의 가중치는 고정한다. 대신 동작 순간의 감시, 여러 실행 결과의 실패 분석, 검증을 통과한 기술 갱신이라는 세 반복 과정을 운영한다. 새 기술은 기존 실패 묶음을 모두 해결하고 별도 검증 조건에서도 효과가 확인돼야 추가된다. RoboCasa 18개 과제의 평균 성공률은 73.56퍼센트에서 93.56퍼센트로, LIBERO-Pro 40개 과제 설정은 32.00퍼센트에서 71.13퍼센트로 올랐다. 다만 주요 결과는 모두 시뮬레이션에서 얻었다.
핵심 요약
- LIBERO-Pro는 고정된 파이0.5를, RoboCasa는 고정된 GR00T N1.5를 기본 정책으로 썼다. 감시 코드는 이상을 제안하고 고정된 조정 에이전트가 복구 실행 여부를 결정한다.
- RoboCasa는 과제마다 개발 조건 50개와 별도 시험 조건 50개를 썼다. LIBERO-Pro도 개발 조건 50개와 겹치지 않는 시험 조건 20개를 사용했다.
- RoboCasa는 네 차례 누적 개선을 거치며 73.56퍼센트에서 93.56퍼센트로 올랐다. LIBERO-Pro의 Goal T와 Goal S는 각각 31.0퍼센트에서 92.5퍼센트, 38.0퍼센트에서 89.0퍼센트로 올랐다.
- PnP-Stove에서 익힌 복구 기술을 관련 과제 3개에 추가 개선 없이 적용하자 평균이 64퍼센트에서 84퍼센트로 올랐다. 8대의 A100 실험에서는 동시 실행 16개에서 분당 22.09회를 처리했다.
- 초록의 LIBERO-Pro 90.8퍼센트와 본문 표 3의 전체 평균 71.13퍼센트는 서로 일치하지 않아 여기서는 표 수치를 썼다. 실제 로봇 영상은 제시하지만 정량 평가는 보고하지 않아 시뮬레이션의 개선 폭을 그대로 현실 성능으로 보면 안 된다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.