Closing the Loop in Humanoid VLA: Persistent 3D Object Tokens for Verifiable Loco-Manipulation
- 발행일
- 출처
- arXiv
- 논문 번호
- 678
- 분야
- Robotics
- arXiv 번호
- 2607.18016
휴머노이드 로봇이 물체를 3D 기록으로 계속 붙들게 만들어, 행동 생성과 성공 검증을 같은 상태로 돌린 연구다.
긴 작업을 하는 휴머노이드 로봇은 걷고 잡고 가리고 실패하는 동안에도 같은 물체를 계속 같은 물체로 알아봐야 한다. 저자들은 행동을 정할 때 쓰는 물체 상태와 성공을 판정할 때 쓰는 물체 상태가 어긋나는 문제를 물체 상태 어긋남으로 정의했다. 해결책으로 RGB-D(색 영상과 깊이 영상) 관측에서 역할별 3D 물체 기록을 만들어 유지하고, 이를 토큰으로 바꿔 전신 행동 모델에 넣는 POT를 제안했다. 같은 기록을 기하 조건 검사에도 써서 실행 후 검증과 복구까지 한 고리로 묶었고, 실제 Unitree G1에서 성공률을 39/80에서 71/80으로 올렸다.
핵심 요약
- 긴 작업에서 로봇이 실패하는 이유는 말을 못 알아들어서가 아니라, 행동용 물체 상태와 검증용 물체 상태가 달라지기 때문이라고 짚었다.
- POT는 대상, 목적지, 지지면, 인계 상대 같은 역할 칸에 물체를 묶어두고, 행동 한 덩어리가 끝날 때마다 3D 위치 근거를 새로 갱신한다.
- 물체 기록은 8칸에 칸당 33개 특징을 담은 고정 형식 토큰으로 바뀌어 전신 행동 모델의 입력 순서에 끼워 넣어진다.
- 같은 기록으로 잡았는지, 담겼는지, 놓였는지를 기하 조건으로 검사해서, 실패면 다시 보기와 재시도와 재계획을 부른다.
- 실물 Unitree G1의 8개 작업군에서 동일 조건 GR00T-N1.7 기준선 39/80을 71/80으로 올렸고, 컵 쌓기는 1/10에서 8/10으로 뛰었다.
- 제거 실험에서 토큰만 쓰면 15/40에서 31/40, 검증만 쓰면 22/40, 둘 다 쓰면 34/40으로, 토큰 조건화가 성능의 주된 원인임을 보였다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.