Closing the Loop in Humanoid VLA: Persistent 3D Object Tokens for Verifiable Loco-Manipulation

발행일
출처
arXiv
논문 번호
678
분야
Robotics
arXiv 번호
2607.18016

휴머노이드 로봇이 물체를 3D 기록으로 계속 붙들게 만들어, 행동 생성과 성공 검증을 같은 상태로 돌린 연구다.

긴 작업을 하는 휴머노이드 로봇은 걷고 잡고 가리고 실패하는 동안에도 같은 물체를 계속 같은 물체로 알아봐야 한다. 저자들은 행동을 정할 때 쓰는 물체 상태와 성공을 판정할 때 쓰는 물체 상태가 어긋나는 문제를 물체 상태 어긋남으로 정의했다. 해결책으로 RGB-D(색 영상과 깊이 영상) 관측에서 역할별 3D 물체 기록을 만들어 유지하고, 이를 토큰으로 바꿔 전신 행동 모델에 넣는 POT를 제안했다. 같은 기록을 기하 조건 검사에도 써서 실행 후 검증과 복구까지 한 고리로 묶었고, 실제 Unitree G1에서 성공률을 39/80에서 71/80으로 올렸다.

핵심 요약

  • 긴 작업에서 로봇이 실패하는 이유는 말을 못 알아들어서가 아니라, 행동용 물체 상태와 검증용 물체 상태가 달라지기 때문이라고 짚었다.
  • POT는 대상, 목적지, 지지면, 인계 상대 같은 역할 칸에 물체를 묶어두고, 행동 한 덩어리가 끝날 때마다 3D 위치 근거를 새로 갱신한다.
  • 물체 기록은 8칸에 칸당 33개 특징을 담은 고정 형식 토큰으로 바뀌어 전신 행동 모델의 입력 순서에 끼워 넣어진다.
  • 같은 기록으로 잡았는지, 담겼는지, 놓였는지를 기하 조건으로 검사해서, 실패면 다시 보기와 재시도와 재계획을 부른다.
  • 실물 Unitree G1의 8개 작업군에서 동일 조건 GR00T-N1.7 기준선 39/80을 71/80으로 올렸고, 컵 쌓기는 1/10에서 8/10으로 뛰었다.
  • 제거 실험에서 토큰만 쓰면 15/40에서 31/40, 검증만 쓰면 22/40, 둘 다 쓰면 34/40으로, 토큰 조건화가 성능의 주된 원인임을 보였다.

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)