ChainVLA: Chaining Vision-Language-Action Queries through a Unified Execution State for Long-Horizon Manipulation

발행일
출처
arXiv
논문 번호
802
분야
Robotics
arXiv 번호
2608.02326

로봇 조작 정책이 매번 처음부터 다시 계획하느라 끊기는 문제를, 직전 질의의 진행상황과 아직 실행 안 된 동작 꼬리를 함께 넘겨주는 방식으로 이었다. 12억 파라미터 모델로 RMBench 평균 성공률 62.8%를 냈다.

행동 묶음을 예측하는 시각언어행동(VLA) 정책은 짧은 구간을 예측하고 앞부분만 실행한 뒤 현재 관측만 보고 다시 계획한다. 이러면 앞선 질의에서 파악한 작업 진행상황도, 아직 실행하지 않은 동작의 나머지도 다음 질의로 넘어가지 않는다. ChainVLA는 관측에서 뽑은 진행상황(Progress Context)과 직전 예측의 미실행 꼬리(Motion Tail)를 하나의 실행 상태로 묶어 다음 질의에 넘기고, 디코더는 최신 관측을 보고 구간 전체를 다시 생성한다. 12억 파라미터로 RMBench 평균 62.8%, LIBERO 네 세트 평균 98.8%를 기록했다. 둘 중 하나만 빼도 RMBench가 각각 11.2%와 3.0%로 무너져, 두 요소가 따로 노는 게 아니라 연달아 붙어 있는 고리임을 보였다.

핵심 요약

  • 실행 상태를 둘로 나눴다. 뒤를 보는 쪽은 순환 작업상태와 드문드문 기록한 사건 메모리를 합친 진행상황이고, 앞을 보는 쪽은 직전 예측 중 아직 실행 안 된 뒷부분이다. 이 상태는 고정된 계획이 아니라 고쳐 쓸 수 있는 사전 정보로만 쓴다.
  • RMBench에서 12억 파라미터로 평균 62.8을 냈다. 전체 과제를 다 커버하는 방법 중 가장 강한 Mem-0이 80억에 20억을 더 쓰고 52.8이었다.
  • 가장 크게 앞선 과제는 Put Back Block이다. 지금 화면에서는 원래 자리를 알 수 없는 블록을 되돌려놔야 하는 과제인데 96을 기록했고 Mem-0은 90, MemoryVLA는 50이었다.
  • 제거 실험 결과가 비대칭이다. 진행상황만 남기면 11.2, 동작 꼬리만 남기면 3.0, 둘 다 빼면 1.6인데 전체는 62.8이다. 반쪽 상태가 상태 없는 것과 별로 다르지 않다는 뜻이다.
  • 기존 방식을 흉내 낸 대조군은 부족했다. 고정 길이 관측 이력에 시간 앙상블(겹치는 예측들을 뒤에서 섞어 부드럽게 만드는 방법)을 붙인 조합은 35.6으로 전체보다 27.2점 낮았다.
  • 매끄러움 자체가 원인이 아님을 보였다. 선형 연장 대조군은 Put Back Block 네 개 경계 지표 전부와 Swap Blocks 네 개 중 셋에서 전체 모델보다 오차가 작았다. 그런데도 성공률은 0%와 2%였고 전체 모델은 96%와 74%였다.

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)