$τ_0$-VLA: a Hierarchical Robot Foundation Model with World-Model-Guided Test-Time Computation

발행일
출처
arXiv
논문 번호
924
분야
Robotics
arXiv 번호
2608.16885

로봇이 긴 일을 수행할 때 애매한 다음 작업을 바로 실행하지 않고, 후보 결과를 영상으로 미리 상상해 비교하는 계층형 모델이다.

이 논문은 한마디로 긴 로봇 작업에서 다음 행동이 애매할 때 여러 후보의 결과를 미리 비교하는 tau0-VLA를 제안한다. 진행 상황을 기억하고 다음 작은 작업을 정하는 상위 정책과 그 작업을 실제 동작으로 바꾸는 하위 정책으로 나뉜다. 상위 정책의 단어 확신도가 낮으면 추가 계산을 켜고, 여러 작업 후보의 마지막 카메라 장면을 세계 모델로 예측한 뒤 가치 모델과 성찰 모델로 최종 작업을 고른다. 하위 정책은 4만 115시간의 여러 실제 로봇 자료로 학습했지만 배치할 과제마다 소량의 추가 학습이 필요했다. 실물 평가 수가 조건별 10회로 작고 세계 모델도 머리 카메라의 마지막 장면만 예측한다.

핵심 요약

  • 상위 정책은 현재 관찰, 전체 지시, 이전 작은 작업과 실행 기록을 함께 보고 다음 작업을 제안한다.
  • 추가 계산에서는 후보를 여러 단계로 넓히고, 예측한 마지막 장면과 누적 점수로 좋은 후보만 남긴 뒤 최종 작업을 다시 생성한다.
  • 긴 작업 4종을 과제당 실제 로봇 10회씩 평가했다. 같은 하위 정책을 쓴 직접 실행의 평균 성공률 27.5퍼센트가 검색 없는 계층형 실행에서 45.0퍼센트로 올랐다.
  • 추가 계산을 켠 3개 과제의 성공 횟수는 차 만들기 5회에서 7회, 책 정리 6회에서 9회, 방 청소 5회에서 7회로 늘었다.
  • 보지 못한 책 배치의 다음 작업 예측 정확도는 단일 예측 50.0퍼센트, 한 단계 후보 비교 57.5퍼센트, 여러 단계 추가 계산 74.0퍼센트였다. 다만 과제별 추가 학습과 기준값 조정이 들어갔다.

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)