Robots Need More than VLA and World Models
- 발행일
- 출처
- arXiv
- 논문 번호
- 370
- 분야
- Robotics
- arXiv 번호
- 2606.06556
로봇 지능이 단순한 정책 스케일링이 아니라 그라운딩 문제임을 주장하며, 물리적 경험을 로봇 학습 가능한 감독으로 변환하는 4대 필수 인터페이스를 제안한 포지션 페이퍼다.
이 포지션 페이퍼는 일반적 로봇 지능이 단순히 더 많은 로봇 데이터와 더 큰 VLA 모델로 해결되지 않음을 주장한다. 핵심 병목은 정책 학습이 아니라 세계의 풍부한 비정형 행동 데이터를 로봇이 사용 가능한 감독으로 변환하는 메커니즘의 부재다. 데이터 자동라벨링을 위한 물리 데이터 엔진, 인간 모션을 로봇 행동으로 리타겟팅하는 embodiment 인터페이스, 물리 기반 3D 추론을 위한 세계 모델 인터페이스, 비디오와 언어에서 과제 진행을 추론하는 보상 인터페이스의 4가지 필수 구성 요소를 제안한다.
핵심 요약
- VLA 모델을 물리 지능 스택의 한 레이어로 재정의하고 상하류 그라운딩 메커니즘이 필수적임을 주장한다
- 비정형 물리 경험을 로봇 사용 가능한 감독으로 변환하는 그라운딩 중심 파이프라인으로의 전환을 제창한다
- 4대 필수 인터페이스로 물리 데이터 엔진, embodiment 리타겟팅, 물리 기반 세계 모델, 과제 조건부 보상 그라운딩을 제안한다
- 배포 루프에서 성공, 실패, 인간 수정을 구조적 감독으로 활용하는 자기 개선 시스템의 비전을 제시한다
- 로봇 네이티브 데이터, 비디오 기반 방법, 시뮬레이션, 세계 모델 등 최신 연구를 그라운딩 병목 관점에서 재조명한다
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.