World Value Models for Robotic Manipulation
- 발행일
- 출처
- arXiv
- 논문 번호
- 488
- 분야
- Robotics
- arXiv 번호
- 2606.24742
월드 모델을 로봇 가치 함수의 기반으로 활용하여 시간적 이해와 미래 계획 능력을 갖춘 World Value Model을 제안하고, 800개 비최적 궤적 벤치마크를 포함한 SOTA 성능을 달성한다.
로봇 정책 학습에서 가치 모델의 정확도는 과거 맥락의 이해와 미래 결과에 대한 계획 능력에 달려 있지만, 기존 VLM 기반 가치 모델은 정적 이미지 사전학습으로 인해 시간적 모델링이 부족하다. 월드 모델이 자연적으로 시간적 역학과 미래 예측에 뛰어나다는 점에 착안하여, 비디오 월드 모델을 가치 학습의 기반으로 재활용하는 World Value Model(WVM)을 제안한다. WVM은 Mixture-of-Transformers로 비디오 스트림과 가치 DiT를 결합하고, 가치 함수를 flow matching으로 훈련된 분포 청크로 정식화한다. 800개 비최적 궤적의 Suboptimal-Value-Bench에서도 SOTA를 유지하며, 시뮬레이션과 실제 환경 모두에서 정책 성능을 향상시킨다.
핵심 요약
- 월드 모델의 시공간 사전 지식을 로봇 가치 추정의 기반으로 재활용하는 최초 접근
- Mixture-of-Transformers(MoT)로 비디오 생성 스트림과 가치 DiT를 결합하여 표현 간섭 최소화
- 가치 함수를 flow matching 훈련된 분포 청크(distributional chunk)로 정식화하여 dense 학습 신호 확보
- 800개 비최적 궤적 + 인간 라벨링으로 구성된 Suboptimal-Value-Bench 공개
- 전문가 VOC와 Suboptimal-Value-Bench 모두에서 SOTA 달성, 하류 정책 학습에서도 일관된 향상
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.