World Tokens: Enhancing Embodied Policies with Training-Time World Modeling
- 발행일
- 출처
- arXiv
- 논문 번호
- 868
- 분야
- Computer Vision
- arXiv 번호
- 2608.09730
이 논문은 비디오 세계 모델을 훈련 시에만 사용하고 배포 시에는 떼어내면서도, 세계 모델의 표현 능력을 행동 정책에 주입하는 방법(World Tokens)을 제안했다. VLA 수준의 속도로 세계 모델 수준의 동적 이해를 구현한다.
이 논문은 한마디로 로봇 정책이 훈련할 때는 비디오 세계 모델의 예측 감독을 받되, 실제 사용할 때는 비디오 모델을 통째로 빼버려서 속도 저하 없이 동적 이해 능력만 남기는 방법을 제안했다. World Adapter가 VLM의 특징을 256개 토큰으로 압축하고, 이 토큰이 비디오 예측과 행동 생성 양쪽을 조건 지으면서 감독이 표현을 직접 형성한다. 2B 백본으로 LIBERO 98.2%, SIMPLER 최고 성능, 실제 로봇 성공률 59.4% → 76.0% 향상을 달성했다.
핵심 요약
- 비디오 세계 모델을 훈련 시에만 사용하고 배포 시 제거하는 World Tokens 아키텍처를 제안했다.
- World Adapter가 VLM 특징을 256개 토큰으로 변환해 비디오 예측과 행동 생성을 모두 조건 지었다.
- 행동 전문가가 VLM 전체 시퀀스를 직접 보지 못하게 해 세계 모델 감독을 우회할 수 없게 했다.
- 2B 모델로 LIBERO 98.2%, SIMPLER-WidowX 71.5%, SIMPLER-GoogleRobot 82.1%을 달성했다.
- 실제 R1 Pro 로봇에서 매칭 베이스라인 대비 성공률을 59.4% → 76.0%로 향상했다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.