$μ_0$: A Scalable 3D Interaction-Trace World Model
- 발행일
- 출처
- arXiv
- 논문 번호
- 418
- 분야
- Robotics
- arXiv 번호
- 2606.13769
3D interaction trace를 예측하는 embodiment-agnostic 세계 모델로, 영상만으로 사전학습하고 로봇에 전이한다.
μ0는 물체·도구·손 등 의미론적 관심점의 3D 궤적(trace)을 예측하는 세계 모델로, 픽셀 예측이나 행동 예측 대신 compact하고 embodiment-agnostic인 3D trace 표현을 사용한다. TraceExtract 파이프라인으로 다종 비디오에서 event-captioned 3D trace를 자동 추출하고(기존 대비 ~8배 확장), B-spline trace target과 semantic flow-matching으로 학습한다. 영상만으로 사전학습하고도 π0와 동등 이상의 성능(RoboCasa 30.25% vs π0 25.25%, 실세계 UR3 91.7%)을 달성했다.
핵심 요약
- TraceExtract: DINOv2 entity clustering으로 시맨틱 키포인트 선택 → 3D trace 추출 자동화(기존 대비 ~8배 확장)
- 3D trace를 B-spline 제어점으로 표현, VLM 백본 + permutation-equivariant trace expert로 flow matching 학습
- 비디오만으로 사전학습(action-free) 후 동결, 별도 action expert만 학습해서 크로스바디 전이
- RoboCasa 8 태스크 평균 30.25%로 π0(25.25%) 대비 +5.0p, 실세계 UR3 3태스크 평균 91.7%
- Trace feature가 없는 VLM+action expert 대비 +18.4p 격차 → trace 표현이 실제 운동 정보 제공
- Event-centric captioning으로 trace 구간별 언어 정합, 추론 시 depth 입력 불필요
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.