WAM4D: Fast 4D World Action Model via Spatial Register Tokens
- 발행일
- 출처
- arXiv
- 논문 번호
- 421
- 분야
- Computer Vision
- arXiv 번호
- 2606.14048
공간 register token으로 학습 시에만 depth를 사용하고 추론 시에는 제거하는 fast 4D world action model이다.
WAM4D는 geometric foundation model의 prior를 causal video-action transformer에 주입하기 위해, 학습 시에만 spatial register token이 history video token에서 depth를 읽어내고 backprop으로 video feature에 geometric 정보를 전달하는 구조를 제안한다. 추론 시 register branch를 제거하여 동일한 2D observation-to-action 인터페이스를 유지하면서도, RoboTwin 2.0과 실제 로봇 조작에서 공간 일관성과 행동 예측 정확도를 동시에 향상시킨다. Causal Mixture Attention으로 video/action/geometry token 간 모달별 가시성을 정의하여 non-causal shortcut을 방지한다.
핵심 요약
- Spatial register token이 학습 시에만 depth readout 담당, 추론 시 제거로 latency 비용 없음
- Causal Mixture Attention: MoT 백본에서 video/action/geometry token 간 모달별 가시성 정의
- RoboTwin 2.0에서 π0 대비 +7.5p, LingBot-VA 대비 +6.1p 향상(selected 10 tasks)
- 추론 latency 525ms(VLA 64ms 대비 느리지만 WAM 중에서는 빠른 편), depth branch 제거로 9.71 GiB VRAM
- 실세계 long-horizon 4단계 조작 태스크에서 π0 대비 +13.4p 향상
- Trainable pretrained geometric head가 random init보다, bidirectional보다 unidirectional이 더 효율적
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.