WAM4D: Fast 4D World Action Model via Spatial Register Tokens

발행일
출처
arXiv
논문 번호
421
분야
Computer Vision
arXiv 번호
2606.14048

공간 register token으로 학습 시에만 depth를 사용하고 추론 시에는 제거하는 fast 4D world action model이다.

WAM4D는 geometric foundation model의 prior를 causal video-action transformer에 주입하기 위해, 학습 시에만 spatial register token이 history video token에서 depth를 읽어내고 backprop으로 video feature에 geometric 정보를 전달하는 구조를 제안한다. 추론 시 register branch를 제거하여 동일한 2D observation-to-action 인터페이스를 유지하면서도, RoboTwin 2.0과 실제 로봇 조작에서 공간 일관성과 행동 예측 정확도를 동시에 향상시킨다. Causal Mixture Attention으로 video/action/geometry token 간 모달별 가시성을 정의하여 non-causal shortcut을 방지한다.

핵심 요약

  • Spatial register token이 학습 시에만 depth readout 담당, 추론 시 제거로 latency 비용 없음
  • Causal Mixture Attention: MoT 백본에서 video/action/geometry token 간 모달별 가시성 정의
  • RoboTwin 2.0에서 π0 대비 +7.5p, LingBot-VA 대비 +6.1p 향상(selected 10 tasks)
  • 추론 latency 525ms(VLA 64ms 대비 느리지만 WAM 중에서는 빠른 편), depth branch 제거로 9.71 GiB VRAM
  • 실세계 long-horizon 4단계 조작 태스크에서 π0 대비 +13.4p 향상
  • Trainable pretrained geometric head가 random init보다, bidirectional보다 unidirectional이 더 효율적

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)