Geometric Action Model for Robot Policy Learning
- 발행일
- 출처
- arXiv
- 논문 번호
- 425
- 분야
- Robotics
- arXiv 번호
- 2606.17046
GAM(Geometric Action Model)은 geometric foundation model을 로봇 정책의 공유 backbone으로 직접 재사용하여 3D 기하학을 명시적으로 추론하는 언어 조건부 조작 정책이다.
GFM을 중간 층에서 분할하여 shallow layer는 관측 인코더, deep layer는 action/기하학 decoder로 활용하며, 중간에 causal future predictor를 삽입해 future latent token을 예측한다. 단일 backbone forward pass로 action과 future geometry를 동시에 생성하며, 기존 VLA/WAM 대비 55× 빠르고 더 정확하며 더 가볍다. 특히 camera perturbation 설정에서 +9.7%p 우수하다.
핵심 요약
- GFM 중간층 분할: shallow layer는 관측 인코더, causal future predictor 삽입, deep layer는 action+geometry decoder로 재사용
- 단일 autoregressive token sequence + 단일 forward pass로 action token과 future-scene token을 동시에 생성
- 기존 foundation-model-scale baseline 대비 55× 빠른 추론, 더 적은 parameter로 동등 이상의 성능
- LIBERO-Plus camera perturbation 설정에서 +9.7%p 우수 (3D geometric prior의 직접적 효과)
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.