SpatialClaw: Rethinking Action Interface for Agentic Spatial Reasoning
- 발행일
- 출처
- arXiv
- 논문 번호
- 413
- 분야
- Computer Vision
- arXiv 번호
- 2606.13673
VLM 기반 공간 추론 에이전트의 action interface로 code를 사용하는 SpatialClaw를 제안한다. 20개 벤치마크에서 59.9% 평균 정확도로 기존 대비 +11.2점 향상했다.
비전-언어 모델(VLM)의 공간 추론 능력을 향상하기 위해, SpatialClaw는 stateful Python kernel을 action interface로 사용하는 training-free 프레임워크를 제안한다. 기존 single-pass code 실행이나 structured tool-call과 달리, VLM 에이전트가 매 step마다 이전 결과를 관찰하며 코드를 작성·실행·수정할 수 있다. 20개 공간 추론 벤치마크에서 59.9% 평균 정확도를 달성하여 최근 spatial agent 대비 +11.2점 향상했으며, 6개 VLM 백본(Qwen, Gemma4)에서 일관된 개선을 보였다.
핵심 요약
- Stateful Python kernel로 매 step마다 중간 결과를 관찰하고 코드를 수정하는 agent loop 설계
- Single-pass code(사전 커밋)와 structured tool-call(제한적 조합)의 한계를 모두 극복
- 20개 공간 추론 벤치마크(정적/동적 3D·4D)에서 59.9% 평균, 기존 spatial agent 대비 +11.2점
- 6개 VLM 백본(Qwen 27B~397B, Gemma4)에서 벤치마크·모델 특화 튜닝 없이 일관된 성능 향상
- 가장 큰 개선은 dynamic 4D video reasoning과 multi-view inference에서 발생
- Training-free: 백본 모델이나 시스템 프롬프트 변경 없이 action interface 설계만으로 달성
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.