SpatialClaw: Rethinking Action Interface for Agentic Spatial Reasoning

발행일
출처
arXiv
논문 번호
413
분야
Computer Vision
arXiv 번호
2606.13673

VLM 기반 공간 추론 에이전트의 action interface로 code를 사용하는 SpatialClaw를 제안한다. 20개 벤치마크에서 59.9% 평균 정확도로 기존 대비 +11.2점 향상했다.

비전-언어 모델(VLM)의 공간 추론 능력을 향상하기 위해, SpatialClaw는 stateful Python kernel을 action interface로 사용하는 training-free 프레임워크를 제안한다. 기존 single-pass code 실행이나 structured tool-call과 달리, VLM 에이전트가 매 step마다 이전 결과를 관찰하며 코드를 작성·실행·수정할 수 있다. 20개 공간 추론 벤치마크에서 59.9% 평균 정확도를 달성하여 최근 spatial agent 대비 +11.2점 향상했으며, 6개 VLM 백본(Qwen, Gemma4)에서 일관된 개선을 보였다.

핵심 요약

  • Stateful Python kernel로 매 step마다 중간 결과를 관찰하고 코드를 수정하는 agent loop 설계
  • Single-pass code(사전 커밋)와 structured tool-call(제한적 조합)의 한계를 모두 극복
  • 20개 공간 추론 벤치마크(정적/동적 3D·4D)에서 59.9% 평균, 기존 spatial agent 대비 +11.2점
  • 6개 VLM 백본(Qwen 27B~397B, Gemma4)에서 벤치마크·모델 특화 튜닝 없이 일관된 성능 향상
  • 가장 큰 개선은 dynamic 4D video reasoning과 multi-view inference에서 발생
  • Training-free: 백본 모델이나 시스템 프롬프트 변경 없이 action interface 설계만으로 달성

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)