S-Agent: Spatial Tool-Use Elicits Reasoning for Spatial Intelligence

발행일
출처
arXiv
논문 번호
454
분야
Computer Vision
arXiv 번호
2606.20515

VLM을 공간적 도구 사용 에이전트로 전환하여 다중 뷰 영상의 3D 공간 추론을 수행하는 프레임워크. training-free로 GPT-5.4를 능가하고 8B 모델로 상용 모델과 경쟁한다.

S-AGENT는 VLM을 의미론적 플래너로 활용하고 2D 객체 그라운딩, 3D 기하학적 리프팅, 전문가 수준 공간 지식 집적의 3계층 도구를 결합한다. Scene Memory와 Agent Memory를 통해 프레임 간 증거를 축적하며, training-free 설정에서 GPT-5.4 대비 MMSI-Bench 4.5% 향상을 달성했다. S-300K 궤적 데이터셋으로 파인튜닝한 S-AGENT-8B는 Qwen3-VL-8B 대비 10.5% 향상(31.1%→41.6%)을 보이며 GPT-5.4, Gemini 3 Pro와 경쟁 가능한 수준이다.

핵심 요약

  • 공간 추론을 프레임 단위 예측이 아닌 시공간 증거 축적 과정으로 재정의
  • 2D 그라운딩 → 3D 기하학적 리프팅 → 공간 지식 집적의 3계층 도구 사용
  • Scene Memory(객체 상태) + Agent Memory(추론 이력)로 상태 유지 추론 지원
  • Training-free 설정에서 GPT-5.4 대비 MMSI-Bench 4.5% 향상
  • S-300K 궤적 학습한 S-AGENT-8B는 Qwen3-VL-8B 대비 +10.5% (31.1%→41.6%)
  • Level-3 전문가가 원시 3D 데이터를 작업 지향적 측정으로 변환하는 것이 핵심

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)