SpatialWorld: Benchmarking Interactive Spatial Reasoning of Multimodal Agents in Real-World Tasks

발행일
출처
arXiv
논문 번호
372
분야
AI / General
arXiv 번호
2606.09669

다중모달 에이전트의 실제 3D 환경에서 공간 추론 능력을 평가하는 통합 벤치마크 SpatialWorld를 제안했다. GPT-5도 17.4% 성공률에 그쳐 현재 모델의 한계를 명확히 드러낸다.

SpatialWorld는 8개의 이기종 시뮬레이터(AI2-THOR, CARLA, VirtualHome 등)를 통합 인터페이스로 묶어, 760개의 인간 어노테이션 태스크로 다중모달 에이전트의 공간 추론을 평가한다. 에이전트는 1인칭 시야만으로 부분 관측 환경에서 능동적으로 정보를 수집하고 text-based 액션으로 의사결정해야 한다. 15개 최신 모델 평가 결과 GPT-5가 17.4%로 최고 성능이었으나 여전히 낮은 수준이었고, 도메인별 성능 편차가 컸다. 작업 성공과 실행 효율성 간 불일치도 발견되었다.

핵심 요약

  • 8개 시뮬레이터를 통합한 simulator-agnostic 평가 프로토콜 설계
  • 가구일, 여행, 사회협력, 디지털 게임 등 6개 도메인 760개 태스크 구축
  • 1인칭 vision-only 관측 + text-based 액션으로 MLLM 네이티브 인터페이스 제공
  • GPT-5 최고 17.4%, Qwen-3.5 14.1%로 공간 추론 여전히 큰 과제
  • 도메인별 리더가 달라지는 현상: 가구일은 GPT-5, 게임은 Gemini-3.1-Pro 우세
  • 작업 성공률과 실행 효율성 간 불일치 발견

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)