SpatialWorld: Benchmarking Interactive Spatial Reasoning of Multimodal Agents in Real-World Tasks
- 발행일
- 출처
- arXiv
- 논문 번호
- 372
- 분야
- AI / General
- arXiv 번호
- 2606.09669
다중모달 에이전트의 실제 3D 환경에서 공간 추론 능력을 평가하는 통합 벤치마크 SpatialWorld를 제안했다. GPT-5도 17.4% 성공률에 그쳐 현재 모델의 한계를 명확히 드러낸다.
SpatialWorld는 8개의 이기종 시뮬레이터(AI2-THOR, CARLA, VirtualHome 등)를 통합 인터페이스로 묶어, 760개의 인간 어노테이션 태스크로 다중모달 에이전트의 공간 추론을 평가한다. 에이전트는 1인칭 시야만으로 부분 관측 환경에서 능동적으로 정보를 수집하고 text-based 액션으로 의사결정해야 한다. 15개 최신 모델 평가 결과 GPT-5가 17.4%로 최고 성능이었으나 여전히 낮은 수준이었고, 도메인별 성능 편차가 컸다. 작업 성공과 실행 효율성 간 불일치도 발견되었다.
핵심 요약
- 8개 시뮬레이터를 통합한 simulator-agnostic 평가 프로토콜 설계
- 가구일, 여행, 사회협력, 디지털 게임 등 6개 도메인 760개 태스크 구축
- 1인칭 vision-only 관측 + text-based 액션으로 MLLM 네이티브 인터페이스 제공
- GPT-5 최고 17.4%, Qwen-3.5 14.1%로 공간 추론 여전히 큰 과제
- 도메인별 리더가 달라지는 현상: 가구일은 GPT-5, 게임은 Gemini-3.1-Pro 우세
- 작업 성공률과 실행 효율성 간 불일치 발견
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.