Thinking with Imagination: Agentic Visual Spatial Reasoning with World Simulators
- 발행일
- 출처
- arXiv
- 논문 번호
- 367
- 분야
- Computer Vision
- arXiv 번호
- 2606.06476
VLM이 세계 시뮬레이터와 상호작용하며 상상된 시각 증거를 능동적으로 획득하는 에이전트 공간 추론 프레임워크 Astra를 제안했다.
Astra는 VLM이 세계 시뮬레이터와 상호작용하며 능동적으로 상상된 시각 증거를 획득하는 에이전트 공간 추론 프레임워크다. Astra-VL(RL 훈련된 VLM 정책)과 Astra-WM(Bagel 기반 세계 시뮬레이터)로 구성된다. Astra-WM은 뷰 일관성 튜닝으로 자세 및 콘텐츠 일관성을 향상시키고, Astra-VL은 세계 시뮬레이터-인-더-루프 2단계 RL 커리큘럼으로 시뮬레이터 호출 시점과 방법을 학습한다. MMSI-Bench에서 Qwen3-VL 백본을 29.8에서 38.8로, MindCube에서 36.8에서 42.7로 향상시켰다.
핵심 요약
- 공간 추론을 상호작용적 증거 획득 문제로 정식화하여 VLM이 능동적으로 상상된 시각 증거를 요청하고 활용하도록 설계했다
- Astra-WM에 뷰 일관성 튜닝을 적용하여 기존 이미지 생성 모델의 공간적 일관성 부족 문제를 해결했다
- 2단계 RL 커리큘럼으로 1단계에서 유효한 시뮬레이터 호출을 학습하고 2단계에서 선택적 상상을 장려한다
- 단순히 Qwen3-VL에 시뮬레이터를 연결하면 성능이 저하되지만 RL 훈련 후에는 유의미한 향상이 발생함을 입증했다
- 상상이 유용하려면 세계 시뮬레이터의 품질과 언제 어디서 어떻게 상상할지를 결정하는 에이전트 정책이 모두 필요함을 보였다
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.