Qwen-3D: A Generalist 3D Vision-Language Model for Spatial Understanding
- 발행일
- 출처
- arXiv
- 논문 번호
- 830
- 분야
- Computer Vision
- arXiv 번호
- 2608.02980
3D 공간 정보(깊이, 카메라 자세)를 멀티모달 모델에 자연스럽게 통합해서 긴 비디오도 효율적으로 이해하고 3D에서 물체를 정확히 찾게 만들었다.
이 논문은 한마디로 3D 공간 정보를 활용해 멀티모달 AI가 긴 비디오와 3D 장면을 효율적으로 이해하게 만든 모델이다. Qwen-3D는 깊이와 카메라 자세를 써서 여러 시점의 비디오 프레임을 3D 공간에서 압축(merge)한다. 3D 회전 위치 인코딩(RoPE)으로 어텐션이 프레임 단위가 아닌 3D 공간에서 직접 작동하게 한다. 또한 언어 모델과 마스크 디코더가 시각 토큰을 공유해 3D 물체를 정확히 찾고 분할할 수 있다.
핵심 요약
- 3D 위치 정보(깊이+카메라 자세)로 시각 토큰을 공간적으로 압축해 긴 비디오를 효율적으로 처리한다.
- 3D Rotary Positional Embedding으로 어텐션이 3D 공간에서 직접 작동해 교차 시점 추론을 개선했다.
- 언어모델과 segmentation 디코더가 full visual token을 공유하는 구조로 3D 시각 grounding에서 대폭 향상되었다.
- 3D visual grounding +4% Acc@25, 3D instance segmentation +13% mAP로 기존 3D LMM을 능가했다.
- 2D 비전-언어 벤치마크 성능은 Qwen2.5-VL 수준을 유지해 3D 학습이 2D 능력을 해치지 않음을 보였다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.