3D-Aware VLMs with Implicit and Explicit Geometries
- 발행일
- 출처
- arXiv
- 논문 번호
- 706
- 분야
- Computer Vision
- arXiv 번호
- 2607.21595
2D 이미지만으로 3D 공간을 이해하는 VLM에, 암묵적(전역) 기하 정보와 명시적(세부) 기하 정보를 함께 주입해서 3D 과제 성능을 높인 프레임워크다.
이 논문은 한마디로 비전-언어 모델(VLM)이 RGB 비디오만 보고도 3D 공간을 정확히 이해하도록, 암묵적 기하 토큰(전체 장면의 대략적 3D 구조)과 명시적 기하 토큰(깊이 지도, 포인트 클라우드 같은 세부 3D 정보)을 함께 주입하는 프레임워크(VLM-IE3D)를 제안했다. 기존 방식은 암묵적 정보만 써서 세밀한 3D 과제에 한계가 있었다. 두 종류 토큰을 3D-aware 어댑터로 융합해서 2D 시각 정보와 결합한다. 3D 객체 감지, 3D 시각 위치 파악, 3D 밀집 캡션, 공간 추론에서 RGB-only 방식 중 최고 성능을 달성했다.
핵심 요약
- 암묵적 기하 토큰(IGT)과 명시적 기하 토큰(EGT)을 동시에 VLM에 주입했다.
- EGT는 깊이 지도·포인트 클라우드 같은 세부 3D 정보를 경량 임베딩으로 인코딩한다.
- 3D-aware 어댑터로 2D 시각 + 암묵 3D + 명시 3D 정보를 효과적으로 융합한다.
- RGB 비디오만 입력으로 사용해서 추가 3D 센서가 필요 없다.
- 3D 비디오 감지, 3D 시각 그라운딩, 3D 밀집 캡션, 공간 추론 4개 과제에서 SOTA 달성.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.