3D-Aware VLMs with Implicit and Explicit Geometries

발행일
출처
arXiv
논문 번호
706
분야
Computer Vision
arXiv 번호
2607.21595

2D 이미지만으로 3D 공간을 이해하는 VLM에, 암묵적(전역) 기하 정보와 명시적(세부) 기하 정보를 함께 주입해서 3D 과제 성능을 높인 프레임워크다.

이 논문은 한마디로 비전-언어 모델(VLM)이 RGB 비디오만 보고도 3D 공간을 정확히 이해하도록, 암묵적 기하 토큰(전체 장면의 대략적 3D 구조)과 명시적 기하 토큰(깊이 지도, 포인트 클라우드 같은 세부 3D 정보)을 함께 주입하는 프레임워크(VLM-IE3D)를 제안했다. 기존 방식은 암묵적 정보만 써서 세밀한 3D 과제에 한계가 있었다. 두 종류 토큰을 3D-aware 어댑터로 융합해서 2D 시각 정보와 결합한다. 3D 객체 감지, 3D 시각 위치 파악, 3D 밀집 캡션, 공간 추론에서 RGB-only 방식 중 최고 성능을 달성했다.

핵심 요약

  • 암묵적 기하 토큰(IGT)과 명시적 기하 토큰(EGT)을 동시에 VLM에 주입했다.
  • EGT는 깊이 지도·포인트 클라우드 같은 세부 3D 정보를 경량 임베딩으로 인코딩한다.
  • 3D-aware 어댑터로 2D 시각 + 암묵 3D + 명시 3D 정보를 효과적으로 융합한다.
  • RGB 비디오만 입력으로 사용해서 추가 3D 센서가 필요 없다.
  • 3D 비디오 감지, 3D 시각 그라운딩, 3D 밀집 캡션, 공간 추론 4개 과제에서 SOTA 달성.

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)