VLM3: Vision Language Models Are Native 3D Learners

발행일
출처
arXiv
논문 번호
277
분야
Computer Vision
arXiv 번호
2605.30561

VLM3: 비전 언어 모델은 본질적으로 3D 학습자다.

비전 언어 모델(VLM)은 프롬프팅을 통해 단일 모델이 다양한 비전 과제를 풀 수 있게 한다. 이들은 의미 이해에서 유망한 성능을 보여 왔다. 그러나 3D 이해는 여전히 복잡한 과제별 설계를 갖춘 전문 비전 모델에 크게 의존하고 있다. 이 연구가 제기하려는 핵심 주장은 VLM이 본질적으로 3D 학습자라는 것이다. 심층적인 대규모 연구는 첫째 초점 거리 통일, 둘째 텍스트 기반 픽셀 참조, 셋째 데이터 혼합 및 스케일링만 있으면 효과적인 3D 학습에 충분하다는 것을 보인다. 모델 구조 변경, 대형 모델, 무거운 데이터 증강, 그리고 회귀 정식화를 포함한 복잡한 손실 함수 등 전문 비전 모델의 근간을 이루는 많은 요소가 실제로는 필요조건이 아니다. 그 결과로 저자들은 표준 VLM이 다양한 3D 과제를 능숙하게 수행할 수 있게 하는, 가장 단순한 설계의 확장 가능한 방법인 VLM3를 제안한다. VLM3는 VLM의 깊이 추정 정확도를 큰 폭으로 향상시킬 뿐만 아니라(0.84에서 0.9로), 픽셀 대응, 카메라 자세 추정, 객체 수준 3D 이해 같은 다양한 3D 과제를 가능하게 하면서도 표준 구조와 텍스트 기반 학습을 유지한 채 전문 비전 모델의 정확도에 필적한다. VLM3는 단순하고 확장 가능한 3D 학습을 위한 새로운 패러다임을 연다.

핵심 요약

  • 그 결과로 저자들은 표준 VLM이 다양한 3D 과제를 능숙하게 수행할 수 있게 하는, 가장 단순한 설계의 확장 가능한 방법인 VLM3를 제안한다.
  • 심층적인 대규모 연구는 첫째 초점 거리 통일, 둘째 텍스트 기반 픽셀 참조, 셋째 데이터 혼합 및 스케일링만 있으면 효과적인 3D 학습에 충분하다는 것을 보인다.
  • 비전 언어 모델(VLM)은 프롬프팅을 통해 단일 모델이 다양한 비전 과제를 풀 수 있게 한다.

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)