DINOcular: Self-Supervised Visuospatial Representations

발행일
출처
arXiv
논문 번호
1041
분야
Computer Vision
arXiv 번호
2608.27226

RGB 영상에 깊이 센서 정보를 함께 넣어 3D 공간 감각까지 갖춘 시각 표현을 자기지도학습으로 만든 프레임워크.

이 논문은 한마디로 RGB 영상과 깊이(Depth) 정보를 같이 보고 3D 공간 감각이 있는 시각 표현을 배우는 DINOcular 프레임워크다. 요즘 시각 기반모델은 RGB만 배워서 3D 이해가 약한데, 깊이를 위치 인코딩의 세 번째 축으로 넣어(3D 확장 RoPE) 기하 정보가 특징 자체에 스미게 했다. 3D 대응점 찾기·자세 추정 같은 기하 과제에서 같은 규모 기존 모델을 이겼고, 시맨틱 분할에서도 뒤처지지 않았다. 작은 모델이 3배 큰 DINO ViT-B보다 나은 경우도 있었다.

핵심 요약

  • 깊이를 로터리 위치 인코딩(RoPE)의 세 번째 축으로 넣어 기하 정보가 특징 표현에 자연스럽게 들어가게 했다.
  • 자기지도학습(라벨 없는 학습) 방식으로 RGB-D 영상에서 외관과 공간 구조를 함께 담은 표현을 배웠다.
  • 3D 대응점 찾기(NAVI·ScanNet)에서 같은 규모 기존 모델을 이겼고, ScanNet에서는 DINOv3 ViT-B보다도 높았다.
  • 3D 자세 추정에서 대형 모델(DINOcular-L)이 모든 baseline을 이기는 구간이 있었다.
  • 3D 이해를 높이는 대신 시맨틱 성능이 소폭 희생되는 트레이드오프를 확인했다.

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)