DINOcular: Self-Supervised Visuospatial Representations
- 발행일
- 출처
- arXiv
- 논문 번호
- 1041
- 분야
- Computer Vision
- arXiv 번호
- 2608.27226
RGB 영상에 깊이 센서 정보를 함께 넣어 3D 공간 감각까지 갖춘 시각 표현을 자기지도학습으로 만든 프레임워크.
이 논문은 한마디로 RGB 영상과 깊이(Depth) 정보를 같이 보고 3D 공간 감각이 있는 시각 표현을 배우는 DINOcular 프레임워크다. 요즘 시각 기반모델은 RGB만 배워서 3D 이해가 약한데, 깊이를 위치 인코딩의 세 번째 축으로 넣어(3D 확장 RoPE) 기하 정보가 특징 자체에 스미게 했다. 3D 대응점 찾기·자세 추정 같은 기하 과제에서 같은 규모 기존 모델을 이겼고, 시맨틱 분할에서도 뒤처지지 않았다. 작은 모델이 3배 큰 DINO ViT-B보다 나은 경우도 있었다.
핵심 요약
- 깊이를 로터리 위치 인코딩(RoPE)의 세 번째 축으로 넣어 기하 정보가 특징 표현에 자연스럽게 들어가게 했다.
- 자기지도학습(라벨 없는 학습) 방식으로 RGB-D 영상에서 외관과 공간 구조를 함께 담은 표현을 배웠다.
- 3D 대응점 찾기(NAVI·ScanNet)에서 같은 규모 기존 모델을 이겼고, ScanNet에서는 DINOv3 ViT-B보다도 높았다.
- 3D 자세 추정에서 대형 모델(DINOcular-L)이 모든 baseline을 이기는 구간이 있었다.
- 3D 이해를 높이는 대신 시맨틱 성능이 소폭 희생되는 트레이드오프를 확인했다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.