Vision Pretraining for Dense Spatial Perception
- 발행일
- 출처
- arXiv
- 논문 번호
- 565
- 분야
- Computer Vision
- arXiv 번호
- 2607.05247
경계(boundary) 중심 자기지도 학습으로 dense spatial perception을 극대화한 비전 사전학습 방법을 제안한다. LingBot-Vision은 7B DINOv3와 동급 성능을 1B 파라미터로 달성한다.
이 논문은 경계(boundary)를 단순 출력이 아닌 학습 신호로 활용하는 masked boundary modeling을 제안한다. 교사 모델이 발견한 경계 토큰을 학생의 마스킹 타겟으로 강제하여 의미론적 표현과 기하학적 표현이 공동으로 학습되게 한다. 1B 파라미터 LingBot-Vision은 NYU-Depth v2에서 7B DINOv3를 능가하며, 0.3B 증류 모델로 7B와 동등한 깊이 추정 성능을 달성했다.
핵심 요약
- 경계를 출력이 아닌 고밀도 학습 신호로 재정의, 자기지도 사전학습에 경계 모델링 도입
- Masked boundary modeling: 교사의 경계 예측을 마스킹 타겟으로 사용, 기하학적 라우팅으로 의미·경계 갈등 해소
- 경계 필드의 범주적 재매개변수화로 안정적인 dense self-distillation 가능
- 1B LingBot-Vision이 NYU-Depth v2 정확도에서 7B DINOv3 능가, 14개 depth completion 벤치마크 SOTA
- 0.3B 증류 모델이 약 23배 적은 파라미터로 7B DINOv3와 동등한 NYU-Depth v2 정확도 달성
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.