Video Generative Models as Geometry Learner

발행일
출처
arXiv
논문 번호
1045
분야
Computer Vision
arXiv 번호
2608.28549

사진 한 장에서 깊이와 표면 방향을 함께 뽑아내는 문제를, 이미 학습된 '영상 생성 AI'를 다음 프레임 예측으로 재활용해 적은 데이터로 푼 논문.

이 논문은 한마디로 사진 한 장으로 3D 기하 정보(깊이+표면 법선)를 동시에 뽑는 새 방법 GeoNeXt를 제안한 것이다. 핵심 아이디어는 이미 대규모로 학습된 영상 생성 모델을 가져와, 원본 이미지의 '다음 프레임'에 깊이 맵과 법선 맵이 오는 것처럼 예측 문제를 다시 정의한 것이다. 적은 학습 데이터(Hypersim, Virtual KITTI 수준)로 가벼운 미세조정만 했는데도 기존 생성형 방법을 모두 앞질렀다. 심지어 100배 이상 많은 데이터로 학습한 판별식(정답을 맞히기만 하던) 최고 성능 모델과도 대등한 수준을 보였다.

핵심 요약

  • 영상 생성 모델이 원래 갖고 있던 시간 일관성 지식을 그대로 물려받아, 깊이·법선을 이미지와 함께 한 번에 생성했다.
  • 약 100분의 1 수준의 학습 데이터로도 기존 최고 성능 판별 모델과 대등한 성능을 냈다.
  • 깊이·법선을 각각 따로 예측하던 기존 방식과 달리 하나의 모델로 통합해 체크포인트 저장과 계산 비용을 아꼈다.
  • 단 한 번의 예측으로 모든 생성형 기준선을 넘어섰고, 가벼운 앙상블(5×5, 10초)로 성능을 더 끌어올렸다.
  • 뽑아낸 3D 기하 정보로 이미지 재조명, 조절 가능한 이미지 생성, 3D 메쉬 복원 같은 응용이 가능해졌다.

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)