PointDiT: Pixel-Space Diffusion for Monocular Geometry Estimation

발행일
출처
arXiv
논문 번호
560
분야
Computer Vision
arXiv 번호
2607.02515

단순한 pixel-space Diffusion Transformer(ViT)로 원시 3D 포인트 맵 패치에 직접 diffusion을 적용해 단안 기하학 추정을 수행한다. VAE 기반 latent diffusion 없이도 복잡한 기존 방법을 능가하며 더 선명한 기하학적 구조를 복원한다.

PointDiT는 DINOv3 토큰으로 조건부 처리되는 plain ViT 백본을 raw 3D point map 패치 위에서 처음부터 학습시키는 미니멀 pixel-space diffusion 프레임워크다. VAE 압축이나 하이브리드 아키텍처 없이도 x-prediction 목표 하나로 GeometryCrafter 같은 latent diffusion 모델을 능가하며, 특히 투명 물체나 얇은 구조 같은 모호한 영역에서 더 선명한 기하학을 생성한다. 1-step inference만으로도 경쟁력 있는 결과를 내며, multi-step에서 구조적 디테일이 더 개선된다.

핵심 요약

  • 핵심 혁신: latent space(VAE)를 거치지 않고 raw 3D point map에 직접 diffusion을 적용하는 최초의 pixel-space 접근
  • x-prediction(클린 point map 직접 예측)이 v-prediction보다 압도적 우위—v-pred는 Rel 35.44 vs x-pred 9.29
  • DINOv3 4-layer 특징 주입이 경계 선명도(BF1)를 13.47로 끌어올림—MoGe-2(11.75), DA3(12.58)보다 우수
  • 생성형 접근이 결정론적 회귀보다 경계 품질(BF1 13.92 vs 10.90)과 모호 영역 처리에서 확실한 우위
  • ICML 2026(서울) 채택—pixel-space diffusion이 자연 이미지를 넘어 3D/4D 기하학으로 확장될 수 있음을 입증

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)