PointDiT: Pixel-Space Diffusion for Monocular Geometry Estimation
- 발행일
- 출처
- arXiv
- 논문 번호
- 560
- 분야
- Computer Vision
- arXiv 번호
- 2607.02515
단순한 pixel-space Diffusion Transformer(ViT)로 원시 3D 포인트 맵 패치에 직접 diffusion을 적용해 단안 기하학 추정을 수행한다. VAE 기반 latent diffusion 없이도 복잡한 기존 방법을 능가하며 더 선명한 기하학적 구조를 복원한다.
PointDiT는 DINOv3 토큰으로 조건부 처리되는 plain ViT 백본을 raw 3D point map 패치 위에서 처음부터 학습시키는 미니멀 pixel-space diffusion 프레임워크다. VAE 압축이나 하이브리드 아키텍처 없이도 x-prediction 목표 하나로 GeometryCrafter 같은 latent diffusion 모델을 능가하며, 특히 투명 물체나 얇은 구조 같은 모호한 영역에서 더 선명한 기하학을 생성한다. 1-step inference만으로도 경쟁력 있는 결과를 내며, multi-step에서 구조적 디테일이 더 개선된다.
핵심 요약
- 핵심 혁신: latent space(VAE)를 거치지 않고 raw 3D point map에 직접 diffusion을 적용하는 최초의 pixel-space 접근
- x-prediction(클린 point map 직접 예측)이 v-prediction보다 압도적 우위—v-pred는 Rel 35.44 vs x-pred 9.29
- DINOv3 4-layer 특징 주입이 경계 선명도(BF1)를 13.47로 끌어올림—MoGe-2(11.75), DA3(12.58)보다 우수
- 생성형 접근이 결정론적 회귀보다 경계 품질(BF1 13.92 vs 10.90)과 모호 영역 처리에서 확실한 우위
- ICML 2026(서울) 채택—pixel-space diffusion이 자연 이미지를 넘어 3D/4D 기하학으로 확장될 수 있음을 입증
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.