World Tracing: Generative Pixel-Aligned Geometry Beyond the Visible
- 발행일
- 출처
- arXiv
- 논문 번호
- 407
- 분야
- Computer Vision
- arXiv 번호
- 2606.13652
단일 이미지에서 visible surface와 가려진 면을 동시에 예측하는 pixel-aligned 다층 기하 표현. WT-DiT 확산 트랜스포머로 객체·장면·동적 비디오에서 기존 depth 예측기와 image-to-3D 생성기 모두를 능가한다.
World Tracing은 각 입력 픽셀에 대해 카메라 좌표계 3D 점의 정렬된 스택을 예측한다. 첫 번째 층은 visible surface, 이후 층들은 가려진 표면과의 교차점을 나타낸다. WT-DiT는 다층 기하를 개별 디노이징 토큰으로 처리하고, 3-way 분해 어텐션(층별·광선별·전역)으로 결합한다. 픽셀 공간 flow matching과 혼합 노이즈 스케줄로 visible surface 재구성과 가려진 기하 생성의 균형을 잡았다. 객체·장면·동영상 벤치마크에서 깊이 예측기와 image-to-3D 생성기 양쪽을 능가하며, 3D 장면 편집·시점 합성·텍스처 메시 생성에 training-free로 활용 가능하다.
핵심 요약
- 픽셀 정렬 다층 pointmap: 각 픽셀에 L개의 camera-space 3D 점을 예측해 가려진 면까지 완성
- WT-DiT: 동결된 MoGe 인코더 + 3-way 분해 어텐션(layer/ray/global)으로 다층 결합
- depth-filling 전략: 가려진 층의 빈 값을 forward-fill하여 mask 예측 없이 dense XYZ 학습
- 객체·장면·동적 클립 모두 단일 아키텍처로 처리, 카메라 내부 파라미터 입력 불필요
- 기존 depth 예측기 대비 visible surface 정확도 우위, image-to-3D 생성기 대비 Chamfer 거리 우위
- 텍스트 기반 3D 장면 편집, 기하 조건부 시점 영상 합성, training-free 텍스처 메시 생성 적용
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.