Beyond Pixels: From Video Priors to 4D Worlds
- 발행일
- 출처
- arXiv
- 논문 번호
- 877
- 분야
- Computer Vision
- arXiv 번호
- 2608.10744
이 논문은 비디오 생성 모델의 중간 표현(잠재 공간)을 4D(3D+시간) 장면으로 직접 변환해서, RGB 이미지를 거치지 않고도 동적 3D 장면을 만드는 새로운 방법을 제안한다.
이 논문은 한마디로 비디오 AI의 '내부 표현'을 4D 장면으로 직접 바꾸는 방법을 제안한다. 기존 방식은 비디오를 RGB 이미지로 만든 뒤 다시 3D로 복원했는데, 이 과정에서 정보 손실과 오류가 누적됐다. Latent-to-4D는 비디오 모델의 VAE(변분 오토인코더, 데이터를 압축 표현하는 부분) 잠재 공간과 4D 디코더 사이에 직접 연결 다리를 놓는다. 약 1,000개 클립으로 학습한 단일 체크포인트가 여러 비디오 생성기에 변경 없이 적용되며, 기존 방식 대비 기하학적 품질과 시간적 안정성에서 우위를 보였다.
핵심 요약
- 비디오 생성 모델의 VAE 잠재 표현을 4D 디코더에 직접 연결하는 Latent-to-4D 프레임워크를 제안했다.
- RGB 이미지를 생성하는 단계를 건너뛰어 정보 손실과 오류 누적을 방지했다.
- 약 1,000개의 기존 복원 클립으로 학습해, 하나의 체크포인트로 여러 비디오 생성기에 재사용 가능하다.
- Text4D-200 벤치마크에서 DINO-F1 2.88~3.45점 향상, I4D-200에서 5.81점 향상을 달성했다.
- 인간 평가에서 기하학적 타당성, 완전성, 시간적 안정성 모두에서 기존 방식을 능가했다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.