Latent Spatial Memory for Video World Models

발행일
출처
arXiv
논문 번호
371
분야
Computer Vision
arXiv 번호
2606.09828

비디오 월드 모델의 3D 공간 일관성 유지를 위해 RGB 대신 diffusion latent 공간에 직접 3D 메모리를 구축하는 Mirage 프레임워크를 제안했다. 기존 RGB 포인트클라우드 대비 최대 10.57배 빠른 속도와 55배 적은 GPU 메모리를 달성했다.

기존 비디오 월드 모델은 3D 공간 일관성을 위해 RGB 포인트클라우드 메모리를 사용했으나, 렌더링-인코딩 과정이 연산 병목이자 정보 손실의 원인이었다. Mirage는 depth 기반 역투영으로 latent token을 3D 공간에 직접 적재하고, 타겟 뷰를 latent 해상도에서 투영해 읽어오는 방식으로 이 문제를 해결한다. ControlNet 스타일 side branch를 통해 diffusion backbone에 주입하며, 동적 객체 필터링으로 장기 롤아웃 안정성을 확보한다. WorldScore에서 SOTA를 달성하고 RealEstate10K에서 강한 재구성 품질을 보여준다.

핵심 요약

  • Latent 공간에 직접 3D spatial memory를 구축해 pixel-space 왕복 비용 제거
  • Depth-guided back-projection으로 latent token을 3D world-space에 적재
  • Occlusion-aware latent-resolution projection으로 타겟 뷰 획득
  • 동적 객체와 하늘을 메모리 업데이트에서 제외해 장기 안정성 향상
  • RGB 캐시 대비 end-to-end 10.57배 속도, 55배 GPU 메모리 절감
  • 2-stage 훈련으로 side branch와 LoRA 안정적 수렴 유도

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)