Wonder: Video World Model Done Better
- 발행일
- 출처
- arXiv
- 논문 번호
- 745
- 분야
- Computer Vision
- arXiv 번호
- 2607.26037
이 논문은 실시간으로 카메라를 조작할 수 있는 비디오 세계 모델(Wonder)을 처음부터 끝까지 시스템 수준으로 설계해, 16 FPS로 분 단위 긴 영상을 만들면서도 카메라 제어 정확도와 장기 기억 일관성을 동시에 잡은 연구다.
이 논문은 한마디로 사진 한 장에서 출발해 사용자가 실시간으로 카메라를 움직이며 탐험할 수 있는 '비디오 세계 모델'을 만든 연구다. 핵심은 카메라 제어 방식, 메모리 구조, 증류(distillation) 훈련을 하나의 시스템으로 통합 설계한 것이다. 픽셀 단위 좌표장(coordinate field)으로 카메라 움직임을 시각 정보로 직접 주고, 희소 어텐션(sparse attention)으로 긴 영상에서도 필요한 부분만 빠르게 찾아낸다. 결과적으로 16 FPS 실시간 생성, 이전 최고 모델 대비 카메라 이동 오차 24% 감소, 그리고 분 단위 롤아웃에서도 장면 일관성을 유지했다.
핵심 요약
- 카메라 움직임을 추상 데이터가 아닌 '렌더링된 시각 단서'로 변환해서, 증류 후에도 제어 정확도가 떨어지지 않게 했다.
- 희소 풀해상도 메모리(sparse full-fidelity memory)로 모든 과거 프레임을 보존하면서도 어텐션 비용은 일정하게 유지했다.
- 시간별 혼합 학생(mixture-of-students) + 카메라 인식 적대 정규화로 증류 과정에서 시각 품질과 제어 정확도를 둘 다 지켰다.
- 회전 위치 오차(RPE)에서 최강 기준선 대비 이동 0.0174→0.0132, 회전 0.1155→0.0784로 유의미한 개선을 달성했다.
- 비디오 입력도 지원해서, 기존 동영상의 카메라 경로를 실시간으로 바꿔 재촬영할 수 있다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.