Learning How the World Evolves: Extrapolative Video World Models via Latent Dynamics Reasoning
- 발행일
- 출처
- arXiv
- 논문 번호
- 864
- 분야
- Computer Vision
- arXiv 번호
- 2608.09926
이 논문은 비디오 모델이 단순히 픽셀을 맞추는 게 아니라 물리 법칙을 학습해서 훈련 분포 밖에서도 잘 일반화하도록 만든 세계 모델(LDR)을 제안했다. 26배 작고 143배 빠르면서도 외삽 오차가 20배 이상 적다.
이 논문은 한마디로 비디오 생성 모델이 '다음 프레임이 뭘까'만 맞추는 게 아니라 '물체가 어떻게 움직일까'라는 역학을 학습하게 만들었다. 핵심은 Latent Dynamics Reasoning(LDR)으로, 구조화된 잠재 공간에서 저차 미분(위치, 속도, 가속도)은 수치 적분하고 모델은 고차 잔여만 예측한다. 이렇게 하면 적은 데이터로 학습한 물리 법칙을 훈련 분포 밖에서도 정확히 외삽할 수 있다. 빨간 공이 왼쪽으로 가는 걸로 학습하고 파란 사각형이 오른쪽으로 가는 상황도 맞춘다.
핵심 요약
- 잠재 공간에서 운동 법칙을 명시적으로 추론하는 최초의 비디오 세계 모델(LDR)을 제안했다.
- 저차 미분은 수치 적분, 고차 잔여만 모델이 예측하는 구조로 물리 법칙 학습을 강제했다.
- 비디오 확산 모델 대비 26배 적은 매개변수, 143배 빠른 속도로 동작한다.
- 훈련 분포 내-외부 오차 격차가 20배 이상 작아 외삽 능력이 압도적이다.
- 색깔, 형태, 방향이 바뀌어도 학습한 역학을 정확히 일반화함을 보였다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.