minWM: A Full-Stack Open-Source Framework for Real-Time Interactive Video World Models
- 발행일
- 출처
- arXiv
- 논문 번호
- 270
- 분야
- Computer Vision
- arXiv 번호
- 2605.30263
minWM은 양방향 비디오 확산 모델을 실시간 상호작용이 가능하고 카메라 제어가 가능한 자기회귀(AR) 월드 모델로 변환하는 오픈소스 프레임워크다.
minWM은 양방향 텍스트-비디오 또는 이미지-비디오 확산 모델을 실시간 상호작용형 월드 모델로 바꾸는 전체 오픈소스 절차를 제공한다. 먼저 카메라 제어를 학습시킨 뒤 자기회귀 확산 학습, 인과 ODE 또는 일관성 증류, 비대칭 DMD를 거쳐 적은 단계로 영상을 이어 생성하게 한다. Wan2.1-T2V-1.3B와 HY1.5-TI2V-8B처럼 조건 주입 구조가 다른 공개 백본에 적용해 구조 확장성을 확인했고, 기존 HY-WorldPlay를 새 데이터와 지연 목표에 맞추는 기능도 지원한다. 실행 스크립트와 체크포인트뿐 아니라 카메라 궤적 품질, 제어 학습 단계, 최소 배치 크기에 관한 실용적 절제 실험도 공개했다. 현재 지원 범위는 두 계열 모델과 카메라 제어가 중심이며, 자세 같은 추가 제어 조건과 더 많은 백본으로의 확장은 후속 과제로 남아 있다.
핵심 요약
- 학습 단계: 카메라 제어성은 즉각적으로 생기지 않는다. HY1.5 백본을 사용했을 때, 모델은 2,000 스텝에서는 반응성을 보이지 않았고, 5,000 스텝에서 제어의 징후를 보이기 시작했으며, 8,000 스텝 이후에야 안정화되었다.
- 체화 AI: 로봇에게 행동의 시각적 결과를 예측할 정신적 시뮬레이터를 제공한다.
- 게임 개발: 플레이어의 움직임에 즉석에서 반응하는 무한하고 상호작용 가능한 환경을 생성한다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.