minWM: A Full-Stack Open-Source Framework for Real-Time Interactive Video World Models

발행일
출처
arXiv
논문 번호
270
분야
Computer Vision
arXiv 번호
2605.30263

minWM은 양방향 비디오 확산 모델을 실시간 상호작용이 가능하고 카메라 제어가 가능한 자기회귀(AR) 월드 모델로 변환하는 오픈소스 프레임워크다.

minWM은 양방향 텍스트-비디오 또는 이미지-비디오 확산 모델을 실시간 상호작용형 월드 모델로 바꾸는 전체 오픈소스 절차를 제공한다. 먼저 카메라 제어를 학습시킨 뒤 자기회귀 확산 학습, 인과 ODE 또는 일관성 증류, 비대칭 DMD를 거쳐 적은 단계로 영상을 이어 생성하게 한다. Wan2.1-T2V-1.3B와 HY1.5-TI2V-8B처럼 조건 주입 구조가 다른 공개 백본에 적용해 구조 확장성을 확인했고, 기존 HY-WorldPlay를 새 데이터와 지연 목표에 맞추는 기능도 지원한다. 실행 스크립트와 체크포인트뿐 아니라 카메라 궤적 품질, 제어 학습 단계, 최소 배치 크기에 관한 실용적 절제 실험도 공개했다. 현재 지원 범위는 두 계열 모델과 카메라 제어가 중심이며, 자세 같은 추가 제어 조건과 더 많은 백본으로의 확장은 후속 과제로 남아 있다.

핵심 요약

  • 학습 단계: 카메라 제어성은 즉각적으로 생기지 않는다. HY1.5 백본을 사용했을 때, 모델은 2,000 스텝에서는 반응성을 보이지 않았고, 5,000 스텝에서 제어의 징후를 보이기 시작했으며, 8,000 스텝 이후에야 안정화되었다.
  • 체화 AI: 로봇에게 행동의 시각적 결과를 예측할 정신적 시뮬레이터를 제공한다.
  • 게임 개발: 플레이어의 움직임에 즉석에서 반응하는 무한하고 상호작용 가능한 환경을 생성한다.

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)