SolarWM: Open Data and Scalable Training for Long-Horizon Video World Models
- 발행일
- 출처
- arXiv
- 논문 번호
- 1061
- 분야
- Computer Vision
- arXiv 번호
- 2609.02886
서로 다른 10개 영상 데이터셋(클립 143만 개)을 하나의 규격으로 통일하고, 구조가 다른 영상 생성기 4종(5B~33B)에 같은 훈련법을 적용해, 5초 영상만 배워도 시간 단위로 이어지는 카메라 조작형 영상 월드모델을 완전 오픈소스로 만든 프로젝트다.
이 논문은 한마디로 영상 생성기를 '카메라로 탐색할 수 있는 가상 세계'로 바꾸는 완전 오픈소스 기술기반이다. 데이터 쪽에서는 시간축·카메라 좌표·캡션 스타일이 제각각인 10개 데이터셋의 클립 143만 개를 프레임 단위로 정렬된 통합 규격으로 묶고, 원본 전처리와 훈련 배합을 분리해 다양한 배합 실험이 가능하게 했다. 모델 쪽에서는 Wan2.2·LTX-2.5·MiniMax-H3라는 서로 다른 생성기의 원래 구조와 학습 목표를 보존한 채 카메라 제어·훈련·롤아웃 공통 인터페이스만 얹어 5B부터 33B까지 4개 모델을 만들었다. 양방향 사전학습 → 자기회귀 적응 → 분포 정합 증류의 3단계 레시피로 학습했는데, 5초짜리 영상만으로 훈련하고도 분 단위에서 1시간짜리 연속 롤아웃을 실시간 카메라 조작에 반응하며 유지한다.
핵심 요약
- 10개 데이터셋 143만 클립(25TB 이상)을 프레임 정렬·카메라 기하·캡션·품질 메타데이터를 포함한 통합 규격으로 변환해, 전처리를 다시 돌리지 않고도 훈련 배합을 바꿔 실험할 수 있게 했다.
- 구조가 전혀 다른 Wan2.2(5B/14B)·LTX-2.5(22B)·MiniMax-H3(33B) 백본에 원래 표현과 목표를 해치지 않는 백본 네이티브 적응을 적용해, 서로 직접 비교 가능한 4개 모델 패밀리를 완성했다.
- 양방향 학습 → 자기회귀 적응 → 분포 정합 증류(DMD, 큰 모델의 출력 분포를 흉내 내도록 작은 모델을 압축 학습하는 기법)의 단순한 3단계만으로 특수한 초기화 없이 최고 수준 성능을 냈다.
- 5초 시퀀스만으로 학습했는데도 긴 영상 미세조정이나 어텐션 싱크 장치 없이 60분 연속 롤아웃 끝까지 장면 정체성과 카메라 반응을 유지했다.
- 학습 데이터에 없는 스타일의 외부 생성 이미지(GPT Image 2, Krea)로 시작해도 처음 보이는 영역을 상상하며 탐색 가능한 세계로 확장하는 일반화를 보였다.
- 데이터·처리 파이프라인·훈련 레시피·가중치를 전부 공개해 재현 가능한 영상 월드모델 연구의 기준점을 만들었다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.