Sekai2: From World Exploration to Interactive World Modeling
- 발행일
- 출처
- arXiv
- 논문 번호
- 863
- 분야
- Computer Vision
- arXiv 번호
- 2608.09449
이 논문은 비디오 세계 모델 학습을 위해 장시간 영상, 카메라 궤적, 시간별 주석을 함께 제공하는 2,826시간 규모의 데이터셋(Sekai2)을 구축했다. 113개국 영상과 360도 파노라마 재방문 영상이 핵심이다.
이 논문은 한마디로 비디오 세계 모델을 학습하려면 긴 영상, 카메라 경로, 시간별 텍스트 주석이 다 필요한데, 기존 데이터셋은 이 셋을 같이 주지 못해서 Sekai2를 만들었다. 128,892개 클립, 2,826시간, 113개국 영상에 카메라 궤적과 피사체/환경/정적 장면/카메라 행동을 분리한 계층적 주석을 달았다. 특히 982개의 360도 파노라마 재방문 영상으로 공간 일관성 학습을 지원한다.
핵심 요약
- 2,826시간, 128,892클립, 113개국의 실세계 영상에 카메라 궤적과 계층적 주석을 함께 제공했다.
- 피사체 이동, 환경 변화, 정적 장면, 카메라 행동을 분리한 649,597개 시간 단위 세그먼트를 만들었다.
- 982개의 360도 파노라마 재방문(루프) 영상으로 장거리 공간 일관성 학습 감독을 제공한다.
- 카메라 주석과 독립적으로 생성된 캡션이 실제 카메라 움직임과 정렬됨을 교차 검증했다.
- 비디오 생성, 카메라 제어, 인터랙티브 세계 모델 사전학습용 확장 가능한 데이터 기반을 제공한다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.