Sekai2: From World Exploration to Interactive World Modeling

발행일
출처
arXiv
논문 번호
863
분야
Computer Vision
arXiv 번호
2608.09449

이 논문은 비디오 세계 모델 학습을 위해 장시간 영상, 카메라 궤적, 시간별 주석을 함께 제공하는 2,826시간 규모의 데이터셋(Sekai2)을 구축했다. 113개국 영상과 360도 파노라마 재방문 영상이 핵심이다.

이 논문은 한마디로 비디오 세계 모델을 학습하려면 긴 영상, 카메라 경로, 시간별 텍스트 주석이 다 필요한데, 기존 데이터셋은 이 셋을 같이 주지 못해서 Sekai2를 만들었다. 128,892개 클립, 2,826시간, 113개국 영상에 카메라 궤적과 피사체/환경/정적 장면/카메라 행동을 분리한 계층적 주석을 달았다. 특히 982개의 360도 파노라마 재방문 영상으로 공간 일관성 학습을 지원한다.

핵심 요약

  • 2,826시간, 128,892클립, 113개국의 실세계 영상에 카메라 궤적과 계층적 주석을 함께 제공했다.
  • 피사체 이동, 환경 변화, 정적 장면, 카메라 행동을 분리한 649,597개 시간 단위 세그먼트를 만들었다.
  • 982개의 360도 파노라마 재방문(루프) 영상으로 장거리 공간 일관성 학습 감독을 제공한다.
  • 카메라 주석과 독립적으로 생성된 캡션이 실제 카메라 움직임과 정렬됨을 교차 검증했다.
  • 비디오 생성, 카메라 제어, 인터랙티브 세계 모델 사전학습용 확장 가능한 데이터 기반을 제공한다.

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)