EgoCS-400K: An Egocentric Gameplay Dataset for World Models

발행일
출처
arXiv
논문 번호
443
분야
Computer Vision
arXiv 번호
2606.18180

Counter-Strike 데모에서 구축된 40만 개 이상의 1인칭 비디오와 1만 시간의 gameplay로 구성된 대규모 egocentric world model 데이터셋을 소개한다.

EgoCS-400K는 world model 학습에 필요한 video-action-language 궤적을 대규모로 제공하기 위해, 프로 CS/CS2 경기 데모에서 1인칭 비디오와 정밀하게 정렬된 액션/상태/이벤트 주석을 추출한 데이터셋이다. 1,000개 이상의 경기, 40,000개 라운드, 13개 맵에서 10만 시간 이상의 gameplay를 400K+ 비디오로 렌더링했다. 각 세그먼트는 키보드/마우스 입력, 카메라 움직임, 무기 상태, 게임 이벤트 등 tick 단위로 정렬된 주석을 포함한다. action-conditioned 미래 예측, 장면 롤아웃, 캡셔닝, 에이전트 액션 이해 등 다양한 world model 태스크를 지원한다.

핵심 요약

  • 프로 CS/CS2 데모 기반으로 400K+ 1인칭 비디오, 10,000+ 시간 gameplay 데이터셋 구축
  • Tick 단위 정밀 정렬: 키보드/마우스 입력, 카메라 움직임, 무기/이동 상태, 게임 이벤트 모두 동기화
  • 계층적 구조: player-view sequence → segment → action chain → atomic action → per-tick state trace
  • 1,000+ 경기, 40,000+ 라운드, 13개 맵, 라운드당 최대 10개 플레이어 관점 제공
  • Replay-grounded 구조로 파싱/재생/렌더링/시간 정렬이 모두 가능—단순 비디오 캡처와 차별화
  • Action-conditioned future prediction, state-aware scene rollout, egocentric action understanding 지원

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)