EgoCS-400K: An Egocentric Gameplay Dataset for World Models
- 발행일
- 출처
- arXiv
- 논문 번호
- 443
- 분야
- Computer Vision
- arXiv 번호
- 2606.18180
Counter-Strike 데모에서 구축된 40만 개 이상의 1인칭 비디오와 1만 시간의 gameplay로 구성된 대규모 egocentric world model 데이터셋을 소개한다.
EgoCS-400K는 world model 학습에 필요한 video-action-language 궤적을 대규모로 제공하기 위해, 프로 CS/CS2 경기 데모에서 1인칭 비디오와 정밀하게 정렬된 액션/상태/이벤트 주석을 추출한 데이터셋이다. 1,000개 이상의 경기, 40,000개 라운드, 13개 맵에서 10만 시간 이상의 gameplay를 400K+ 비디오로 렌더링했다. 각 세그먼트는 키보드/마우스 입력, 카메라 움직임, 무기 상태, 게임 이벤트 등 tick 단위로 정렬된 주석을 포함한다. action-conditioned 미래 예측, 장면 롤아웃, 캡셔닝, 에이전트 액션 이해 등 다양한 world model 태스크를 지원한다.
핵심 요약
- 프로 CS/CS2 데모 기반으로 400K+ 1인칭 비디오, 10,000+ 시간 gameplay 데이터셋 구축
- Tick 단위 정밀 정렬: 키보드/마우스 입력, 카메라 움직임, 무기/이동 상태, 게임 이벤트 모두 동기화
- 계층적 구조: player-view sequence → segment → action chain → atomic action → per-tick state trace
- 1,000+ 경기, 40,000+ 라운드, 13개 맵, 라운드당 최대 10개 플레이어 관점 제공
- Replay-grounded 구조로 파싱/재생/렌더링/시간 정렬이 모두 가능—단순 비디오 캡처와 차별화
- Action-conditioned future prediction, state-aware scene rollout, egocentric action understanding 지원
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.