Game2World Engine: Unlocking In-the-Wild Gameplay Videos for World Model Training
- 발행일
- 출처
- arXiv
- 논문 번호
- 1010
- 분야
- Computer Vision
- arXiv 번호
- 2608.24680
이 논문은 게임 화면에 겹쳐진 인터페이스를 자동으로 걷어내는 데이터 엔진과 제거 모델을 만들어, 인터넷 게임 영상을 세계 모델 학습 자료로 바꿀 수 있음을 보였다.
이 논문은 한마디로 '게임 영상에서 화면 표시를 지워 학습 데이터로 만드는 공장'이다. 게임 영상에는 체력 막대나 미니맵 같은 화면 표시가 섞여 있어, 게임 세계의 움직임과 무관한 신호가 학습을 방해한다. 연구진은 실제 게임 영상에서 인터페이스 조각 5,132개를 뽑아 21개 갈래로 정리하고, 이를 깨끗한 영상 위에 다시 얹어 짝지어진 학습 데이터 9만 6천 개를 만들었다. 이 데이터로 학습한 GameCleaner는 지울 영역을 따로 받지 않고도 화면 표시를 지우며, 합성 평가에서 AAR 95.36, 실제 게임 영상에서 80.05를 기록했다. 사전 실험에서 화면 표시를 지운 영상으로 학습한 영상 모델은 그렇지 않은 경우보다 VideoReward 종합 점수가 6.83% 높았다.
핵심 요약
- 실제 게임 영상에서 인터페이스 조각을 자동으로 뽑아 사람이 확인한 자산 5,132개를 모으고, 이를 깨끗한 영상 위에 시간 흐름이 자연스럽게 다시 얹어 짝지어진 학습 데이터를 합성했다.
- GameCleaner는 멀티모달 언어 모델이 화면 표시를 알아보고 영상 확산 트랜스포머가 가려진 부분을 복원하는 구조라, 지울 영역을 미리 그려주지 않아도 된다.
- 합성 평가에서 AAR 95.36과 배경 보존 99.00을, 실제 게임 영상 평가에서는 참조 이미지를 준 조건으로 AAR 80.05와 배경 보존 99.80을 기록했다.
- 화면 표시를 지운 영상으로 학습하면 VideoReward 종합이 6.83% 올라, 인터넷에 널린 게임 영상을 세계 모델 학습 자료로 재활용할 길이 열린다.
- 다만 저자들은 크고 불투명한 창이나 빠르게 바뀌는 겹침 요소, 장면과 뒤엉킨 표시에서는 복원이 어긋날 수 있고, 후속 실험도 행동 조건 없이 글로 영상을 만드는 대리 실험이었다고 밝혔다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.