GameCraft-Bench: Can Agents Build Playable Games End-to-End in a Real Game Engine?

발행일
출처
arXiv
논문 번호
438
분야
LLMs / NLP
arXiv 번호
2606.17861

코딩 에이전트가 실제 게임 엔진(Godot)에서 엔드투엔드로 플레이 가능한 게임을 만들 수 있는지 평가하는 GameCraft-Bench(140 과제, 15 게임 장르)를 제안한다.

GameCraft-Bench는 게임 생성 평가의 3가지 요건(Engine Grounding, Artifact Completeness, Interactive Verification)을 정의하고, Godot 엔진에서 140개 과제/15개 게임 장르로 구성된 벤치마크를 제공한다. 에이전트가 자연어 명세로부터 완전한 게임 프로젝트를 생성하면, 헤드리스 빌드/실행/플레이 동영상 증거를 수집해 다중 모달 judge가 4개 루브릭(메커니즘, 콘텐츠 깊이, 시각적 피드백, 프레젠테이션)으로 평가한다. 최강 에이전트(Opus 4.7)도 41.46%에 그쳐, 엔드투엔드 게임 생성이 여전히 해결되지 않았음을 보여준다.

핵심 요약

  • 엔진 기반 게임 생성 평가의 3가지 요건(Engine Grounding, Artifact Completeness, Interactive Verification) 최초 정의
  • 140개 Godot 과제, 15개 게임 장르로 구성된 실제 엔진 기반 벤치마크
  • 헤드리스 빌드→플레이 동영상→루브릭 기반 다중 모달 judge의 3단계 interaction-grounded 평가 파이프라인
  • 최강 에이전트(Opus 4.7 high) 41.46%, 대다수 40% 미만—end-to-end 게임 생성은 여전히 미해결
  • 에이전트가 메커니즘은 구현하지만 콘텐츠 깊이, 시각적 피드백, 프레젠테이션 완성도에서 크게 부족
  • 메커니즘·콘텐츠·시각은 중등도 상관(r=0.5-0.6)이지만 예술/프레젠테이션은 약한 결합(r=0.11)으로 능력이 부분 분해됨

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)