Code World Model: Coding Agent as World Brain

발행일
출처
arXiv
논문 번호
1017
분야
Computer Vision
arXiv 번호
2608.25927

코딩 에이전트를 '세계의 뇌'로 써서 게임 세계 상태를 코드로 굴리고, 비디오 모델은 화면만 그리게 역할을 나눈 논문.

이 논문은 한마디로 '세계 진화는 코드가, 화면 구현은 비디오 모델이' 맡는 세계 모델 구조다. 코딩 에이전트가 사건의 결과를 추론해 실행 가능한 코드로 세계 상태를 계속 갱신하고, 그 상태를 프록시(대리 표현) 영상으로 바꿔 비디오 모델에 조건을 주면 고화질 영상이 나온다. 게임플레이 약 5.6시간 짝 데이터로 MiniMax-H3를 파인튜닝한 결과, 프록시가 지정한 위치·이동·카메라 궤적을 잘 따라가는 영상이 생성됐다. 상태가 코드로 유지되니 과거 사건의 결과가 사라지지 않고 계속 이어지는 게 기존 비디오 세계 모델과의 차이다.

핵심 요약

  • 비디오만으로 배우는 기존 세계 모델은 '왜 그렇게 되는지'라는 규칙을 못 배우고 결과 장면만 흉내 낸다고 진단했다.
  • 코딩 에이전트(뇌)는 드물게 복잡한 결정만 내리고, 코드는 자주 반복되는 상태 갱신을 빠르게 처리하는 이중 구조로 역할을 나눴다.
  • 게임플레이 157개 테이크(약 5.6시간)에서 9,420개 클립을 뽑어 MiniMax-H3를 LoRA로 파인튜닝했다(훈련 파라미터 약 5.96억 개).
  • 프록시 조건 해상도는 출력의 1/16 수준이라 추가 추론 부담이 거의 없다고 밝혔다.
  • 학습 규모가 작고 실시간 생성도 안 되며, 코딩 에이전트가 복잡한 게임 메커니즘을 처음부터 만들긴 아직 어렵다고 한계를 인정했다.

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)