Code World Model: Coding Agent as World Brain
- 발행일
- 출처
- arXiv
- 논문 번호
- 1017
- 분야
- Computer Vision
- arXiv 번호
- 2608.25927
코딩 에이전트를 '세계의 뇌'로 써서 게임 세계 상태를 코드로 굴리고, 비디오 모델은 화면만 그리게 역할을 나눈 논문.
이 논문은 한마디로 '세계 진화는 코드가, 화면 구현은 비디오 모델이' 맡는 세계 모델 구조다. 코딩 에이전트가 사건의 결과를 추론해 실행 가능한 코드로 세계 상태를 계속 갱신하고, 그 상태를 프록시(대리 표현) 영상으로 바꿔 비디오 모델에 조건을 주면 고화질 영상이 나온다. 게임플레이 약 5.6시간 짝 데이터로 MiniMax-H3를 파인튜닝한 결과, 프록시가 지정한 위치·이동·카메라 궤적을 잘 따라가는 영상이 생성됐다. 상태가 코드로 유지되니 과거 사건의 결과가 사라지지 않고 계속 이어지는 게 기존 비디오 세계 모델과의 차이다.
핵심 요약
- 비디오만으로 배우는 기존 세계 모델은 '왜 그렇게 되는지'라는 규칙을 못 배우고 결과 장면만 흉내 낸다고 진단했다.
- 코딩 에이전트(뇌)는 드물게 복잡한 결정만 내리고, 코드는 자주 반복되는 상태 갱신을 빠르게 처리하는 이중 구조로 역할을 나눴다.
- 게임플레이 157개 테이크(약 5.6시간)에서 9,420개 클립을 뽑어 MiniMax-H3를 LoRA로 파인튜닝했다(훈련 파라미터 약 5.96억 개).
- 프록시 조건 해상도는 출력의 1/16 수준이라 추가 추론 부담이 거의 없다고 밝혔다.
- 학습 규모가 작고 실시간 생성도 안 되며, 코딩 에이전트가 복잡한 게임 메커니즘을 처음부터 만들긴 아직 어렵다고 한계를 인정했다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.