Programmable World Model
- 발행일
- 출처
- arXiv
- 논문 번호
- 1078
- 분야
- Computer Vision
- arXiv 번호
- 2609.10540
영상 생성 AI로 만든 가상 세계가 '상태를 기억하지 못하는' 문제를, 게임 엔진처럼 상태는 프로그램이 따로 관리하고 영상은 렌더러로 분리해 해결한 논문.
이 논문은 한마디로 '생성 AI 영상만으로 세계를 기억하면 안 되고, 상태 관리와 그림 그리기를 분리해야 한다'는 논문이다. 코딩 에이전트가 사용자 지시를 실행 가능한 프로그램(엔티티 상태와 상태 변화 규칙)으로 바꾸면, 가벼운 엔진이 화면 밖 정보까지 포함한 전체 세계 상태를 계속 유지한다. 이 상태를 3D 방향성 바운딩 박스(OBB, 물체의 위치·크기·방향을 담은 상자)로 표현해 영상 생성 모델에 넘기면, 영상 모델은 사실적인 '렌더러' 역할만 한다. 그 결과 만든 게임 같은 상황에서 살아있는 캐릭터 수를 정확히 유지하는 정확도 94%, 사망 같은 상태 변화를 화면에 제대로 반영하는 정확도 98%를 달성해 기존 대화형 영상 세계 모델을 크게 앞섰다.
핵심 요약
- 세계 상태를 관리하는 엔진과 영상을 생성하는 렌더러를 분리해, 영상 세계 모델의 '기억하지 못하는' 문제를 구조적으로 해결했다.
- 코딩 에이전트가 자연어 지시를 실행 가능한 프로그램으로 바꿔, 사용자가 게임 규칙을 직접 프로그래밍할 수 있게 했다.
- 3D OBB라는 중간 표현을 써서 프로그램이 다루기 쉬우면서도 영상 생성을 정밀하게 안내할 수 있게 했다.
- 새 벤치마크 CombatStateBench에서 캐릭터 수 유지 정확도 94%, 상태 반영 정확도 98%로 기존 모델들을 최대 62%p 차이로 앞섰다.
- 영상 품질 지표(VBench) 4개 항목에서도 모두 최고 성적을 유지해, 구조화된 제어가 화면 품질을 해치지 않음을 보였다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.