Programmable World Model

발행일
출처
arXiv
논문 번호
1078
분야
Computer Vision
arXiv 번호
2609.10540

영상 생성 AI로 만든 가상 세계가 '상태를 기억하지 못하는' 문제를, 게임 엔진처럼 상태는 프로그램이 따로 관리하고 영상은 렌더러로 분리해 해결한 논문.

이 논문은 한마디로 '생성 AI 영상만으로 세계를 기억하면 안 되고, 상태 관리와 그림 그리기를 분리해야 한다'는 논문이다. 코딩 에이전트가 사용자 지시를 실행 가능한 프로그램(엔티티 상태와 상태 변화 규칙)으로 바꾸면, 가벼운 엔진이 화면 밖 정보까지 포함한 전체 세계 상태를 계속 유지한다. 이 상태를 3D 방향성 바운딩 박스(OBB, 물체의 위치·크기·방향을 담은 상자)로 표현해 영상 생성 모델에 넘기면, 영상 모델은 사실적인 '렌더러' 역할만 한다. 그 결과 만든 게임 같은 상황에서 살아있는 캐릭터 수를 정확히 유지하는 정확도 94%, 사망 같은 상태 변화를 화면에 제대로 반영하는 정확도 98%를 달성해 기존 대화형 영상 세계 모델을 크게 앞섰다.

핵심 요약

  • 세계 상태를 관리하는 엔진과 영상을 생성하는 렌더러를 분리해, 영상 세계 모델의 '기억하지 못하는' 문제를 구조적으로 해결했다.
  • 코딩 에이전트가 자연어 지시를 실행 가능한 프로그램으로 바꿔, 사용자가 게임 규칙을 직접 프로그래밍할 수 있게 했다.
  • 3D OBB라는 중간 표현을 써서 프로그램이 다루기 쉬우면서도 영상 생성을 정밀하게 안내할 수 있게 했다.
  • 새 벤치마크 CombatStateBench에서 캐릭터 수 유지 정확도 94%, 상태 반영 정확도 98%로 기존 모델들을 최대 62%p 차이로 앞섰다.
  • 영상 품질 지표(VBench) 4개 항목에서도 모두 최고 성적을 유지해, 구조화된 제어가 화면 품질을 해치지 않음을 보였다.

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)