Current World Models Lack a Persistent State Core

발행일
출처
arXiv
논문 번호
462
분야
Computer Vision
arXiv 번호
2606.20545

현재 world model들이 카메라가 보지 않는 동안 세계 상태를 지속하지 못하는 '지속적 상태 코어' 결함을 23개 모델 9,600개 비디오로 체계적으로 입증한 벤치마크 연구.

WRBench는 비디오 생성 모델이 카메라 시점 변화 중에도 세계 상태가 지속적으로 진화하는지를 평가하는 최초의 진단 벤치마크다. 23개 모델의 9,600개 비디오를 분석한 결과, 현재 시스템들은 관찰 중인 세계를 트래킹 샷처럼 유지할 뿐, 카메라가 돌아왔을 때 대상을 떠난 시점의 상태로 되돌리는 치명적 결함을 보였다. 이 문제는 스케일이나 아키텍처 개선으로 해결되지 않으며, worldline 일관성과 상태 코어 안정성이 world model 설계의 1순위 목표가 되어야 함을 주장한다.

핵심 요약

  • WRBench: 카메라 모션을 '관찰성에 대한 개입'으로 정의하고 6차원 계층적 진단 체인(requested-camera → visual integrity → re-observed consistency)으로 평가
  • Natural-25: 25개 씬 패밀리 × 4단계 이벤트 설계로 공간 이동과 상태 변화를 직교 분해
  • 23개 모델(4가지 제어 패러다임) 공통 실패: 카메라가 돌아오면 대상을 떠난 시점 상태로 단순 복원, 비관찰 중 이벤트 진행 반영 안 함
  • Wan 1.3B→14B 스케일업이 re-observed state를 0.66→0.62로 오히려 악화시킴; 스케일링으로는 해결 불가
  • LingBot-World: 가장 강력한 visible state 일관성(0.874/0.719)이지만 requested-camera precision은 최저(0.468)로 제어력-상태 일관성 트레이드오프
  • 핵심 진단: 'what-memory'(숨겨진 변화 기록)와 endpoint persistence 학습 목표가 현재 모든 public 모델에 부재

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)