Addressable Memory for Video World Models

발행일
출처
arXiv
논문 번호
851
분야
Computer Vision
arXiv 번호
2608.07408

비디오 세계 모델이 긴 시간이 지나도 이전 장면을 기억하지 못하는 문제를, 메모리를 '주소 가능'하게 만들어 해결했다. 추가 학습 없이 즉시 적용 가능하다.

이 논문은 한마디로 AI 비디오 생성 모델이 긴 시간 동영상을 만들 때 이전 장면을 까먹는 현상을 '주소 가능한 메모리'로 해결한 연구다. 비디오 세계 모델은 이전 프레임을 KV 캐시(일종의 단기 기억)에 저장하는데, 생성이 길어지면 학습 때 본 적 없는 위치 정보가 들어가서 기억을 꺼내올 수 없게 된다. WorldTrace는 각 메모리 요약에 학습 범위 안의 가상 위치를 할당해 이 문제를 해결한다. Field 모드는 시간 흐름의 일관성을, Landmark 모드는 중요 장면 전환을 기억한다. LoopBench라는 새로운 평가 벤치마크에서 시간 일관성 +15.5%, 장면 회상 +19.5% 향상을 보였다.

핵심 요약

  • 비디오 세계 모델의 장기 기억 실패 원인이 위치 인코딩(RoPE)의 분포 이탈이라는 점을 정확히 진단했다.
  • WorldTrace: 각 메모리 요약에 학습 범위 내의 가상 위치를 부여해, 추가 학습 없이 메모리 접근성을 복원하는 프레임워크.
  • WorldTrace-Field는 시간적 일관성을 +15.5% 개선하고, WorldTrace-Landmark는 이전 장면 회상을 +19.5% 향상시켰다.
  • LoopBench: 긴 우회 후 원래 장면으로 돌아왔을 때 복원할 수 있는지 측정하는 새로운 벤치마크를 제안했다.
  • NVIDIA에서 개발했으며, 별도의 재학습 없이 기존 모델에 바로 적용할 수 있다.

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)