WorldKV: Efficient World Memory with World Retrieval and Compression

발행일
출처
arXiv
논문 번호
205
분야
Computer Vision
arXiv 번호
2605.22718

WorldKV는 자기회귀 비디오 월드 모델을 위한 학습 불필요 프레임워크를 제시해, 실시간 추론 속도를 유지하면서 장시간에 걸쳐 지속적이고 일관된 탐색 가능한 세계를 유지할 수 있게 한다.

자기회귀 비디오 세계 모델은 전체 KV 캐시를 유지하면 과거 장면을 일관되게 재현할 수 있지만 메모리와 계산량이 시간에 따라 늘어난다. 반대로 짧은 창만 쓰면 실시간 속도는 지키지만 오래전 장소의 정보를 잃는다. WorldKV는 창 밖으로 밀려난 캐시 조각을 GPU나 CPU 메모리에 보관하고 카메라와 행동의 대응 관계로 현재 장면에 맞는 조각만 다시 가져온다. 또한 기준 프레임과 비슷한 키 토큰을 제거해 조각당 저장량을 절반으로 줄이고 같은 예산에서 두 배의 이력을 담는다. Matrix-Game-2.0과 LingBot-World-Fast에서 추가 학습 없이 전체 캐시와 비슷하거나 더 좋은 기억 충실도를 약 두 배 처리 속도로 달성했다.

핵심 요약

  • 토큰 가지치기: 유사도 점수가 높은 토큰은 중복으로 간주되어 폐기된다. 가장 변별력 있는 토큰(유사도 기준 하위 P%)만 유지된다.
  • LPIPS: 지각적 유사도를 측정한다(낮을수록 좋다).
  • PSNR 및 SSIM: 신호 및 구조적 유사도를 측정한다(높을수록 좋다).

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)