WorldKV: Efficient World Memory with World Retrieval and Compression
- 발행일
- 출처
- arXiv
- 논문 번호
- 205
- 분야
- Computer Vision
- arXiv 번호
- 2605.22718
WorldKV는 자기회귀 비디오 월드 모델을 위한 학습 불필요 프레임워크를 제시해, 실시간 추론 속도를 유지하면서 장시간에 걸쳐 지속적이고 일관된 탐색 가능한 세계를 유지할 수 있게 한다.
자기회귀 비디오 세계 모델은 전체 KV 캐시를 유지하면 과거 장면을 일관되게 재현할 수 있지만 메모리와 계산량이 시간에 따라 늘어난다. 반대로 짧은 창만 쓰면 실시간 속도는 지키지만 오래전 장소의 정보를 잃는다. WorldKV는 창 밖으로 밀려난 캐시 조각을 GPU나 CPU 메모리에 보관하고 카메라와 행동의 대응 관계로 현재 장면에 맞는 조각만 다시 가져온다. 또한 기준 프레임과 비슷한 키 토큰을 제거해 조각당 저장량을 절반으로 줄이고 같은 예산에서 두 배의 이력을 담는다. Matrix-Game-2.0과 LingBot-World-Fast에서 추가 학습 없이 전체 캐시와 비슷하거나 더 좋은 기억 충실도를 약 두 배 처리 속도로 달성했다.
핵심 요약
- 토큰 가지치기: 유사도 점수가 높은 토큰은 중복으로 간주되어 폐기된다. 가장 변별력 있는 토큰(유사도 기준 하위 P%)만 유지된다.
- LPIPS: 지각적 유사도를 측정한다(낮을수록 좋다).
- PSNR 및 SSIM: 신호 및 구조적 유사도를 측정한다(높을수록 좋다).
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.