Can I Buy Your KV Cache?
- 발행일
- 출처
- arXiv
- 논문 번호
- 411
- 분야
- AI / General
- arXiv 번호
- 2606.13361
문서의 KV cache를 한 번만 계산하고 여러 에이전트가 재사용하는 Prefill CDN을 제안한다. 재사용은 prefill 대비 9~50배 저렴하며 token-exact 정확도를 보장한다.
수많은 AI 에이전트가 동일한 문서를 반복적으로 prefill하는 비효율을 지적하며, 문서의 KV cache를 publishable artifact로 취급할 것을 제안한다. Qwen3-4B 기준 KV 재사용은 prefill 대비 9~50배 저렴하고, greedy 디코딩에서 24/24 토큰이 정확히 일치하는 lossless 정확도를 보인다. 다만 KV는 거의 압축이 불가능해 shipping보다 provider-side hosting이 경제적으로 유리하며, 80M 에이전트에게 하나의 hot document를 서빙할 때 재사용이 약 0K로 prefill .5M 대비 49.7배 절감된다.
핵심 요약
- KV cache 재사용은 from-scratch prefill과 token-exact로 동일 (greedy 24/24 매치, logits 수준 검증)
- Qwen3-4B에서 재사용 compute가 prefill 대비 9~50배 저렴, 문서가 길수록 격차 확대 (L² attention 항)
- Break-even은 사실상 즉시(N≈1), 두 번째 읽기부터 재사용이 이득
- KV는 무손실 압축이 거의 불가능(shipping 실패), provider-side hosting이 최적 — production prompt-caching과 동일 원리
- 3774토큰 문서를 80M 에이전트에게 서빙 시 prefill .5M vs 재사용 /bin/sh.03M (49.7× 절감)
- int8 양자화는 크기를 절반으로 줄이지만 token-exact를 깨뜨려 lossless가 필요한 경우 부적합
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.