DeepSeek-V4.1-Flash: Pushing the Limits of KV Cache Compression
- 발행일
- 출처
- arXiv
- 논문 번호
- 1094
- 분야
- LLMs / NLP
- arXiv 번호
- 2609.19969
긴 컨텍스트 에이전트의 배포 비용 병목인 KV 캐시를 CSA2(층 간 공유)와 FP4 캐시로 1/4까지 줘서 성능은 더 좋아진 DeepSeek 신모델 기술 보고서다.
이 논문은 한마디로 DeepSeek가 에이전트용 초장문 모델 'V4.1-Flash'를 발표하며 KV 캐시(모델이 문맥을 기억하는 데 쓰는 메모리)를 극한까지 압축한 기술 보고서다. 552B 파라미터의 멀티모달 MoE(전문가 혼합) 모델인데, 인코더-디코더 구조를 바꿔 입력 처리 시엔 8B, 출력 시엔 16B만 켜서 비용을 아꼈다. 층끼리 KV 캐시를 공유하는 CSA2 어텐션과 FP4 저정밀 캐시를 함께 써서 HBM 안 캐시는 토큰당 890바이트, 즉 이전 세전의 약 1/4로 줄였다. 그럼에도 에이전트 벤치마크 성능은 이전 세대보다 오히려 더 좋다.
핵심 요약
- KV 캐시를 층 간 공유(CSA2) + FP4 저정밀 저장으로 묶어, 토큰당 메모리를 이전 세대의 약 1/4(890바이트)로 줄였다.
- SSD에 저장하는 영구 캐시는 SWA Bounded Replay 기법으로 약 1/8까지 줄여, 긴 대화를 여러 번 이어 쓰는 에이전트에 유리하다.
- 인코더-디코더 구조(CED)로 입력 처리 시 활성 파라미터를 절반(8B)으로 낮춰, 입력이 많고 출력이 짧은 에이전트 작업에 비용 효율이 좋다.
- 최대 100만 토큰 컨텍스트를 지원하며, 45T 토큰 멀티모달 데이터로 사전학습하고 대규모 에이전트 과제 합성 + RL로 사후학습했다.
- 추론 노력(reasoning effort) 설정을 25→100으로 올리면 답 길이가 2.0~3.1배로 예측 가능하게 늘고, 성능도 일관되게 올라가는 것을 8개 벤치마크에서 확인했다.
- 모델 체크포인트를 허깅페이스에 공개해 바로 써볼 수 있다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.