FlashMemory-DeepSeek-V4: Lightning Index Ultra-Long Context via Lookahead Sparse Attention

발행일
출처
arXiv
논문 번호
373
분야
Machine Learning
arXiv 번호
2606.09079

DeepSeek-V4 아키텍처 기반으로 초장문맥 추론 시 GPU 메모리를 86.5% 절감하면서 정확도를 유지하는 Lookahead Sparse Attention(LSA) 방식을 제안했다. 프로젝트 리더의 퇴사로 개발이 중단된 상태다.

FlashMemory-DeepSeek-V4는 기존 LLM 디코딩 시 전체 KV cache를 GPU에 유지하는 비효율을 해결한다. Neural Memory Indexer가 주기적으로 미래 context 수요를 예측해 쿼리에 필수적인 KV chunk만 GPU에 적재하는 Lookahead Sparse Attention(LSA)을 도입했다. Indexer를 dual-encoder로 분리해 backbone 모델 로딩 없이 독립 훈련하는 것이 핵심 혁신이다. LongBench-v2, LongMemEval, RULER 평가에서 평균 13.5% 메모리만 사용하면서 +0.6% 정확도 향상을 달성했으나, MRCR 벤치마크에서는 76%에서 48%로 크게 저하되는 한계도 존재한다.

핵심 요약

  • 미래 context 수요를 예측해 필수 KV chunk만 GPU에 적재하는 LSA 패러다임
  • Indexer를 backbone과 완전 분리해 단일 H20 GPU 1시간 훈련 가능
  • Sigmoid threshold 기반 동적 chunk 리콜로 고정 Top-k 대체
  • 평균 13.5% KV cache로 baseline 대비 +0.6% 정확도 향상
  • 500K 길이에서 90% 메모리 절감, 오히려 정확도 +1.9% 향상
  • MRCR 밀집 검색 벤치마크에서 76%에서 48%로 심각한 저하 한계 존재

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)