End-to-End Context Compression at Scale

발행일
출처
arXiv
논문 번호
391
분야
LLMs / NLP
arXiv 번호
2606.09659

encoder-decoder 구조의 Latent Context Language Model(LCLM)을 350B 토큰으로 학습해 KV cache 압축 대비 정확도-효율 Pareto frontier를 개선한다.

긴 문맥 LLM 추론에서 KV cache 메모리가 병목인 문제를 해결하기 위해, encoder-decoder 방식의 Latent Context Language Model(LCLM)을 제안한다. 0.6B encoder와 4B decoder를 1:4, 1:8, 1:16 압축비로 350B 토큰 학습했다. LCLM은 RULER, LongBench 등에서 기존 KV cache 압축 방법론보다 빠르고 정확하며, 에이전트가 압축된 문맥을 훑고 필요 부분을 선택적 확장하는 시스템도 시연했다.

핵심 요약

  • 0.6B encoder + 4B decoder(Qwen3-4B 기반)를 1:4/1:8/1:16 압축비로 각각 350B+ 토큰 학습
  • 대규모 아키텍처 서치로 encoder-decoder 설계 최적화: pooling 방식, adapter 구조, 학습 단계 설계 등
  • RULER 4K에서 8.8배, LongBench 64K에서 5.2배 빠른 TTFT 달성하며 정확도 우위
  • 에이전트가 압축된 전체 컨텍스트를 한번에 읽고 EXPAND 도구로 필요 청크만 원문 확장하는 agentic harness 제안
  • 최대 1M 토큰까지 거의 선형에 가까운 메모리 스케일링, vLLM/SGLang 등 표준 추론 엔진과 호환

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)