CompKV: Compensation-Aware KV Selection for Long-Context LLM Inference
- 발행일
- 출처
- arXiv
- 논문 번호
- 1110
- 분야
- Machine Learning
- arXiv 번호
- 2609.26300
잘라낸 토큰의 기여도를 보정하는 KV 캐시 선택 기법으로 롱컨텍스트 추론을 가속한다.
프루닝된 토큰의 기여를 명시적으로 보정하는 KV 캐시 선택 기법을 제안한다. 표준 희소 어텐션 대비 성능 저하를 최소화하면서 롱컨텍스트 추론을 빠르게 해, 에이전트 하네스의 긴 실행 트레이토리 처리 비용을 낮춘다.
핵심 요약
- 프루닝된 토큰 기여를 보정하는 KV 캐시 선택
- 희소 어텐션 대비 최소 성능 저하로 가속
- 롱컨텍스트 추론 병목 완화
- 에이전트 하네스의 긴 트레이토리 비용 절감에 적용
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.