Random Attention: Rethinking KV Cache Eviction for Efficient Reasoning

발행일
출처
arXiv
논문 번호
1071
분야
LLMs / NLP
arXiv 번호
2609.03430

입력 질문을 보존하고 추론 기록의 캐시를 무작위로 줄이는 단순한 방법이, 논문의 비교 실험에서 복잡한 중요도 계산 방식에 견줄 정확도와 더 높은 처리량을 보였다.

언어 모델이 길게 추론할수록 이전 계산을 저장하는 KV 캐시가 커져 GPU 메모리를 많이 차지한다. 이 논문의 Random Attention은 입력 질문은 그대로 남기고, 각 어텐션 헤드에서 추론 기록의 캐시를 무작위로 덜어내 중요도 점수를 계산하지 않는다. 네 모델과 여섯 추론 과제를 비교한 결과, 연구진은 이 단순한 방법이 강한 기존 캐시 제거 방법에 견줄 정확도를 보였다고 보고한다. H200 한 대의 vLLM 실험에서는 같은 캐시 예산의 TriAttention보다 출력 처리량이 32~43% 높았다. 연구진은 추론 중 필요한 내용이 다시 서술되고 여러 헤드에도 저장되기 때문에 가능한 결과라고 설명하지만, 한 번만 등장하고 반복되지 않는 정보를 찾아야 하는 상황에서는 무작위 제거가 불리할 수 있다.

핵심 요약

  • 연구 방법은 입력 질문을 보존한 채 각 어텐션 헤드의 추론 기록에서 캐시 항목을 균등한 확률로 제거해, 중요도 점수 계산과 순위 선정을 없애는 것이다.
  • 네 모델과 여섯 추론 과제의 비교에서는 강한 기존 제거 방법에 견줄 정확도를 보였으며, 모든 방법이 입력 질문을 보존하도록 맞추면 방법 사이의 성능 차이가 대부분 줄었다.
  • H200 한 대에서 캐시 예산 2048, 입력 길이 1k 토큰, 생성 길이 32k 토큰을 사용한 vLLM 실험의 출력 처리량은 TriAttention보다 32~43% 높았다.
  • 추론 중 필요한 정보가 다시 서술되고 여러 헤드에 중복 저장된다는 분석은, 복잡한 중요도 계산 없이도 긴 추론 서비스의 메모리 부담과 캐시 관리 비용을 줄일 가능성을 보여준다.
  • 한 번만 등장하고 다시 언급되지 않는 정보를 찾는 실험에서는 선별 신호가 도움이 됐으므로, 이 결과를 모든 정보 검색 과제나 모든 모델에서 무작위 제거가 우수하다는 뜻으로 일반화해서는 안 된다.

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)