Don't Do RAG: When Cache-Augmented Generation is All You Need for Knowledge Tasks
- 발행일
- 출처
- arXiv
- 논문 번호
- 010
- 분야
- RAG / Efficiency
- arXiv 번호
- 2412.15605
CAG는 지식 베이스가 긴 컨텍스트 윈도에 들어갈 때 검색을 제거하는 것이 이를 최적화하는 것보다 더 단순하고 빠를 수 있음을 일깨우는 유용한 사례다.
이 논문은 경계가 있는 지식 작업을 위한 RAG의 검색 없는 대안인 캐시 증강 생성(CAG)을 제안한다. 질의 시점에 청크를 임베딩하고 색인하고 검색하는 대신, CAG는 관리 가능한 전체 지식 베이스를 긴 컨텍스트 LLM에 미리 적재하고 그 결과로 얻은 KV 캐시를 저장하므로, 추론은 캐시된 지식 상태에 사용자 질의만 덧붙이면 된다. Llama 3.1 8B를 사용한 SQuAD 1.0 및 HotPotQA 변형에서, alphaXiv 블로그는 CAG가 검색 지연 시간을 제거하고 누락되거나 무관한 검색 구절을 피하면서 가장 높은 BERTScore를 달성하는 경우가 많다고 보고한다. 주요 한계는 컨텍스트 용량과 지식 베이스 크기다. CAG는 내부 문서, FAQ, 기타 안정적이고 경계가 있는 코퍼스에 가장 적합한 반면, 크거나 빠르게 변하는 코퍼스에는 여전히 검색 또는 하이브리드 설계가 필요할 수 있다.
핵심 요약
- 핵심 아이디어는 온라인 RAG 파이프라인을 모든 관련 문서를 긴 컨텍스트 LLM에 오프라인으로 미리 적재하는 방식으로 대체하고, 추론 시점에 사전 계산된 KV 캐시를 재사용하는 것이다.
- 방법으로 CAG는 세 단계로 구성된다. 지식 사전 적재 및 KV 인코딩, 캐시된 상태를 조건으로 한 질의 시점 생성, 그리고 지식 캐시는 보존하면서 질의별 토큰을 제거하는 캐시 초기화 및 잘라내기다.
- 결과적으로 SQuAD 1.0 및 HotPotQA의 소/중/대 설정에서 CAG는 답변 품질 면에서 BM25 및 밀집 색인 RAG 기준선과 동등하거나 이를 능가하고 검색 시간을 제거하는 것으로 보고된다. HotPotQA-Large 생성은 동적 인컨텍스트 처리의 92.08초 대비 2.26초로 제시된다.
- 범위와 절충 측면에서 이 접근은 임베딩 모델, 벡터 스토어, 검색기를 제거하여 배치를 단순화하지만, 긴 컨텍스트 용량에 의존하며 경계가 있고 비교적 안정적인 지식 베이스에 가장 적합하다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.