REFRAG: Rethinking RAG based Decoding

발행일
출처
arXiv
논문 번호
080
분야
RAG / Efficiency
arXiv 번호
2509.01092

REFRAG는 RAG 컨텍스트 고유의 희소 어텐션 패턴을 활용하는, 검색 증강 생성(RAG)을 위한 효율적인 디코딩 프레임워크를 도입한다.

REFRAG는 RAG 컨텍스트 고유의 희소 어텐션 패턴을 활용하는, 검색 증강 생성(RAG)을 위한 효율적인 디코딩 프레임워크를 도입한다. 컨텍스트 압축과 선택적 확장을 수반하는 이 접근법은 다양한 장문 컨텍스트 응용에서 perplexity와 정확도를 유지하거나 개선하면서, Time-To-First-Token을 30.85배 가속하고 유효 컨텍스트 윈도우를 16배 확장한다.

핵심 요약

  • 대규모 언어 모델(LLM)을 사용하는 검색 증강 생성(RAG) 시스템은 길게 검색된 컨텍스트를 처리할 때 상당한 시스템 지연과 높은 메모리 소비에 직면한다.
  • 이로 인해 더 긴 컨텍스트로 지식을 강화하는 것이 흔히 시스템 효율성과 처리량을 저하시키는 트레이드오프가 발생한다.
  • 범용 LLM 장문 컨텍스트 추론 최적화는 RAG 컨텍스트에 내재된 특유의 '블록 대각 어텐션 패턴'과 중복 연산을 적절히 다루지 못한다.
  • 경량 인코더를 사용하는 프레임워크가 RAG 컨텍스트를 청크 임베딩으로 압축하여, 디코더 전용 LLM의 유효 입력 시퀀스 길이를 크게 줄인다.
  • 인코더와 디코더는 다음 단락 예측 및 재구성 과제를 포함한 지속적 사전학습(CPT) 체계를 통해 정렬되며, 복잡도를 관리하기 위해 커리큘럼 학습을 적용한다.
  • 강화학습 정책이 중요한 컨텍스트 청크를 전체 토큰 시퀀스로 동적으로 확장하고 덜 중요한 청크는 감지(압축)하여, 유연하고 임의 위치의 압축을 가능하게 한다.

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)