CLaRa: Bridging Retrieval and Generation with Continuous Latent Reasoning

발행일
출처
arXiv
논문 번호
096
분야
RAG
arXiv 번호
2511.18659

CLaRa 프레임워크는 문서를 연속적인 잠재 표현으로 압축하고 Straight-Through 추정기를 사용해 종단 간 미분 가능 최적화를 가능하게 함으로써 검색 증강 생성을 통합한다.

CLaRa 프레임워크는 문서를 연속적인 잠재 표현으로 압축하고 Straight-Through 추정기를 사용해 종단 간 미분 가능 최적화를 가능하게 함으로써 검색 증강 생성을 통합한다. 이는 우수한 압축 효과를 입증하여 기준선 대비 최대 17.31%의 CEM 향상을 달성했으며, 경쟁력 있는 QA 성능과 함께 크게 개선된 검색 재현율(예: HotpotQA Recall@5에서 BGE-Reranker보다 10퍼센트포인트 앞섬)을 보였다.

핵심 요약

  • 전통적인 검색 증강 생성(RAG) 시스템은 검색기와 생성기가 별도로 최적화되는 분리된 최적화 문제를 겪으며, 이로 인해 검색된 정보와 생성기의 실제 필요 사이에 불일치가 발생한다.
  • RAG 시스템은 흔히 길고 압축되지 않은 텍스트 컨텍스트를 처리하여 높은 추론 비용, 중복 텍스트 처리, LLM에서의 컨텍스트 오버플로, 그리고 임베딩 기반 검색과 원시 텍스트 기반 생성 간의 구조적 불일치를 초래한다.
  • 검색에서 문서 선택의 이산적 특성은 생성기로부터 검색기로의 직접적인 그래디언트 흐름을 막아, 진정한 종단 간 공동 학습과 검색기의 다운스트림 과제 정렬을 저해한다.
  • Salient Compressor Pretraining(SCP) 단계는 합성 QA 쌍과 패러프레이즈를 사용해 압축기가 문서를 핵심 정보를 보존하는 간결하고 의미적으로 풍부한 연속적 '메모리 토큰'으로 정제하도록 학습시킨다.
  • CLaRa는 사전 계산된 압축 문서 표현과 함께 언어 모델링 손실을 사용해 질의 추론기와 생성기를 공동으로 학습시킴으로써, 단일한 종단 간 미분 가능 프레임워크 내에서 검색과 생성을 통합한다.
  • 이산적인 상위 k개 문서 선택을 통과하는 그래디언트 흐름을 가능하게 하기 위해 Straight-Through(ST) 추정기를 사용하여, 질의 추론기가 생성기의 다운스트림 과제 목표로부터 약한 지도를 받도록 한다.

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)