CLaRa: Bridging Retrieval and Generation with Continuous Latent Reasoning
- 발행일
- 출처
- arXiv
- 논문 번호
- 096
- 분야
- RAG
- arXiv 번호
- 2511.18659
CLaRa 프레임워크는 문서를 연속적인 잠재 표현으로 압축하고 Straight-Through 추정기를 사용해 종단 간 미분 가능 최적화를 가능하게 함으로써 검색 증강 생성을 통합한다.
CLaRa 프레임워크는 문서를 연속적인 잠재 표현으로 압축하고 Straight-Through 추정기를 사용해 종단 간 미분 가능 최적화를 가능하게 함으로써 검색 증강 생성을 통합한다. 이는 우수한 압축 효과를 입증하여 기준선 대비 최대 17.31%의 CEM 향상을 달성했으며, 경쟁력 있는 QA 성능과 함께 크게 개선된 검색 재현율(예: HotpotQA Recall@5에서 BGE-Reranker보다 10퍼센트포인트 앞섬)을 보였다.
핵심 요약
- 전통적인 검색 증강 생성(RAG) 시스템은 검색기와 생성기가 별도로 최적화되는 분리된 최적화 문제를 겪으며, 이로 인해 검색된 정보와 생성기의 실제 필요 사이에 불일치가 발생한다.
- RAG 시스템은 흔히 길고 압축되지 않은 텍스트 컨텍스트를 처리하여 높은 추론 비용, 중복 텍스트 처리, LLM에서의 컨텍스트 오버플로, 그리고 임베딩 기반 검색과 원시 텍스트 기반 생성 간의 구조적 불일치를 초래한다.
- 검색에서 문서 선택의 이산적 특성은 생성기로부터 검색기로의 직접적인 그래디언트 흐름을 막아, 진정한 종단 간 공동 학습과 검색기의 다운스트림 과제 정렬을 저해한다.
- Salient Compressor Pretraining(SCP) 단계는 합성 QA 쌍과 패러프레이즈를 사용해 압축기가 문서를 핵심 정보를 보존하는 간결하고 의미적으로 풍부한 연속적 '메모리 토큰'으로 정제하도록 학습시킨다.
- CLaRa는 사전 계산된 압축 문서 표현과 함께 언어 모델링 손실을 사용해 질의 추론기와 생성기를 공동으로 학습시킴으로써, 단일한 종단 간 미분 가능 프레임워크 내에서 검색과 생성을 통합한다.
- 이산적인 상위 k개 문서 선택을 통과하는 그래디언트 흐름을 가능하게 하기 위해 Straight-Through(ST) 추정기를 사용하여, 질의 추론기가 생성기의 다운스트림 과제 목표로부터 약한 지도를 받도록 한다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.