When to Retrieve During Reasoning: Adaptive Retrieval for Large Reasoning Models

발행일
출처
arXiv
논문 번호
168
분야
Agents / RAG / Reasoning
arXiv 번호
2604.26649

ReaLM-Retrieve는 대형 추론 모델(LRM)을 위한 동적이고 추론 인식형 프레임워크를 도입하여, 추론 도중에 검색을 통합하고 필요할 때 외부 지식을 적응적으로 제공한다.

ReaLM-Retrieve는 대형 추론 모델(LRM)을 위한 동적이고 추론 인식형 프레임워크를 도입하여, 추론 도중에 검색을 통합하고 필요할 때 외부 지식을 적응적으로 제공한다. 이 접근법은 표준 RAG 베이스라인 대비 답변 정확도를 평균 절대 F1 10.1% 향상시키고, 고정 간격 방식 대비 검색 호출을 47% 줄였다.

핵심 요약

  • 대형 추론 모델(LRM)은 광범위한 다단계 사고 사슬을 생성하지만, 외부 지식이 필요할 때 사실적 부정확성과 증가한 환각률에 시달린다.
  • 전통적인 검색 증강 생성(RAG) 시스템은 단일 사전 검색을 사용하는데, 이는 LRM의 다단계 추론 중 출현하는 동적이고 예측 불가능한 지식 공백과 근본적으로 어긋난다.
  • 표준 LLM을 위해 설계된 기존 반복 검색 방법은 입도 불일치, 블랙박스 모델에서 사용할 수 없는 내부 신호 의존, 긴 추론 사슬에 대한 과도한 효율 비용 때문에 LRM과 호환되지 않는다.
  • 추론 인식형 검색 프레임워크인 ReaLM-Retrieve는 동적 검색을 순차적 의사결정 문제로 정식화하여, 토큰이나 문장 수준이 아니라 논리적 추론 단계 입도에서 개입한다.
  • 언어화된 불확실성, 개체 기반 엔트로피, 일관성 신호를 결합한 Reasoning Step Uncertainty Score(RSUS)를 도입하여, 블랙박스 호환 방식으로 지식 공백과 검색 필요성을 탐지한다.
  • REINFORCE로 학습된 검색 개입 정책은 언제 검색할지를 동적으로 결정하고, 관련 질의를 구성하며, 암묵적 압축·추측적 캐싱·KV-캐시 보존 같은 기법을 사용해 검색된 콘텐츠를 효율적으로 통합한다.

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)