RECAST: Learning to Compute the Right Context through Adaptive Evidence Routing

발행일
출처
arXiv
논문 번호
1180
분야
Agents
arXiv 번호
2610.10507

RAG이 '검색만' 하는 한계를 넘어, 검색·계산·코드 합성을 섞어 필요한 근거를 '만들어내는' 라우터를 학습시켜 6개 벤치마크 평균 75.6%를 달성했다.

이 논문은 한마디로 답에 필요한 근거가 문서에 그대로 있는 게 아니라 계산해서 만들어야 할 때를 위한 새 RAG 프레임워크다. 저자들은 가벼운 RouterLM이 매 라운드마다 어휘·의미·관계형 검색이나 맞춤형 코드 합성 중 필요한 연산을 골라 근거를 만들고, 충분하다고 판단하면 AnswerLM에 넘기는 RECAST를 제안했다. 6개 이기종 벤치마크 평균 75.6%로 최강 대형 모델 baseline(59.7%)을 15.9%p 앞질렀고, 못 본 벤치마크에서도 평균 15.0%p 우위를 보였다.

핵심 요약

  • 근거를 '검색'이 아니라 필터·집계·계산으로 '파생'하는 문제를 순차 의사결정으로 정식화했다.
  • RouterLM이 원시 연산 호출과 맞춤 코드 합성을 오가며 근거를 만들고, SFT+GRPO로 학습했다.
  • 6개 이기종 벤치마크에서 평균 75.6%로 최강 baseline 대비 +15.9%p를 기록했다.
  • 9B 소형 학습 모델이 학습 없는 Gemini 3.5 Flash 라우터보다 5.0%p 앞서는 효율성을 보였다.
  • 새로 본 3개 벤치마크에서도 평균 +15.0%p 우위로 제로샷 일반화를 입증했다.

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)