RECAST: Learning to Compute the Right Context through Adaptive Evidence Routing
- 발행일
- 출처
- arXiv
- 논문 번호
- 1180
- 분야
- Agents
- arXiv 번호
- 2610.10507
RAG이 '검색만' 하는 한계를 넘어, 검색·계산·코드 합성을 섞어 필요한 근거를 '만들어내는' 라우터를 학습시켜 6개 벤치마크 평균 75.6%를 달성했다.
이 논문은 한마디로 답에 필요한 근거가 문서에 그대로 있는 게 아니라 계산해서 만들어야 할 때를 위한 새 RAG 프레임워크다. 저자들은 가벼운 RouterLM이 매 라운드마다 어휘·의미·관계형 검색이나 맞춤형 코드 합성 중 필요한 연산을 골라 근거를 만들고, 충분하다고 판단하면 AnswerLM에 넘기는 RECAST를 제안했다. 6개 이기종 벤치마크 평균 75.6%로 최강 대형 모델 baseline(59.7%)을 15.9%p 앞질렀고, 못 본 벤치마크에서도 평균 15.0%p 우위를 보였다.
핵심 요약
- 근거를 '검색'이 아니라 필터·집계·계산으로 '파생'하는 문제를 순차 의사결정으로 정식화했다.
- RouterLM이 원시 연산 호출과 맞춤 코드 합성을 오가며 근거를 만들고, SFT+GRPO로 학습했다.
- 6개 이기종 벤치마크에서 평균 75.6%로 최강 baseline 대비 +15.9%p를 기록했다.
- 9B 소형 학습 모델이 학습 없는 Gemini 3.5 Flash 라우터보다 5.0%p 앞서는 효율성을 보였다.
- 새로 본 3개 벤치마크에서도 평균 +15.0%p 우위로 제로샷 일반화를 입증했다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.