Search-o1: Agentic Search-Enhanced Large Reasoning Models
- 발행일
- 출처
- arXiv
- 논문 번호
- 013
- 분야
- Reasoning / Search
- arXiv 번호
- 2501.05366
검색을 장기 사슬 추론의 중단 가능한 일부로 전환한다. 모델은 사고 사슬이 지식 공백에 부딪힐 때 정확히 그 시점에 검색하고, 반환된 페이지를 별도의 Reason-in-Documents 단계로 압축한 뒤 계속 진행한다.
Search-o1은 o1 스타일 대형 추론 모델의 특정 실패 양상을 목표로 한다. 긴 단계별 추론이 누락되거나 오래된 지식을 다운스트림 오류로 증폭시키는 문제다. QwQ-32B-Preview에 에이전트형 RAG를 추가하여, 모델이 추론 중에 특수 검색 질의 토큰을 방출하고, Bing이나 Jina로 웹 문서를 검색하며, 검색 결과 토큰으로 둘러싸인 정제된 증거만 삽입하도록 한다. 정제는 동일한 추론 모델이 이전 추론, 현재 질의, 검색된 페이지를 조건으로 별도의 Reason-in-Documents 단계에서 수행하여, 긴 문서의 노이즈를 줄인다. GPQA, MATH500/AMC/AIME, LiveCodeBench, 그리고 6개 개방형 도메인 QA 데이터셋에 대한 실험은 직접 추론, 표준 RAG, 문서 추론이 없는 검색 에이전트 대비 일관된 향상을 보여준다. 까다로운 추론 과제에서는 RAgent-QwQ보다 평균 4.7%, 직접 QwQ보다 3.1% 높으며, GPQA 확장 세트에서 QwQ의 51.8 대비 전체 57.9에 도달한다.
핵심 요약
- 방법으로 모델은 '검색 질의 시작'과 '검색 질의 끝' 특수 토큰을 생성할 때 생성을 일시 중지하고, 상위 k개의 웹 문서를 검색한 뒤, '검색 결과 시작'과 '검색 결과 끝' 토큰 사이에 정제된 지식을 삽입한 후 재개한다.
- 핵심 아이디어는 검색이 표준 RAG에서처럼 일회성 서두가 아니라, 추론 궤적의 불확실한 지점에서 반복되는 모델 제어 행동이라는 것이다.
- Reason-in-Documents 단계는 현재 추론 맥락에 비추어 검색된 페이지를 분석하고 간결한 최종 정보를 출력하여, 장황하거나 무관한 페이지가 사고 사슬을 탈선시키는 것을 방지한다.
- 결과와 의미 측면에서 가장 강력한 향상은 GPQA 및 멀티홉 QA 같은 지식 집약적 다단계 환경에서 나타나며, 이는 추론 모델이 언제 검색할지와 증거를 증명 경로로 어떻게 다시 접어 넣을지를 모두 결정할 수 있을 때 검색이 가장 큰 도움이 됨을 시사한다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.