Cross-Domain Hybrid OPD for Generalizable Search Agents
- 발행일
- 출처
- arXiv
- 논문 번호
- 805
- 분야
- LLMs / NLP
- arXiv 번호
- 2608.02101
검색 특화 강화학습만 돌리면 일반 능력이 깎이는 문제를 다룬 기술보고서다. Yuanbao 검색 에이전트를 만들면서 검색용 강화학습과 여러 분야 전문 교사 모델의 온폴리시 증류(학생 모델이 직접 만들어 낸 답 위에서 교사 모델이 정답 분포를 알려 주는 학습)를 함께 돌려 두 마리 토끼를 잡았다.
검색 에이전트를 강화학습으로 세게 학습시키면 검색 성능은 오르지만 지시 따르기, 대화 품질, 일반 추론 같은 범용 능력이 떨어지는 정렬 세금(alignment tax) 문제가 생긴다. 저자들은 Hunyuan3 기반 Yuanbao 검색 에이전트에 두 단계 학습을 적용했다. 1단계는 자율 계획과 반복 검색을 배우는 에이전트 강화학습이고, 2단계는 코드, 수학, 과학, 논리추론 등 여러 분야 전문 교사 모델을 학생 모델에 온폴리시 증류하는 단계다. 실험 결과 검색 벤치마크 성능은 그대로 강하게 유지하면서 일반 능력 벤치마크는 기반 모델보다 오히려 올라갔다. 절제 실험에서 증류를 강화학습으로 대체하면 논리추론 정확도가 46.90퍼센트에서 36.31퍼센트로 크게 떨어졌다.
핵심 요약
- 먼저 에이전트 강화학습으로 자율 계획과 반복 검색을 익히고, 이어 여러 분야 전문가의 온폴리시 증류로 일반 능력을 회복하는 두 단계 학습을 썼다.
- 증류 뒤에도 검색 능력은 대체로 유지됐고 여러 검색 과제에서는 강화학습 단계보다 더 향상돼 전문성과 범용성의 절충을 보였다.
- 증류를 검색·일반 자료의 혼합 강화학습으로 바꾸면 HYEval3.1 논리 추론이 46.90%에서 36.31%, BBEH Mini가 47.86%에서 35.22%로 떨어졌다.
- 분야별 교사와 쉬운 문제부터 가르치는 과정이 범용 교사 한 개나 과정 없는 학습보다 어려운 추론·코딩·수학 과제에서 더 좋은 결과를 냈다.
- 기술 보고서의 증거는 Hunyuan3 기반 Yuanbao와 제시된 검색·일반 벤치마크에 집중돼 있어 다른 기반 모델과 외부 운영 환경으로의 일반화는 추가 검증이 필요하다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.