Dr. Zero: Self-Evolving Search Agents without Training Data
- 발행일
- 출처
- arXiv
- 논문 번호
- 107
- 분야
- Agents / Search
- arXiv 번호
- 2601.07055
인간이 라벨링한 학습 데이터 없이도 검색 에이전트가 스스로 진화한다. 문제를 내는 제안자와 푸는 해결자가 같은 베이스 모델에서 공진화하며 지도학습 기반 에이전트에 필적한다.
Meta Superintelligence Labs와 UIUC가 개발한 프레임워크 Dr. Zero는 인간이 큐레이션한 학습 데이터 없이도 다중 턴 검색 에이전트가 자기 진화할 수 있게 한다. 이는 제안자-해결자 공진화 메커니즘과 새로운 Hop-Grouped Relative Policy Optimization을 활용하여, 에이전트가 개방형 도메인 QA 과제에서 지도 학습 기반 베이스라인에 필적하거나 이를 능가하면서도 계산 오버헤드를 대폭 줄일 수 있게 한다.
핵심 요약
- 고급 검색 및 추론 대규모 언어 모델(LLM)을 개발하기 위해 비용이 큰 인간 큐레이션 학습 데이터에 의존해야 하는 것이 문제다.
- 다중 홉 추론을 위한 다양하고 도전적인 개방형 도메인 질문을 생성하는 데에서 기존 데이터 비의존적 자기 진화 프레임워크가 한계를 보인다.
- 외부 도구와 상호작용하는 다중 턴 검색 에이전트를 최적화하기 위한 기존 강화학습 방법은 계산 비효율성이 크다.
- 두 에이전트 모두 인간 데이터 없이 학습하며, 사실 검증을 위해 오직 외부 검색 엔진에만 의존하는 자기 진화 제안자-해결자 프레임워크다.
- 효율적인 제안자 학습을 위한 Hop-Grouped Relative Policy Optimization(HRPO)을 도입하여, 질문을 홉 복잡도별로 군집화하고 그룹 수준 베이스라인을 사용해 계산 오버헤드를 줄인다.
- 제안자가 다양하고 도전적이면서도 검증 가능한 다중 홉 질문을 생성하도록 난이도 기반 보상을 활용하여, 동적인 커리큘럼을 조성한다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.