SFR-DeepResearch: Towards Effective Reinforcement Learning for Autonomously Reasoning Single Agents
- 발행일
- 출처
- arXiv
- 논문 번호
- 078
- 분야
- Research Agents / RL
- arXiv 번호
- 2509.06283
Salesforce AI Research는 단일 에이전트 대규모 언어 모델의 자율적 추론 및 도구 사용 역량을 강화하기 위해 지속적 강화학습을 활용하는 프레임워크인 SFR-DeepResearch를 소개했다.
Salesforce AI Research는 단일 에이전트 대규모 언어 모델의 자율적 추론 및 도구 사용 역량을 강화하기 위해 지속적 강화학습을 활용하는 프레임워크인 SFR-DeepResearch를 소개했다. 이 접근법은 HLE 벤치마크에서 베이스 모델 대비 65%의 상대적 향상을 이끌어냈으며, FRAMES와 GAIA에서 SOTA 성능을 달성하여 여러 독점 및 멀티 에이전트 시스템을 능가했다.
핵심 요약
- 대규모 언어 모델(LLM)에 고급 추론과 도구 사용 능력을 장착하여, 환각 같은 문제를 완화하면서 복잡하고 장기적인 과제를 수행하게 한다.
- 경직된 멀티 에이전트 오케스트레이션 없이도 작동하며 더 나은 일반화를 제공하는, Deep Research(DR)를 위한 효과적인 자율 단일 에이전트 시스템을 개발한다.
- 기존 방법이 안정성에서 어려움을 겪고 베이스 모델의 추론 능력을 저하시킬 수 있는, 다중 턴 에이전트형 과제에 대한 강화학습(RL)을 안정화한다.
- 특정 LLM 계열을 위해 세 가지 도구('인터넷 검색', '페이지 열람', '코드 인터프리터')의 최소 집합과 반복적 단일 턴 워크플로우를 갖춘 에이전트형 추론 스캐폴딩을 개발했다.
- 에이전트형 훈련을 위해 까다로운 다중 홉 QA와 장문 보고서 작성 과제를 생성하는 새로운 합성 데이터 생성 파이프라인을 구축했다.
- 다중 턴 상호작용에 대한 안정적인 정책 최적화를 보장하기 위해 길이 정규화 REINFORCE 목적함수, 궤적 필터링, 부분 롤아웃을 특징으로 하는 종단간 강화학습 레시피를 구현했다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.