AgenticQwen: Training Small Agentic Language Models with Dual Data Flywheels for Industrial-Scale Tool Use
- 발행일
- 출처
- arXiv
- 논문 번호
- 161
- 분야
- LLMs / Agents / Efficiency
- arXiv 번호
- 2604.21590
Alibaba Group 연구진은 다회차 강화학습과 지속적·다양한 데이터 생성을 위한 이중 데이터 플라이휠을 통합하여, 산업 규모 도구 사용을 위한 소형 언어 모델 시리즈 AgenticQwen을 개발했다.
Alibaba Group 연구진은 다회차 강화학습과 지속적·다양한 데이터 생성을 위한 이중 데이터 플라이휠을 통합하여, 산업 규모 도구 사용을 위한 소형 언어 모델 시리즈 AgenticQwen을 개발했다. 이 모델들은 향상된 에이전트 능력을 보이며, 더 큰 모델에 필적하는 성능을 달성하면서도 실제 응용을 위한 비용 대비 성능 효율을 개선한다.
핵심 요약
- LLM 기반 에이전트의 산업 배포는 매우 크거나 독점적인 파운데이션 모델에 따르는 높은 계산 비용과 지연 시간 때문에 제약된다.
- 견고한 다단계 에이전트 능력과 도구 상호작용에 특화되어 최적화된 소형 언어 모델이 부족하다.
- 에이전트 강화학습에 사용되는 정적 합성 데이터셋은 데이터 동질성과 학습 신호의 빠른 포화를 초래하는 경우가 많아 추가적인 성능 향상을 제한한다.
- Reasoning RL과 Agentic RL을 결합한 다회차 강화학습 접근법으로 소형 AgenticQwen 모델(8B 및 30B-A3B)을 학습시켰다.
- Reasoning Data Flywheel과 Agentic Data Flywheel로 구성된 이중 데이터 플라이휠 메커니즘을 도입하여 점점 더 복잡하고 다양한 학습 데이터를 반복적으로 생성한다.
- 강력한 LLM(Qwen3-235B)이 사용자와 도구를 모두 모델링하는 완전 시뮬레이션 학습 환경을 활용하여, 데이터 합성 및 시뮬레이션에서 외부 독점 API에 대한 의존을 제거했다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.