OpenThoughts-Agent: Data Recipes for Agentic Models

발행일
출처
arXiv
논문 번호
486
분야
AI / General
arXiv 번호
2606.24855

에이전트 모델 훈련을 위한 완전 공개 데이터 큐레이션 파이프라인으로, 100K 예제로 Qwen3-32B를 미세조정하여 7개 벤치마크 평균 44.8%로 기존 최고 오픈 모델 대비 3.9%p 향상한다.

에이전트 모델 훈련용 데이터 큐레이션에 대한 공개 연구가 부족한 문제를 해결하기 위해, OpenThoughts-Agent(OT-Agent) 프로젝트는 6단계 SFT 데이터 파이프라인을 구축하고 100개 이상의 통제된 절실험을 수행했다. 100K 예제로 Qwen3-32B를 미세조정한 결과 7개 에이전트 벤치마크 평균 44.8%를 달성하여, 기존 최고 오픈 데이터 모델(Nemotron-Terminal-32B, 40.9%)을 3.9%p 능가했다. 또한 RL 데이터 큐레이션도 연구하여 SFT+RL 2단계 파이프라인에서 8B 모델로 기존 최고 베이스라인을 능가한다.

핵심 요약

  • 6단계 SFT 데이터 파이프라인에 100개 이상의 통제된 절실험 수행으로 각 단계의 효과를 정량 분석
  • 지시문 선택이 파이프라인에서 가장 중요한 요인이며, 최강 모델이 최고 교사가 아님을 입증
  • 100K 예제로 Qwen3-32B 미세조정 시 SWE-Bench Verified 54.0%, Terminal-Bench 2.0 26.2% 달성
  • 평균 44.8%로 기존 최고 오픈 데이터 에이전트 모델 대비 3.9%p 향상 (Nemotron-Terminal-32B 40.9%)
  • 모든 훈련 세트 크기에서 경쟁 오픈 데이터셋을 능가하는 스케일링 특성 입증
  • SFT+RL 2단계 8B 모델이 순수 SFT 및 순수 RL 모두를 능가함을 확인

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)