MidTool: Mid-training Data Synthesis for Agentic Tool Use

발행일
출처
arXiv
논문 번호
976
분야
AI / General
arXiv 번호
2608.20314

도구 사용 능력을 포스트트레이닝에만 맡기지 말고, 미드트레이닝(사전학습과 파인튜닝 사이 단계)에서 전용 데이터로 미리 심어주자는 논문이다.

이 논문은 한마디로 'LLM의 도구 사용 능력은 미드트레이닝(사전학습과 포스트트레이닝 사이 단계)에서 길러야 한다'는 것을 보여준다. 저자들은 웹, PDF, 코드, 실제 API와 MCP 스킬을 결합해 203억 토큰짜리 'MidTool-Mix' 코퍼스를 만들었다. 데이터 합성은 두 갈래다. 문서를 근거로 도구를 알아보고 인자를 채우는 '그라운딩' 감독과, 실제 도구를 돌려보며 다단계 실행과 복구를 가르치는 '실행' 감독이다. Qwen3-4B/8B 베이스에 이걸로 미드트레이닝하니 BFCL, tau2-Bench, MCP Universe에서 SFT와 RL 어떤 후속 훈련에도 일관되게 점수가 올랐다. 특히 다중 턴·인터랙티브 과제에서 향상이 컸고, 4B·8B 모두 MCP-Universe에서 공식 Qwen3 모델을 능가했다.

핵심 요약

  • 웹·PDF·코드·실제 API/MCP 스킬을 결합한 203억 토큰 규모의 도구 사용 전용 미드트레이닝 코퍼스 MidTool-Mix와 그 구축 파이프라인을 오픈소스로 공개했다.
  • 문서 기반 '그라운딩' 합성과 실제 도구 실행 기반 '실행' 합성이 각자 다른 역할을 하며, 둘 다 있어야 여덟 지표 전부에서 향상이 났다.
  • 4B와 8B 모두 BFCL, tau2-Bench, MCP Universe 세 벤치마크에서 SFT·RL 어느 후속 훈련 아래에서도 일관된 이득을 보였다.
  • 미드트레이닝된 4B·8B 모델은 MCP-Universe에서 공식 Qwen3 모델을 능가해, 모델을 키우는 것보다 전용 미드트레이닝이 효과적임을 보였다.
  • 실행 궤적 합성 단독은 BFCLv3에서 +7.9로 가장 큰 폭이 오르고, 그라운딩 합성은 tau2-Bench·MCP-Universe 같은 낯선 환경 이전에 더 강했다.

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)