MidTool: Mid-training Data Synthesis for Agentic Tool Use
- 발행일
- 출처
- arXiv
- 논문 번호
- 976
- 분야
- AI / General
- arXiv 번호
- 2608.20314
도구 사용 능력을 포스트트레이닝에만 맡기지 말고, 미드트레이닝(사전학습과 파인튜닝 사이 단계)에서 전용 데이터로 미리 심어주자는 논문이다.
이 논문은 한마디로 'LLM의 도구 사용 능력은 미드트레이닝(사전학습과 포스트트레이닝 사이 단계)에서 길러야 한다'는 것을 보여준다. 저자들은 웹, PDF, 코드, 실제 API와 MCP 스킬을 결합해 203억 토큰짜리 'MidTool-Mix' 코퍼스를 만들었다. 데이터 합성은 두 갈래다. 문서를 근거로 도구를 알아보고 인자를 채우는 '그라운딩' 감독과, 실제 도구를 돌려보며 다단계 실행과 복구를 가르치는 '실행' 감독이다. Qwen3-4B/8B 베이스에 이걸로 미드트레이닝하니 BFCL, tau2-Bench, MCP Universe에서 SFT와 RL 어떤 후속 훈련에도 일관되게 점수가 올랐다. 특히 다중 턴·인터랙티브 과제에서 향상이 컸고, 4B·8B 모두 MCP-Universe에서 공식 Qwen3 모델을 능가했다.
핵심 요약
- 웹·PDF·코드·실제 API/MCP 스킬을 결합한 203억 토큰 규모의 도구 사용 전용 미드트레이닝 코퍼스 MidTool-Mix와 그 구축 파이프라인을 오픈소스로 공개했다.
- 문서 기반 '그라운딩' 합성과 실제 도구 실행 기반 '실행' 합성이 각자 다른 역할을 하며, 둘 다 있어야 여덟 지표 전부에서 향상이 났다.
- 4B와 8B 모두 BFCL, tau2-Bench, MCP Universe 세 벤치마크에서 SFT·RL 어느 후속 훈련 아래에서도 일관된 이득을 보였다.
- 미드트레이닝된 4B·8B 모델은 MCP-Universe에서 공식 Qwen3 모델을 능가해, 모델을 키우는 것보다 전용 미드트레이닝이 효과적임을 보였다.
- 실행 궤적 합성 단독은 BFCLv3에서 +7.9로 가장 큰 폭이 오르고, 그라운딩 합성은 tau2-Bench·MCP-Universe 같은 낯선 환경 이전에 더 강했다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.