MidTool: Mid-training Data Synthesis for Agentic Tool Use

📄 arXiv: 2608.20314v1 📥 PDF

作者: Fengqing Jiang, Yite Wang, Boyi Liu, Zhaoyang Wang, Canwen Xu, Zhewei Yao, Radha Poovendran, Yuxiong He

分类: cs.AI

发布日期: 2026-08-20

备注: Data & Model: https://hf.co/collections/MidTool/midtool-release


💡 一句话要点

提出MidTool以增强大型语言模型的工具使用能力

🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture) 支柱三:空间感知与语义 (Perception & Semantics) 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 工具使用 中期训练 大型语言模型 合成监督 开放语料库 软件工程 强化学习

📋 核心要点

  1. 现有方法在大型语言模型的工具使用能力上存在不足,尤其是在中期训练阶段的应用较少。
  2. 论文提出MidTool,通过构建开放语料库,结合真实工具API和文档驱动工作流,强化模型的工具使用能力。
  3. 实验结果显示,MidTool-Mix在多个基准测试中显著提升了模型的下游性能,验证了中期训练的重要性。

📝 摘要(中文)

中期训练被越来越多地认为是塑造大型语言模型能力的关键阶段。近期研究表明,针对性的中期训练可以增强推理能力,并改善软件工程环境中的代理能力。本研究探讨了一个较少被研究的代理能力:通用工具使用。我们提出了MidTool,一个用于代理工具使用中期训练的开放语料库构建管道,结合了大规模的网络、PDF和代码数据,以及来自真实工具API、MCP技能和文档驱动工作流的合成监督。MidTool旨在教会模型如何识别工具的可用性、从上下文中提取论据、组合工具调用工作流,并从不完整信息中恢复。我们在MidTool-Mix上对Qwen3-4B-Base和Qwen3-8B-Base进行了中期训练,并随后应用了监督微调和强化学习的后续训练。与基线相比,MidTool-Mix在BFCL、tau2-Bench和MCP Universe上在SFT和RL下均持续改善了下游性能。这些结果表明,通用工具使用与其他重要的LLM能力一样,受益于专门的中期训练,而不是完全依赖后期训练。

🔬 方法详解

问题定义:本研究旨在解决大型语言模型在工具使用能力方面的不足,尤其是在中期训练阶段的应用较少,导致模型在实际应用中的表现不佳。

核心思路:论文提出MidTool,通过构建一个开放的语料库,结合真实工具API和文档驱动工作流,来增强模型的工具使用能力。这样的设计旨在让模型更好地理解工具的可用性和上下文信息。

技术框架:MidTool的整体架构包括数据收集、合成监督生成和模型训练三个主要模块。数据收集阶段整合了大规模的网络、PDF和代码数据,合成监督生成阶段利用真实工具API生成训练信号,最后进行模型的中期训练。

关键创新:MidTool的核心创新在于其开放语料库的构建和合成监督的使用,这与现有方法的单一数据源和缺乏上下文理解的训练方式形成了鲜明对比。

关键设计:在模型训练过程中,采用了特定的损失函数和参数设置,以确保模型能够有效地学习工具调用的工作流和从不完整信息中恢复的能力。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果表明,使用MidTool-Mix进行中期训练的模型在BFCL、tau2-Bench和MCP Universe基准测试中,相较于基线模型在SFT和RL下均有显著提升,验证了中期训练在工具使用能力上的有效性。

🎯 应用场景

该研究的潜在应用领域包括软件工程、自动化工具使用和智能助手等。通过增强模型的工具使用能力,MidTool可以在实际场景中提升人机交互的效率和准确性,具有重要的实际价值和未来影响。

📄 摘要(原文)

Mid-training is increasingly recognized as a critical stage for shaping the capabilities of large language models. Recent work has shown that targeted mid-training can strengthen reasoning-intensive abilities such as math and science, and can also improve agentic capabilities in software-engineering settings. In this work, we study the parallel but less explored agentic capability: general tool use. We present MidTool, an open corpus construction pipeline for agentic tool-use mid-training that combines large-scale web, PDF, and code data with synthesized supervision from real-world tool APIs, MCP skills, and document-grounded workflows. MidTool is designed to teach models how to recognize tool affordances, ground arguments from context, compose tool call workflow, and recover from incomplete information. We mid-train Qwen3-4B-Base and Qwen3-8B-Base on MidTool-Mix, and then apply follow-up post-training with both supervised fine-tuning and reinforcement learning. Compared with baselines, MidTool-Mix consistently improves downstream performance under both SFT and RL on BFCL, tau2-Bench, and MCP Universe. These results suggest that general tool use, like other important LLM capabilities, benefits from dedicated mid-training rather than being left entirely to post-training.