ToolGrad:利用文本“梯度“高效生成工具调用数据集

发布时间:2026/9/12 0:14:23
ToolGrad:利用文本“梯度“高效生成工具调用数据集 ToolGrad是一种数据生成框架它颠覆了传统范式先生成工具调用答案再生成用户查询。我们的研究表明这种设计能让大语言模型获得更好的工具调用性能。快速链接AI智能体在自动化处理现实世界任务方面已展现出巨大潜力例如进行谷歌搜索、读取本地计算机文件或执行生成的Python脚本。为实现这类智能体工作流大语言模型需要学会正确、高效地使用工具。要教会大语言模型使用工具我们需要包含工具调用链及其对应用户查询的数据集。在我们此前介绍InstructPipe的工作中我们手动标注了评估数据但对于先进的大语言模型微调工作流程而言扩大人工标注规模并不现实。为了简化数据处理流程此前的工作例如ToolBench和ToolACE探索了使用智能体通过试错来自动搜索工具调用路径的方法。这种代表性的标注方法包含两个步骤1从采样的API池中生成一个假设的用户指令2使用深度优先搜索DFS智能体来找到其工具调用解决方案。这种方法本质上效率低下因为其核心理念是从复杂的智能体探索过程中提炼出有价值的轨迹用于训练大语言模型。在ACL 2026上发表的论文《ToolGrad利用文本梯度高效生成工具调用数据集》中我们提出了一种替代性的解决方案范式。ToolGrad首先生成一个真实的工具调用链然后为其标注对应的用户提示词。直观来看一个明确的工具调用解决方案比一个提示词提供了更多明确的信息这使得从工具用法到用户查询的标注变得更加容易只需一步大语言模型处理即可完成。我们的结果表明这种以答案为先的方法能够以更低的成本生成更复杂长链条的工具调用数据。在我们生成的数据上训练的大语言模型其表现也优于在基线方法数据上训练的模型甚至在包含未见过工具的分布外OOD数据集上能够与最先进的专有大语言模型相媲美。此前的技术通过搜索用户查询的解决方案来生成工具调用数据集但通过率较低而ToolGrad在生成提示词之前先生成成功的工具调用链从而实现了更高的通过率。利用文本梯度进行迭代式工具调用链生成标准机器学习ML系统通过在训练样本的小批量数据上计算数值损失梯度来实现优化这些梯度随后被优化算法用来更新模型权重。最近TextGrad将这一范式应用到了提示词工程中利用大语言模型评判器提供丰富的、描述性的纯文本反馈——这种反馈被称为文本梯度。这些文本梯度随后指导给定提示词的优化将其改进为能更好解决目标任务的新草稿。ToolGrad将文本梯度的概念从提示词优化领域引入到了合成数据集生成领域。ToolGrad并非优化一个静态的文本提示词而是利用这些梯度从庞大的工具库中迭代构建复杂、有效的API工作流。将ToolGrad的优化组件与传统机器学习和TextGrad进行比较。ToolGrad框架ToolGrad包含四个核心模块依次执行提议、执行、选择和更新操作。重复这一迭代过程最终生成一个数据样本其中包含用户查询、经过验证的API工作流以及最终的AI响应。ToolGrad在生成提示词之前先生成成功的工具调用链从而实现了较高的通过率。实验我们首先评估了数据生成的成本和质量。我们使用包含逾1.6万个真实世界API的ToolBench作为API数据库来生成我们的工具调用数据集。我们将ToolBench上原有的以查询为先的数据生成方法使用深度优先搜索DFS与我们以答案为先的方法ToolGrad进行了比较。结果表明ToolGrad能够以更低的生成成本生成更复杂且通过率更高的工具调用数据。以查询为先的方法基线与以答案为先的方法我们的方法之间的生成效率比较。我们利用来自ToolBench的API数据库生成了名为ToolGrad-500的小规模工具调用数据集。随后我们使用ToolGrad-500对Gemma-3模型1B、4B和12B进行了微调并将这些微调后的模型分别称为ToolGrad-1B、ToolGrad-4B和ToolGrad-12B。我们在伯克利函数调用排行榜BFCL上评估了这些模型的工具调用性能该基准测试的工具集与ToolBench不同。我们将微调后的模型与以下几类模型进行了比较1未经微调的基础模型2最先进的专有模型Gemini、GPT和Claude以及3最先进的工具调用专用模型ToolACE、Hammer-2.1-7B。以下总结了我们的研究发现。Gemma-3、ToolGrad系列模型、Gemini 2.5系列、GPT-5、Claude-4.5、ToolACE以及Hammer-2.1-7B模型的BFCL评估结果。结论与未来方向ToolGrad证明通过以答案为先的范式可以更高效、更可靠地生成高质量的工具调用数据集。通过设计一个利用文本梯度迭代链接API的智能体框架ToolGrad解决了生成真实数据过程中长期存在的成本和可扩展性瓶颈问题。我们的设计在数据生成中实现了近乎100%的通过率使相对小巧的模型也能表现出色并证明了学生大语言模型甚至可以超越其教师模型。展望未来通过扩展该框架以处理日益动态和庞大的API生态系统这项研究可以拓展到更广泛的现实世界应用中。未来的工作还将探索扩展这种自我演进的能力以支持随时间推移实现持续、即时的个性化学习。随着智能体工作流日益融入企业和日常任务像ToolGrad这样的框架为训练兼具高能力和经济可扩展部署优势的数字智能体奠定了重要基础。致谢这项研究主要由Zhongyi Zhou在谷歌担任访问研究员期间主导完成。我们衷心感谢主要贡献者Kohei Uehara、Haoyu Zhang、Jingtao Zhou、Lin Gu、Zheng Xu、Tatsuya Harada的支持并感谢Adarsh Kowdle和Shahram Izadi提供的战略指导和深入审阅。快速链接QAQ1ToolGrad是什么AToolGrad是一种数据生成框架它颠覆了传统的先生成用户查询再生成工具调用答案的方式改为先生成工具调用答案再标注对应的用户查询从而更高效地生成大语言模型工具调用训练数据。Q2ToolGrad相比传统方法有什么优势AToolGrad能以更低的生成成本生成更复杂长链条的工具调用数据并且数据生成通过率接近100%。用ToolGrad数据训练的模型表现优于基线方法训练的模型甚至能在未见过工具的场景下媲美顶尖专有大语言模型。Q3ToolGrad训练出来的模型表现如何A研究团队用ToolGrad生成的小规模数据集微调了Gemma-3系列模型1B、4B、12B并在伯克利函数调用排行榜BFCL上进行评估结果显示这些相对小巧的模型表现优异甚至超越了其训练所参考的教师模型。