
这项由上海人工智能实验室主导的研究以预印本形式于2026年8月发布论文编号为arXiv:2608.02287感兴趣的读者可通过该编号检索完整论文。**研究概要工具摆在面前AI却不知道怎么用**假设你雇了一位新员工给他配备了一整套顶级工具专业的财务分析软件、数据处理脚本、行业报告模板。然而这位员工虽然认识这些工具却不知道在什么时候该用哪一个更不知道当任务需要同时用上三四个工具时该如何协调配合。结果是工具摆在面前任务照样做不好。这正是当前大语言模型也就是ChatGPT、文心一言这类AI系统面临的真实困境。这类AI的开发者和研究社区近年来逐渐形成了一套Agent Skill智能体技能的体系——你可以把它理解为一本本操作手册每本手册描述了一项具体技能的使用方法、步骤流程和注意事项比如如何扫描PDF并提取关键数字或如何调用模糊匹配算法比对供应商信息。根据公开记录截至2025年10月公开可用的技能包已超过60万份数量还在持续增长。然而把手册塞给AI并不等于AI就会用。上海人工智能实验室的研究团队在深入研究这个问题后发现大量现有的AI模型在拿到技能手册之后依然无法准确判断这个任务需不需要用这本手册、手册里写的步骤该如何一步步执行更别提当任务需要同时调用多本手册时如何把它们有条不紊地协调起来。为了解决这个问题研究团队提出了一个名为**SKTSkill-use Training at Scale大规模技能使用训练**的完整解决方案。其核心思路是与其指望AI自己悟出如何用技能不如造一套训练场让AI通过大量高质量的实战演练真正学会在各种复杂场景下正确使用技能。这套训练场从公开的技能库中挑选了2000项技能自动生成了4000个考题收集了27164条经过严格验证的答题全过程最终把这些范例答卷作为教材教会AI如何使用技能。---**一、技能手册为什么这么难用先理解问题的本质**在深入了解这套训练方案之前有必要先弄清楚为什么有手册和会用手册之间存在这么大的鸿沟。以一项具体任务为例检测发票是否存在欺诈行为。这项任务需要先扫描PDF格式的发票提取数字然后查询供应商数据库做模糊匹配再调用数学验证模块检查金额和IBAN号码是否一致最后生成一份格式规范的报告。每个步骤都有对应的技能手册可以参考但AI需要做到以下几件事才能完成任务第一识别出这个任务需要用到哪几本手册第二明白每本手册的适用范围和使用限制第三按照正确的顺序调用这些手册前一步的输出作为后一步的输入第四在执行具体操作时严格按照手册规定的流程走而不是凭感觉差不多地完成。现有的大多数AI模型在面对这样的任务时往往会出现以下几种情况要么完全不去查技能手册凭自身的训练记忆硬答要么打开了手册却没有真正理解里面的步骤要么在多个技能需要配合使用时遗漏了其中某几步的关键操作。研究团队发现已有的学术工作大多聚焦于如何更快地找到对应的技能手册或者如何把手册里的知识永久刻入AI的记忆里却很少有人系统研究如何让AI在拿到手册的情况下真正用好它。SKT正是要填补这个空白。---**二、训练场的第一关挑选合格的考题材料**造一个训练场首先需要选择好的原材料。研究团队从公开的技能库skills.sh中筛选了2000个技能包但这个筛选过程并不是随机抓取而是经过了严格的质量把关。负责筛选的是一个评委AI——研究人员给它设定了一套评分标准这项技能能不能用来出一道可以明确判断对错的考题如果一项技能太过模糊或者很难构造出有标准答案的任务就会被排除在外。只有那些能出好题的技能才会进入候选池。通过筛选之后研究团队进一步将技能按照单独使用和组合使用两种方式分类。单独使用的任务只需要一项技能适合考察AI对某一具体操作的掌握程度而组合使用的任务则需要两项或三项技能协同完成考察的是AI统筹协调多个操作步骤的能力。当涉及多技能组合时评委AI还会额外做一个检验这几项技能放在一起是否能形成一套逻辑流畅、分工明确的完整工作流如果两项技能放在一起没有任何协作的必要性它们就不会被配对成组合题。最终进入正式训练的2000项技能被组合成了4000道题其中单技能题1520道双技能题1295道三技能题1185道。---**三、训练场的第二关把题目做得有意义**选好了材料下一步是把题目真正造出来。研究团队为每道题设计了一个标准化的题包结构这个结构类似于一道编程竞赛题的完整题目包含清晰的任务说明、运行环境类似于考场提供完成任务所需的文件和数据、配置信息、用来自动打分的评测器以及一份隐藏的参考答案。这套自动出题的系统叫做TaskGen它会读取指定技能的内容然后按照上述结构生成一道完整的题目。但光有题目还不够研究团队还为每道题建立了三道质量检验关卡只有通过全部三关的题目才能进入训练池。第一关是规则核查负责检查题目本身的基本完整性和合法性题目的各个组成部分是否齐全文件路径是否有效评测器是否能正常运行最重要的一点是在一个干净的起点环境中运行参考答案是否能得满分如果参考答案自己都跑不过这道题就是废题直接淘汰。第二关是语义核查由另一个AI来审阅题目内容检查的是更细致的语义层面的问题题目说明是否清晰地告诉答题者要生成什么样的结果完成任务所需的所有信息是否都能在题目提供的环境中找到有没有出现答案泄露的情况——也就是题目的可见部分有没有把关键的技能要点直接写出来让答题者不用真正查阅技能手册就能答对第二关还包含一个特别精妙的测试技能依赖性检验。具体做法是用同一道题、同一个AI答题分两次运行一次提供技能手册另一次不提供。如果两次运行的得分相差不大说明这道题其实不需要技能手册也能答对这种题目对训练AI用技能毫无意义同样会被淘汰。只有有手册比没手册明显答得更好的题目才算是真正考察技能使用能力的好题。第三关是难度控制。研究团队用一个固定的AI答题系统在提供技能手册的条件下对每道题独立尝试5次记录每次的得分。如果5次中有3次或以上都得了满分说明这道题对AI来说太简单了没有训练价值会被送回修改要求在保留技能依赖性的同时增加推理难度或执行复杂度。修改后的题目需要重新从第一关开始走完整个检验流程。如果多次修改后仍然无法达标这道题就会被彻底丢弃。---**四、训练场的第三关收集完美答卷而非普通答卷**有了高质量的题目下一步是收集训练数据——具体来说是收集AI答题的完整过程包括它思考的步骤、调用工具的记录、最终生成的结果。研究团队选择了四位老师AI来示范答题MiniMax-M2.5、GLM-5、Qwen3.5-397B-A17B以及DeepSeek V4 Pro这些都是目前业界能力较强的大模型。同时答题的考场环境也就是代理执行框架有两种选择DeepAgents和OpenCode它们代表了两种不同的AI任务执行方式就像考试可以用纸笔答题或者用电脑答题。四位老师在两种考场环境下各自答一遍全部4000道题理论上共产生32000份答卷。但这些答卷并不会全部被接受每一份都需要再经过严格的两轮验收。第一轮是客观核查答卷必须从评测器那里拿到满分答题过程必须正常结束不能中途崩溃或者超时放弃工具调用的记录必须格式完整答题过程中必须明确打开过对应的技能手册文件。这四条有一条不达标答卷直接作废。第二轮是技能使用质量核查由一个AI审查员来仔细阅读整份答卷。审查员要确认对于每一项指定的技能手册AI是否在执行相关操作之前就已经先查阅了手册而不是做完了才翻手册走走过场技能手册里的关键规则是否真实地影响了AI的具体操作——比如改变了它选择的方法、用到了手册里特定的参数、遵循了手册规定的验证步骤如果AI只是把手册读了一遍但完全没有按照里面的内容行动或者在完全不看手册的情况下用通用知识答对了题目这份答卷也会被拒绝。对于需要多项技能配合的题目审查员还要确认每一项技能都在最终的答题流程中发挥了独特的、实质性的作用缺一不可。经过这一轮严苛的双重筛选32000份候选答卷中最终留下了27164份——其中DeepAgents环境下14277份OpenCode环境下12887份。这些答卷被用作训练教材教导新的AI模型学习如何使用技能。---**五、用这些范例答卷训练出来的AI成绩如何**研究团队选择了两个基础模型作为学生Qwen3.5-9B和Gemma 4 E4B-IT分别在上述训练数据上进行了完整的微调训练。训练完成后研究团队在四个不同的考试场景中对比了训练前后的成绩变化。四个考试场景涵盖了非常不同的任务类型SkillsBench考察工程、科学、金融、软件开发、数据处理等综合领域的多步骤技能任务SkillEval是研究团队自己搭建的新评测集专门用来考察技能使用能力覆盖软件开发调试、数据分析机器学习、信息安全、金融商业分析等领域MolBench-Bind考察的是分子科学领域的专业决策具体是给定两个药物分子AI需要判断哪个与目标蛋白结合力更强AgentSkillOS考察的是多格式文件生成能力包括数据计算报告、文档创作、视频生成、视觉内容创作和网页交互。结果显示在两个基础模型、两种考场环境、四个考试场景的16个对比组合中经过SKT训练的AI全部都比训练前有所提升提升幅度在3.20到18.91分之间满分100分。在综合技能任务的考场SkillsBench上提升幅度在3.20到9.99分在专门针对技能使用的SkillEval上提升幅度更大达到10.25到18.91分在分子科学决策的MolBench-Bind上提升幅度稳定在10分以上最高达到15.54分在文件生成任务的AgentSkillOS上提升了5.09到7.33分即便基础模型在这项任务上原本已经得分较高训练后依然有所提升。---**六、技能手册是真的有用还是AI自己就会**面对这些提升数据有一个问题自然而然地浮现这些进步到底是AI真正学会了用技能手册还是只不过训练过程顺带提升了AI的通用解题能力如果是后者那么即使不给技能手册训练后的AI也应该表现更好这样的话训练数据中的技能使用这个核心特征就没有意义了。为了回答这个问题研究团队做了一个对照实验把同样的题目分两组运行一组提供技能手册另一组故意不提供技能手册然后比较训练前后两种条件下的成绩差异。实验结果非常清晰当不提供技能手册时经过SKT训练的AI和原始AI之间的差距只有0.53到5.69分但当提供技能手册时这个差距跳升到8.68到18.91分。这种差距在两个不同的考试场景和两种考场环境下都一致出现。换句话说SKT训练的核心效果是让AI更善于利用外部提供的技能手册而不是简单地提升AI自身的通用知识储备。有手册和没手册之间的性能差距在训练后明显拉大了——这正是研究团队最希望看到的结果。---**七、验证两个关键问题质量重要吗换个考场还管用吗**训练效果既然如此明显有人或许会问这种效果是不是主要靠给AI看了更多数据带来的跟数据质量的关系不大毕竟研究团队花费了大量的精力在质量把控上这些精力是否真的值得为了回答这个问题研究团队专门设计了一组对比实验用同样数量的题目和答卷但跳过所有的验证和修复步骤直接用未经筛选的原始合成数据来训练同一个模型然后对比两者的成绩。结果令人印象深刻使用未经验证的原始数据训练后AI在SkillsBench上的成绩下降了1.9分在MolBench-Bind上下降了6.1分在SkillEval上下降了5.6分在AgentSkillOS上更是下降了19.5分——四个考试场景全部退步。相比之下使用经过严格验证的SKT数据训练后四个场景全部提升。两套方案之间的差距最大达到24.61分。这个结果说明未经验证的合成数据不只是没有帮助实际上会对AI造成反向的负面影响让AI学到错误的行为模式。质量把控不是可选项而是整个方案能否奏效的核心前提。另一个值得关注的问题是考场迁移AI在DeepAgents环境下训练换到OpenCode环境去考试成绩还能保持吗反过来也一样。这个问题很重要因为在实际应用中一个训练好的AI模型可能需要在多种不同的执行环境下使用。实验结果显示跨考场的效果确实不如对口的情况但依然比完全没有经过训练要好得多。具体来说在SkillsBench上用DeepAgents数据训练出来的模型在OpenCode环境下考试得分从5.8分提升到11.6分而用OpenCode数据训练出来的模型在同样的OpenCode环境下考试得到15.8分。换算来看跨考场的提升效果保留了对口提升效果的58.1%。在相反方向和另一个考试场景SkillEval上保留率在49.1%到52.1%之间。这意味着AI通过SKT训练学到的技能使用能力有相当大的一部分是通用的可以跨越不同的执行环境发挥作用同时也有一部分是特定于某种执行环境的专属能力。---**八、能不能训练出一个两用的AI**跨考场实验的结果自然引出了一个实用问题既然技能使用能力有通用的成分是否可以训练一个同时擅长两种考场环境的AI从而避免维护两套独立的训练模型研究团队的做法是把DeepAgents环境下的12000条验证轨迹和OpenCode环境下的12000条验证轨迹混合在一起共24000条用这份混合数据训练了一个通用版模型然后同时在两种考场环境下测试它与各自环境下的专版模型对比。结果表明这个通用版模型在两种环境下都能表现良好。与专版模型相比差距非常小最大只有2.71分的差距而且在三个对比中通用版反而略微超过了专版——在OpenCode环境下MolBench-Bind项目超出0.68分SkillEval项目超出1.57分在DeepAgents环境下SkillsBench项目超出0.31分。这意味着混合训练的方案在保持两种执行环境下良好表现的同时只牺牲了非常微小的专项优势。一个模型两种用途这对实际部署来说无疑更加经济。---**九、训练用的技能越多AI就越厉害吗**除了对训练质量和跨环境迁移的考察研究团队还测试了一个更直观的问题如果增加训练时使用的技能数量AI的技能使用能力会随之提升吗为了测试这个问题研究团队用100、500、1000和2000项技能分别训练了四个版本的模型然后在SkillEval上测试。未经训练的原始模型作为基准得分为55.24分。随着训练技能数量的增加模型得分从100技能时的59.8分逐步提升到500技能时的67.4分、1000技能时的70.8分最终达到2000技能时的72.48分。这种单调上升的趋势表明扩大训练中覆盖的技能范围确实能够持续改善模型的技能使用能力且目前还看不到明显的天花板。研究团队还进一步分析了训练效果是否集中在单技能任务上还是多技能任务同样能受益。在SkillsBench的77道题中按照每道题需要用到的技能数量分组来看单技能任务的得分从原来的9.54分提升到16.94分提升了7.4分双技能任务的提升最为显著从3.95分提升到20.72分提升了16.8分三个及以上技能的任务从4.04分提升到12.08分提升了8.04分。三个组别都有实质性的提升说明SKT训练的效果并不依赖于简化单一技能任务在需要多个技能协同配合的复杂场景下同样有效。---**结语工具还是那些工具关键是学会怎么用**说到底这项研究回答的是一个朴素的问题给了AI工具怎么才能让它真正会用研究团队的答案是让它通过大量经过严格筛选的实战演示来学习——演示本身必须是真实有效的演示中的每一步操作都必须真正依赖了技能手册而不是凑数的。与此同时题目本身也必须足够有意义太简单的直接淘汰不依赖技能手册也能答对的直接淘汰题目描述有漏洞的送去修复。这种严格的质量把控带来的效果是全面的对不同架构的AI模型有效对不同的任务领域有效对不同的执行环境有效并且随着训练覆盖的技能范围扩大而持续提升。归根结底这套方法的价值不仅仅在于让AI认识更多技能而在于训练出一种能力——在面对新的技能手册时AI能够自然地判断它有没有用、该在何时查阅、该怎么把手册里的规则转化为具体操作。就像一个熟练的工程师面对一本从未见过的设备手册也能很快找到关键信息并正确操作而不是茫然地翻完又放下。感兴趣深入了解这套方法细节的读者可以通过arXiv检索编号2608.02287找到完整论文SkillEval评测集也已在Hugging Face上公开数据集地址为datasets/Artemis0430/skilleval-v1。---**QA**Q1SKT训练方案和直接给AI更多数据训练有什么区别ASKT的核心区别在于数据质量的严格把控而非单纯增加数量。实验证明使用未经验证的原始合成数据训练后AI在四个测试场景上全部退步最大下降19.5分而经过SKT严格验证的数据则让四个场景全部提升。未经验证的数据会让AI学到错误的行为模式反而有害。Q2SKT训练出来的AI离开了技能手册还能用吗A能用但提升效果主要体现在有技能手册的情况下。实验对比显示不提供技能手册时训练前后的差距只有0.53到5.69分提供技能手册后差距扩大到8.68到18.91分。这说明SKT训练的重点是增强AI利用外部技能手册的能力而不是单纯提升通用知识储备。Q3SkillEval评测集是怎么保证和训练数据不重叠的ASkillEval采用了与训练数据完全不同的技能池来生成题目训练用了2000项技能SkillEval的100道题则来自另一批单独生成的技能组合两个集合在技能层面没有交叉。此外SkillEval的题目和答题轨迹都没有被纳入训练数据从任务包和轨迹两个层面都保持了严格隔离。