这项由上海人工智能实验室主导的研究以预印本形式于2026年8月发布,论文编号为arXiv:2608.02287,感兴趣的读者可通过该编号检索完整论文。

**研究概要:工具摆在面前,AI却不知道怎么用**

假设你雇了一位新员工,给他配备了一整套顶级工具:专业的财务分析软件、数据处理脚本、行业报告模板。然而,这位员工虽然认识这些工具,却不知道在什么时候该用哪一个,更不知道当任务需要同时用上三四个工具时该如何协调配合。结果是,工具摆在面前,任务照样做不好。

这正是当前大语言模型(也就是ChatGPT、文心一言这类AI系统)面临的真实困境。这类AI的开发者和研究社区近年来逐渐形成了一套"Agent Skill"(智能体技能)的体系——你可以把它理解为一本本"操作手册",每本手册描述了一项具体技能的使用方法、步骤流程和注意事项,比如"如何扫描PDF并提取关键数字"或"如何调用模糊匹配算法比对供应商信息"。根据公开记录,截至2025年10月,公开可用的技能包已超过60万份,数量还在持续增长。

然而,把手册塞给AI,并不等于AI就会用。上海人工智能实验室的研究团队在深入研究这个问题后发现:大量现有的AI模型在拿到技能手册之后,依然无法准确判断"这个任务需不需要用这本手册"、"手册里写的步骤该如何一步步执行",更别提当任务需要同时调用多本手册时,如何把它们有条不紊地协调起来。

为了解决这个问题,研究团队提出了一个名为**SKT(Skill-use Training at Scale,大规模技能使用训练)**的完整解决方案。其核心思路是:与其指望AI自己悟出如何用技能,不如造一套"训练场",让AI通过大量高质量的实战演练,真正学会在各种复杂场景下正确使用技能。这套训练场从公开的技能库中挑选了2000项技能,自动生成了4000个考题,收集了27164条经过严格验证的答题全过程,最终把这些"范例答卷"作为教材,教会AI如何使用技能。

**一、技能手册为什么这么难用?先理解问题的本质**

在深入了解这套训练方案之前,有必要先弄清楚,为什么"有手册"和"会用手册"之间存在这么大的鸿沟。

以一项具体任务为例:检测发票是否存在欺诈行为。这项任务需要先扫描PDF格式的发票提取数字,然后查询供应商数据库做模糊匹配,再调用数学验证模块检查金额和IBAN号码是否一致,最后生成一份格式规范的报告。每个步骤都有对应的技能手册可以参考,但AI需要做到以下几件事才能完成任务:第一,识别出这个任务需要用到哪几本手册;第二,明白每本手册的适用范围和使用限制;第三,按照正确的顺序调用这些手册,前一步的输出作为后一步的输入;第四,在执行具体操作时,严格按照手册规定的流程走,而不是凭感觉"差不多"地完成。

现有的大多数AI模型在面对这样的任务时,往往会出现以下几种情况:要么完全不去查技能手册,凭自身的训练记忆"硬答";要么打开了手册却没有真正理解里面的步骤;要么在多个技能需要配合使用时,遗漏了其中某几步的关键操作。

研究团队发现,已有的学术工作大多聚焦于"如何更快地找到对应的技能手册"或者"如何把手册里的知识永久刻入AI的记忆里",却很少有人系统研究"如何让AI在拿到手册的情况下,真正用好它"。SKT正是要填补这个空白。

**二、训练场的第一关:挑选合格的"考题材料"**

造一个训练场,首先需要选择好的原材料。研究团队从公开的技能库skills.sh中筛选了2000个技能包,但这个筛选过程并不是随机抓取,而是经过了严格的质量把关。

负责筛选的是一个"评委AI"——研究人员给它设定了一套评分标准:这项技能能不能用来出一道"可以明确判断对错"的考题?如果一项技能太过模糊,或者很难构造出有标准答案的任务,就会被排除在外。只有那些"能出好题"的技能才会进入候选池。

通过筛选之后,研究团队进一步将技能按照"单独使用"和"组合使用"两种方式分类。单独使用的任务只需要一项技能,适合考察AI对某一具体操作的掌握程度;而组合使用的任务则需要两项或三项技能协同完成,考察的是AI统筹协调多个操作步骤的能力。当涉及多技能组合时,评委AI还会额外做一个检验:这几项技能放在一起,是否能形成一套逻辑流畅、分工明确的完整工作流?如果两项技能放在一起没有任何协作的必要性,它们就不会被配对成组合题。

最终进入正式训练的2000项技能,被组合成了4000道题:其中单技能题1520道,双技能题1295道,三技能题1185道。

**三、训练场的第二关:把题目做得"有意义"**

选好了材料,下一步是把题目真正"造出来"。研究团队为每道题设计了一个标准化的"题包"结构,这个结构类似于一道编程竞赛题的完整题目:包含清晰的任务说明、运行环境(类似于考场,提供完成任务所需的文件和数据)、配置信息、用来自动打分的评测器,以及一份隐藏的参考答案。

这套自动出题的系统叫做TaskGen,它会读取指定技能的内容,然后按照上述结构生成一道完整的题目。但光有题目还不够,研究团队还为每道题建立了三道质量检验关卡,只有通过全部三关的题目才能进入训练池。

第一关是"规则核查",负责检查题目本身的基本完整性和合法性:题目的各个组成部分是否齐全?文件路径是否有效?评测器是否能正常运行?最重要的一点是,在一个干净的起点环境中运行参考答案,是否能得满分?如果参考答案自己都跑不过,这道题就是废题,直接淘汰。

第二关是"语义核查",由另一个AI来审阅题目内容,检查的是更细致的语义层面的问题:题目说明是否清晰地告诉答题者要生成什么样的结果?完成任务所需的所有信息是否都能在题目提供的环境中找到?有没有出现"答案泄露"的情况——也就是题目的可见部分有没有把关键的技能要点直接写出来,让答题者不用真正查阅技能手册就能答对?

第二关还包含一个特别精妙的测试:"技能依赖性检验"。具体做法是,用同一道题、同一个AI答题,分两次运行:一次提供技能手册,另一次不提供。如果两次运行的得分相差不大,说明这道题其实不需要技能手册也能答对,这种题目对训练AI用技能毫无意义,同样会被淘汰。只有"有手册比没手册明显答得更好"的题目,才算是真正考察技能使用能力的好题。

第三关是"难度控制"。研究团队用一个固定的AI答题系统,在提供技能手册的条件下,对每道题独立尝试5次,记录每次的得分。如果5次中有3次或以上都得了满分,说明这道题对AI来说太简单了,没有训练价值,会被送回修改,要求在保留技能依赖性的同时增加推理难度或执行复杂度。修改后的题目需要重新从第一关开始走完整个检验流程。如果多次修改后仍然无法达标,这道题就会被彻底丢弃。

**四、训练场的第三关:收集"完美答卷"而非普通答卷**

有了高质量的题目,下一步是收集训练数据——具体来说,是收集AI答题的完整过程,包括它思考的步骤、调用工具的记录、最终生成的结果。

研究团队选择了四位"老师AI"来示范答题:MiniMax-M2.5、GLM-5、Qwen3.5-397B-A17B以及DeepSeek V4 Pro,这些都是目前业界能力较强的大模型。同时,答题的"考场环境"(也就是代理执行框架)有两种选择:DeepAgents和OpenCode,它们代表了两种不同的AI任务执行方式,就像考试可以用纸笔答题或者用电脑答题。

四位老师在两种考场环境下各自答一遍全部4000道题,理论上共产生32000份答卷。但这些答卷并不会全部被接受,每一份都需要再经过严格的两轮验收。

第一轮是"客观核查":答卷必须从评测器那里拿到满分;答题过程必须正常结束(不能中途崩溃或者超时放弃);工具调用的记录必须格式完整;答题过程中必须明确打开过对应的技能手册文件。这四条有一条不达标,答卷直接作废。

第二轮是"技能使用质量核查",由一个AI审查员来仔细阅读整份答卷。审查员要确认:对于每一项指定的技能手册,AI是否在执行相关操作之前就已经先查阅了手册(而不是做完了才翻手册走走过场)?技能手册里的关键规则是否真实地影响了AI的具体操作——比如改变了它选择的方法、用到了手册里特定的参数、遵循了手册规定的验证步骤?如果AI只是把手册读了一遍但完全没有按照里面的内容行动,或者在完全不看手册的情况下用通用知识答对了题目,这份答卷也会被拒绝。对于需要多项技能配合的题目,审查员还要确认每一项技能都在最终的答题流程中发挥了独特的、实质性的作用,缺一不可。

经过这一轮严苛的双重筛选,32000份候选答卷中最终留下了27164份——其中DeepAgents环境下14277份,OpenCode环境下12887份。这些答卷被用作训练教材,教导新的AI模型学习如何使用技能。

**五、用这些"范例答卷"训练出来的AI,成绩如何?**

研究团队选择了两个基础模型作为"学生":Qwen3.5-9B和Gemma 4 E4B-IT,分别在上述训练数据上进行了完整的微调训练。训练完成后,研究团队在四个不同的考试场景中对比了训练前后的成绩变化。

四个考试场景涵盖了非常不同的任务类型:SkillsBench考察工程、科学、金融、软件开发、数据处理等综合领域的多步骤技能任务;SkillEval是研究团队自己搭建的新评测集,专门用来考察技能使用能力,覆盖软件开发调试、数据分析机器学习、信息安全、金融商业分析等领域;MolBench-Bind考察的是分子科学领域的专业决策,具体是给定两个药物分子,AI需要判断哪个与目标蛋白结合力更强;AgentSkillOS考察的是多格式文件生成能力,包括数据计算报告、文档创作、视频生成、视觉内容创作和网页交互。

结果显示,在两个基础模型、两种考场环境、四个考试场景的16个对比组合中,经过SKT训练的AI全部都比训练前有所提升,提升幅度在3.20到18.91分之间(满分100分)。在综合技能任务的考场SkillsBench上,提升幅度在3.20到9.99分;在专门针对技能使用的SkillEval上,提升幅度更大,达到10.25到18.91分;在分子科学决策的MolBench-Bind上,提升幅度稳定在10分以上,最高达到15.54分;在文件生成任务的AgentSkillOS上,提升了5.09到7.33分,即便基础模型在这项任务上原本已经得分较高,训练后依然有所提升。

**六、技能手册是真的有用,还是AI"自己就会"?**

面对这些提升数据,有一个问题自然而然地浮现:这些进步到底是AI真正学会了"用技能手册",还是只不过训练过程顺带提升了AI的通用解题能力?如果是后者,那么即使不给技能手册,训练后的AI也应该表现更好,这样的话训练数据中的"技能使用"这个核心特征就没有意义了。

为了回答这个问题,研究团队做了一个对照实验:把同样的题目分两组运行,一组提供技能手册,另一组故意不提供技能手册,然后比较训练前后两种条件下的成绩差异。

实验结果非常清晰:当不提供技能手册时,经过SKT训练的AI和原始AI之间的差距只有0.53到5.69分;但当提供技能手册时,这个差距跳升到8.68到18.91分。这种差距在两个不同的考试场景和两种考场环境下都一致出现。

换句话说,SKT训练的核心效果是让AI更善于利用外部提供的技能手册,而不是简单地提升AI自身的通用知识储备。有手册和没手册之间的性能差距,在训练后明显拉大了——这正是研究团队最希望看到的结果。

**七、验证两个关键问题:质量重要吗?换个考场还管用吗?**

训练效果既然如此明显,有人或许会问:这种效果是不是主要靠"给AI看了更多数据"带来的,跟数据质量的关系不大?毕竟,研究团队花费了大量的精力在质量把控上,这些精力是否真的值得?

为了回答这个问题,研究团队专门设计了一组对比实验:用同样数量的题目和答卷,但跳过所有的验证和修复步骤,直接用未经筛选的原始合成数据来训练同一个模型,然后对比两者的成绩。

结果令人印象深刻:使用未经验证的原始数据训练后,AI在SkillsBench上的成绩下降了1.9分,在MolBench-Bind上下降了6.1分,在SkillEval上下降了5.6分,在AgentSkillOS上更是下降了19.5分——四个考试场景全部退步。相比之下,使用经过严格验证的SKT数据训练后,四个场景全部提升。两套方案之间的差距最大达到24.61分。

这个结果说明,未经验证的合成数据不只是"没有帮助",实际上会对AI造成反向的负面影响,让AI学到错误的行为模式。质量把控不是可选项,而是整个方案能否奏效的核心前提。

另一个值得关注的问题是"考场迁移":AI在DeepAgents环境下训练,换到OpenCode环境去考试,成绩还能保持吗?反过来也一样。这个问题很重要,因为在实际应用中,一个训练好的AI模型可能需要在多种不同的执行环境下使用。

实验结果显示,"跨考场"的效果确实不如"对口"的情况,但依然比完全没有经过训练要好得多。具体来说,在SkillsBench上,用DeepAgents数据训练出来的模型在OpenCode环境下考试,得分从5.8分提升到11.6分,而用OpenCode数据训练出来的模型在同样的OpenCode环境下考试得到15.8分。换算来看,"跨考场"的提升效果保留了"对口"提升效果的58.1%。在相反方向和另一个考试场景SkillEval上,保留率在49.1%到52.1%之间。

这意味着AI通过SKT训练学到的技能使用能力,有相当大的一部分是"通用"的,可以跨越不同的执行环境发挥作用,同时也有一部分是特定于某种执行环境的专属能力。

**八、能不能训练出一个"两用"的AI?**

"跨考场"实验的结果自然引出了一个实用问题:既然技能使用能力有通用的成分,是否可以训练一个同时擅长两种考场环境的AI,从而避免维护两套独立的训练模型?

研究团队的做法是,把DeepAgents环境下的12000条验证轨迹和OpenCode环境下的12000条验证轨迹混合在一起,共24000条,用这份混合数据训练了一个"通用版"模型,然后同时在两种考场环境下测试它,与各自环境下的"专版"模型对比。

结果表明,这个通用版模型在两种环境下都能表现良好。与专版模型相比,差距非常小,最大只有2.71分的差距,而且在三个对比中通用版反而略微超过了专版——在OpenCode环境下MolBench-Bind项目超出0.68分,SkillEval项目超出1.57分,在DeepAgents环境下SkillsBench项目超出0.31分。

这意味着,混合训练的方案在保持两种执行环境下良好表现的同时,只牺牲了非常微小的专项优势。一个模型两种用途,这对实际部署来说无疑更加经济。

**九、训练用的技能越多,AI就越厉害吗?**

除了对训练质量和跨环境迁移的考察,研究团队还测试了一个更直观的问题:如果增加训练时使用的技能数量,AI的技能使用能力会随之提升吗?

为了测试这个问题,研究团队用100、500、1000和2000项技能分别训练了四个版本的模型,然后在SkillEval上测试。未经训练的原始模型作为基准,得分为55.24分。随着训练技能数量的增加,模型得分从100技能时的59.8分,逐步提升到500技能时的67.4分、1000技能时的70.8分,最终达到2000技能时的72.48分。这种单调上升的趋势表明,扩大训练中覆盖的技能范围,确实能够持续改善模型的技能使用能力,且目前还看不到明显的"天花板"。

研究团队还进一步分析了训练效果是否集中在单技能任务上,还是多技能任务同样能受益。在SkillsBench的77道题中,按照每道题需要用到的技能数量分组来看,单技能任务的得分从原来的9.54分提升到16.94分,提升了7.4分;双技能任务的提升最为显著,从3.95分提升到20.72分,提升了16.8分;三个及以上技能的任务从4.04分提升到12.08分,提升了8.04分。三个组别都有实质性的提升,说明SKT训练的效果并不依赖于简化单一技能任务,在需要多个技能协同配合的复杂场景下同样有效。

**结语:工具还是那些工具,关键是学会怎么用**

说到底,这项研究回答的是一个朴素的问题:给了AI工具,怎么才能让它真正会用?

研究团队的答案是:让它通过大量经过严格筛选的"实战演示"来学习——演示本身必须是真实有效的,演示中的每一步操作都必须真正依赖了技能手册,而不是凑数的。与此同时,题目本身也必须足够有意义:太简单的直接淘汰,不依赖技能手册也能答对的直接淘汰,题目描述有漏洞的送去修复。

这种严格的质量把控带来的效果是全面的:对不同架构的AI模型有效,对不同的任务领域有效,对不同的执行环境有效,并且随着训练覆盖的技能范围扩大而持续提升。

归根结底,这套方法的价值不仅仅在于让AI"认识"更多技能,而在于训练出一种能力——在面对新的技能手册时,AI能够自然地判断它有没有用、该在何时查阅、该怎么把手册里的规则转化为具体操作。就像一个熟练的工程师,面对一本从未见过的设备手册,也能很快找到关键信息并正确操作,而不是茫然地翻完又放下。

感兴趣深入了解这套方法细节的读者,可以通过arXiv检索编号2608.02287找到完整论文,SkillEval评测集也已在Hugging Face上公开,数据集地址为datasets/Artemis0430/skilleval-v1。

**Q&A**

Q1:SKT训练方案和直接给AI更多数据训练有什么区别?

A:SKT的核心区别在于数据质量的严格把控,而非单纯增加数量。实验证明,使用未经验证的原始合成数据训练后,AI在四个测试场景上全部退步,最大下降19.5分;而经过SKT严格验证的数据则让四个场景全部提升。未经验证的数据会让AI学到错误的行为模式,反而有害。

Q2:SKT训练出来的AI,离开了技能手册还能用吗?

A:能用,但提升效果主要体现在有技能手册的情况下。实验对比显示,不提供技能手册时,训练前后的差距只有0.53到5.69分;提供技能手册后,差距扩大到8.68到18.91分。这说明SKT训练的重点是增强AI利用外部技能手册的能力,而不是单纯提升通用知识储备。

Q3:SkillEval评测集是怎么保证和训练数据不重叠的?

A:SkillEval采用了与训练数据完全不同的技能池来生成题目,训练用了2000项技能,SkillEval的100道题则来自另一批单独生成的技能组合,两个集合在技能层面没有交叉。此外,SkillEval的题目和答题轨迹都没有被纳入训练数据,从任务包和轨迹两个层面都保持了严格隔离。