AI资讯 / 研究

研究 / 官方

将智能体技能文件变成可训练参数

Microsoft Research

大型语言模型驱动的 AI 智能体在执行多步骤任务时,往往因技能指令质量参差不齐而表现不稳定。现有方法——无论是人工手写、前沿模型一次性生成,还是执行后松散修订——都缺乏深度学习优化器所具备的步长控制、验证集评估和失败记忆机制,导致技能文件随每次改写不断膨胀漂移。微软研究院在最新论文中提出 SkillOpt,将技能文件视为冻结目标模型之外的可训练参数,引入前向执行、反向反思、有界文本更新、验证门控和慢速元更新等机制,构建出一套类深度学习的优化闭环。在六项基准测试、七个目标模型、三种执行模式共 52 个评估单元中,SkillOpt 均取得最优或并列最优成绩。以 GPT-5.5 直接对话模式为例,六项基准平均分从 58.8 提升至 82.3,绝对提升幅度达 23.5 个百分点,且全程无需修改模型权重。

AI 智能体的核心挑战已从「能否调用工具」演变为「能否可靠、持续地完成任务」。当前技能来源主要有三种:领域专家手工编写、前沿模型一次性生成、智能体执行后自行修订。这三种方式均缺乏系统性优化机制——没有步长控制,没有留出验证集,也没有对失败修订的记忆。结果是技能文件随每次改写越来越长,一次看似合理的修订可能悄然拉低真实任务表现,成为智能体从原型走向生产部署的重大障碍。

SkillOpt 将问题从「如何写出更好的提示词」重新定义为「如何训练技能」。其核心思路是把技能文件视为冻结目标模型之外的可训练参数,由一个独立的优化器模型负责更新,而目标模型本身的权重始终保持不变。这种设计将技能编写从一次性操作转变为受控的迭代优化过程,使技能文件保持可读、可审计、可迁移。

SkillOpt 的优化循环由前向、反向、更新三个阶段组成。前向阶段,冻结的目标模型使用当前技能执行一批训练任务,收集执行轨迹;反向阶段,优化器模型以小批量方式读取轨迹,从成功案例中提炼值得保留的模式,从失败案例中识别需要纠正的问题;更新阶段,优化器提出添加、删除、替换等小幅文本编辑,候选编辑经合并、去重、排序后受「文本学习率」约束,即每步编辑预算上限。被拒绝的编辑不会丢弃,而是进入拒绝编辑缓冲区,作为同一轮次后续优化调用的负反馈信号。

验证门控机制是 SkillOpt 防止技能漂移的关键防线。每个候选技能版本必须在留出验证集上取得严格高于当前版本的分数,才能被正式采纳。此外,系统还设有慢速元更新机制,在每个训练轮次结束时整合单批次无法揭示的长周期规律。有界编辑、验证门控与最优版本选择三重约束共同作用,使技能优化过程收敛而非漂移,最终导出可复用的技能文件。

研究团队在六项基准测试上对 SkillOpt 进行了全面评估,涵盖 SearchQA、SpreadsheetBench、OfficeQA、DocVQA、LiveMathematicianBench 和 ALFWorld,目标模型从前沿规模的 GPT-5.5 到小型开源模型 Qwen3.5-4B,执行模式包括直接对话、Codex 和 Claude Code。在与人工编写技能、一次性 LLM 技能、Trace2Skill、TextGrad、GEPA 和 EvoSkill 的对比中,SkillOpt 在全部 52 个评估单元中均取得最优或并列最优结果。程序性基准的提升尤为显著:SpreadsheetBench 从 41.8 升至 80.7,OfficeQA 从 33.1 升至 72.1,LiveMathematicianBench 从 37.6 升至 66.9。

SkillOpt 优化后的技能文件展现出良好的迁移性,可跨模型规模、智能体框架和相关任务复用,表明其捕获的是可复用的工作流知识,而非针对特定基准的指令。这一特性对生产环境尤为重要——企业无需为每个模型版本或部署场景重新训练技能,降低了维护成本。SkillOpt 的提出为智能体技能工程提供了一套系统化框架,有望推动 AI 智能体从实验室原型迈向可靠的生产级部署。

要点

  • SkillOpt 将智能体技能文件视为可训练参数,引入类深度学习的优化闭环,无需修改目标模型权重即可大幅提升任务表现。
  • 有界文本编辑、验证门控、拒绝编辑缓冲区和慢速元更新四重机制协同作用,有效防止技能文件随迭代漂移膨胀。
  • 在 52 个评估单元中全面领先,GPT-5.5 直接对话模式下六项基准平均分绝对提升 23.5 个百分点,SpreadsheetBench 单项提升近 39 个百分点。
  • 优化后的技能文件可跨模型规模、执行框架和相关任务迁移复用,具备捕获通用工作流知识的能力。
  • 该方法为 AI 智能体从原型走向生产级可靠部署提供了系统化的技能工程框架。
查看原始来源

原始标题:SkillOpt: Agent skills as trainable parameters

本文由 DataHub 基于公开来源整理,用于信息发现与摘要阅读;具体事实、数据和后续更新以原始来源为准。