AI资讯 / 产业

产业 / 媒体

谷歌WikiSkill让AI智能体记住过去的错误,持续提升未来表现

The Decoder

谷歌研究院推出了WikiSkill框架,旨在解决AI智能体「用完即忘」的根本缺陷。传统智能体在每次任务结束后会丢弃所有经验,而WikiSkill通过类似维基百科的结构,将每次运行中的失败模式与成功策略持久化存储,并将其提炼为可复用的「智能体技能」模块,在不改变模型训练权重的前提下持续优化智能体行为。研究团队在数学推理、网页搜索、电子表格操作、文档问答和虚拟环境交互等五项基准测试中验证了该框架,结果显示WikiSkill在所有测试场景中均优于现有方法。Gemini-3.5-Flash的平均得分从49.5%提升至68.1%,Qwen-3.6-27B从39.4%提升至63.3%。值得关注的是,搭载WikiSkill的小模型可以达到未使用该框架的大模型的性能水平,且不同模型之间的技能迁移在多数情况下同样有效。

谷歌研究院近日发布WikiSkill框架,为AI智能体引入了一套持久化知识管理机制。现有智能体系统的核心痛点在于:每次任务执行完毕后,智能体积累的所有经验都会被清空,下一次运行时又从零开始。WikiSkill借鉴了AI研究者Andrej Karpathy提出的「LLM Wiki」理念,将经验转化为可累积的结构化知识,从根本上改变了智能体的学习方式。

WikiSkill将智能体的工作空间划分为三个层级。底层的「原始层」以不可变方式存储完整的执行轨迹,包括工具调用记录和结果数据;中间的「维基层」将原始数据提炼为结构化洞察,记录失败模式和成功策略,该层只增不减,永不重置;顶层的「技能层」则存放智能体执行任务时实际调用的程序化指令,若某次更新导致性能下降,技能可以回滚,但维基层的知识始终保留。

WikiSkill的运行遵循四步闭环:推理智能体执行任务并生成执行轨迹;「维基维护者」分析轨迹,识别失败模式和成功策略并写入维基;「技能提议者」基于更新后的维基提出针对性的技能修改方案;最后由门控机制在独立验证集上测试该方案是否真正有效,无效则回滚技能,但提案本身的失败记录仍会写入维基,供后续迭代参考。这一机制确保即便是失败的尝试也不会被浪费。

研究团队在五项基准测试中对Qwen系列(4B、9B、27B)、Gemma-4-31B和Gemini-3.5-Flash等多个模型进行了评测。WikiSkill在绝大多数模型与基准的组合中均取得最优或统计等效的最优成绩。其中提升最为显著的是数学推理和电子表格操作任务:Gemini-3.5-Flash在LiveMath上从33.0%跃升至72.6%,在SpreadSheet上从50.5%提升至76.6%。相比之下,涉及长文档上下文的OfficeQA任务提升幅度较为有限。

模型规模对WikiSkill的收益影响明显,大模型通常能从进化后的技能中获得更多提升。但研究同样发现,搭载WikiSkill的小模型可以达到未使用该框架的大模型的性能水平,这对于追求成本效率的实际部署场景具有重要意义。此外,由一个模型开发的技能往往可以迁移至另一个模型,有时甚至优于接收模型自行开发的技能,但研究者建议技能迁移的有效性应逐案验证,不宜一概而论。

WikiSkill并非真正意义上的持续学习,模型的训练权重并未改变,智能体本质上是在为自己编写更好的操作指南。研究者坦承这一方式不够优雅,也可能比真正的学习更容易出错,但实验数据表明它是一种切实有效的工程替代方案。在持续学习仍是未解难题的当下,WikiSkill提供了一条可落地的路径,让智能体在反复执行任务的过程中真正积累可用的经验。

要点

  • WikiSkill通过三层架构将AI智能体的执行经验持久化,失败案例同样被记录并用于后续迭代,避免经验浪费
  • 门控机制确保只有经过验证能提升性能的技能更新才会被采纳,技能可回滚但维基知识永久保留
  • 搭载WikiSkill的小模型可达到未使用该框架的大模型的性能水平,有助于降低实际部署成本
  • 不同模型之间的技能迁移在多数情况下有效,但建议逐案验证而非默认通用
  • 数学推理和电子表格操作任务受益最大,长文档上下文任务提升相对有限
查看原始来源

原始标题:Google's WikiSkill gives AI agents a persistent memory of past mistakes to sharpen future performance

本文由 DataHub 基于公开来源整理,用于信息发现与摘要阅读;具体事实、数据和后续更新以原始来源为准。