工程 / 官方
Warp 如何在 Claude 上构建自我进化的 AI 智能体
Warp 是一款基于 AI 的终端与代理开发环境,服务全球近 100 万开发者,其中 56% 的财富 500 强企业正在使用该产品。在构建内部代码审查智能体的过程中,Warp 团队发现一个核心痛点:智能体的用户反馈在会话结束后便消失殆尽,导致错误反复出现、输出质量难以提升。为此,Warp 基于 Claude 平台设计了一套以「技能文件」为核心的自我改进循环架构。该架构由两个技能层组成:内层技能负责执行具体任务,外层「改进者技能」则定期汇总人类反馈,自动提出对内层技能的修订建议,并通过标准代码审查流程合并更新。这一机制让智能体能够随时间积累领域知识,持续提升输出质量,目前已在 Warp 整个开源仓库中全面铺开运行。
Warp 成立于 2020 年,由 Zach Lloyd 创立,已累计融资 7300 万美元,每周有超过 40 万次 Claude Code 会话在其平台内运行。作为一款面向开发者的 AI 终端工具,Warp 深知智能体在处理重复性任务时的质量稳定性至关重要。然而,团队在内部代码审查智能体上线初期便遭遇了棘手问题:工程师普遍反映智能体的评论无关痛痒、输出质量低下,手动重写提示词只能治标不治本。
问题的根源在于:无论用户给出多少反馈,这些信息在会话结束后便彻底消失,智能体无法从历史交互中积累经验。Warp 将这一现象定义为「无状态反馈陷阱」,并由此催生了基于技能文件的自我改进架构。技能文件是一种将领域知识编码为独立文件的方式,智能体在执行任务时可随时查阅,而无需将所有指令塞入原始提示词,从而保持提示词的简洁与灵活。
该架构的核心由两个技能层构成。内层「基础技能」存储具体的功能性知识与执行指令,例如代码审查的判断标准;外层「改进者技能」则作为观察者智能体定期运行,汇总人类对智能体输出的反馈,对比智能体建议与人类响应之间的差异,并生成针对基础技能的小幅精准修订。由于技能文件本质上是普通文本文件,智能体对其进行更新的能力极为出色,修订内容可通过标准 PR 流程审核、批准并合并。
在反馈机制的设计上,Warp 强调「低摩擦」原则。反馈应在开发者已有的工作流中自然发生,例如直接在 PR 或 Issue 中留下评论,无需额外的提交步骤。Zach Lloyd 指出,反馈的质量比数量更重要:一位资深工程师提供的详细领域反馈,往往胜过大量泛泛的点赞或踩。具体说明「为什么这条建议不合适」,远比简单的二元评价更能帮助智能体理解改进方向。
Warp 的 GitHub Issue 分类智能体是这套框架的典型应用案例。每当有新 Issue 提交,GitHub Action 便自动触发智能体对该 Issue 进行复杂度与可行性分析,自动打标签并给出修复方向建议。随着反馈不断积累,改进者技能会定期优化基础技能,使分类准确率持续提升。目前,Warp 已在旗下整个开源仓库中部署了规格撰写、代码审查、Issue 分类三类智能体,每类均配备独立的自我改进循环。
Warp 团队在实践中总结出若干关键原则:技能文件应写「原则」而非「规则」,并解释规则背后的原因,让智能体能够举一反三;改进者技能的编写值得投入额外精力,因为它具有高度可复用性,适用于不同类型的智能体场景;技能文件应保持精简,通过引用外部资源文件实现渐进式信息披露,避免一次性将所有内容堆入上下文。这套简洁而有效的框架,为任何希望构建自我进化智能体的团队提供了可直接复用的参考范式。
要点
- 智能体反馈在会话结束后消失是质量难以提升的核心原因,Warp 通过技能文件将反馈持久化,实现跨会话的知识积累
- 自我改进循环由「基础技能」与「改进者技能」两层构成,改进者定期汇总反馈并自动提出修订,更新通过标准 PR 流程合并
- 反馈机制应嵌入开发者已有工作流,降低反馈摩擦是保持信号持续流入的关键,质量详尽的反馈比数量更有价值
- 技能文件应写原则而非规则,并说明原因,使智能体能够基于理解进行推理而非机械执行
- 改进者技能具有高度可复用性,投入精力打磨后可跨不同类型智能体场景复用,降低整体开发成本
原始标题:How Warp builds self-improving agents on Claude | Claude by Anthropic
本文由 DataHub 基于公开来源整理,用于信息发现与摘要阅读;具体事实、数据和后续更新以原始来源为准。