AI资讯 / 工程

工程 / 工程

Amazon Bedrock AgentCore 如何自动优化智能体系统提示词

AWS Machine Learning

Amazon Bedrock AgentCore 推出系统提示词优化功能,将传统依赖人工审查追踪日志、手动调整提示词的繁琐流程自动化。该功能利用生产环境中记录的智能体追踪数据,结合奖励信号,通过一个称为「反射引擎」的推理组件分析成功与失败运行之间的规律,进而提出针对性的配置修改建议。优化器提供两种反射器架构:单智能体反射器(Single Agent Reflector)已正式上线,在单次遍历中完成全量追踪分析;实验性的多智能体反射器(Sub-Agent Reflector)则通过子智能体群组并行分析不同追踪片段,以换取更高的优化上限。所有候选配置变更在生效前均须通过平台级护栏审查,包括长度上限、内容安全等多项约束,确保优化过程不会引入新的风险。

传统的智能体质量改进是一项耗时的手动工作:工程师需要逐条审阅冗长的追踪日志,定位智能体出错的环节,逐一调整系统提示词、工具描述和技能配置,再重新运行评估以验证效果。AgentCore 优化功能将这一流程系统化,通过生产追踪数据自动提出配置变更建议,并支持离线批量评估和在线 A/B 测试,最终将表现更优的版本推广上线。

系统提示词优化器的核心是反射引擎。由于智能体追踪记录往往篇幅很长,即便只有几十条也可能超出模型的上下文窗口,因此优化器并不将所有追踪数据直接塞入提示词,而是将完整的追踪语料库存储在文件系统中,赋予反射器 Shell 工具访问权限。反射器可以自主决定检查哪些文件、进行哪些比较,使用 grep、cat、diff 等命令灵活探索成功与失败案例之间的差异,最终输出修改建议。

单智能体反射器是目前 AgentCore 优化功能的默认方案。它在单次遍历中完成对全量追踪数据的分析:先审视分数分布,再深入最具信息量的追踪片段,对比成功与失败案例,最终输出一套连贯的配置修改建议。每个优化轮次重复「评分—反射—接受」的循环,用户可通过增加轮次数量换取更高的优化质量。

实验性的多智能体反射器在单智能体方案基础上引入了子智能体群组机制。单次反射可能过度聚焦于最先检查的少数追踪记录,从而遗漏仅在小部分数据中出现的失败模式。多智能体方案为每条追踪分配一个独立的子智能体,分三个层次进行分析:表层提取奖励值、难度和结果;回合层定位轨迹偏离最优路径的决策节点;认知层诊断失败原因并给出反思性指导。各子智能体在独立上下文窗口中运行,互不干扰,最终由编排器汇总发现、归纳共性规律并生成配置变更建议。

为防止优化过程产生可预见的偏差,所有候选配置变更在被接受前均须通过基于评分标准的护栏审查。其中一项关键约束是长度上限:若候选配置相较上一版本增长超过 20%,则直接拒绝并要求优化器精简内容。此外,护栏还会防止提示词直接引用追踪数据中的具体术语作为示例,以及阻止安全约束在追求评估分数的过程中被削弱或绕过,确保负责任 AI 原则贯穿整个优化工作流。

AWS 已将多智能体反射器作为实验性功能发布至 Strands 开源 GitHub 仓库,并在两个公开基准测试上与 GEPA、MIPROv2 等方法进行了对比评估。整套优化工作流与 AgentCore Observability 深度集成,追踪数据的采集、评估信号的生成、推荐配置的生成与验证形成完整闭环,为智能体系统的持续改进提供了一条更具可操作性的路径。

要点

  • AgentCore 优化器通过反射引擎分析生产追踪数据,自动提出系统提示词修改建议,将手动调优流程系统化
  • 单智能体反射器在单次遍历中完成全量分析,多智能体反射器通过子智能体并行探索提升优化上限,两者各有适用场景
  • 所有候选配置变更须通过护栏审查,包括长度上限(不超过上一版本 20%)、禁止引用追踪术语、防止安全约束被软化等
  • 多智能体反射器已以实验性功能形式开源发布,并在公开基准测试上与 GEPA、MIPROv2 进行了横向对比
  • 优化工作流与 AgentCore Observability 集成,支持离线批量评估和在线 A/B 测试,形成从追踪采集到配置推广的完整闭环
查看原始来源

原始标题:Optimizing agent system prompts with Amazon Bedrock AgentCore

本文由 DataHub 基于公开来源整理,用于信息发现与摘要阅读;具体事实、数据和后续更新以原始来源为准。