工程 / 工程
用 Amazon Bedrock AgentCore 与 GitHub Actions 构建 AI 智能体自动评估流水线
随着 AI 智能体在生产环境中的广泛部署,如何在代码变更后快速、客观地衡量智能体行为质量,成为工程团队面临的核心挑战。本文介绍一套基于 Amazon Bedrock AgentCore 与 GitHub Actions 的自动化评估方案:将智能体及受 OAuth 保护的 MCP 服务器部署至 AgentCore 运行时,在每次 PR 提交时自动触发评估流程,利用 AgentCore Evaluate API 以 LLM 作为评判者对智能体响应进行多维度打分,涵盖有用性、正确性、工具选择准确率等指标。若评分低于预设阈值,流水线将自动阻断合并请求。整套方案还解决了无用户上下文的 CI 环境如何通过 OAuth M2M 客户端凭证流完成鉴权这一关键难题,并通过 CDK 实现基础设施即代码,形成完整的构建、部署、观测、评估闭环。
在 AI 智能体开发中,质量回归往往难以察觉。开发者修改一条系统提示词、更换底层模型或调整工具配置后,智能体的输出质量可能悄然下滑,而这种变化在用户投诉之前几乎不会被主动发现。传统的人工测试既耗时又缺乏一致性,无法随团队规模扩展。将评估环节嵌入 CI/CD 流水线,是解决这一问题的根本路径——每次代码变更都触发自动化评估,将质量判断从主观经验转变为可量化的客观指标。
AgentCore Evaluations 是 Amazon Bedrock AgentCore 平台的质量度量层,与负责托管智能体的 AgentCore 运行时及负责采集追踪数据的 AgentCore Observability 共同构成完整的生命周期闭环。该服务默认采用 LLM 作为评判者对智能体交互进行打分,同时支持通过 AWS Lambda 实现基于代码的自定义评估逻辑。评估数据来源于智能体已通过 AgentCore Observability 上报的 OpenTelemetry 追踪,无需额外埋点。
评估模式分为三类以覆盖不同场景:按需评估允许在任意时刻对指定会话进行评分,直接在 API 调用中提供 span 数据,是驱动 CI/CD 质量门禁的核心模式;在线评估以可配置的采样率持续监控生产流量,结果汇入 CloudWatch 仪表板用于趋势分析;批量评估则以异步方式对多个会话统一打分,适合建立基线测量和前后对比回归测试。内置评估器涵盖有用性、正确性、目标达成率、工具选择准确率等常见质量维度,还提供轨迹评估器用于比对实际工具调用序列与预期路径的匹配程度。
本方案中的 MCP 服务器采用基于角色的访问控制,部分工具对所有用户开放,另一部分则按用户角色限制访问。这给 CI 环境带来了特殊挑战:流水线没有用户上下文,无法走标准的用户授权流程。解决方案是采用 OAuth 的机器对机器(M2M)客户端凭证流,通过共享的 Amazon Cognito 用户池同时支持 M2M 鉴权与用户范围鉴权两种场景。CI 流水线通过 GitHub Actions 的 OIDC 联合机制获取临时 AWS IAM 凭证,无需在仓库中存储长期密钥,安全性得到保障。
整套基础设施通过 AWS CDK 以代码形式定义,涵盖 AgentCore 运行时部署、MCP 服务器配置、Cognito 用户池及 IAM 角色设置。GitHub Actions 工作流在 PR 提交时自动执行:拉取代码、部署开发环境、向智能体发送测试提示词、调用 AgentCore Evaluate API 获取评分,最后将评分与预设阈值(如 0.8 分)进行比较。若任一关键指标低于阈值,工作流标记为失败,PR 保持阻断状态,直至开发者修复问题并重新提交。
这套方案将智能体质量评估从事后人工审查转变为前置自动化验证,使团队能够以更高频率、更低风险地迭代智能体。对于正在构建生产级 AI 智能体的工程团队而言,将评估逻辑与 CI/CD 流程深度集成,是保障智能体长期稳定运行的关键工程实践。完整参考实现已在配套代码仓库中开放,涵盖 Strands 智能体、MCP 服务器、CDK 基础设施及统一评估脚本的全栈代码。
要点
- AgentCore Evaluations 以 LLM 作为评判者,对智能体响应的有用性、正确性、工具选择准确率等多个维度进行量化打分,评估数据直接来源于已有的 OpenTelemetry 追踪,无需额外埋点。
- 通过在 GitHub Actions 中设置质量门禁,当评估分数低于预设阈值时自动阻断 PR 合并,将智能体质量回归问题拦截在进入生产环境之前。
- CI 环境中的 OAuth 鉴权难题可通过 M2M 客户端凭证流结合 GitHub Actions OIDC 联合机制解决,无需在仓库中存储长期密钥。
- 评估模式分为按需、在线、批量三类,分别适用于 CI/CD 质量门禁、生产流量持续监控和基线回归测试等不同场景。
- 整套方案通过 AWS CDK 实现基础设施即代码,形成构建、部署、观测、评估的完整闭环,适合需要高频迭代智能体的工程团队参考落地。
原始标题:Automated agent evaluation with Amazon Bedrock AgentCore and GitHub Actions
本文由 DataHub 基于公开来源整理,用于信息发现与摘要阅读;具体事实、数据和后续更新以原始来源为准。