AI资讯 / 工程

工程 / 工程

Amazon Bedrock AgentCore Evaluations:跨框架统一评估智能体的新方案

AWS Machine Learning

AI 团队在构建生产级智能体时面临一个棘手问题:智能体框架种类持续增多,但评估工具的兼容性远未跟上。大多数评估系统默认用户使用特定 SDK 或特定追踪模式,一旦偏离这一假设,评估流程便会中断。Amazon Bedrock AgentCore Evaluations 通过将评估能力与框架选择彻底解耦来解决这一碎片化问题。其核心机制是以 OpenTelemetry 作为通用协议——只要智能体的遥测数据通过 OpenTelemetry 输出,评估服务便可对其打分,无论底层使用的是 LangGraph、LlamaIndex、OpenAI Agents SDK、Google ADK、Claude Agent SDK 还是 Strands Agents。服务从追踪数据中识别三类关键 Span:invoke agent span、inference span 和 execute tool span,并以此重建会话过程,驱动目标成功率、正确性、有用性及自定义 LLM 评判等评估器,对所有框架一视同仁地进行评分。

构建生产级智能体的 AI 团队长期面临一种令人沮丧的不对称:框架选择越来越多样,评估工具却始终滞后。LangGraph 凭借工作流编排能力受到青睐,LlamaIndex 因与检索管道的深度集成而被广泛采用,OpenAI Agents SDK 则在以 GPT 模型为标准的组织中占据主导地位。Google ADK 适用于多智能体协调,Claude Agent SDK 提供原生 Anthropic 能力,而 Strands Agents 则能在 Amazon Bedrock AgentCore 上以极短时间启动一个可运行的智能体。这些框架各有所长,却也造成了评估工具难以统一覆盖的困境。

Amazon Bedrock AgentCore Evaluations 的解题思路是引入 OpenTelemetry 作为通用语言。OpenTelemetry 是一个厂商中立的仪表化框架,标准化了分布式系统发出追踪、指标和日志的方式。一条追踪由多个 Span 组成,每个 Span 代表请求中的一个步骤,包含名称、时间戳、类型化属性及可选的 Span 事件。在 AgentCore Runtime 上,遥测后端为 AWS Distro for OpenTelemetry(ADOT),负责将 Span 和事件记录路由至 Amazon CloudWatch,为后续评估提供数据基础。

评估服务在重建会话时,重点关注三类 Span 角色。invoke agent span 代表顶层请求-响应周期,即对话中的一次用户轮次,携带用户提示词和智能体最终回复;inference span 代表单次模型调用,包含传入模型的消息历史及模型回复;execute tool span 代表每次工具调用,携带工具名称、输入参数和执行结果。评估器仅依赖这三类 Span 即可完成评分,其余如检索、重排序、护栏检查等 Span 作为补充上下文存在,不影响核心评估逻辑。

服务通过读取每个 Span 上的 scope.name 字段来自动判断应采用哪种解析方式,无需用户进行任何额外配置。OpenTelemetry GenAI 语义约定与 OpenInference 规范均定义了上述三类 Span 角色的模式,但使用不同的属性键和 Span 类型词汇。AgentCore Evaluations 对两套规范均提供桥接支持,最终映射到相同的评估结果。目前已支持的框架涵盖 Strands Agents、LangGraph、OpenAI Agents SDK、LlamaIndex、Google ADK 和 Claude Agent SDK,多数框架同时支持 OpenTelemetry 和 OpenInference 两种仪表化方式。

这一设计的前向兼容性同样值得关注。当框架或规范随时间引入新的 Span 类型时,评估服务会将未识别的 Span 视为可跳过的上下文,而非报错中断。任何 scope.name 符合 opentelemetry.instrumentation.* 或 openinference.instrumentation.* 命名规范的仪表化库,均可自动获得评估服务的支持,覆盖范围因此延伸至官方列表之外的更多框架。对于已在 AgentCore Runtime 上部署智能体的团队而言,评估能力可以直接复用现有的遥测基础设施,无需改动智能体代码。

要点

  • AgentCore Evaluations 以 OpenTelemetry 为通用协议,将评估能力与框架选择彻底解耦,支持 LangGraph、LlamaIndex、OpenAI Agents SDK 等主流框架。
  • 评估服务仅依赖三类关键 Span(invoke agent、inference、execute tool)重建会话并驱动评分,其余 Span 作为补充上下文,不影响评估流程。
  • scope.name 字段驱动自动路由,无需修改智能体代码或进行额外配置,正确的解析逻辑随仪表化包安装自动激活。
  • 对两套主流规范(OpenTelemetry GenAI 语义约定与 OpenInference)均提供原生支持,并具备前向兼容性,未来新增 Span 类型不会导致评估中断。
  • 目标成功率、正确性、有用性及自定义 LLM 评判等评估器对所有框架采用统一标准,确保跨框架评估结果的可比性。
查看原始来源

原始标题:Evaluate any agent framework with Amazon Bedrock AgentCore Evaluations

本文由 DataHub 基于公开来源整理,用于信息发现与摘要阅读;具体事实、数据和后续更新以原始来源为准。