AI资讯 / 工程

工程 / 工程

AWS 提出多轮对话智能体评估指标 AEM,精准定位错误根源

AWS Machine Learning

AWS 机器学习团队发布了一种名为智能体评估指标(AEM)的新型评估框架,专门针对多轮对话场景中现有评估方法的核心缺陷。传统的任务级评估只关注最终结果,无法区分错误的根源轮次与受其影响的后续轮次。AEM 将智能体质量分解为可独立测量的子指标,首个落地维度为「正确性」,进一步拆分为真实性(工具调用参数值或自然语言回复是否与预期一致)和完整性(所有必要参数或信息是否齐全)。该框架在每个轮次独立计算得分,最终汇总为对话级别的综合指标,并可随需求扩展至安全性、指令保留等新维度,无需重构评估架构。

在多轮对话场景中,智能体的一个早期错误往往会悄无声息地污染后续所有轮次。以一个五轮企业助手对话为例:第二轮中,智能体选择了正确的操作,却将参数「收入」误填为「利润」,这一单一错误随即在第三至第五轮中持续传播。传统的任务级评估只检查最终输出,会将整个交互标记为失败,却无法指出只有第二轮需要修复。这正是多轮评估的核心难题——级联错误让结果级评估无法区分根本原因与其下游影响。

现有主流智能体评估工具大多以整体方式打分,提供目标完成率或基于大语言模型的质量评估,部分工具还加入了追踪级别的根因分析。这些方法的共同局限在于:将智能体质量视为单一信号,而非可独立追踪的多个子指标。知道智能体「目标完成率为70%」并不能告诉开发者失败源于事实错误、信息缺失还是工具选择错误。单一分数也难以随需求增长而平滑扩展至新维度。

AEM 的核心贡献在于其分解机制。框架将正确性拆分为两个子指标:真实性,衡量智能体产出的值(工具调用参数值或自然语言回复内容)是否与预期语义一致;完整性,衡量所有必要元素是否齐全,包括工具调用中不缺少参数键,以及自然语言回复中不遗漏所请求的信息。两个子指标均基于语义比较而非精确字符串匹配,「纽约市」与「NYC」、「Q3 2024收入」与「2024年第三季度营收数据」均被视为等价表达。

AEM 的评估层级覆盖两类轮次:回复轮次(智能体向用户作答)和动作轮次(智能体调用工具)。对于回复轮次,完整性检查回复是否覆盖完整查询,真实性检查内容是否符合事实;对于动作轮次,完整性检查参数键是否齐全,真实性检查参数值是否语义正确,两者均建立在工具与动作选择正确的结构性前提之上。每轮得分当前以二元方式呈现(通过或失败,并附带具体失败原因),同时也支持对单个字段或声明进行连续尺度的细粒度评分。

在对话层面,AEM 得分为通过轮次的占比。由于得分按子指标分解,当正确性下降时,开发者可以清晰判断是真实性还是完整性出现了问题,而不仅仅是知道「正确性降低了」。这种分解-评估-合成的模式具有良好的可扩展性,未来可在不改变评估机制的前提下,将安全性、指令保留、推理深度等新维度纳入同一框架,为智能体质量管理提供统一的结构化基础。

AEM 的提出回应了多轮智能体系统在生产环境中日益突出的可观测性需求。随着企业将智能体部署于销售报告生成、客户服务等复杂业务流程,单一的任务成功率已不足以支撑持续优化。逐轮、分维度的评估体系不仅能帮助工程团队快速定位需要修复的具体轮次,还能为模型迭代和提示词调优提供更精准的信号,从而降低多轮对话系统的调试成本。

要点

  • 多轮对话中单一轮次的错误会级联传播,任务级评估无法区分根本原因与下游影响,AEM 通过逐轮评估解决这一盲点。
  • AEM 将正确性分解为真实性(参数值或回复内容是否语义正确)和完整性(必要元素是否齐全)两个独立子指标,均采用语义比较而非精确匹配。
  • AEM 同时适用于回复轮次和动作轮次,对话级得分为通过轮次占比,可精确定位是哪个子指标导致了质量下降。
  • 该框架采用分解-评估-合成模式,未来可无缝扩展至安全性、指令保留等新维度,无需重构现有评估架构。
查看原始来源

原始标题:Agent Evaluation Metric for multi-turn conversations

本文由 DataHub 基于公开来源整理,用于信息发现与摘要阅读;具体事实、数据和后续更新以原始来源为准。