工程 / 工程
Motorway与AWS联合打造端到端评估管道
英国在线汽车市场Motorway与AWS合作,基于Strands Agents SDK和Amazon Bedrock AgentCore构建了端到端AI Agent评估管道。该管道采用两阶段评估策略,涵盖构建时测试和生产监控,通过三层框架评估工具使用、推理和输出质量,并设置五阶段部署管道和质量门禁。实施后,错误查询结果从八分之一降至五十分之一,问题检测时间从数小时缩短至数分钟。本文提供了可部署的蓝图,核心原则适用于任何生产级AI Agent。
Motorway是一家英国在线汽车市场,每日拍卖中多达8000家经销商对2500辆汽车进行竞标。该公司与AWS原型设计和AI客户工程团队合作,构建了AI驱动的经销商库存搜索Agent,将数小时的手动筛选转变为自然语言查询。Agent暴露了八个工具,结合超过89个车辆属性的结构化过滤和基于LanceDB与Amazon Titan文本嵌入V2的向量相似性搜索。
Agent评估与传统的LLM评估有本质区别。LLM评估关注文本生成质量,而Agent评估需要考察任务完成度、工具使用正确性、推理连贯性、可靠性和一致性等维度。例如,精确查询“Volkswagen Golf 7-12 years old”可能完美工作,但口语化变体“I'm looking for an older VW”可能因语义搜索层未正确评估而失败。
该蓝图实施两阶段评估策略:构建时评估使用strands-agents-evals开源库在部署前捕获问题,生产评估则捕获合成测试遗漏的问题。评估框架分为三层:工具使用层验证正确工具选择和参数传递,阈值大于95%;推理层评估逻辑决策,阈值大于85%;输出质量层衡量响应有用性和准确性,阈值大于90%。所有三层必须通过才能部署。
五阶段部署管道包含质量门禁,当指标低于阈值时阻止发布。该管道结合了Strands Agents SDK与Amazon Bedrock AgentCore,后者是用于大规模部署和运营AI Agent的完全托管服务。配套代码仓库提供了可部署的蓝图,虽然使用AWS服务,但核心原则是系统无关的,适用于任何生产级AI Agent。
实施结果显著:错误查询结果从八分之一降至五十分之一,问题检测时间从数小时缩短至数分钟。对于拥有约1500名并发用户的系统,Agent行为的正确性直接影响用户信任。工具选择错误或语义搜索误解会直接损害经销商信任,而该评估管道有效降低了这些风险。
要点
- Motorway与AWS构建的评估管道将错误率从八分之一降至五十分之一,问题检测时间从数小时缩短至数分钟。
- 评估框架采用三层结构:工具使用层(阈值>95%)、推理层(阈值>85%)和输出质量层(阈值>90%)。
- 两阶段评估策略包括构建时测试和生产监控,确保Agent在生产环境中的可靠性。
- 五阶段部署管道包含质量门禁,当指标低于阈值时自动阻止发布。
- 核心原则是系统无关的,适用于任何生产级AI Agent,不仅限于AWS环境。
原始标题:Evaluating AI Agents: A production blueprint with Strands and AgentCore
本文由 DataHub 基于公开来源整理,用于信息发现与摘要阅读;具体事实、数据和后续更新以原始来源为准。