AI资讯 / 工程

工程 / 官方

架构、延迟与评估全解析

Claude Blog

Anthropic 近日发布了一份面向工程师的电商智能体构建指南,总结了过去一年与零售商、市场平台、旅行、娱乐及电信服务商合作的实践经验。这些已投入生产的智能体基于 Claude 构建,帮助企业客户实现了更大的购物车金额和更高效的卖家运营。指南分为三大部分:第一部分介绍核心架构,即以单一模型运行在标准智能体循环中,配合技能模块和工具调用;第二部分聚焦延迟与成本优化策略;第三部分涵盖生产环境中的记忆管理、安全机制、评估体系以及大型组织的协作方式。Anthropic 同时开源了参考实现代码库,包含购物智能体和商家智能体的蓝图,支持零售、旅行、电信和票务等多个场景,工程团队可在数天内完成部署。

Anthropic 工程师 Ali Shazal 与 Matthew Koen 在这份指南中明确定义了电商智能体的边界:凡是能简化在线目录中买卖流程的智能体,均属此类。面向消费者的智能体负责搜索、比价、替换商品并组装订单,覆盖零售购物车、旅行行程、手机套餐变更乃至演出选座等场景;面向商家的智能体则处理销售查询、促销活动管理以及库存定价等业务。核心架构统一采用单一模型在标准智能体循环中运行,无需在前端设置意图路由器,也无需在后端部署多个领域专属子智能体。

指南中最具工程价值的观点之一,是对「技能模块」与「子智能体」的明确取舍。电商对话往往跨越多个意图和轮次,是一个高度耦合的会话过程。子智能体架构中,每次状态交接都会造成上下文丢失,不仅影响响应质量,还会带来数倍的 token 消耗和数秒的额外延迟。以退货流程为例,它同时需要订单历史、当前购物车和商品目录,子智能体按领域拆分后要么重复访问这些数据,要么在任务中途进行交接,两种方式都会降低整体效果。

相比之下,技能模块将各领域的指令直接加载进已持有完整对话历史的主智能体,在保持模块化的同时避免了交接损耗。Anthropic 在多个企业部署中的对比实验显示,单智能体加技能模块的方案在质量上持续优于「单一大提示词」和子智能体两种设计,且往往在成本和延迟上也更具优势。子智能体仍有其适用场景:当任务高度独立、需要专属上下文窗口时,例如深度研究类子智能体,或企业内部已有合规要求严格的专属智能体(如药房或金融服务),此时进行完整的会话交接才是合理选择。

在系统提示词与技能模块的分配策略上,指南给出了清晰的判断标准:以调用频率为核心依据。加载一个技能模块需要消耗一次模型调用,因此凡是在大多数会话中都会用到的能力,应直接写入系统提示词。Anthropic 建议将覆盖三分之一以上流量的功能放入系统提示词,其余放入技能模块。若某个技能可以从已有信号(如用户来源页面)中预判,则推荐在首次模型调用前由框架层直接注入,省去额外的加载轮次。安全规则、法律约束、品牌规范以及用户关键信息(如过敏史)则无论频率如何,始终置于系统提示词中。

为降低工程团队的上手门槛,Anthropic 同步开源了参考实现代码库 anthropics/commerce-agents,提供了构建电商智能体所需的框架、模式和安全护栏。代码库包含购物智能体和商家智能体两类蓝图,覆盖零售、旅行、电信和票务四大平台场景,工程团队可在数天内完成从零到可运行智能体的全流程搭建。指南后续章节还将深入探讨延迟优化(包括感知延迟与提示词缓存)、跨会话记忆管理、安全执行机制,以及如何在大型组织中规模化推进智能体的评估与迭代工作。

要点

  • 单一模型加技能模块的架构在质量、成本和延迟上均优于子智能体拆分方案,适合电商这类多意图耦合场景。
  • 系统提示词与技能模块的分配应以调用频率为核心标准,覆盖三分之一以上流量的能力直接写入提示词,安全与合规指令始终置于提示词中。
  • 子智能体仅在任务高度独立或已有专属合规智能体的场景下才具备优势,关键区别在于是否需要完整交接会话所有权。
  • Anthropic 已开源参考实现代码库,支持零售、旅行、电信、票务四类场景,工程团队可快速复用框架和护栏完成部署。
  • 生产环境中的记忆管理、安全执行和评估体系是智能体规模化落地的关键,指南第三部分对此有专项论述。
查看原始来源

原始标题:A guide to the anatomy of effective commerce agents | Claude by Anthropic

本文由 DataHub 基于公开来源整理,用于信息发现与摘要阅读;具体事实、数据和后续更新以原始来源为准。