AI资讯 / 工程

工程 / 工程

用 Strands Evals 和 Amazon Bedrock AgentCore 评估技能型智能体

AWS Machine Learning

通用智能体需要遵循企业特定流程,如合规检查、文档处理和升级策略。将所有流程塞入单一系统提示难以维护,技能(Skill)作为模块化替代方案应运而生。技能通常以 SKILL.md 文件存储,包含领域专属指令、工具绑定、知识库和工作流,遵循开放的 Agent Skills 标准,可跨兼容框架移植。然而,技能的可组合性带来两种新型失效模式:智能体调用了不适合当前任务的技能,或调用了正确技能但未完整遵循其指令。这两种失效都可能产生看似合理的流畅回答,传统输出质量指标无法识别。为此,Strands Evals SDK 和 Amazon Bedrock AgentCore Evaluations 新增了三项技能专项评估器:技能选择准确性、技能指令遵循度,以及确定性的技能调用检测,帮助团队精准定位智能体在技能路由和执行层面的问题。

技能是一种可复用的指令集合,让智能体掌握特定领域任务,例如合同脱敏、发票核对或代码审查规范。每个技能打包了领域专属指导、工具绑定(API、MCP 服务器或本地命令)、参考知识库、多步骤工作流以及格式要求和验证规则等护栏。这种模块化设计让团队能够快速专业化智能体,在不微调底层模型的情况下更新领域知识,并保持跨工作流的行为一致性。

技能的可组合性引入了两种传统评估指标难以捕捉的失效模式。第一种是技能路由错误:智能体调用了不适合当前任务的技能。第二种是指令遵循不完整:智能体调用了正确技能,但跳过或仅部分执行了其规定步骤。两种失效均可能产生流畅且看似合理的回答,却违背了预设的领域知识和业务流程,仅凭最终输出质量无法发现问题。

Strands Evals SDK 和 Amazon Bedrock AgentCore Evaluations 为此引入三项专项评估器。技能选择准确性(Skill Selection Accuracy)对每个被调用技能返回二元判断,评估该技能是否适合当前任务。技能指令遵循度(Skill Instruction Following)对每个被调用技能返回五级评分,衡量智能体遵循技能规定步骤的完整程度,并附有证据支撑。技能调用检测(Skill Invoked)则是 Strands Evals 特有的确定性检查,无需调用模型即可验证指定技能是否成功加载。

以一个 HR 助手智能体为例,该智能体配备了 PTO 规划和员工福利查询两项技能。当员工询问牙科和视力福利时,若智能体错误调用 PTO 技能,技能选择准确性评估器能精准定位这一路由决策失误。若智能体正确调用 PTO 技能处理相关请求,但跳过了核查结转规则这一步骤,技能指令遵循度评估器则能识别该执行缺失并标注具体遗漏步骤,而非仅报告整体得分下降。

两类失效需要不同的修复策略。技能选择错误通常指向技能描述存在重叠或歧义,需要优化技能的描述边界。指令遵循不完整则可能需要更清晰的步骤拆分、不同的技能结构设计,或切换到能力更强的智能体模型。由于基于评判模型的评估器返回每个被调用技能的独立结果,多技能运行场景依然可诊断,团队可精确定位是哪个技能的选择或执行问题拉低了整体得分,从而有针对性地迭代优化。

要点

  • 技能(Skill)作为模块化指令集,让智能体无需修改核心逻辑即可获得领域专属能力,并可跨框架移植复用
  • 技能可组合性带来两种新型失效:路由错误和指令遵循不完整,两者均可产生流畅但错误的回答,传统输出质量指标无法识别
  • Strands Evals 和 AgentCore Evaluations 新增三项评估器,分别从技能选择、指令遵循和调用确认三个维度量化智能体的技能使用质量
  • 技能选择准确性返回二元结果,技能指令遵循度返回五级评分并附证据,两者结合可精准区分路由问题与执行问题
  • 不同失效类型对应不同修复方向:路由错误需优化技能描述,指令遵循不足需改进步骤设计或升级模型能力
查看原始来源

原始标题:Evaluate skill-equipped agents with Strands Evals and Amazon Bedrock AgentCore

本文由 DataHub 基于公开来源整理,用于信息发现与摘要阅读;具体事实、数据和后续更新以原始来源为准。