AI资讯 / Agent

Agent / 工程

LangSmith 推出调优评估器,以极低成本实现全量生产对话质量监控

LangChain

LangChain 于 2026 年 8 月 18 日正式推出 LangSmith Tuned Evaluators,这是一套可自动为生产环境 Traces 附加质量反馈的评估产品。首个落地的评估项为「感知错误(Perceived Error)」,用于检测对话中智能体出现误解、走偏或被用户纠正等失误迹象。传统方案依赖前沿大模型进行评判,成本高昂且只能抽样覆盖,而 LangChain 针对该目标专项后训练了一个小型模型,在内部基准测试中超越所有前沿模型,同时将评估成本降低最高 82%,部分早期合作伙伴场景下节省幅度甚至达到 98%。团队无需自行编写提示词、选择模型或维护推理基础设施,只需将评估器挂载到 LangSmith 追踪项目即可立即获得覆盖全量对话的质量信号,并将结果用于失败溯源、数据集构建和持续改进流程。

在生产环境中评估对话智能体的质量,长期以来面临精度与覆盖率难以兼顾的困境。使用前沿大模型作为评判者可以获得较高准确率,但对大量生产对话逐一调用的成本极为昂贵;而使用小型模型虽然便宜,却因精度不足难以信任其判断结果。最终,许多团队只能对极小比例的对话线程进行抽样评估,从而错过智能体给用户带来糟糕体验的关键信号。

LangSmith Tuned Evaluators 的设计目标正是打破这一两难局面。每个 Tuned Evaluator 都是针对特定评估目标的完整、版本化评估器,LangChain 已完成从目标定义、歧义案例处理、标注数据生产到模型选型与基准测试的全部工作。团队只需选择所需的评估器并将其附加到追踪项目,无需自行编写或维护复杂提示词,也无需管理模型凭证或推理基础设施,LangChain 负责端到端的运营与维护。

首个推出的评估项「感知错误」专门检测对话中存在智能体犯错迹象的线程。这些迹象可以是显式的,例如用户纠正、重复请求或拒绝某个操作;也可以由模型从矛盾回复、已承认的错误、持续性误解或未解决的结果中推断得出。由于绝大多数用户不会主动提交评分,感知错误成为衡量智能体是否真正满足用户需求的重要代理指标。

在模型能力方面,LangChain 基于对话智能体的标注 Traces 对专项模型进行了后训练。该模型在内部基准测试中超越了所有参与对比的前沿模型,同时将评估成本降低最高 82%。早期合作伙伴 Vanta 的 Staff ML/AI 工程师 Kevin Royer 表示,这个开箱即用的评估器从第一天起就为团队提供了捕获失败模式的安全网,是他们找到的让团队最快具备质量监控能力的方式。

在使用流程上,当一个对话线程包含至少两轮人机消息交互并达到配置的空闲等待期后,即成为感知错误评估器的合格评估对象,评估将在线程达标后 12 小时内完成。评估结果及其解释将作为反馈附加到对应的 Trace 或线程上,团队可据此筛选值得深入调查的对话、比对重复出现的失败模式、将标注 Traces 加入评估数据集,或将模糊案例路由至人工审核流程,从而形成完整的智能体持续改进闭环。

感知错误 Tuned Evaluator 目前已面向美国地区的 Plus 和 Cloud Enterprise 计划用户开放,按成功评估次数计费,跳过和失败的评估不收费。LangChain 表示后续将持续扩展 Tuned Evaluators 的评估目标覆盖范围,并欢迎团队提交自身业务场景需求,以推动更多专项评估器的研发落地。

要点

  • Tuned Evaluators 将评估器的定义、训练、版本管理和推理基础设施全部托管,团队无需任何额外工程投入即可获得生产级质量信号。
  • 首个评估项「感知错误」通过专项后训练模型,在超越前沿模型精度的同时将评估成本降低最高 82%,实现了精度与覆盖率的双重突破。
  • 评估结果直接附加到生产 Traces,可无缝接入失败溯源、数据集构建、CI 流程和人工审核等多种智能体改进工作流。
  • 感知错误是衡量智能体用户体验的关键代理指标,尤其适用于用户主动评分率极低的生产场景。
  • 该功能目前面向美国地区 Plus 和 Cloud Enterprise 用户开放,按成功评估次数计费。
查看原始来源

原始标题:Introducing LangSmith Tuned Evaluators

本文由 DataHub 基于公开来源整理,用于信息发现与摘要阅读;具体事实、数据和后续更新以原始来源为准。