AI资讯 / Agent

Agent / 工程

Jev 模型正式接入 LangSmith 评估体系,为 Agent 追踪提供更快更廉价的结构化反馈

LangChain

LangChain 宣布 TypeSafe AI 开发的 Jev 模型正式接入 LangSmith 评估体系,用户可在任意追踪项目的 Evaluators 标签页中直接启用 Jev 作为评判器。Jev 属于 System One 模型,不生成自由文本,而是直接返回类型化的结构化答案与概率值,支持是否判断、多选一和评分三种问题类型。与传统 LLM 评判器相比,Jev 在分类任务上速度最高快约 200 倍、成本最低降至约 1/450,且能在单次请求中并行处理多个评估维度。LangChain 团队在实测中将 Jev 与 GPT-5.6 Luna、GPT-5.6 Terra 及 Claude Sonnet 4.6 进行对比,结果显示 Jev 与人工审核结论完全吻合,方差比 LLM 评判器低 92 至 913 倍,平均响应时间仅 0.44 秒,完成全套评判的总费用仅为 0.34 美元,远低于 Claude Sonnet 4.6 的 28.17 美元。

Agent 评估领域长期以来只有两种主流方案:基于代码的确定性检查和 LLM 评判器。代码评估器速度快、可靠性高,但只能覆盖开发者事先能够完整定义的行为片段。由于 Agent 本身具有非确定性,同一问题的三种合理解法可能只有一种能通过代码检查,导致大量误判。LLM 评判器弥补了这一灵活性缺口,但代价是更高的延迟与费用,以及评判结果本身的不一致性。Jev 的出现代表着第三种路径的成熟:在灵活性与成本之间找到新的平衡点。

Jev 的核心设计理念是 System One 模型,即专为快速结构化决策而构建的 AI 模型。它不产生任何生成式文本,而是接收一个状态输入(可以是 Agent 追踪记录、单条消息或任意上下文),并针对预设问题直接返回类型化答案。三种问题类型分别是:noul(是否概率)、choice(从候选项中选一)和 score(在有序量表上打分)。每个答案都以强类型格式返回,彻底消除了将自由文本转换为结构化输出这一额外的误差来源。

成本压力是团队减少评估频率的首要原因。当 Agent 运行量较大时,每次调用 LLM 评判器的几分钱费用会在生产流量、大规模数据集和每次模型或提示变更的回归测试中迅速累积。Jev 的低成本特性使团队可以对每一条追踪记录而非抽样记录进行评分,同时对每条记录检查更多维度,并多次重复评判以验证一致性。评判成本越低,能够覆盖的 Agent 行为范围就越广,Agent 迭代改进的反馈循环也就越紧密。

速度优势在在线评估场景中尤为关键。在线评估需要对实时流量进行即时评分,Jev 比 LLM 评判器快约 200 倍,能够更好地跟上流量到达的节奏。这对于检测 PII 泄露、提示注入或有害内容等安全风险类反馈键尤为重要——团队可以在这些反馈键上设置告警并触发 Webhook 自动响应。评判器越快,从问题发生到采取行动之间的窗口期就越短,安全响应的实时性也就越强。

并行化能力改变了单条 Agent 追踪可评估的维度数量上限。Jev 在一次请求中同时处理所有问题,因此对同一条追踪记录同时评估 PII 泄露、用户意图和用户情绪三个维度,成本仅比评估单一维度略高一点点。相比之下,LLM 评判器要么需要为每个标准单独调用一次,要么在单个提示中顺序推理所有标准,输出 token 数量随标准数量线性增长。LangChain 的实测数据印证了这一优势:Jev 完成全套评判仅花费 0.34 美元,而 Claude Sonnet 4.6 的同等测试花费高达 28.17 美元。

尽管测试结果令人鼓舞,LangChain 也明确指出 Jev 并不会取代 LLM 评判器。对于需要书面推理过程的开放式评估标准,LLM 评判器仍是更合适的工具;经过微调的开源模型也能以更低成本胜任部分评判任务。Jev 最适合的场景是:决策维度明确且类型化、需要大批量运行的评估任务。三种评估方式各有侧重,共同构成更完整的 Agent 质量保障体系。

要点

  • Jev 是 System One 模型,直接返回类型化结构化答案,无需将自由文本转换为结构化输出,从根本上消除了 LLM 评判器的一类误差来源
  • 实测显示 Jev 与人工审核结论完全吻合,方差比主流 LLM 评判器低 92 至 913 倍,平均响应时间仅 0.44 秒
  • Jev 在分类任务上成本最低约为 LLM 评判器的 1/450,使团队可以对全量追踪记录而非抽样记录进行评估,收紧 Agent 迭代反馈循环
  • 并行化处理多维度评估几乎不增加额外成本,特别适合同时检测 PII 泄露、用户意图、安全风险等多个指标的场景
  • Jev 现已在 LangSmith 任意追踪项目的 Evaluators 标签页中可用,与代码评估器和 LLM 评判器共同构成三类互补的 Agent 评估方案
查看原始来源

原始标题:Jev is now available in LangSmith Evals

本文由 DataHub 基于公开来源整理,用于信息发现与摘要阅读;具体事实、数据和后续更新以原始来源为准。