AI资讯 / Agent

Agent / 工程

Jev 能否成为更优秀的 Agent 评估器?

LangChain

当前 Agent 评估主要依赖两种方式:基于代码的确定性评估和 LLM-as-a-Judge。前者速度快、成本低,但难以处理开放式任务;后者灵活但存在非确定性、速度慢、成本高等问题。TypeSafe AI 推出的 Jev 是一种全新的「System One」模型,它不生成文本,而是直接返回带概率的结构化答案,专为快速结构化决策而设计。LangChain 团队使用 LangSmith 和 Deep Agents 构建了一套测试框架,让 Jev 与 GPT-5.6 Luna、GPT-5.6 Terra 和 Claude Sonnet 4.6 在相同的五组天气查询任务上进行对比评估,重复运行 100 次,从准确性、方差、延迟和成本四个维度进行横向比较。结果显示,Jev 在二元判断上与人工标注完全吻合,连续评分方差比主流 LLM 裁判低 92 至 913 倍,平均响应时间仅 0.44 秒,每次调用成本约 0.00035 美元,展现出极具竞争力的综合表现。

Agent 评估长期面临两难困境。基于代码的评估器速度快、成本低且结果可复现,但它依赖确定性输入,难以处理 Agent 行为中的随机性。例如,代码可以判断 Agent 是否调用了某个工具,却很难评估 Agent 是否真正利用工具结果回答了用户问题——因为同一工具结果可能对应多种合理的使用方式。LLM-as-a-Judge 的出现弥补了这一不足,它能接受非结构化的 Agent 轨迹作为输入,通过推理给出评分,但其固有的非确定性使其难以成为可靠测试体系的基础。

Jev 由 TypeSafe AI 推出,被定义为「System One」模型。与自回归 LLM 逐 token 生成文本不同,Jev 直接对结构化状态进行评估,返回带置信度的类型化答案。TypeSafe AI 声称,在分类任务上,Jev 的推理速度最高可达同类 LLM 的 200 倍,成本降低 400 倍。这种「决策优先」的设计使其天然契合 Agent 评估的本质需求:给定 Agent 的状态与行为,输出一个可供反馈的评分。

Jev 支持三种问题类型:Choice 用于单选并返回各选项概率;Score 依据有序评分标准对答案打分;Noul 返回某个是/否判断为真的概率。多个原子问题可以并行针对同一状态进行评估。LangChain 团队基于 Deep Agents 构建了一个天气查询 Agent,并将五组固定的 Agent 运行结果存储为 LangSmith 数据集,确保所有评估器在完全相同的输入上进行比较,从而将评估器本身的差异与 Agent 行为的变化解耦。

在准确性测试中,以人工标注作为基准,Jev 在 500 次二元判断中与人工标注完全一致,准确率达 100%;Terra 为 99.8%,Luna 为 96.4%,Claude Sonnet 4.6 为 80.0%。在连续评分的方差测试中,Jev 的表现更为突出,其质量评分方差比 GPT-5.6 Luna、Terra 和 Claude Sonnet 4.6 低 92 至 913 倍,意味着在相同输入下,Jev 能够持续给出高度一致的判断,这对生产环境中的可靠性至关重要。

在效率与成本维度,Jev 同样领先。其平均响应时间为 0.44 秒,每次调用成本约 0.00035 美元,五组测试的总花费仅为 0.34 美元,而 Claude Sonnet 4.6 的总成本高达 28.17 美元,差距超过 80 倍。研究团队也坦承,本次测试规模较小,仅涵盖五个天气查询场景,结论尚需在更广泛的任务类型和更大规模数据集上进一步验证。但 Jev 所展示的方向——低延迟、低成本、高一致性的结构化评估——为 Agent 工程领域提供了一条值得深入探索的新路径。

要点

  • Jev 是一种「System One」模型,不生成文本,直接返回带概率的结构化答案,从根本上区别于传统 LLM 裁判。
  • 在连续评分一致性上,Jev 的方差比 GPT-5.6 Luna、Terra 和 Claude Sonnet 4.6 低 92 至 913 倍,可重复性显著更强。
  • Jev 平均响应时间仅 0.44 秒,每次调用成本约 0.00035 美元,五组测试总成本为 0.34 美元,远低于 Claude 的 28.17 美元。
  • 在二元判断准确性上,Jev 与人工标注完全吻合,Claude Sonnet 4.6 的准确率仅为 80%,差距明显。
  • 本次测试规模有限,仅覆盖五个天气查询场景,Jev 在更复杂、更多样化任务上的表现仍需进一步验证。
查看原始来源

原始标题:Can Jev Be a Better Agent Evaluator?

本文由 DataHub 基于公开来源整理,用于信息发现与摘要阅读;具体事实、数据和后续更新以原始来源为准。