AI资讯 / Agent

Agent / 工程

Similarweb 如何用 LangSmith 评估 Agent 生成的研究报告

LangChain

Similarweb 的数据分析产品 Data Studio 是一个基于 Agent 的自然语言查询系统,用户可以用日常语言提问,Agent 自动规划任务、调用数据工具并生成答案。随着产品迭代,团队面临一个核心难题:每次更新 Prompt、模型或工具后,如何判断系统整体是否真的变好了?传统软件的测试逻辑在 Agent 场景下失效,因为同一输入可能走不同路径、调用不同工具,产出不同但同样合理的答案。为此,Similarweb 高级 AI 工程师 Liora Korni 在 LangSmith 上构建了一套完整的评估工作流:对简单问答使用黄金答案加语义裁判,对长篇研究报告则引入多维度评分标准(Rubric)和忠实性检查,并通过 A/B 对比将每个分数与评估注释、执行 Trace 关联,确保每一个评分信号都可追溯、可解释。文章还特别警示了评分标准权重设置不当可能导致的「校准陷阱」。

Similarweb 的核心业务是衡量数字世界的流量格局——估算网站和应用的访问量、流量来源、竞争对手表现以及受众注意力的迁移趋势。Data Studio 是构建在这些数据之上的 Agent 层,用户无需手动操作仪表盘和筛选器,只需用自然语言提问,Agent 便会自动规划工作流、调用合适的数据工具、检索数字并生成答案。这类系统既能处理简单查询,也能完成多步骤的竞品对比研究报告。

Agent 系统的评估难点在于,回归问题可能隐藏在工具选择、数据检索或内容综合的任意环节。Similarweb 团队因此将评估纳入产品架构的核心组成部分,而非事后补丁。他们在 LangSmith 上构建了统一的评估工作流,使每个评分结果都能追溯到背后的评估注释和执行 Trace,让「分数」真正成为可解释的信号,而非黑盒数字。

团队将评估方法分为两类。第一类是确定性检查:Agent 是否调用了必要的工具?是否避开了不该触碰的工具?返回的结构化输出是否合法?这些是纯机械的通过/失败判断,不涉及任何模型。第二类是 LLM 裁判:当评估目标涉及语义或质量时,确定性规则力不从心,便将判断交给模型。裁判 Prompt 向模型提供用户问题、Agent 输出以及评分标准,模型返回分数和解释性注释。两类检查在同一评估循环中运行,结果并排呈现在 LangSmith 的实验面板中。

对于简单问答场景,评估相对直接:每个基准样本包含固定 Prompt、黄金答案、预期工具调用和 Agent 输出。工具调用采用确定性检查,输出质量则由语义裁判与黄金答案对比,判断两者含义是否一致。LangSmith 将反馈转化为实验列,团队可以跨版本对比分数,点击任意分数直接查看背后的执行 Trace,无需在电子表格中手动汇总数据。

长篇研究报告的评估则复杂得多。同一个问题可能存在多份质量相当的报告:有的聚焦流量获取,有的分析竞争定位,有的关注变现风险,只要论据有据可查、推理逻辑严密,都可以是合理答案。黄金答案在此场景下不适用,因为与参考报告的相似度并不等于质量。为此,团队改用多维度评分标准(Rubric),为每个质量维度设置明确的评分锚点,并引入忠实性检查,验证报告中的声明是否有数据来源支撑。

团队在实践中踩过一个代价高昂的坑:评分标准的权重设置不当,会让一次实际上的改进看起来像是退步。他们花了整整一周才意识到问题出在标准校准上,而非 Agent 本身。这一经历让他们得出结论:在信任评估结果之前,必须先验证评分标准本身的合理性。一套校准失当的评估体系,比没有评估更危险,因为它会给错误决策提供虚假的信心背书。

要点

  • 评估方法必须匹配输出类型:简单问答适合黄金答案加语义裁判,长篇报告需要多维度 Rubric、忠实性检查和基线对比
  • 将分数视为可追溯的信号而非最终答案,LangSmith 可将每个分数与评估注释和执行 Trace 关联,确保结果可解释
  • 确定性检查与 LLM 裁判应在同一评估循环中并行运行,覆盖工具调用合规性和输出语义质量两个维度
  • 评分标准校准是评估体系的前提,权重设置不当会导致真实改进被误判为退步,校准失当的评估比没有评估更危险
查看原始来源

原始标题:How Similarweb Evaluates Agent Reports with LangSmith

本文由 DataHub 基于公开来源整理,用于信息发现与摘要阅读;具体事实、数据和后续更新以原始来源为准。