Agent / 工程
智能体调用中真正需要顶级模型的比例只有7%
大多数团队在构建 AI 智能体时,会将所有 LLM 调用统一发送至同一个顶级模型,但这种做法正在变得越来越昂贵。LangChain 与 NVIDIA 合作,通过 NVIDIA NeMo Switchyard 这一开源模型路由库,对145个多步骤智能体任务进行了系统性基准测试。结果显示,在所有模型调用中,仅有7%的轮次真正需要 Claude Opus 4.8 这样的前沿模型,其余93%均由参数量30B的 Nemotron 3.5 Lightning 完成。从费用分布来看,这7%的前沿模型调用却消耗了总成本的68%。通过路由策略,整体成本相比全程使用 Opus 降低了74%,准确率从86%下降至80%,降幅约6个百分点。测试还揭示了一个关键细节:路由中使用的判断模型本身占据了路由方案总成本的21%,是仅次于前沿模型的第二大支出项,值得重点优化。
智能体在执行任务时会产生大量 LLM 调用,但并非每一次调用都需要同等级别的模型能力。读取一个文件和排查一个复杂的测试失败原因,在单模型架构下会以相同的每 token 价格发送给同一个模型,尽管两者的难度天差地别。随着前沿模型价格持续上涨、开源模型能力快速提升,这种一刀切的做法正在产生越来越高的隐性成本。
NVIDIA NeMo Switchyard 是一个开源模型路由库,能够根据配置策略自动将智能体的每次查询分配给不同的模型组合。它既可以作为代理层独立部署,也可以作为中间件嵌入智能体进程。Switchyard 目前提供两种主要路由方式:基于小型判断模型的 LLM 分类器,以及基于工作流阶段的启发式路由器。本次测试采用的是 LLM 分类器的升级模式,即每个任务默认从廉价模型开始,连续两次判断为表现不佳后才升级至前沿模型,且升级后不再降回。
测试基于 LangChain 的 Deep Agents 评估套件,涵盖145个多步骤任务,平均每个任务产生6.3次模型调用,场景包括客户支持对话、故障排查和跨系统工作流自动化。测试数据来源涵盖 τ²-bench、Berkeley Function Calling Leaderboard、FRAMES 和 Nexus 等多个基准集。需要注意的是,这些评估场景经过控制设计,整体准确率较高,30B 模型与前沿模型之间仅有8个百分点的差距,这在一定程度上压缩了路由策略的发挥空间。
核心数据揭示了调用量与费用之间的显著不对称:Nemotron 3.5 Lightning 承担了93%的模型调用,仅消耗总费用的10.4%;而 Claude Opus 4.8 仅处理7%的调用,却占据了68.4%的费用。路由方案将每次完成任务的成本从0.092美元降至0.026美元,降幅达74%。值得注意的是,判断模型的费用占路由方案总成本的21.2%,由于无法享受提示词缓存优惠,其单位成本相对较高,是优化路由总成本时不可忽视的环节。
准确率的损失是真实存在的。路由方案的准确率为80%,比全程使用 Opus 的86%低6个百分点,而单次运行的自然波动约为2.7个百分点,因此6个百分点的差距具有统计意义。有趣的是,将困难任务升级至 Opus 仅比全程使用廉价模型高出2.3个百分点,这一差值甚至低于运行间的正常波动,说明路由的价值主要来自将简单任务转移至廉价模型,而非将复杂任务精准识别并送往前沿模型。
研究团队还提出了一个判断路由是否值得的成本公式:用判断模型的成本除以两个模型之间的价格差,即可得出需要卸载的最低比例。若两个模型价格接近,这一比例可能超过100%,意味着除非自行托管廉价模型,否则路由在经济上无法成立。这一公式提示开发者在动手构建路由系统之前,应先完成这道基本的数学验证,避免投入大量工程成本却换不来实际收益。
要点
- 在145个智能体任务测试中,仅7%的模型调用需要前沿模型,但这7%消耗了总成本的68%,调用量与费用严重不对称。
- 模型路由可将成本降低74%,代价是约6个百分点的准确率损失,每完成一个任务的费用从0.092美元降至0.026美元。
- 路由方案中的判断模型占总成本的21%,因无法享受提示词缓存优惠而成为第二大支出项,优化判断模型与优化升级率同等重要。
- 路由的核心价值在于将简单任务转移至廉价模型,而非精准识别复杂任务,升级至前沿模型带来的准确率提升低于运行间的自然波动。
- 在构建路由系统前,应先用成本公式验证可行性:若两个模型价格差距较小,路由在经济上可能无法成立,除非自行托管开源模型。
原始标题:How many of your agent's calls actually need a frontier model?
本文由 DataHub 基于公开来源整理,用于信息发现与摘要阅读;具体事实、数据和后续更新以原始来源为准。