产业 / 媒体
首个搜索API综合基准发布,专为AI智能体设计
AI评测机构Artificial Analysis近日发布名为「Search Index」的基准测试,专门衡量各大搜索API提供商在AI智能体场景下的综合表现。此次参与测评的提供商包括Parallel、Exa、Firecrawl、You.com、Tavily、Keenable和Brave,共七家。测试采用统一模型GPT-5.6 Luna,在标准化智能体环境中运行,唯一变量为搜索提供商。基准由三项等权重子测试组成:包含900道研究题的DeepSearchQA、200道多步骤浏览题的BrowseComp子集,以及覆盖六大知识领域共600题的AA-Omniscience。结果显示,在不使用任何搜索工具的情况下,模型得分仅为33分;接入搜索后,各提供商得分区间为65至75分。Parallel、Exa和Firecrawl分别以75、74、73分领跑,综合表现最为突出。
Artificial Analysis于2026年8月发布「Search Index」,这是目前首个专门针对AI智能体场景设计的搜索API综合评测基准。测试对象涵盖Parallel、Exa、Firecrawl、You.com、Tavily、Keenable和Brave七家主流提供商。所有测试均在同一模型GPT-5.6 Luna下进行,智能体框架采用Artificial Analysis自研的开源工具Stirrup,每项任务执行25次搜索与网页抓取,确保结果的统计可靠性。
「Search Index」由三项子基准等权重合并而成。DeepSearchQA包含900道需要多次查询才能作答的研究型问题;BrowseComp子集收录200道需要多步骤浏览才能找到的难题;AA-Omniscience则横跨六大知识领域,共设600道题目。此外,测试还设置了一个无工具基线——让模型在不借助任何搜索能力的情况下独立作答,以此作为对照参考点。
测试结果显示,模型在无搜索工具辅助时得分仅为33分,接入搜索API后得分大幅提升至65至75分区间。Parallel以75分居首,Exa和Firecrawl分别以74分和73分紧随其后。这一结果表明,搜索质量的高低对智能体的整体推理能力具有显著影响,优质的搜索结果能够直接减少模型的无效推理步骤。
搜索质量的提升还带来了意想不到的成本优势。当搜索结果质量更高时,模型所需消耗的token数量明显减少。以Parallel Search的高级版本为例,其token消耗量相比基础版本降低超过40%。尽管单次搜索的费用有所上升,但每项任务的总成本反而从0.11美元降至0.084美元,整体经济性更优。
速度维度的测试结果同样值得关注。Parallel Search的Turbo版本每次查询响应时间仅为0.51秒,远快于基础版本的1.03秒,但其质量得分(67分)低于高级版本(73分),导致智能体需要执行更多轮次的搜索,最终每项任务的总耗时与其他版本相差无几。这说明单纯追求查询速度并不等同于整体效率的提升,质量与速度之间的平衡至关重要。
Artificial Analysis表示,Parallel、Firecrawl以及Parallel Turbo在成本与性能的综合权衡上表现最佳。目前,该基准的完整方法论已对外公开,其他搜索API提供商也可申请加入测评。随着AI智能体在企业场景中的应用日益广泛,此类专项基准的出现有望推动搜索API市场向更高质量、更透明的方向发展。
要点
- Artificial Analysis发布「Search Index」,是首个专为AI智能体场景设计的搜索API综合基准,涵盖质量、成本与速度三个维度。
- Parallel、Exa和Firecrawl在七家参测提供商中位居前三,得分分别为75、74和73分,而无搜索工具时模型基线得分仅为33分。
- 搜索质量越高,模型消耗的token越少,综合成本反而更低——Parallel高级版总成本比基础版低约24%。
- 单次查询速度快并不等于整体任务效率高,低质量搜索会迫使智能体执行更多轮次,抵消速度优势。
- 该基准方法论已完全公开,其他提供商可申请加入,有望成为行业评估搜索API的通用参考标准。
原始标题:New benchmark ranks search APIs for AI agents on quality, cost, and speed
本文由 DataHub 基于公开来源整理,用于信息发现与摘要阅读;具体事实、数据和后续更新以原始来源为准。