AI资讯 / 模型

模型 / 官方

阿里Qwen团队发布电商智能体评测基准E-CommerceBench

QwenLM GitHub

阿里巴巴Qwen团队在GitHub上开源了E-CommerceBench,一个专为评估大语言模型在长周期自主商业运营能力而设计的基准测试框架。该基准模拟一位名为「旺旺」的电商商家,在365天内管理最多四家网店,涵盖供应商谈判、库存定价、订单履行与退货处理等完整业务链条,以年末总资产相对初始10万元的倍数作为核心评分指标。测试环境基于真实电商平台脱敏数据构建,包含6886个商品、60个品类和576家供应商,其中152家为欺诈供应商。评测共纳入18款主流模型,涵盖GPT、Claude、Gemini、Qwen、GLM、Kimi、DeepSeek等系列。结果显示,各模型在盈利能力、谈判效率、欺诈识别、资金安全等维度上表现差异显著,单一财务指标难以全面衡量智能体的综合商业能力。

E-CommerceBench的核心设计理念是「无重置」的长周期连续任务。智能体在365个模拟天内管理电商业务,初始资金10万元,每笔库存支出在客户付款并经过9天托管结算前无法回收,上下文窗口也会在任务结束前溢出,迫使模型自主决策哪些信息值得保留。这种设计使得短期决策失误会在后续数百天内持续产生影响,真实还原了商业运营的复杂性与连续性。

评测框架采用完全确定性的市场环境,需求模型基于真实电商平台脱敏数据,涵盖12种店铺类型、全年促销日历与市场冲击事件。供应商谈判同样由确定性内核驱动,大模型仅负责将谈判决策渲染为对话,无法通过措辞技巧突破供应商的底价。这一设计确保了不同模型间的结果差异完全归因于智能体本身,而非环境随机性。

在18款模型的排名中,GPT-5.6以平均143.1万元资产位居榜首,Fable5以80.5万元紧随其后,开源权重模型中Qwen3.8-Max-Preview以41.6万元领跑,超越多款闭源商业模型。然而排名靠后的Qwen3.5-Plus在5次独立测试中有4次破产,资产均值仅1.1万元,与头部模型差距悬殊。整体来看,专有模型在绝对收益上仍具明显优势。

多维度能力雷达图揭示了一个关键发现:最终资产最多的模型并不意味着综合能力最强。GPT-5.6虽然盈利最高,但其谈判中对议价空间的捕获率低于排名靠后的四款模型,且有18.5%的采购资金流向了欺诈供应商,而最谨慎的Claude Opus 4.7这一比例仅为0.12%。这表明高收益可能来自激进策略而非全面的商业判断力。

E-CommerceBench共设置七个评估维度:利润、谈判能力(CSE⁺)、欺诈规避(BadSpend%)、偿付能力(回撤比)、效率(每次工具调用收益)、执行质量(可控退货率)以及学习能力(AnchorRatio,衡量模型是否能从历史交易中学习压低重复订单价格)。目前没有任何一款模型在所有维度上同时达到中位水平,说明当前大模型在复杂商业场景中的能力仍存在明显短板。

该项目已在GitHub完整开源,支持OpenAI、Anthropic、Google、阿里云百炼、智谱、Moonshot、DeepSeek等主流API接入,用户可通过配置models_config.json快速复现排行榜结果或接入自定义模型。项目采用Python实现,提供完整的环境搭建文档与运行脚本,为学术界和产业界评估智能体在真实业务场景中的长周期决策能力提供了标准化工具。

要点

  • E-CommerceBench通过365天无重置模拟经营,系统评估大模型在库存管理、供应商谈判、欺诈识别等复杂商业场景中的长周期自主决策能力
  • 18款模型测试结果显示,GPT-5.6资产增值最高但欺诈采购比例达18.5%,开源模型Qwen3.8-Max-Preview以41.6万元资产领跑同类,各模型能力维度差异显著
  • 单一财务指标无法全面衡量智能体商业能力,七维评估体系揭示当前所有模型均存在明显能力短板,没有模型在全部维度同时达到中位水平
  • 测试环境基于真实电商平台脱敏数据构建,市场需求与供应商谈判均采用确定性模型,确保模型间差异完全归因于智能体决策质量而非环境随机性
  • 项目完整开源,支持主流大模型API接入,为评估LLM智能体在真实业务场景中的综合能力提供了可复现的标准化基准
查看原始来源

原始标题:QwenLM/E-CommerceBench

本文由 DataHub 基于公开来源整理,用于信息发现与摘要阅读;具体事实、数据和后续更新以原始来源为准。