产业 / 媒体
阿里巴巴发布2.4万亿参数旗舰模型Qwen3.8-Max,可独立完成跨天复杂任务
阿里巴巴Qwen团队正式发布旗舰语言模型Qwen3.8-Max,总参数量达2.4万亿,每次查询激活950亿参数。该模型基于Qwen3.5架构构建,核心设计目标是在无人介入的情况下,独立完成跨越数天乃至数周的复杂任务,而非仅回答单次提问。在官方展示的多个案例中,模型自主完成了命令行工具开发、学术论文复现与超越、电商竞赛以及芯片逻辑门优化等高难度任务,表现出持续迭代与深层结构调整的能力。内部基准测试显示,其性能与Claude Opus 4.8、GPT-5.6 Sol等西方顶级模型相当,在PaperBench上以93分位居比较榜首。Qwen3.8-Max目前已可通过阿里相关平台使用,模型权重计划于下周公开发布,成为Qwen-Max系列中首个开放权重的版本。
阿里巴巴Qwen团队于2026年8月正式揭晓Qwen3.8-Max,这是其迄今为止规模最大、能力最强的语言模型。模型总参数量达2.4万亿,每次推理激活950亿参数,基于Qwen3.5架构演进而来。与以往侧重单轮问答的模型不同,Qwen3.8-Max的设计重心在于长周期自主任务执行,能够在数天乃至更长时间内持续工作,无需人工干预。该模型早在7月中旬便以预览版形式上线,彼时仅以标准价格的一折向特定用户开放。
为验证模型的自主编程能力,Qwen团队公布了三项无人介入的实战案例。其中最引人注目的是:模型历时16天独立开发了命令行工具oh-my-cli,期间自行处理用户需求、创建GitHub Issue、编写代码并迭代测试,累计产生265次提交、127个拉取请求和151个Issue,全程零人工操作。另一案例中,模型在约125小时的算力消耗内,不仅完整复现了一篇LLM推理论文的全部六项主要结果,还在AIME24数学基准上将论文方法的得分提升了2.7个百分点。
在阿里天池平台的WWW2025多模态对话意图识别挑战赛中,Qwen3.8-Max在24小时内完成多个中文语言模型的微调与集成,构建投票融合系统,经45次提交后准确率从0.60提升至0.853,最终超越526支参赛人类团队中的458支。芯片设计案例同样令人印象深刻:模型将一个加密电路的逻辑门数量从8298个压缩至678个,经过约500轮迭代后,芯片物理面积缩减了81%,且团队指出模型在数百轮迭代后仍持续进行深层结构优化,而非流于表面调整。
在模拟电商运营测试E-Commerce-Bench中,模型以10万元人民币启动资金,在一个完整模拟财年内并行管理多家网店,涵盖采购、供应商谈判、价格调整、退货处理及危机应对等环节,并需从供应商池中识别出152名骗子。最终Qwen3.8-Max将资金增至41.6万余元,较起始资金翻逾四倍,比排名第二的GLM 5.2高出38%,是其前代Qwen3.7-Max成绩的2.5倍以上。模型在年初采取激进投资策略,并在节假日旺季实现超10万元净利润。
在多模态能力方面,Qwen3.8-Max支持处理超过200页的文档和时长逾100小时的视频。团队同步推出RecreationBench基准,要求模型在无源代码的情况下,仅通过点击和键盘交互观察目标应用并将其重建,测试覆盖Ubuntu、macOS、Windows、Android及Web等多个平台。此外,团队还发布了Qwen-MM-Plugins扩展库,为现有智能体系统补充图像与视频处理、视觉工具调用及多模态记忆等能力。
团队将模型长周期任务能力的提升归因于强化学习阶段训练环境的大幅扩充:训练不再局限于单一任务,而是纳入了多天工作流、嵌套目录结构及多种智能体框架。内部综合评分指数从0.474提升至0.725,模型在约4000个训练环境时表现最优。值得注意的是,上述基准数据均来自团队内部测试,独立第三方验证尚未完成。Qwen3.8-Max的权重将于下周公开发布,成为Qwen-Max系列首个开放权重的模型,进一步加剧中国开源大模型领域的竞争态势。
要点
- Qwen3.8-Max总参数量达2.4万亿,专为无人干预下的长周期复杂任务设计,可持续工作数天乃至数周
- 模型在自主编程、论文复现、芯片优化和电商运营等多项实战测试中表现突出,电商模拟中资金增长超四倍
- 内部基准测试显示其性能与Claude Opus 4.8、GPT-5.6 Sol等顶级西方模型相当,PaperBench得分93分居首
- 强化学习阶段大幅扩充训练环境是模型长周期能力提升的关键,综合评分指数从0.474升至0.725
- 模型权重将于下周开放,成为Qwen-Max系列首个开源版本,进一步推动中国开放大模型生态发展
原始标题:Alibaba’s open-weight Qwen3.8-Max takes on long-horizon AI tasks with 2.4 trillion parameters
本文由 DataHub 基于公开来源整理,用于信息发现与摘要阅读;具体事实、数据和后续更新以原始来源为准。