Agent / 分析
2.4万亿参数开源巨模,自主编程超10天
阿里巴巴 Qwen 团队于2026年8月3日正式宣布 Qwen3.8-Max,将其定位为「迄今最强模型」。该模型拥有2.4万亿总参数,每个 token 激活约95B参数,属于稀疏混合专家架构,支持100万 token 上下文窗口。Qwen 团队同时承诺下周开放模型权重,并同步开源 Qwen3.8-27B。API 定价为每百万输入 token 2美元、输出6美元。在第三方评测中,Qwen3.8-Max 在前端代码竞技场排名第4,视觉竞技场排名第2,SWE-bench 得分87.3%,超越 GPT-5.5 和 GLM-5.2。Vals Index 显示其综合得分与 Claude Opus 4.7 持平,但成本仅为后者的43%。此次发布被业界视为中国开源前沿模型正面挑战西方顶级闭源模型的有力信号,尤其在自主编程、长周期 Agent 任务和多模态推理领域表现突出。
经历去年「Qwen 出走」风波与管理层更迭后,外界一度担忧这家领先的开源模型实验室是否还会持续发布有竞争力的模型。Qwen3.8-Max 的到来彻底打消了这一疑虑。该模型拥有2.4万亿总参数,每个 token 激活约95B参数,激活比例约为4%,属于稀疏混合专家架构。支持100万 token 超长上下文,API 还提供低、中、超高三档推理强度模式,并兼容 OpenAI 与 Anthropic 协议,部署灵活性显著提升。
Qwen 团队在发布公告中重点强调了模型的长周期自主能力。在自主编程方面,模型在无人值守状态下连续运行超过10天,从零构建了一套自进化编程框架,并留有公开的 GitHub 运行记录。在 AI 科研方面,模型自主复现了论文《Unified Data Selection for LLM Reasoning》的完整实验流程,并在125小时内通过迭代研究循环发明了新的数据选择方法,在原论文基准上提升了2.71个百分点。
在更广泛的专业场景中,Qwen3.8-Max 同样展现出生产级能力。芯片设计方面,模型完成了从 RTL 编辑到仿真、综合、物理布局的完整硅设计流程,将门电路数量从8298个压缩至678个,芯片面积减少81%,并在500 MHz 频率下满足物理时序收敛要求。电商策略方面,模型在365天店铺运营模拟中,通过持续博弈谈判与库存规划,实现了4.16倍的资金回报。此外,模型还在企业法律审查、UI/UX 设计、结构工程建模等数百个专业工作流中输出了生产级成果。
第三方评测结果进一步印证了 Qwen3.8-Max 的实力。在前端代码竞技场,该模型以1668 Elo 分排名第4,仅次于 Claude Opus 5 Max(1705)和 Kimi K3 Max(1676),在消费产品子类中排名第2。视觉竞技场中,模型以1305分排名第2,与第1名仅差13分。Vals Index 综合评测中,Qwen3.8-Max 在43个模型中排名第10,开源模型中排名第2,得分66.1,与 Claude Opus 4.7 持平,但每次测试成本仅为2.68美元,约为后者6.17美元的43%。
此次发布的另一大亮点是多模态原生集成能力。Qwen3.8-Max 将视觉反馈深度融入规划、编程与 GUI 交互的完整执行循环,而非仅作为输入通道,支持跨桌面、移动端、Web 端的应用直接复现。Qwen 团队同步发布了 Qwen-MM-Plugins,可将多模态能力扩展至现有 Agent 框架。Baseten、Hermes Agent、Command Code 等基础设施与应用构建商已迅速确认支持计划,开源权重的即将释放也将进一步推动社区生态的快速扩展。
要点
- Qwen3.8-Max 拥有2.4T总参数、95B激活参数,支持100万 token 上下文,下周将开放模型权重,同步开源 Qwen3.8-27B。
- 模型在自主编程、芯片设计、AI 科研、电商运营等长周期 Agent 任务中展现出超过10天的无人值守运行能力。
- 第三方评测中,SWE-bench 得分87.3%,超越 GPT-5.5 和 GLM-5.2;Vals Index 综合得分与 Claude Opus 4.7 持平,成本仅为其43%。
- 多模态能力以原生方式融入执行循环,视觉反馈贯穿规划与编程全流程,并配套发布 Qwen-MM-Plugins 扩展工具。
- 此次发布被业界视为中国开源前沿模型正面竞争西方顶级闭源模型的重要里程碑,尤其在编程与 Agent 领域。
原始标题:[AINews] Qwen 3.8 Max(2.4T) and 27B, new open weights models for Coding and Cowork
本文由 DataHub 基于公开来源整理,用于信息发现与摘要阅读;具体事实、数据和后续更新以原始来源为准。