模型 / 官方
Qwen4 架构的早期预览版
阿里巴巴通义千问团队于2026年8月26日正式发布 Qwen3.8-Flash-Next,并同步开放模型权重。这是一款多模态混合专家(MoE)模型,主体参数量达125B,每个 token 激活6B参数,另附51B N-gram 嵌入参数。该模型最重要的意义在于,它是 Qwen4 完整系列正式发布前的架构预览版,与 Qwen3-Next 之于 Qwen3.5 系列所扮演的角色相同。Qwen3.8-Flash-Next 在注意力机制、残差结构、嵌入方式和优化器四个维度上进行了系统性升级,引入了 GDN+QSA 混合注意力、门控残差、N-gram 嵌入以及改进版 Muon 优化器。与 Qwen3.7-Plus 相比,该模型训练成本降至约九分之一,但在编程和办公任务上的能力表现更优。模型权重已在 Hugging Face 和 ModelScope 上发布,支持 SGLang、vLLM 等主流推理框架。
Qwen3.8-Flash-Next 是阿里巴巴通义千问团队发布的最新基础模型,其核心定位是 Qwen4 完整模型家族的架构预览版。团队延续了此前 Qwen3-Next 的做法,在正式发布大版本之前率先开放架构设计,让社区有充足时间审视和验证新的技术路线。Qwen3-Next 引入的混合门控 DeltaNet 与门控注意力设计,此后已被 Qwen3.5、Qwen3.6、Qwen3.7 和 Qwen3.8 系列广泛采用,此次 Qwen3.8-Flash-Next 同样承担着类似的技术探路角色。
在注意力机制层面,Qwen3.8-Flash-Next 采用了 GDN(门控 DeltaNet)与 QSA(Qwen 稀疏注意力)的混合架构。GDN 负责高效压缩历史信息,QSA 则通过轻量级压缩索引器在微块粒度上筛选重要上下文,大幅降低长序列场景下的注意力计算开销。这一设计使模型在处理超长上下文时具备更强的计算效率,支持最长262144个 token 的上下文窗口。
残差与嵌入层面同样迎来重要升级。门控残差(GR)将残差流拓宽为4个分支,并通过动态门控机制控制读写操作,有效增强了跨层信息流动和训练稳定性。N-gram 嵌入则利用局部上下文查表,以极少的额外计算量扩展模型容量,嵌入表还可卸载至主机内存并通过异步预取与模型计算并行执行,进一步提升推理效率。
优化器方面,团队采用了改进版 Muon 优化器,围绕正交化精度、Muon 与 AdamW 的分工协作以及融合参数的拆分方式进行了精细调整,并针对新架构重新拟合了缩放定律。综合来看,与 Qwen3.7-Plus 相比,Qwen3.8-Flash-Next 的训练成本仅约为其九分之一,但在编程和办公任务上的能力表现反而更胜一筹,体现了效率与性能的双重提升。
在部署和使用层面,Qwen3.8-Flash-Next 提供了丰富的接入选项。官方已将其集成至 QwenWork 平台的「标准」模式,并通过 QwenCloud API 提供兼容 OpenAI 和 Anthropic 规范的接口。本地部署方面,模型支持 Hugging Face Transformers、llama.cpp、Unsloth 等工具,以及 SGLang、vLLM、TokenSpeed 等高性能推理框架,开发者可根据自身硬件条件灵活选择部署方案。模型权重已在 Hugging Face Hub(模型ID:Qwen/Qwen3.8-Flash-Next)和 ModelScope 上公开发布。
要点
- Qwen3.8-Flash-Next 是 Qwen4 的架构预览版,团队延续了提前开放架构供社区审视的惯例,为后续完整系列奠定基础
- 模型采用 GDN+QSA 混合注意力、门控残差、N-gram 嵌入和改进版 Muon 优化器四项系统性升级,兼顾能力与效率
- 与 Qwen3.7-Plus 相比,训练成本降至约九分之一,编程和办公任务能力却更优,效率提升幅度显著
- 主体参数125B,每 token 激活6B,支持262144 token 超长上下文,已在 Hugging Face 和 ModelScope 开放权重下载
- 支持 SGLang、vLLM、Transformers 等主流框架部署,并已集成至 QwenWork 和 QwenCloud API 平台
原始标题:QwenLM/Qwen3.8-Flash-Next — Qwen3.8-Flash-Next is the foundation model developed by Qwen Team, Alibaba Group.
本文由 DataHub 基于公开来源整理,用于信息发现与摘要阅读;具体事实、数据和后续更新以原始来源为准。