AI资讯 / 产业

产业 / 媒体

阿里巴巴发布Qwen3.8-Flash-Next,以九分之一训练成本超越DeepSeek与Claude

The Decoder

阿里巴巴Qwen团队发布了Qwen3.8-Flash-Next,这是一款多模态混合专家模型,同时作为Qwen4架构的预览版本。该模型拥有1250亿总参数,但每个token仅激活60亿参数,并引入了一个包含510亿参数的N-gram嵌入层,该层可存储于系统内存而非GPU显存,大幅降低硬件压力。Qwen团队表示,Flash-Next的训练成本约为Qwen3.7-Plus的九分之一,却在编程和办公任务基准测试中超越了参数规模更大的DeepSeek-V4-Flash(2840亿参数)和Anthropic的Claude Opus 4.6。在定价方面,该模型通过QwenCloud以每百万输入token 0.16美元、每百万输出token 0.47美元的价格提供服务,约为旗舰版Qwen3.8-Max的十二分之一,持续向OpenAI和Anthropic施加价格压力。

阿里巴巴Qwen团队推出的Qwen3.8-Flash-Next是一款多模态混合专家(MoE)模型,总参数量达1250亿,但每个token的推理过程仅激活其中60亿参数。这种稀疏激活机制使模型在保持强大能力的同时,大幅压缩了计算开销。该模型原生支持262,144个token的上下文窗口,并可通过YaRN技术扩展至100万token,技术报告已发布于GitHub,权重文件可在Hugging Face和ModelScope上获取。

Flash-Next最引人注目的架构创新之一是N-gram嵌入层。这一层拥有510亿参数,通过将常见词组作为独立条目存储在类似「短语词典」的结构中,为网络提供短语级别的语义信息。与传统参数不同,该层可运行于系统内存而非GPU显存,额外成本相对较低。这一设计被列为Qwen4架构的核心创新之一,也是本次发布作为架构预览的重要意义所在。

在基准测试表现上,Qwen3.8-Flash-Next在编程和办公任务中展现出显著优势。在自主代码修复基准DeepSWE上,Flash-Next得分58.7,超越DeepSeek-V4-Flash的54.4和Claude Opus 4.6;在SWE-bench Pro上以62.5分领先;在办公协作基准CoWorkBench上更以73.9分大幅领先DeepSeek-V4-Flash的45.1分。在职业工作流测试JobBench上,Flash-Next得分55.7,几乎是Qwen3.7-Plus(27.6分)的两倍。

在科学推理(GPQA Diamond:91.7分)和竞技编程(LiveCodeBench v6:91.9分)等高难度任务上,Flash-Next与竞争对手表现相近,差距不大。Claude Opus 4.6仅在「人类最后考试」(HLE)这一极难多学科测试中以40.0分领先,但该模型本身是Anthropic于2026年2月发布的较早版本。值得注意的是,基准测试成绩与实际应用表现之间始终存在差距,需结合具体场景综合评估。

在定价策略上,Qwen3.8-Flash-Next通过QwenCloud提供商业服务,输入价格为每百万token 0.16美元,输出价格为每百万token 0.47美元,约为旗舰版Qwen3.8-Max(输入2.00美元、输出6.00美元)的十二分之一。这种激进定价持续向OpenAI和Anthropic施压。OpenAI近期已对GPT-5.6系列大幅降价以应对竞争,但这对AI服务商维持高速营收增长、支撑投资叙事构成了不小的挑战。

要点

  • Qwen3.8-Flash-Next采用1250亿总参数、每token仅激活60亿的MoE架构,训练成本约为Qwen3.7-Plus的九分之一
  • 新引入的N-gram嵌入层(510亿参数)可运行于系统内存而非GPU,是Qwen4架构的核心预览创新
  • 在编程和办公任务基准上,Flash-Next超越参数规模更大的DeepSeek-V4-Flash和Claude Opus 4.6
  • 商业定价为输入0.16美元、输出0.47美元(每百万token),约为自家旗舰版的十二分之一,持续压低行业价格基准
  • 该模型支持最长262,144 token原生上下文,通过YaRN可扩展至100万token,适合长文档和复杂代理任务
查看原始来源

原始标题:Alibaba releases Qwen3.8-Flash-Next, targeting "ultimate cost efficiency"

本文由 DataHub 基于公开来源整理,用于信息发现与摘要阅读;具体事实、数据和后续更新以原始来源为准。