Agent / 分析
763B参数全新因果编解码架构,巨鲸归来
DeepSeek于2026年9月10日发布V4.1-Flash,尽管版本号看似只是小幅迭代,但其背后是一次彻底的架构重构。该模型采用全新因果编解码器设计,总参数量达763B,预填充阶段激活8B参数,解码阶段激活16B参数,稀疏度仅为1-2%。模型支持100万token上下文、文本与图像混合输入,采用MIT开源协议,定价仅为每百万输入token 0.30美元。研究者Sebastian Raschka直言该模型应被命名为DeepSeek V5,认为其架构变化幅度远超0.1版本号所暗示的程度。在多项评测中,V4.1-Flash已超越此前旗舰V4 Pro 0813,并在Vals Index上跻身开源模型第一。DeepSeek在后训练方面也明确表态:提升数据质量的回报率已远超研发新算法,这一判断与学界主流观点高度吻合。
DeepSeek在过去一年多时间里刻意保持低调,将开源模型的聚光灯让给了GLM和Kimi等竞争对手。然而此次V4.1-Flash的发布,标志着这家以架构创新著称的实验室强势回归。从V2到V3再到V4,DeepSeek每次大版本之间都会发布聚焦单一架构改进的中间论文,命中率接近百分之百,涵盖数学推理、代码生成、强化学习等多个方向。
V4.1-Flash最核心的创新在于预填充与解码阶段的参数分离设计。输入处理阶段激活8B参数,输出生成阶段激活16B参数,总参数量达763B,由此形成了「763B-P8B-D16B」这一新的模型标注方式。这种极低的稀疏激活比例(约1-2%)结合滑动窗口注意力有界重放等新机制,使KV缓存占用降至V4 Flash的八分之一,对长时间运行的智能体任务而言意义重大。
在基准测试表现上,V4.1-Flash在Artificial Analysis智能指数上得分40分,略低于GLM-5.3-Flash但超越最新版V4 Pro,同时在Vals Index上被评为开源模型第一,领先Kimi K3。值得注意的是,该模型每次测试成本仅0.30美元,是开源前十中最便宜的选项。Baseten在发布当天即提供支持,Ollama也随后向多个付费计划用户开放访问。
此次发布另一个值得关注的信号来自DeepSeek在后训练策略上的公开表态。他们明确指出,在当前阶段,提升训练数据质量所带来的收益已远超研发新型后训练算法。这一判断与清华大学唐杰教授等学界人士的观点高度一致,也反映出整个大模型领域在工程实践上的重心正在悄然转移。
从更宏观的视角来看,V4.1-Flash的发布方式本身就是一种信息传递策略。DeepSeek选择用一个低调的版本号包装一次架构级别的彻底革新,既退役了V4 Pro,又引入了原生视觉理解能力,却没有为视觉单独发布一个模型。研究者们普遍认为,当前的公开基准测试尚无法充分衡量DeepSeek真正追求的目标——对上下文最具创造性和效率的利用方式。这场「巨鲸归来」,远比版本号所呈现的更具分量。
要点
- V4.1-Flash采用全新因果编解码器架构,预填充激活8B、解码激活16B参数,KV缓存占用降至前代的八分之一,大幅提升长上下文智能体任务效率
- 尽管版本号仅为0.1升级,该模型实为架构级重构,多位研究者认为其变化幅度足以称为DeepSeek V5
- 模型定价极具竞争力,每百万输入token仅0.30美元,在Vals Index开源排行中位列第一,超越Kimi K3
- DeepSeek公开表态:当前阶段提升数据质量的回报率已远超研发新型后训练算法,标志着研发重心的战略性转移
- 模型原生支持视觉输入、100万token上下文,采用MIT协议开源,发布首日即获Baseten和Ollama等平台支持
原始标题:[AINews] DeepSeek v4.1-Flash: 763B-P8B-D16B novel causal Encoder–Decoder architecture with vision marks the Return of the Whale
本文由 DataHub 基于公开来源整理,用于信息发现与摘要阅读;具体事实、数据和后续更新以原始来源为准。