AI资讯 / 产业

产业 / 媒体

DeepSeek V4.1 Flash 正式接入国家超算互联网,性能全面超越 V4 Pro

IT之家

DeepSeek V4.1 Flash 模型于 2026 年 9 月 10 日正式上线国家超算互联网中心,用户可通过官网「模型服务」页面直接调用 API。该模型采用 552B 参数的混合专家(MoE)架构,并引入全新的 Causal-Encoder-Decoder 结构,输入激活参数仅 8B、输出激活 16B,在保持强大能力的同时显著降低推理成本。基准测试结果显示,V4.1 Flash 在多项指标上超越了包括 DeepSeek V4 Pro 在内的旗舰模型。在硬件资源占用方面,新模型对高带宽内存(HBM)的需求较上一代减少至四分之一,对 SSD 的需求减少至八分之一,KV Cache 的大幅压缩尤其有利于降低 Agent 类任务的运行成本,为企业级 AI 应用部署提供了更具竞争力的选择。

DeepSeek V4.1 Flash 模型于 9 月 10 日正式接入国家超算互联网中心,标志着这一新一代大模型开始面向国内用户提供公共算力服务。用户只需登录国家超算互联网官网,在首页进入「模型服务」页面,即可打开 V4.1 Flash 的 API 调用界面,无需自行搭建推理环境,大幅降低了使用门槛。

从架构层面看,V4.1 Flash 是一个拥有 552B 总参数的混合专家(MoE)模型,其最大亮点在于采用了全新的 Causal-Encoder-Decoder 非对称结构。输入端激活参数仅为 8B,输出端为 16B,这种设计使得单次推理所需的计算资源远低于同等规模的传统密集模型,在成本控制上具备明显优势。

在训练策略上,V4.1 Flash 引入了新的预训练方法,并经历了更大规模的强化学习后训练流程。这一组合使其在多项公开基准测试中超越了 DeepSeek V4 Pro 等旗舰模型,实现了以更低参数激活量达到更高智能水平的目标,进一步验证了 MoE 架构结合强化学习的技术路线的有效性。

硬件资源占用的大幅缩减是 V4.1 Flash 的另一核心竞争力。与上一代模型相比,新模型对高带宽内存(HBM)的需求降至四分之一,对 SSD 存储的需求降至八分之一。KV Cache 体积的显著压缩,意味着在相同硬件条件下可以支持更长的上下文或更高的并发请求量。

对于 Agent 应用场景而言,KV Cache 的优化尤为关键。在多轮对话或复杂任务链中,缓存命中费用通常占据总推理成本的较大比例。V4.1 Flash 通过大幅压缩 KV Cache 体积,直接降低了 Agent 类任务的单次调用成本,为构建自动化工作流和智能体应用的开发者提供了更具吸引力的经济模型。

此次接入国家超算互联网,也意味着 V4.1 Flash 获得了稳定的国内公共算力支撑。结合此前已披露的最高 60% 降价信息,DeepSeek 正在以性能与成本的双重优势,持续扩大其在国内外 AI 模型市场的影响力,并为后续可能推进的 IPO 进程积累更广泛的用户基础。

要点

  • DeepSeek V4.1 Flash 已正式上线国家超算互联网,用户可通过官网模型服务页面直接调用 API
  • 552B 参数 MoE 架构配合非对称 Causal-Encoder-Decoder 结构,推理成本显著低于同规模模型
  • 基准测试中全面超越 DeepSeek V4 Pro,HBM 需求降至上代四分之一,SSD 需求降至八分之一
  • KV Cache 大幅压缩,直接降低 Agent 类任务的运行成本,对企业级 AI 应用部署更为友好
查看原始来源

原始标题:DeepSeek V4.1 Flash 模型上线国家超算互联网

本文由 DataHub 基于公开来源整理,用于信息发现与摘要阅读;具体事实、数据和后续更新以原始来源为准。