AI资讯 / 产业

产业 / 媒体

DeepSeek V4 Flash 新版本性能逼近 GPT-5.6 Luna,成本低六成

The Decoder

DeepSeek 于 2026 年 7 月 31 日发布了旗下预算级模型 V4 Flash 的重大更新版本「0731」。根据 Artificial Analysis 智能指数,新版本得分从此前的 40 分跃升至 50 分,与 OpenAI 的预算模型 GPT-5.6 Luna 仅相差 1 分。更值得关注的是,即便 OpenAI 已对 GPT-5.6 Luna 实施了 80% 的大幅降价,DeepSeek V4 Flash「0731」的每次任务成本仍比其低约 60%。这一价格优势的核心来源是 DeepSeek 高达 98% 的缓存折扣,远超行业普遍的 90% 水平。此外,新版本在所有测试类别中均有提升,尤其在智能体任务上进步最为显著,同时幻觉率也有所下降,模型权重以 MIT 许可证形式在 Hugging Face 上公开发布。

DeepSeek 在 2026 年 7 月底推出了 V4 Flash「0731」更新,这是其预算级 AI 模型自 2026 年 4 月首发以来最重要的一次升级。根据 Artificial Analysis 智能指数的评测,新版本得分达到 50 分,较上一版本提升了整整 10 分,在价格性能比榜单上跃居首位,引发业界广泛关注。

在与 OpenAI 的横向对比中,DeepSeek V4 Flash「0731」仅比 GPT-5.6 Luna 低 1 分,但成本差距却相当悬殊。即便 OpenAI 已对 GPT-5.6 Luna 进行了 80% 的降价处理,DeepSeek 的每次任务成本仍低约 60%。这一差距的关键在于 DeepSeek 提供高达 98% 的缓存折扣,而行业普遍水平仅为 90%,这使其在高频调用场景下具备显著的经济优势。

从性能提升的具体维度来看,新版本在智能体任务上的进步最为突出。在专门用于测试复杂真实办公场景的 GDPval 基准测试中,模型得分从 1189 Elo 分大幅攀升至 1559 Elo 分,涨幅超过 30%。与此同时,模型的幻觉率也有所降低,整体可靠性进一步提升,适用场景得到拓展。

在 token 效率方面,新版本比前代减少了 12% 的 token 消耗,这意味着在处理相同任务时所需的计算资源更少,进一步压低了实际使用成本。对于需要大规模部署 AI 能力的企业用户而言,这一改进在长期运营中将带来可观的成本节约。

模型的底层架构保持不变,仍采用 2840 亿总参数、130 亿激活参数的混合专家架构,并支持 100 万 token 的超长上下文窗口。模型权重以 MIT 许可证形式在 Hugging Face 平台上公开发布,开发者和研究人员可自由下载使用,这也延续了 DeepSeek 一贯的开放策略。

此次更新再度印证了 DeepSeek 在预算级 AI 模型领域的竞争力。在顶级闭源模型持续降价的背景下,DeepSeek 依然能够以更低成本提供接近前沿水平的性能,这对整个 AI 行业的定价体系和竞争格局都构成了持续压力。

要点

  • DeepSeek V4 Flash「0731」在 Artificial Analysis 智能指数上得分 50 分,与 OpenAI GPT-5.6 Luna 仅差 1 分,但每次任务成本低约 60%。
  • 98% 的缓存折扣是 DeepSeek 实现超低成本的核心机制,远高于行业普遍的 90% 水平。
  • 新版本在智能体任务上进步最大,GDPval 基准得分从 1189 跃升至 1559 Elo 分,幻觉率同步下降。
  • 模型 token 消耗较前代减少 12%,进一步降低高频使用场景下的实际成本。
  • 模型权重以 MIT 许可证在 Hugging Face 公开发布,延续 DeepSeek 的开源开放策略。
查看原始来源

原始标题:New Deepseek Flash model matches OpenAI's GPT-5.6 Luna at roughly 60 percent lower cost

本文由 DataHub 基于公开来源整理,用于信息发现与摘要阅读;具体事实、数据和后续更新以原始来源为准。