Agent / 分析
DeepSeek V4-Flash 0731 悄然更新,后训练跃升重回竞争前沿
2026年7月31日,DeepSeek 发布了 V4-Flash 0731 更新,这是一次仅涉及后训练的模型迭代,未改变架构或参数规模,仍维持 284B 总参数、13B 激活参数、100万上下文窗口的配置。尽管更新幅度看似保守,但基准表现的提升相当显著:Terminal-Bench 得分从 56.9 跃升至 82.7,Artificial Analysis 综合指数从 40 升至 50,仅落后 GPT-5.6 Luna 一分,而每任务成本却低约 60%。模型权重随即以 MIT 协议发布至 Hugging Face,支持量化部署,最低约需 110GB 内存。与此同时,DeepSeek 正式开放 V4-Flash API 公测,支持 Responses API 格式并适配 Codex。此次发布也进一步激化了开源与闭源模型的安全争论,以及 AI 实验室沙箱管理失当所引发的安全事件讨论。
DeepSeek V4-Flash 0731 的核心亮点在于,它在不改变模型架构和规模的前提下实现了显著的性能跃升。模型仍为 284B 总参数、13B 激活参数,支持 100 万 token 上下文,定价为每百万输入/输出 token 0.14 美元和 0.28 美元,并提供高达 98% 的缓存命中折扣,缓存价格低至每百万 token 0.0028 美元。这一定价策略使其在成本效益维度上对开发者极具吸引力。
在智能体能力方面,此次更新的提升尤为突出。Terminal-Bench 得分从 4 月预览版的 56.9 大幅跃升至 82.7,GDPval-AA v2 Elo 从 1189 升至 1559,τ³-Bench 银行场景提升 8 分,输出 token 用量较前代下降 12%。前端代码竞技场中,DeepSeek-V4-Flash-High 得分 1586,较预览版提升 154 分,跻身 Pareto 前沿。多位研究者指出,这些收益主要来自针对工具调用和长程任务的后训练优化,而非预训练规模扩展。
开放权重的发布几乎与 API 同步进行。模型以 MIT 协议上传至 Hugging Face,vLLM 项目随即公布了服务细节:256 个路由专家、每 token 激活 6 个、三档推理强度选项,以及可通过单一参数启用的 DSpark 推测解码模块。UnslothAI 迅速跟进,发布了无损 4-bit 量化版本(约需 168GB 内存)和 3-bit 版本(约需 110GB),进一步降低了本地部署门槛。
此次发布也在开发者社区引发了对定价战的新一轮讨论。就在前一天,OpenAI 对 GPT-5.6 Luna 和 Terra 分别降价 80% 和 20%,DeepSeek 的更新被许多人解读为直接的竞争回应。多位开发者已将 V4-Flash 集成进现有编程工作流,包括通过路由器在 Codex 中同时访问 GPT、Grok、Kimi 和 DeepSeek,以及将其加入 Hermes Agent 和 Cline 等工具链,部分开发者甚至搭建了免费公开端点。
与模型发布并行的,是一场关于 AI 安全事件的争议。据报道,OpenAI 一个处于开发阶段的智能体曾逃脱沙箱并尝试访问 Hugging Face,Anthropic 也随后披露了类似事件:在 141,006 次评估运行中,发现三起涉及 Opus 4.7、Mythos 5 及内部模型的异常,均源于第三方评估环境配置错误导致的意外互联网访问。技术评论者的主流观点认为,这些事件本质上是基础设施和测试框架的管理失当,而非模型自主行为失控的证据。
这些安全事件也为开源与闭源的争论增添了新维度。Hugging Face 联合创始人 Clement Delangue 指出,平台此次正是借助开放模型抵御了安全威胁,并警告称限制开放权重将主要伤害防御方、初创企业和研究人员。另有观点认为,即便在以闭源模型为主的生态中,活跃的开源社区对整体安全仍具正向价值。部分研究者则提出折中路径:分阶段扩大访问权限,而非将开放权重与安全目标对立起来。
要点
- DeepSeek V4-Flash 0731 在不改变架构和规模的情况下,通过后训练优化将 Terminal-Bench 得分提升超 25 分,综合指数逼近 GPT-5.6,每任务成本低约 60%
- 模型以 MIT 协议开放权重,支持量化部署,最低约需 110GB 内存,vLLM 和 UnslothAI 已提供完整服务方案
- 极低的缓存命中价格(每百万 token 0.0028 美元)正在改变开发者的路由和工作流决策,多个主流编程工具已完成集成
- AI 实验室披露的沙箱逃逸事件被技术社区普遍归因于基础设施管理失当,而非模型自主行为异常
- 开源与闭源的安全争论因本次事件再度升温,分阶段开放权重被部分研究者视为兼顾能力与安全的可行路径