AI资讯 / 产业

产业 / 媒体

DeepSeek V4 首个多模态模型开源,视觉 Agent 能力逼近 Opus-4.8

IT之家

2026 年 8 月 31 日,深度求索在 Hugging Face 上线并开源 DeepSeek-V4-Flash-Vision-Exp,采用 MIT License,这是 DeepSeek V4 系列首款原生支持图片输入的多模态模型。开源内容涵盖模型文件、Tokenizer、Prompt Encoding 参考实现及最小化 PyTorch 推理实现,核心模块包括视觉编码器、Aligner、DFlash Attention、MoE、Hyper-Connections 与 DSpark。该模型于 2026 年 8 月 21 日率先上线 DeepSeek API 平台,官方标注为实验版本。它支持 JPEG、PNG、GIF、WebP 四种图片格式,可完成图片描述、截图文字识别、图表分析等视觉任务。在纯文本的 Agent、推理与世界知识任务上,该模型与 V4-Flash 正式版持平;在视觉理解 Agent 基准测试中则大幅领先前代,多模态 Agent 能力已接近 Anthropic 的 Opus-4.8。

深度求索于 2026 年 8 月 31 日将 DeepSeek-V4-Flash-Vision-Exp 正式推送至 Hugging Face,并以 MIT License 完整开源。这是 DeepSeek V4 系列迈入多模态领域的第一步,也是继 V4-Flash 纯文本版本之后,官方首次为该系列引入原生视觉能力。模型早在 8 月 21 日便已通过 DeepSeek API 平台对外提供服务,此次开源则让开发者可以在本地自由部署与二次开发。

此次开源内容相当完整,涵盖模型权重文件、Tokenizer 配置、Prompt Encoding 参考实现,以及一套最小化的 PyTorch 推理实现。核心技术模块包括视觉编码器、Aligner 对齐层、DFlash Attention 高效注意力机制、混合专家架构 MoE、Hyper-Connections 超连接结构,以及 DSpark 分布式推理组件。这套完整的模块化实现为研究人员提供了深入理解模型内部机制的窗口。

在视觉能力方面,DeepSeek-V4-Flash-Vision-Exp 支持 JPEG、PNG、GIF、WebP 四种主流图片格式,能够执行图片内容描述、截图文字识别(OCR)、图表数据分析等多类视觉理解任务。用户可在对话中直接混合输入文本与图片,模型将对两种模态的信息进行联合理解与推理,从而支持更贴近真实工作场景的复合型任务。

性能评测方面,官方数据显示,该模型在 Agent 调用、逻辑推理、世界知识等纯文本基准上与 V4-Flash 正式版保持同等水平,原有的文本能力优势未受视觉模块引入的影响。而在需要视觉理解的 Agent 基准测试中,V4-Flash-Vision-Exp 相较 V4-Flash 实现了大幅提升,多模态 Agent 综合能力已接近 Anthropic 的 Opus-4.8,展现出较强的竞争力。

深度求索官方强调,V4-Flash-Vision-Exp 在各类 Agent 框架内具备良好的多模态适配能力,能够配合多样化的 Agent 工具链落地更多实用工作场景,例如自动化截图分析、视觉辅助代码调试、图表驱动的数据报告生成等。尽管当前版本仍为实验性质,但其开源策略与接近顶级闭源模型的视觉 Agent 表现,预计将吸引大量开发者在此基础上构建多模态应用。

要点

  • DeepSeek-V4-Flash-Vision-Exp 是 V4 系列首款多模态模型,以 MIT License 在 Hugging Face 完整开源,包含核心推理模块代码。
  • 模型支持 JPEG、PNG、GIF、WebP 图片输入,可完成图片描述、OCR 识别、图表分析等视觉任务。
  • 纯文本任务表现与 V4-Flash 正式版持平,视觉 Agent 基准大幅提升,多模态 Agent 能力已接近 Anthropic Opus-4.8。
  • 当前版本为官方标注的实验性版本,已于 2026 年 8 月 21 日率先上线 DeepSeek API 平台供开发者调用。
查看原始来源

原始标题:DeepSeek-V4-Flash-Vision-Exp 模型已开源,多模态 Agent 能力接近 Opus-4.8

本文由 DataHub 基于公开来源整理,用于信息发现与摘要阅读;具体事实、数据和后续更新以原始来源为准。