AI资讯 / 产业

产业 / 媒体

DeepSeek 推出多模态视觉实验模型,Agent 能力比肩 Opus-4.8

IT之家

深度求索正式宣布,多模态视觉理解实验模型 DeepSeek-V4-Flash-Vision-Exp 已上线 DeepSeek API 平台。该模型在保留原有纯文本能力的基础上,新增对图片输入的支持,可完成图片描述、截图文字识别、图表分析等任务,兼容 JPEG、PNG、GIF、WebP 四种格式。在视觉理解相关的 Agent Benchmark 测试中,该模型相较 V4-Flash 正式版实现大幅跃升,多模态 Agent 能力已接近 Anthropic 的 Opus-4.8。API 计费方面,图片按 token 换算,单张最多占 384 tokens,价格与 V4-Flash 保持一致。与此同时,Files API 同步开放且免费,用户可预先上传图片并通过 file_id 引用,有效节省重复请求的带宽消耗。目前该模型仍属实验性质,开发者可通过指定 model 参数直接调用。

深度求索于 2026 年 8 月 21 日宣布,旗下多模态视觉理解实验模型 DeepSeek-V4-Flash-Vision-Exp 正式上线 API 平台。这是继 V4-Flash 正式版之后,深度求索在多模态方向迈出的重要一步。该模型属于实验性质,开发者可通过在请求中设置 model 参数为 deepseek-v4-flash-vision-exp 来访问,无需额外申请权限。

在功能层面,V4-Flash-Vision-Exp 支持图文混合输入,能够对图片进行描述、识别截图中的文字内容以及解析各类图表数据,兼容 JPEG、PNG、GIF 和 WebP 四种主流图片格式。深度求索强调,该模型在纯文本能力方面与 V4-Flash 正式版保持同等水准,涵盖 Agent 调用、逻辑推理及世界知识等核心维度,确保多模态扩展不以牺牲文本性能为代价。

在 Agent 能力的横向对比中,V4-Flash-Vision-Exp 在需要视觉理解的 Agent Benchmark 上表现突出,相较 V4-Flash 正式版实现了显著跃升,综合多模态 Agent 能力已接近 Anthropic Claude 的 Opus-4.8 水平。深度求索表示,该模型在各类 Agent 框架内展现出良好的多模态适配能力,可帮助开发者借助多样化工具解锁更多实用工作场景。

API 调用方面,V4-Flash-Vision-Exp 支持 Chat Completions、Messages 和 Responses 三种格式,方便接入不同 Agent 工具链。图片传入支持 base64 内联、外部 URL 以及 Files API 三种方式。计费规则上,图片将转换为 token 后按量收费,单张图片最多占用 384 tokens,整体价格与 V4-Flash 模型保持一致,对现有用户的成本影响较小。

与模型同步上线的还有 Files API,该接口目前完全免费开放。用户可预先将图片上传至平台,后续请求中通过 file_id 进行引用,同一张图片在多次请求中无需重复上传,从而有效降低带宽消耗并提升调用效率。这一设计对于需要频繁处理相同图片素材的批量自动化场景尤为实用。

要点

  • DeepSeek-V4-Flash-Vision-Exp 为实验性多模态模型,支持图文混合输入,兼容四种主流图片格式
  • 在视觉 Agent Benchmark 上大幅超越 V4-Flash 正式版,多模态 Agent 能力接近 Anthropic Opus-4.8
  • 图片按 token 计费,单张最多 384 tokens,价格与 V4-Flash 一致,不额外增加使用成本
  • Files API 同步免费开放,支持预上传图片并通过 file_id 复用,节省重复请求带宽
查看原始来源

原始标题:DeepSeek V4-Flash-Vision-Exp 上线:开启多模态 API 服务,Agent 能力接近 Opus-4.8

本文由 DataHub 基于公开来源整理,用于信息发现与摘要阅读;具体事实、数据和后续更新以原始来源为准。