AI资讯 / 产业

产业 / 媒体

DeepSeek发布实验性多模态Flash视觉模型,智能体基准测试逼近Opus 4.8

The Decoder

中国AI公司DeepSeek于2026年8月21日发布了实验性多模态模型V4-Flash-Vision-Exp,在V4-Flash文本能力基础上新增图像理解功能。根据DeepSeek内部多模态智能体基准测试,该视觉版本在部分任务上已接近甚至超越Anthropic的Opus 4.8。模型支持JPEG、PNG、GIF和WebP格式,能够描述图像、从截图中提取文字并分析图表,定位于视觉智能体工作流场景。在API层面,该模型兼容OpenAI的Chat Completions与Responses API以及Anthropic的Messages端点,并与DeepSeek同步发布的Harness框架0.1.1版本原生适配。图像处理方面,每张图片最多消耗384个token,定价与V4-Flash保持一致,单次请求最多可包含600张图片,为开发者提供了较高的灵活性。

DeepSeek正式推出实验性多模态模型V4-Flash-Vision-Exp,该模型在V4-Flash原有文本推理与世界知识能力的基础上,新增了图像处理功能。DeepSeek表示,视觉能力的引入并未对基础模型的文本性能造成明显影响。在公司内部的多模态智能体基准测试中,这一视觉版本的得分已接近Anthropic的Opus 4.8,在部分任务上甚至能够超越后者,展示出较强的竞争力。

从定位来看,DeepSeek将V4-Flash-Vision-Exp主要面向基于智能体的应用场景。模型设计上支持与多种智能体框架协同工作,能够将视觉理解与工具调用相结合。实际使用中,它可以描述图像内容、从截图中提取文字、分析图表结构。值得注意的是,模型通过读取文件实际内容来判断图像格式,而非依赖文件名或声明的MIME类型,这在一定程度上提升了处理的鲁棒性。

在API兼容性方面,V4-Flash-Vision-Exp支持OpenAI的Chat Completions和Responses API,同时也兼容Anthropic的Messages端点,为已在使用上述接口的开发者提供了低成本的迁移路径。与此同时,DeepSeek同步发布了Harness框架的0.1.1版本,该版本开箱即用地支持新模型,进一步降低了开发者的集成门槛。

图像输入方面,开发者可通过三种方式向模型发送图像:直接嵌入Base64编码、提供公开可访问的URL(最大32 MiB),或使用新推出的免费Files API。Files API允许开发者一次上传文件后通过ID在多次请求中复用,单文件上限为64 MiB。模型在处理前会自动将图像归一化至约800×800像素,并提供可选的「detail」字段将图像缩小至512×512像素以节省token消耗。

在资源限制与定价方面,无论原始分辨率如何,每张图像最多消耗384个token,定价与V4-Flash保持一致。单次请求最多可包含600张图像,每边最大像素为8192,但当请求中图像数量达到15张或以上时,最大边长将降至4096像素。图像目前仅能出现在用户消息中。这一系列设计在灵活性与成本控制之间取得了一定平衡,适合大规模视觉智能体应用的落地部署。

要点

  • DeepSeek-V4-Flash-Vision-Exp在保留原有文本推理能力的同时新增图像理解,在内部多模态智能体基准测试中已接近甚至超越Anthropic Opus 4.8。
  • 模型兼容OpenAI和Anthropic主流API端点,并与Harness框架0.1.1版本原生适配,开发者集成成本较低。
  • 图像输入支持Base64、URL和免费Files API三种方式,每张图像最多消耗384个token,定价与V4-Flash一致。
  • 单次请求最多支持600张图像,但图像数量超过15张后最大边长限制将从8192像素降至4096像素。
  • 该模型主要面向视觉智能体工作流,能够结合图像理解与工具调用,适用于截图文字提取、图表分析等场景。
查看原始来源

原始标题:Deepseek releases experimental Flash vision model that rivals Opus 4.8 on agent benchmarks

本文由 DataHub 基于公开来源整理,用于信息发现与摘要阅读;具体事实、数据和后续更新以原始来源为准。