产业 / 媒体
豆包大模型 2.1 Pro 推出 0915 版本,Agent 可靠性与多模态编程能力全面升级
火山引擎于 9 月 16 日正式发布豆包大模型 2.1 Pro 的 0915 版本,API 已全量上线火山方舟平台。此次升级聚焦企业生产级场景,在 Agent 任务交付、多模态 Coding、多模态理解与 Token 效率四个维度均有显著改进。Agent 层面,模型强化了证据溯源与权威信源检索能力,幻觉率明显下降,在金融投研、办公自动化等长报告场景中可产出有据可查的专家级分析底稿。多模态 Coding 方面,模型借助 VLM 能力直接解析设计稿与操作录屏,将视觉信息转化为前端代码或游戏逻辑。视频与图像理解能力同步增强,可跨帧定位证据、识别 CAD 工件及 AR 空间元素。Token 消耗方面,图像与视频推理较上一代减少 30% 以上,有效降低高频场景的使用成本。TRAE 及 Doubao-Seed-Evolving 已同步接入该版本,企业无需更换 API 节点。
火山引擎于 2026 年 9 月 16 日宣布,豆包大模型 2.1 Pro 正式更新至 0915 版本,API 已全量上线火山方舟。用户在豆包客户端升级至最新版后,选择「豆包 2.1 Pro(0915 新版)」模型即可体验。与此同时,AI 编程工具 TRAE 及今年 6 月推出的 Doubao-Seed-Evolving 均已同步接入该版本,企业用户无需更换现有 API 接入节点,迁移成本几乎为零。
在 Agent 任务交付层面,0915 版本重点强化了证据溯源、权威信源检索、时效判断与数据核验四项能力,模型幻觉率显著降低,工具调用结果更加忠实可靠。以金融投研场景为例,模型具备分析师级别的研究框架,能够自主拆解研究需求、查询高质量数据源并完成建模分析,最终产出专家级建模底稿,结论均有明确数据支撑,适合对准确性要求极高的企业级长报告任务。
多模态 Coding 能力在本次升级中得到全面进化。模型对复杂代码仓库的理解能力增强,面对跨文件、长程依赖问题时,能够梳理项目结构与模块关系、精准定位根因并完成修复,覆盖从需求理解到运行验证的完整端到端流程。借助 VLM(视觉语言模型)能力,模型还可直接读取设计稿、工程图纸和操作录屏,将视觉信息转化为前端代码或游戏逻辑,Web 3D 开发与游戏场景的呈现效果因此得到提升。
多模态理解方面,视频推理能力显著增强,模型可在视频中定位关键证据帧、跨帧整合信息后作答,也能对照标准操作规程(SOP)识别操作步骤并解释背后原理。物理教学、工程实验、医疗操作等专业领域的视频内容理解精度提高,视频标注、内容质检、长视频剪辑与定位摘要等下游场景均可从中受益。图像理解方面,模型新增对 CAD 工件、游戏引擎 3D 元素及 AR 空间的识别能力,工程图纸公差符号、财报表格跨页引用等密集图文场景的处理精度也有所提升。
Token 效率优化是本次更新的另一亮点。0915 版本在降低推理轮次与工具调用次数的同时,图像推理和视频推理的 Token 消耗较上一代减少 30% 以上。对于看图解题、图像质检、视频审核等调用频率较高的场景,这一优化意味着可观的成本节省,有助于企业在大规模部署时控制整体推理费用。
要点
- 豆包大模型 2.1 Pro 0915 版本已全量上线火山方舟,TRAE 与 Doubao-Seed-Evolving 同步接入,企业无需更换 API 节点。
- Agent 任务交付能力升级,幻觉率下降,金融投研等长报告场景可产出有据可查的专家级分析底稿。
- VLM 能力加持多模态 Coding,模型可直接解析设计稿与录屏并生成前端代码或游戏逻辑,端到端开发流程更完整。
- 视频与图像理解全面增强,支持跨帧推理、CAD 工件识别及密集图文处理,覆盖医疗、工程、内容审核等专业场景。
- 图像与视频推理 Token 消耗较上一代降低逾 30%,高频调用场景的使用成本显著下降。
原始标题:豆包大模型 2.1 Pro 更新 0915 版本:Agent 交付更可靠,多模态 Coding 进化
本文由 DataHub 基于公开来源整理,用于信息发现与摘要阅读;具体事实、数据和后续更新以原始来源为准。