产业 / 官方
Google DeepMind 发布 Gemini 3.7 Flash:编程与智能体任务性能大幅跃升
Google DeepMind 于2026年8月13日正式推出 Gemini 3.7 Flash,定位为面向编程与智能体场景的最强「主力模型」。新版本在软件工程、网页开发和知识密集型工作流上均取得显著提升:在 FrontierCode 1.1 基准测试中,首次代码通过率从34.4%升至43.6%;在 DeepSWE v1.1 上从49.0%跃升至65.3%。网页开发方面,3.7 Flash 在 Arena.ai WebDev Arena 的 Elo 评分达到1588,超越前代的1538。针对金融、法律、生命科学等知识密集领域,模型在 GDP.pdf 基准上的得分从22.0%大幅提升至34.0%,在 AutomationBench 上也从17.0%升至30.4%。与此同时,3.7 Flash 以半价策略上市,输入价格为每百万 token 0.75美元,输出为3.75美元,优惠期持续至2026年底。
Gemini 3.7 Flash 是 Google DeepMind 在 Gemini 3.6 Flash 发布仅三周后推出的新一代主力模型,主要面向编程自动化与智能体工作流场景。官方表示,此次快速迭代源于开发者反馈与算法层面的持续创新,相关技术改进也将延续至未来版本。新模型在多项权威基准测试中均超越前代,标志着 Flash 系列在性能与成本效益之间取得了新的平衡。
在代码生成与软件工程领域,3.7 Flash 展现出明显优势。FrontierCode 1.1 Main 基准测试中,模型得分从34.4%提升至43.6%;DeepSWE v1.1 测试中则从49.0%跃升至65.3%,显示其在调试、问题定位和生产级代码生成方面的能力均有实质性进步。开发者反馈显示,新模型在多步骤规划和工具调用上更为严谨,减少了人工干预和重试次数,整体工程效率得到提升。
网页开发是 3.7 Flash 的另一大亮点。模型能够在更少的提示轮次内生成功能完整的布局与应用,并在 UI 生成任务中对参考输入(截图、图片或完整设计系统)保持高度还原度。在 Arena.ai 的 WebDev Arena 评测中,3.7 Flash 以1588的 Elo 评分超越 3.6 Flash 的1538,进一步巩固了其在前端智能生成领域的竞争力。官方演示中,模型已能从单一文本提示生成可交互的3D游戏场景和动态落地页。
在金融、法律、生命科学等知识密集型领域,3.7 Flash 同样表现突出。GDP.pdf 基准测试专门考察模型处理复杂文档的能力,3.7 Flash 得分从22.0%大幅提升至34.0%。AutomationBench 测试则衡量模型完成真实商业工作流的能力,新版本得分从17.0%升至30.4%,表明其在企业级自动化场景中具备更强的实用价值。这些提升使模型在处理年报分析、合规审查等复杂任务时更加可靠。
定价策略方面,3.7 Flash 以极具竞争力的价格入市:输入价格为每百万 token 0.75美元,输出为3.75美元,约为 3.6 Flash 原始定价的一半,优惠期持续至2026年12月31日。2027年1月起,价格将调整为输入1.50美元、输出7.50美元。此外,3.7 Flash 已集成至 Gemini Spark 个人智能体,为 Google AI Pro 和 Ultra 用户提供全天候的 Workspace 工作流支持,涵盖文件整合、邮件起草和状态文档更新等场景。
安全性方面,3.7 Flash 随版本更新强化了针对化学、生物、放射性及核武器(CBRN)领域滥用的防护机制,同时升级了网络攻击防御能力,并在保障安全的前提下支持合规的有益用途。开发者可通过 Google AI Studio、Android Studio 及 Gemini API 立即体验新模型;企业用户可通过 Gemini Enterprise Agent Platform 接入;个人用户则可在 Gemini 应用的 Spark 智能体中使用。
要点
- Gemini 3.7 Flash 在 FrontierCode 和 DeepSWE 等编程基准上大幅超越前代,首次代码通过率和问题解决能力均有显著提升。
- 网页开发与 UI 生成能力增强,WebDev Arena Elo 评分达1588,能在更少提示轮次内生成功能完整的应用。
- 知识密集型工作流表现突出,GDP.pdf 基准得分提升55%,AutomationBench 得分提升近80%,适用于金融、法律等专业场景。
- 上市价格为 3.6 Flash 的一半,优惠期至2026年底,为大规模生产部署提供更高性价比。
- 已集成至 Gemini Spark 个人智能体,并强化了 CBRN 和网络安全领域的防护机制。