AI资讯 / 产业

产业 / 媒体

谷歌六周内第三款轻量模型 Gemini 3.8 Flash 发布,旗舰级产品仍缺席

The Decoder

谷歌在 Gemini 3.7 Flash 发布仅三周后推出 3.8 Flash,这也是六周内第三款 Flash 系列模型。新模型分为通用推理编程版和专为网络安全设计的 3.8 Flash Cyber 两个版本。在长周期软件工程基准 DeepSWE v1.1 上,3.8 Flash 以 73.7% 的得分紧追 Claude Opus 5 的 74.0%,并大幅领先 Claude Sonnet 5(53.8%)和 GPT-5.6 Sol(72.7%)。定价方面,发布初期每百万输入 token 收费 0.75 美元、输出 3.75 美元,与前代持平,但 2027 年 1 月起将翻倍。值得注意的是,3.8 Flash 通过在复杂任务中运行额外推理步骤来提升性能,导致每项任务实际花费约 0.58 美元,较 3.7 Flash 的 0.40 美元上涨约 40%。与此同时,旗舰级产品 Gemini 3.5 Pro 和 Gemini 4 仍未现身。

谷歌于2026年9月2日正式发布 Gemini 3.8 Flash,距上一代 3.7 Flash 仅三周,是六周内推出的第三款 Flash 系列模型。此次发布包含两个版本:面向通用场景的推理与编程模型,以及专为防御性网络安全工作设计的 3.8 Flash Cyber。快速迭代的节奏引发外界讨论——这究竟是谷歌技术实力的体现,还是在旗舰模型 Gemini 3.5 Pro 和 Gemini 4 持续缺席背景下的注意力转移?新任 DeepMind 负责人 Koray Kavukcuoglu 明确表示,谷歌并非只追求性价比,仍致力于在原始能力上保持领先。

在性能表现上,Gemini 3.8 Flash 在长周期软件工程基准 DeepSWE v1.1 上取得 73.7% 的成绩,仅略低于 Claude Opus 5 的 74.0%,但显著领先于 Claude Sonnet 5(53.8%)、GPT-5.6 Sol(72.7%)以及前代 3.7 Flash(65.3%)。第三方评测机构 Artificial Analysis 给出的智能指数为 59 分,比 3.7 Flash 高出 3 分,与 GPT-5.6 Sol 和 Grok 4.6 持平。性能提升主要来自工具调用和编程等智能体任务上的强化表现。此外,谷歌还展示了该模型通过单条提示词在 Antigravity 工具中生成完整 3D 游戏的能力。

定价策略上,3.8 Flash 发布初期每百万输入 token 收费 0.75 美元、输出 3.75 美元,与 3.7 Flash 相同。2027 年 1 月起将分别涨至 1.50 美元和 7.50 美元。即便涨价后,仍远低于 Claude Opus 5(输入 5 美元、输出 25 美元)和 GPT-5.6 Sol(输入 4 美元、输出 20 美元)。然而,谷歌坦承性能提升部分源于模型在复杂任务中会自动运行额外推理步骤并迭代调用工具,即「更努力工作」,这导致 token 消耗量上升约 30%,每项任务实际成本从 0.40 美元增至 0.58 美元,涨幅约 40%。

对于追求计算效率的开发者,谷歌建议降低推理级别或继续使用 3.7 Flash。在高推理级别下,3.8 Flash 每秒可生成约 300 个输出 token,平均每项任务耗时 2.5 分钟,略慢于 Claude Fable 5.1 的 2.1 分钟和 3.7 Flash 的 2.2 分钟;切换至低推理级别后,耗时可降至约 48 秒。模型现已通过 Google AI Studio、Antigravity、Android Studio 向开发者开放,企业用户可通过 Gemini Enterprise 接入,消费者则可在 Gemini 应用及谷歌搜索 AI 模式中使用。

网络安全专版 Gemini 3.8 Flash Cyber 不对公众开放,仅通过 Fairwind 计划向政府机构、关键基础设施运营商和软件维护者分发,并采用比标准版更宽松的安全设置以适应防御性安全工作需求。在检测 C/C++ 漏洞的行业标准基准 CyberGym 上,3.8 Flash Cyber 以 86.2% 的得分超越 GPT-5.6 Sol(83.6%)和前代 3.5 Flash Cyber(77.5%)。在抵御提示词注入攻击方面,该模型在 Gray Swan IPI 基准上的攻击成功率仅为 5.5%,仅次于 Claude Opus 5 的 4.8%,远优于 DeepSeek V4 Pro(60.1%)和 Grok 4.6(51.8%)。

要点

  • Gemini 3.8 Flash 是谷歌六周内推出的第三款 Flash 模型,在编程基准上以 73.7% 的得分逼近 Claude Opus 5 的 74.0%,同时定价远低于竞品
  • 模型通过增加推理步骤提升性能,导致每项任务实际成本较前代上涨约 40%,谷歌建议效率优先场景继续使用 3.7 Flash
  • 网络安全专版 3.8 Flash Cyber 在漏洞检测和抗提示词注入方面表现突出,但仅向经审核的政府及关键基础设施机构开放
  • 旗舰级产品 Gemini 3.5 Pro 和 Gemini 4 仍未发布,外界对谷歌快速迭代轻量模型的战略意图存在分歧
查看原始来源

原始标题:Gemini 3.8 Flash is Google's third budget model in six weeks while frontier models remain MIA

本文由 DataHub 基于公开来源整理,用于信息发现与摘要阅读;具体事实、数据和后续更新以原始来源为准。