AI资讯 / 产业

产业 / 官方

Google DeepMind 发布 Gemini 3.5 Transcribe:实时语音转文字精度大幅跃升

Google DeepMind

Google DeepMind 于2026年8月26日正式推出 Gemini 3.5 Transcribe,这是其迄今最精准的语音转文字模型,专为智能语音交互场景设计。与传统语音识别模型相比,该模型能直接将原始音频转换为准确、整洁且格式化的文本,有效应对背景噪音、专业术语和口语不流畅等挑战。根据 Artificial Analysis 的测评,模型在流式场景下词错率(WER)为4.0%,非流式场景下仅为2.6%,较上一代 Chirp 3 的最终转录时间缩短约70%。该模型已通过 Gemini API 向开发者开放公测,同时集成于 Gboard、Google Antigravity、Gemini macOS 应用及 Google AI Studio 等多个产品中,并计划即将登陆 Chrome 浏览器,让用户可在任意网页输入框中直接语音输入。

Gemini 3.5 Transcribe 的核心能力在于「智能转录」:模型能自动处理说话者的自我纠正(如将「周二开会——不,周三」正确记录为最终意图),过滤「嗯」「啊」等填充词,并对输出文本进行自动格式化。这一能力使其超越了单纯的语音识别范畴,更接近于理解说话者意图的智能助手。此外,模型还支持自定义词汇表,可识别行业专属术语和特殊拼写,满足医疗、法律、金融等垂直领域的专业需求。

在多语言与多说话人支持方面,Gemini 3.5 Transcribe 可自动检测并转录超过85种语言,无缝处理地区口音和方言差异,并支持实时语言切换。对于预录音频,模型可识别最多三位说话人并提供带时间戳的归因标注,三人以上的多说话人识别功能目前处于实验阶段。在 FLEURS 多语言基准测试中,流式模式 WER 为5.50%,非流式模式为5.04%,整体优于前代模型 Chirp 3。

面向开发者,Gemini 3.5 Transcribe 提供两种 API 接入方式:通过 Live API 使用 gemini-3.5-transcribe-live 实现亚秒级延迟的实时双向流式转录,适用于交互式语音应用;通过 Interactions API 使用 gemini-3.5-transcribe 处理预录音频,支持会议记录、通话日志分析等场景,并提供说话人归因和词级时间戳。Agora、LangChain、LiveKit、Pipecat、Vercel 等主流开发者平台已率先接入 Gemini Live API,帮助开发者快速构建高性能语音驱动界面。

在消费端产品层面,Gemini 3.5 Transcribe 已深度集成至多个 Google 产品。Android 端 Gboard 的新功能 Rambler 可将口述内容转化为格式整洁的文本,并支持语音编辑和风格调整。Google Antigravity 则结合屏幕上下文与对话历史,确保文件名、代理思路等专有内容的转录精度。在 Gemini macOS 应用中,用户可通过语音指令调用其他 Gemini 模型,完成本地文件摘要、跨应用文本复用或图像生成等复杂工作流。

从商业化路径来看,Gemini 3.5 Transcribe 目前已通过 Google AI Studio 和 Google Antigravity 向开发者开放公测,企业用户可通过 Gemini Enterprise Agent Platform 使用,并计划进入 Gemini Enterprise for Customer Experience 产品线。Vivo、Intellitek Health、Lingopal 等企业已对其延迟表现、识别准确率和语言覆盖范围给予积极评价。Chrome 浏览器的语音输入功能也在即将推出的计划之列,届时用户将可在任意网页表单中直接语音输入。

要点

  • Gemini 3.5 Transcribe 在非流式场景下词错率低至2.6%,较上代 Chirp 3 最终转录时间缩短约70%,树立了语音转文字新基准
  • 模型支持实时流式与预录音频两种 API 模式,开发者可通过 Gemini API 在 Google AI Studio 直接调用,快速构建语音代理、实时字幕和通话分析等应用
  • 智能转录能力涵盖口语纠错、填充词过滤、自定义词汇表和85种语言自动检测,显著降低垂直行业语音应用的开发门槛
  • 消费端已集成至 Gboard Rambler、Google Antigravity、Gemini macOS 应用等多个产品,Chrome 浏览器语音输入功能即将上线
  • Agora、LangChain、LiveKit 等主流开发者平台已完成接入,企业级部署通道同步开放
查看原始来源

原始标题:Intelligent transcription with Gemini 3.5 Transcribe

本文由 DataHub 基于公开来源整理,用于信息发现与摘要阅读;具体事实、数据和后续更新以原始来源为准。