产业 / 媒体
支持85种语言实时转录,自动纠正口误
谷歌正式推出语音转文字模型 Gemini 3.5 Transcribe,支持超过85种语言的自动识别,能够实时过滤语气词、纠正口误并自动格式化文本。在性能指标上,流式转录的词错率为4.0%,录音音频的词错率降至2.6%,整体延迟较前代模型 Chirp 3 降低70%。该模型提供两种接口:Live API 专为超低延迟的实时流式场景设计,Interactions API 则处理录音音频并支持说话人归属与时间戳标注。此外,模型通过「函数调用」机制可将图像生成、网络搜索等任务移交给其他 Gemini 模型协同完成。目前 Gemini 3.5 Transcribe 已在 Google AI Studio 和 Gemini 企业智能体平台上线,并已集成至 Android 版 Gboard 和 macOS 版 Gemini 应用,Chrome 支持也即将到来。
谷歌于2026年8月27日正式发布 Gemini 3.5 Transcribe,这是一款面向实时转录场景的语音转文字模型。该模型能够自动识别超过85种语言,无需用户手动切换,同时具备过滤「嗯」「啊」等语气词、纠正口误以及自动格式化输出文本的能力,大幅降低了后期人工校对的成本。
在准确率方面,谷歌公布的数据显示,Gemini 3.5 Transcribe 在流式转录模式下的词错率为4.0%,处理预录音频时词错率进一步降至2.6%。与前代模型 Chirp 3 相比,整体延迟降低了70%,这对于会议记录、实时字幕等对响应速度要求较高的应用场景具有重要意义。
该模型提供两套独立接口以适配不同使用场景。Live API(gemini-3.5-transcribe-live)专为超低延迟的实时流式转录设计,适合直播、实时会议等场合;Interactions API(gemini-3.5-transcribe)则针对录音音频处理进行优化,支持说话人归属识别与精确时间戳标注,便于后期内容整理与检索。
Gemini 3.5 Transcribe 还引入了「函数调用」机制,使其能够在转录过程中识别特定指令,并将图像生成、网络搜索等延伸任务动态移交给其他 Gemini 模型处理。这一设计将语音转录从单一功能扩展为多模型协作的入口,为构建更复杂的 AI 智能体工作流提供了基础能力。
在产品落地层面,Gemini 3.5 Transcribe 已同步上线 Google AI Studio 和 Gemini 企业智能体平台,开发者可立即接入测试。消费端方面,该模型已通过「Rambler」功能集成至 Android 版 Gboard 输入法,并在 macOS 版 Gemini 应用中提供支持,Chrome 浏览器的集成支持也在计划之中,预计近期推出。
要点
- Gemini 3.5 Transcribe 支持超过85种语言自动识别,流式词错率4.0%,录音词错率2.6%,延迟较 Chirp 3 降低70%
- 模型提供 Live API 和 Interactions API 两套接口,分别针对实时流式转录与录音音频处理场景
- 通过函数调用机制,该模型可将图像生成、网络搜索等任务移交给其他 Gemini 模型,具备多模型协作能力
- 已集成至 Android 版 Gboard 和 macOS 版 Gemini 应用,Chrome 支持即将上线
原始标题:Google's Gemini 3.5 Transcribe turns speech to text in 85 languages while auto-correcting your verbal stumbles
本文由 DataHub 基于公开来源整理,用于信息发现与摘要阅读;具体事实、数据和后续更新以原始来源为准。