AI资讯 / 产业

产业 / 官方

Gemini 3.8 文字转语音模型正式发布,支持无限自定义声音库

Google DeepMind

Google DeepMind 于2026年9月23日正式发布两款新文字转语音模型:Gemini 3.8 Flash TTS 与 Gemini 3.8 Flash-Lite TTS。前者专为深度创意导演与角色设计而生,支持通过自然语言提示从零创建全新声音,并可逐行控制表演节奏、情绪与口音;后者则针对大规模、高性价比场景优化,适用于配音、语音助手等高并发需求。两款模型均已接入 Google AI Studio、Gemini API、Gemini Enterprise、Gemini Notebook 及 Google Vids。在 Hume AI 语音设计基准测试中,Gemini 3.8 Flash TTS 以71.4分位列综合榜首,口音建模同样排名第一。模型还内置 SynthID 水印与 C2PA 凭证等安全机制,确保生成音频的可追溯性与合规性。

Google DeepMind 此次推出的两款模型标志着语音生成技术的重要跃升。Gemini 3.8 Flash TTS 定位于创意导演场景,开发者和内容创作者可通过自然语言描述,在超过100种语言和方言中从零构建专属声音角色——无论是喷火龙的低沉嗓音,还是带有特定地区腔调的旁白者,均可精准实现。该模型还支持逐行脚本控制,允许用户为每一句台词单独设定表演风格与情绪基调。

Gemini 3.8 Flash-Lite TTS 则面向规模化商业应用。该模型在保持高表现力的同时,针对大批量配音、音频内容生产及实时语音代理场景进行了成本效率优化。两款模型共同构成 Gemini Audio 家族的最新成员,延续了此前 3.5 Live Translate、3.5 Transcribe、3.8 Live 等模型的技术脉络,进一步完善了 Google 在音频 AI 领域的产品矩阵。

在声音定制能力方面,Gemini 3.8 Flash TTS 将可用声音库从30个原始预设扩展至近乎无限的自定义空间,并提供超过2000个生产就绪的声音供直接调用,覆盖墨西哥西班牙语、魁北克法语、苏格兰英语等区域变体。用户还可通过仅30秒的音频样本复制特定声音,系统内置同意验证机制以保护声音版权。即将上线的声音混音功能将支持对音色、音调、语速与口音进行细粒度调整。

在表演控制层面,两款模型均支持原生双人场景编排,创作者可从单一脚本出发,无缝导演多轮对话,同时保持两个声音的清晰分离与自然轮换。模型还支持脚本化声音爆发与回应词插入,例如笑声、叹气、惊呼以及「嗯」「对」等倾听反馈,为播客、有声书和互动媒体提供更真实的对话质感。长篇内容生成方面,模型可在数小时连续音频中维持声音质量与角色音色的一致性。

安全与合规是此次发布的重要组成部分。所有通过声音复制功能生成的音频均附带 SynthID 数字水印与 C2PA 内容凭证,确保音频来源可追溯。在第三方评测中,Gemini 3.8 Flash TTS 在 Hume AI 语音设计基准测试中以71.4分夺得综合第一,Flash-Lite TTS 紧随其后位列第二;在 Voice Arena 盲测人类偏好评估中,两款模型在日语、巴西葡萄牙语、越南语、阿拉伯语、墨西哥西班牙语和印地语等主要语言中均跻身竞争对手前列。

要点

  • Gemini 3.8 Flash TTS 在 Hume AI 语音设计基准测试中以71.4分位列综合第一,口音建模同样排名第一,代表当前文字转语音领域的顶尖水平。
  • 声音库从30个预设扩展至近乎无限,支持通过30秒音频样本复制声音,并内置同意验证与 SynthID 水印保护声音版权。
  • 逐行脚本控制与原生双人场景编排功能,使有声书、播客及互动媒体的音频制作精度大幅提升。
  • Flash-Lite TTS 专为大规模商业场景优化,在保持表现力的同时降低成本,适合高并发配音与语音代理需求。
  • 两款模型已全面接入 Google AI Studio、Gemini API 及 Google Vids 等平台,企业与开发者可即时使用。
查看原始来源

原始标题:Gemini 3.8 text-to-speech says hello

本文由 DataHub 基于公开来源整理,用于信息发现与摘要阅读;具体事实、数据和后续更新以原始来源为准。