AI资讯 / 产业

产业 / 媒体

用文字描述即可从零设计 AI 声音

The Decoder

谷歌正式推出两款新的文字转语音模型——Gemini 3.8 Flash TTS 与 Gemini 3.8 Flash-Lite TTS,均支持超过 100 种语言。Flash TTS 面向播客、有声书、游戏角色等创意场景,允许用户通过文本提示从零定义声音的角色、口音与音色特征;Flash-Lite TTS 则专注于大规模低成本语音生成,适用于配音、音频内容及语音助手。两款模型均支持逐行台词舞台指示、双声道对话生成,以及笑声、叹气等非语言声效的精确插入。声音克隆功能仅需 30 秒音频样本即可构建声音档案,但要求被克隆者录制同声道的口头授权声明。所有生成音频均内嵌不可听见的 SynthID 水印。两款模型已通过 Gemini API 和 Google AI Studio 开始推出,企业级 API 访问将随后跟进。

谷歌于 2026 年 9 月正式发布 Gemini 3.8 Flash TTS 与 Flash-Lite TTS 两款语音生成模型。前者定位于创意内容制作,涵盖游戏角色配音、有声书录制和播客生产;后者则以低成本、大规模语音输出为核心目标,主要服务于视频配音、音频内容平台和语音智能体等商业场景。两款模型均已通过 Gemini API 和 Google AI Studio 开始向开发者开放,Gemini Notebook 集成了 Flash TTS,Google Vids 则集成了 Flash-Lite TTS。

Flash TTS 最具特色的功能之一是「文本描述造声」——用户无需录音素材,只需用自然语言描述目标声音的角色定位、口音类型和音色特征,模型便可生成对应声线。谷歌同时提供超过 2000 个预设声音库,涵盖墨西哥西班牙语、魁北克法语、苏格兰英语等地区变体。即将上线的「Voice Remixing」功能还将允许用户对库存声音的音色、音调、语速和口音进行二次调整,目前尚未开放。

声音克隆功能支持从 30 秒音频样本中构建个人声音档案。为保障授权合规,被克隆者必须录制一段与样本声音一致的口头同意声明,系统会核验两段音频的声纹匹配度。此外,所有由 Gemini 音频模型生成的音频片段均内嵌不可听见的 SynthID 水印,以便后续检测和溯源 AI 生成内容,这也是谷歌在生成式音频领域持续推进内容真实性标记的组成部分。

在对话控制层面,两款模型均支持用户为每行台词单独添加舞台指示,也可让模型自动解读剧本中的情绪线索。双声道模式可从单一剧本生成两个声线截然不同的对话角色,同时保持长时间生成过程中的声音稳定性,谷歌将此称为低「说话人漂移」特性。用户还可在脚本中精确标注笑声、叹气或「嗯哼」等非语言声效的出现位置,实现更细腻的情感表达控制。

在定价方面,Flash TTS 与 Flash-Lite TTS 均按每百万 token 计费,文本输入与音频输出分开计算。2026 年底前,Flash TTS 音频输出定价为每百万 token 9 美元,Flash-Lite TTS 为 6 美元;2027 年起将分别涨至 18 美元和 12 美元。按谷歌公布的换算标准,1 秒音频等于 25 个音频 token,即 1 小时音频约合 9 万 token。以此计算,2026 年底前生成 1 小时音频的输出成本约为 0.81 美元(Flash TTS)和 0.54 美元(Flash-Lite TTS)。免费层级的数据将用于产品改进,付费层级数据则不会被用于训练。

谷歌表示,两款新模型在 Hume AI 的文字转语音基准测试中大多数类别均处于领先位置。Agora、LiveKit、Pipecat 和 Vercel 等开发者平台已率先完成与 Gemini API 的集成对接。企业级 Gemini Enterprise API 访问权限将于近期跟进开放。值得注意的是,谷歌目前尚未公布新模型的区域性数据处理端点信息,此前旧版 TTS 模型曾提供欧盟数据本地化处理选项,新模型的合规细节有待进一步披露。

要点

  • Flash TTS 支持通过纯文本描述从零创建声音,并提供逾 2000 个预设声音库及即将上线的 Voice Remixing 二次调整功能。
  • 声音克隆仅需 30 秒样本,但强制要求被克隆者录制同声道口头授权,所有生成音频均内嵌 SynthID 水印。
  • 双声道对话模式与逐行舞台指示功能,使模型可在单一脚本中生成风格各异的多角色对话,并支持精确插入非语言声效。
  • 2026 年底前,生成 1 小时音频的输出成本约为 0.54—0.81 美元,2027 年起价格翻倍,免费层数据将用于产品训练。
  • 两款模型已通过 Gemini API 和 Google AI Studio 开放,企业级 API 及更多区域端点支持将陆续跟进。
查看原始来源

原始标题:Google's new Flash TTS models let you design AI voices from scratch using text descriptions

本文由 DataHub 基于公开来源整理,用于信息发现与摘要阅读;具体事实、数据和后续更新以原始来源为准。