AI资讯 / 产业

产业 / 媒体

谷歌发布 Gemini 3.8 Flash 系列文本转语音模型,逐行台词精确可控

IT之家

谷歌正式推出 Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS 两款文本转语音模型,大幅扩展了 Gemini 家族的音频生成能力。前者面向深度创意与角色设计场景,支持通过自然语言提示从零构建全新语音,适用于游戏、有声读物、播客等领域;后者则针对大容量、高性价比的配音与语音代理场景进行优化。两款模型均支持逐行台词指导、长篇连续生成、原生双声音对话编排,以及笑声、叹气等非语言提示的脚本化插入。可用语音库从原有 30 种扩展至 2000 余种,并支持仅凭 30 秒样本完成语音复制。在 Hume AI 基准测试中,Gemini 3.8 Flash TTS 综合得分 71.4 分,位居第一;两款模型在 Voice Arena 盲测中亦在多个主要语言市场领先竞争对手。目前开发者已可通过 Google AI Studio 和 Gemini API 使用这两款模型。

谷歌于 9 月 23 日正式宣布,Gemini 家族新增 Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS 两款文本转语音模型。两款模型定位有所区分:Flash TTS 主打深度创意与角色设计,可在游戏、沉浸式有声读物、播客和互动媒体中赋予角色生命力,并支持对表演提示、节奏、方言转换等进行精细控制;Flash-Lite TTS 则面向大容量、高性价比的规模化场景,针对配音生产、音频内容创作和富有表现力的语音代理进行了专项优化。

在语音库建设方面,两款模型将可用语音从原有 30 种大幅扩展至 2000 余种现成语音,覆盖墨西哥西班牙语、魁北克法语、苏格兰英语等区域变体。用户还可通过自然语言提示,在 100 多种语言和方言中自定义角色、口音和语音特征,从头创建专属定制语音。此外,语音混音功能即将上线,届时用户可对音色、音高、节奏和口音进行进一步微调。

在表演控制层面,两款模型均支持逐行舞台指导,用户可自行编写指令或借助自然脚本提示让 Gemini 引导输出,无论是平静的客服语气还是低沉的悬疑氛围均可实现。长篇生成方面,模型可在数小时连续音频中保持高质量语音、自然节奏和角色音色,扬声器漂移极小,非常适合播客和有声读物制作。原生双声音场景编排功能则可从单一脚本中无缝调度多轮对话,同时保持两种声音清晰分离。

在性能表现上,Gemini 3.8 Flash TTS 在 Hume AI 语音设计基准测试中以 71.4 分位居总体第一,口音建模得分 60.8 分同样领先。两款模型在 Hume AI 整体质量指数中分别占据第一和第二位,与上一代 Gemini 3.1 Flash TTS 相比,在长格式内容和双扬声器剧本控制等场景中均有显著提升。在 Voice Arena 盲法人类偏好评估中,两款模型在日语、巴西葡萄牙语、越南语、现代标准阿拉伯语、墨西哥西班牙语和印地语等主要语言市场均领先竞争对手。

在安全与合规机制方面,谷歌为语音复制功能内置了严格保护措施。用户必须提供来自语音所有者的口头同意记录,经与参考说话者匹配验证后方可创建复制语音。每段由 Gemini Audio 模型生成的音频均嵌入难以察觉的 SynthID 水印,并附带 C2PA 凭据,确保 AI 生成内容可被检测识别,有助于防范虚假信息传播。值得注意的是,语音复制功能目前在伊利诺伊州、德克萨斯州、欧洲经济区、英国、瑞士和印度暂不可用。

在产品落地方面,两款模型即日起已向开发者开放,可通过 Gemini API 和 Google AI Studio 使用;企业用户版本将很快通过 Gemini Enterprise API 推出。面向普通用户,Gemini 3.8 Flash TTS 将集成至 Gemini Notebook,Gemini 3.8 Flash-Lite TTS 则将在 Google Vids 中提供服务,进一步提升这两款谷歌旗下产品的音频体验。

要点

  • Gemini 3.8 Flash TTS 和 Flash-Lite TTS 分别面向创意角色设计和大容量配音场景,支持逐行台词精确控制和原生双声音对话编排。
  • 可用语音库从 30 种扩展至 2000 余种,并支持仅凭 30 秒样本完成语音复制,同时内置同意验证和 SynthID 水印保障合规安全。
  • Gemini 3.8 Flash TTS 在 Hume AI 基准测试中综合得分第一,两款模型在 Voice Arena 多语言盲测中均领先主要竞争对手。
  • 开发者现可通过 Google AI Studio 和 Gemini API 立即使用,普通用户将通过 Gemini Notebook 和 Google Vids 体验相关功能。
查看原始来源

原始标题:谷歌推出 Gemini 3.8 Flash / Flash-Lite 文本转语音模型,每一行台词都能精确控制

本文由 DataHub 基于公开来源整理,用于信息发现与摘要阅读;具体事实、数据和后续更新以原始来源为准。