产业 / 官方
Google DeepMind 发布 Gemini 3.8 Live 系列:语音 AI 迈入实时推理新阶段
Google DeepMind 于2026年9月15日正式推出 Gemini 3.8 Live 与 Gemini 3.8 Live Extended Thinking 两款语音对话模型。前者专为规模化部署与成本效益设计,具备近实时视觉理解、97种语言自动切换及后台工具调用能力;后者面向高复杂度任务,支持多步骤推理与同步语音输出,在 Artificial Analysis 语音质量指数中以82.6分位列第一,并在 τ-Voice 智能体任务完成率上达到68.6%。两款模型均已通过 Gemini API、Google Workspace 及 Gemini 应用向用户开放,同时借助 Agora、LangChain、LiveKit 等开发者平台构建生态。所有 AI 生成音频均内嵌 SynthID 水印,以支持内容溯源与防范虚假信息传播。
Google DeepMind 此次发布的 Gemini 3.8 Live 定位于大规模商业部署场景,核心优势在于将流畅对话与视觉上下文理解相结合。该模型能够在近实时状态下处理摄像头或屏幕输入,并在对话过程中自动识别并切换97种支持语言,无需用户手动指定。在 Speech Agent Arena 评测中,Gemini 3.8 Live 获得用户偏好第二名,展现出在自然度与响应速度上的竞争力。
Gemini 3.8 Live Extended Thinking 则针对需要深度推理的复杂工作流而设计。其核心创新在于推理与语音输出可同步进行——模型在思考过程中会以「让我查一下……」等自然语言提示告知用户当前状态,并通过实时进度叙述引导用户了解多步骤任务的执行情况,从而在不中断对话的前提下完成复杂指令。该模型在 Big Bench Audio 上得分97.7%,在 Sierra τ-Voice-banking 基准测试中达到35.1%。
在后台工具调用方面,两款模型均支持在持续对话的同时执行 API 调用与外部工具操作。这意味着用户发出指令后,模型可以一边确认请求、继续交流,一边在后台完成数据查询、预订或代码生成等任务,整个过程对用户透明且不产生明显等待感。这一能力在 ServiceNow EVA-Bench 语音智能体评测中被验证为在准确性与对话质量之间取得了帕累托最优平衡。
在产品集成层面,Google 已将上述模型引入 Workspace 生态,包括 Docs Live、Gmail Live 和 Keep Live,用户可通过语音完成文档编辑、邮件处理等复杂操作。Search Live 也集成了 Gemini 3.8 Live,提供逐步实时故障排查支持。此外,Salesforce、Genspark、Lumeris 等企业合作伙伴已就低延迟、流畅度与工具调用能力表达了积极评价。
在开发者生态建设上,Google 通过 Gemini Live API 与 Agora、Fishjam、LangChain、LiveKit、Pipecat、Vercel、Vision Agents 等平台深度合作,将复杂的实时媒体流基础设施封装于底层,使开发者能够专注于用户体验设计。安全层面,所有由 AI 生成的音频均内嵌不可感知的 SynthID 数字水印,确保 AI 生成内容在传播链路中始终可被检测,以应对潜在的虚假信息风险。
要点
- Gemini 3.8 Live Extended Thinking 在 Artificial Analysis 语音质量指数中以82.6分排名第一,并在多项智能体任务基准中领先
- 两款模型均支持后台工具调用,可在不中断对话的情况下并行执行 API 请求与多步骤任务
- Gemini 3.8 Live 支持97种语言的对话中自动切换,并具备近实时视觉上下文理解能力
- 模型已集成至 Google Workspace、Search 及主流开发者平台,面向企业与开发者同步开放
- 所有 AI 生成音频均内嵌 SynthID 水印,提供内容溯源与防伪能力
原始标题:Introducing Gemini 3.8 Live and 3.8 Live Extended Thinking
本文由 DataHub 基于公开来源整理,用于信息发现与摘要阅读;具体事实、数据和后续更新以原始来源为准。