产业 / 媒体
谷歌发布 Gemini 3.8 Live,以极低价格挑战 OpenAI 语音模型
谷歌 DeepMind 正式推出 Gemini 3.8 Live 与 Gemini 3.8 Live Extended Thinking 两款面向开发者的音频模型,可通过 Gemini API 及 Google AI Studio 调用。其中 Extended Thinking 版本在 Artificial Analysis 语音对话排行榜上以 82.6% 的得分位居第一,超越 OpenAI 最新的 GPT-Live-1 系列。在定价方面,谷歌音频输入收费为每分钟 0.005 美元、输出为 0.018 美元,一小时语音对话总成本约 1.38 美元,而 OpenAI GPT-Live-1 的同等费用至少为 3.00 美元。不过,OpenAI 凭借支持同步收听与说话的全双工技术,在对话自然度方面仍具优势。分析人士认为,谷歌此次再度以价格换质量,在性价比上占据主动,但音质与流畅度仍有差距。
谷歌 DeepMind 于 2026 年 9 月 15 日发布了 Gemini 3.8 Live 与 Gemini 3.8 Live Extended Thinking 两款新音频模型,面向开发者开放,可通过 Gemini API 和 Google AI Studio 接入。这两款模型专为语音智能体场景设计,支持在后台调用外部 API、处理视觉输入,并在执行任务的同时保持语音输出不中断,覆盖语言超过 97 种。
在性能评测方面,Gemini 3.8 Live Extended Thinking 在 Artificial Analysis 语音对话排行榜上以 82.6% 的综合得分夺得第一,超越了 OpenAI 的 GPT-Live-1 系列模型。这一成绩标志着谷歌在语音 AI 领域的技术积累正在加速追赶,也是其在多模态能力上持续投入的阶段性成果。相关示例应用已在 GitHub 上公开发布,供开发者参考与测试。
价格是谷歌此次发布的最大亮点之一。谷歌对音频输入收费每分钟 0.005 美元、输出收费每分钟 0.018 美元,一小时完整语音对话的总成本约为 1.38 美元。相比之下,OpenAI GPT-Live-1 的每分钟费率为 0.05 美元,一小时费用至少达到 3.00 美元。这意味着谷歌的定价不足 OpenAI 的一半,对于需要大规模部署语音智能体的企业客户而言,成本优势相当显著。
尽管排行榜成绩亮眼,但在对话自然度方面,OpenAI GPT-Live-1 仍被认为更具优势。其核心原因在于全双工技术的支持——该技术允许模型在说话的同时持续监听用户输入,从而实现更流畅、更接近真实人类对话的交互体验。从公开演示来看,GPT-Live-1 的音质与语气表现也更为自然,显示谷歌在此次迭代中优先考量的是成本效率而非极致音质。
此次发布折射出语音 AI 市场竞争格局的深层逻辑:谷歌凭借基础设施规模优势持续压低价格,以性价比吸引开发者生态;而 OpenAI 则坚守高质量体验的差异化路线。对于预算敏感型应用场景,Gemini 3.8 Live 提供了极具吸引力的选择;而对于追求极致对话体验的产品,OpenAI 的全双工方案仍是更优解。两家公司的竞争,正在将语音 AI 的能力边界与价格底线同步推向新的水平。
要点
- Gemini 3.8 Live Extended Thinking 在 Artificial Analysis 语音对话排行榜上以 82.6% 得分位居第一,超越 OpenAI GPT-Live-1
- 谷歌语音模型每小时对话成本约 1.38 美元,不足 OpenAI 3.00 美元的一半,价格优势明显
- OpenAI GPT-Live-1 凭借全双工技术在对话自然度与音质上仍领先于谷歌
- Gemini 3.8 Live 支持后台 API 调用、视觉输入处理及 97 种以上语言,适合多场景语音智能体部署
- 谷歌此次再度以低价策略切入市场,延续其以规模换份额的竞争路线
原始标题:Google launches Gemini 3.8 Live to take on OpenAI's GPT-Live-1 at a fraction of the cost
本文由 DataHub 基于公开来源整理,用于信息发现与摘要阅读;具体事实、数据和后续更新以原始来源为准。