AI资讯 / 产业

产业 / 媒体

OpenAI 开放 GPT-Live-1 API,全双工语音让应用同时说话与聆听

The Decoder

OpenAI 正式将 GPT-Live-1 作为 API 向开发者开放。这款语音模型支持全双工通信,即在说话的同时持续聆听用户输入,目前已在 ChatGPT 内部运行。开发者可根据任务需求将其与不同后端模型搭配使用,灵活匹配推理深度、响应速度与成本。在 OpenAI 的基准测试中,GPT-Live-1 表现大幅领先前代:全双工互动性测试得分从 45.4% 提升至 80.1%,轮次切换延迟从 1.4 秒降至 0.8 秒,工具调用准确率从 60% 跃升至 87%。在银行语音客服基准测试中,通过率从 12.4% 提升至 32%。此外,该模型还新增了 12 种涵盖不同口音、方言和语言的声音,并原生支持 ASR 转录文本与响应文本输出。定价方面,GPT-Live-1 收费为每分钟 0.05 美元。

OpenAI 于 2026 年 9 月 10 日宣布,将 GPT-Live-1 正式开放为开发者 API。这款语音模型的核心能力在于支持全双工通信——即模型在输出语音的同时,能够持续接收并处理用户的语音输入,而非等待一方说完再切换。这一特性使对话体验更接近真实的人际交流,而非传统的轮流发言模式。目前,GPT-Live-1 已在 ChatGPT 产品内部运行,此次面向开发者开放标志着该技术进入更广泛的商业应用阶段。

在性能指标上,GPT-Live-1 相较前代模型 GPT-Realtime-2.1 实现了全面跃升。全双工互动性测试得分从 45.4% 大幅提升至 80.1%;轮次切换延迟从 1.4 秒缩短至 0.8 秒,响应更加流畅自然;工具调用准确率则从 60% 提升至 87%,显著增强了模型在复杂任务中的可靠性。在专项的银行语音客服基准测试中,GPT-Live-1 的通过率从 12.4% 提升至 32%,展现出在垂直行业场景中的实际落地潜力。

已有企业率先将 GPT-Live-1 应用于实际业务。点评平台 Yelp 将该模型用于电话预订服务,其首席技术官 Alex Levy 表示,引入 GPT-Live-1 后电话处理质量明显改善。这一案例表明,全双工语音模型在需要实时交互的客服、预订等场景中具备切实的商业价值,也为其他行业的开发者提供了参考方向。

GPT-Live-1 在功能层面也有所扩展。模型新增了 12 种声音选项,涵盖不同口音、方言和语言,有助于开发者构建面向多元用户群体的语音应用。同时,模型原生支持自动语音识别(ASR)转录文本与响应文本的直接输出,降低了开发者在语音转文字环节的额外集成成本。开发者可根据具体用例,将 GPT-Live-1 与不同后端模型灵活组合,以平衡推理深度、速度与成本。

定价方面,GPT-Live-1 的收费标准为每分钟 0.05 美元,在当前语音 AI API 市场中属于较高水平。对于通话时长较短的场景,这一价格尚在可接受范围;但对于需要长时间持续通话的应用,成本压力不容忽视。开发者在评估是否采用该模型时,需结合自身业务场景的通话时长与频次进行详细的成本核算,方能判断其商业可行性。

要点

  • GPT-Live-1 支持全双工通信,可同时说话与聆听,互动性测试得分从 45.4% 提升至 80.1%,轮次切换延迟降至 0.8 秒
  • 工具调用准确率从 60% 跃升至 87%,银行语音客服基准通过率从 12.4% 提升至 32%,垂直行业落地能力显著增强
  • Yelp 已将其用于电话预订服务并报告通话处理质量改善,是目前最具代表性的商业落地案例
  • 模型新增 12 种多口音多语言声音,原生支持 ASR 转录输出,降低开发集成门槛
  • 定价为每分钟 0.05 美元,成本较高,开发者需根据实际通话场景评估商业可行性
查看原始来源

原始标题:OpenAI's GPT-Live-1 API lets developers build apps that talk and listen at the same time

本文由 DataHub 基于公开来源整理,用于信息发现与摘要阅读;具体事实、数据和后续更新以原始来源为准。