AI资讯 / 产业

产业 / 媒体

xAI 发布 Grok Voice Think Fast 2.0:最强语音 AI 模型,转录精度大幅跃升

IT之家

埃隆·马斯克旗下 xAI 公司于 7 月 29 日正式发布 Grok Voice Think Fast 2.0,定位为目前该公司功能最强、最智能的语音对语音 AI 模型。新模型在语音推理、转录准确性、对话流畅度及工具调用可靠性四个维度均有显著提升。根据第三方机构 Artificial Analysis 的基准测试,其 AA Speech-to-Speech Quality Index 达到 82.9%,较上一代 1.0 版本的 75.7% 提升 7.2 个百分点。定价为每分钟音频 0.08 美元,官方计划于 8 月 5 日将 grok-voice-latest 接口正式切换至 2.0 版本。在覆盖 24 种语言、数千条短语的内部评估中,新模型转录表现较 Deepgram Nova 3 和 ElevenLabs Scribe v2 提升 1.5 至 2 倍,在嘈杂环境下优势更为突出。

xAI 于 7 月 29 日推出 Grok Voice Think Fast 2.0,这是该公司迄今发布的最强语音对语音 AI 模型。新模型的核心改进集中在四个方向:语音推理能力、转录准确性、多轮对话质量以及工具调用的稳定性。官方将于 8 月 5 日把 grok-voice-latest 接口从 1.0 版本正式升级至 2.0,开发者届时无需修改调用方式即可享受新版能力。

在第三方基准测试层面,Artificial Analysis 公布的 AA Speech-to-Speech Quality Index 显示,Grok Voice Think Fast 2.0 得分为 82.9%,较 1.0 版本的 75.7% 提升 7.2 个百分点。这一指标综合衡量语音理解与生成的整体质量,是目前语音 AI 领域较具参考价值的评估维度之一。

xAI 特别强调,新模型能够在说话的同时同步完成推理,无需牺牲额外延迟来换取推理深度。与此同时,2.0 版本减少了每次回复所需消耗的推理 Token 数量,在生产环境中,工具调用通常可在智能体说完第一句话之前完成,这对于实时语音交互场景具有重要意义。

在多语言转录能力方面,xAI 基于覆盖 24 种语言、数千条短语的内部评估数据称,Grok Voice Think Fast 2.0 的转录表现较 Deepgram Nova 3 和 ElevenLabs Scribe v2 提升 1.5 至 2 倍,较自家 1.0 版本提升约 1.4 倍。在存在明显背景噪声或电话压缩失真的场景下,其与专用语音转文字模型之间的差距甚至可扩大至约 10 倍。

定价方面,Grok Voice Think Fast 2.0 的音频处理费用为每分钟 0.08 美元,按当前汇率折合约 0.54 元人民币。这一定价面向 API 调用的开发者和企业用户,适合构建实时语音助手、智能客服、多语言转录等应用场景。随着语音 AI 竞争持续升温,xAI 此次发布进一步加剧了与 OpenAI、ElevenLabs 等玩家在语音赛道上的角力。

要点

  • Grok Voice Think Fast 2.0 的 AA Speech-to-Speech Quality Index 达 82.9%,较上代提升 7.2 个百分点
  • 模型支持边说话边推理,工具调用可在智能体开口前完成,显著降低实时交互延迟
  • 24 种语言内部评估显示,转录精度较 Deepgram Nova 3 和 ElevenLabs Scribe v2 提升 1.5 至 2 倍
  • 定价为每分钟 0.08 美元,官方将于 8 月 5 日完成 grok-voice-latest 接口的版本切换
查看原始来源

原始标题:马斯克旗下 SpaceXAI 最智能 AI 语音模型,Grok Voice Think Fast 2.0 登场

本文由 DataHub 基于公开来源整理,用于信息发现与摘要阅读;具体事实、数据和后续更新以原始来源为准。