产业 / 媒体
Meta发布实时语音转录模型,为永不停歇的AI助手奠定基础
Meta超级智能实验室推出首款实时音频感知模型Muse Voice Transcribe,能够在直播对话中同步完成语音转录、说话人区分与句子边界检测,无需依赖独立的后处理系统。模型将音频切割为80毫秒的片段,并通过强化学习训练出一套自适应延迟机制——简单词汇快速输出,难以识别的词汇则延长监听时间,在速度与准确率之间动态取得平衡。独立评测机构Artificial Analysis的测试显示,该模型在英语上的词错误率为3.1%,在说话人停止发言后0.16秒内即可输出最终转录结果,综合表现优于ElevenLabs、AssemblyAI等竞争对手。定价方面,Meta以每小时0.18美元大幅低于市场主流产品,延续了其以价格换市场份额的一贯策略。该模型目前已集成至Meta AI及Muse Code,并通过Meta Model API对外开放。
Meta超级智能实验室于2026年9月发布了Muse Voice Transcribe,这是其Spark系列下的首款实时音频感知模型。与传统语音识别系统不同,该模型将转录、说话人区分和句子边界检测三项任务整合在同一模型中联合训练,无需在推理阶段调用额外的独立系统。这一设计不仅降低了工程复杂度,也减少了多系统协作带来的延迟累积。
在技术实现上,模型将输入音频切割为80毫秒的连续片段,每处理完一个片段后,模型自主决定是继续监听还是将当前词汇输出为文本。Meta通过强化学习训练了这一自适应延迟机制,同时以低词错误率和短延迟作为奖励信号,使模型在每个词的层面上独立权衡速度与准确率的取舍,而非对整段音频采用统一的固定延迟策略。
在说话人区分能力上,Muse Voice Transcribe可同时处理超过20位说话人,并在转录文本中以A至Z的标识符标注每段话的归属,支持超过一小时的长录音而无需后处理。Meta在演示中展示了8人同处一室的场景,系统能够实时将每个词分配给对应的说话人。此外,模型支持代码切换场景,即说话人在同一句话中混用两种语言的情况,并可通过提示语言类型、关键词及上下文来进一步提升专有名词的识别准确率。
独立评测机构Artificial Analysis于2026年9月1日发布的测试结果印证了Meta的技术主张。Muse Voice Transcribe在英语上的词错误率为3.1%,在说话人停止发言后0.16秒内输出最终转录,优于ElevenLabs Scribe v2 Realtime的3.6%和AssemblyAI Universal-3.5 Pro Realtime的4.0%。这一赛道竞争激烈,OpenAI于今年5月发布了GPT-Realtime-Whisper,并在7月下调了转录模型价格。
定价策略是Meta此次发布的另一个核心卖点。Muse Voice Transcribe的定价为每小时0.18美元(即每1000分钟音频3美元),显著低于Cartesia Ink-2的每小时约0.067美元折合后价格,以及ElevenLabs Scribe v2 Realtime和Deepgram Flux各自的每小时约0.108美元。这延续了Meta在Muse Spark 1.1和1.2上以价格竞争而非追求峰值性能的产品策略。Meta未披露模型参数量、训练数据规模及音频数据来源,也不开放模型权重。
Meta将这款模型与CEO马克·扎克伯格提出的「个人超级智能」愿景直接挂钩。在官方演示中,Meta员工将可靠的实时语音识别定位为个人AI智能体的感知基础,使其能够通过AI眼镜等可穿戴设备持续监听真实对话。这一应用场景在隐私层面引发了广泛关注——德国此前曾讨论对Meta摄像头眼镜实施禁令,但德国联邦网络局最终决定不予推进。目前,Muse Voice Transcribe已集成至Meta AI和Muse Code,用户可在任意应用中按住Fn键体验语音听写功能。
要点
- Muse Voice Transcribe将转录、说话人区分和句子边界检测整合为单一模型,通过强化学习实现逐词自适应延迟,在速度与准确率之间动态平衡
- 独立机构测试显示其英语词错误率为3.1%,综合表现优于ElevenLabs和AssemblyAI等主要竞争对手
- 每小时0.18美元的定价大幅低于市场主流产品,延续Meta以价格换市场份额的竞争策略
- 支持超过70种语言及代码切换场景,可同时区分20位以上说话人,支持超过一小时的长录音
- Meta将该模型定位为AI眼镜等设备上个人智能体的感知基础层,但持续监听能力引发隐私层面的监管关注
原始标题:Meta's new real-time audio model is the foundation for AI assistants that never stop listening
本文由 DataHub 基于公开来源整理,用于信息发现与摘要阅读;具体事实、数据和后续更新以原始来源为准。