产业 / 媒体
微软首款全双工AI语音模型MAI Realtime开启测试,支持中文等16种语言
微软正在测试其首款原生实时语音模型MAI Realtime,这也是该公司首个采用全双工架构的自研AI语音模型。与此前发布的单向语音模型不同,MAI Realtime无需等待用户说完再作答,可在同一时间接收语音输入并输出回复,实现真正意义上的双向实时对话。该模型目前支持包括中文在内的16种语言,并提供Victoria和Grant两种语音风格,均比Copilot现有语音模式更为自然流畅。用户既可手动指定语言,也可开启自动检测功能,模型还支持在对话中途自动切换语言。目前微软已邀请部分合作伙伴在MAI Playground平台进行封闭测试,何时正式上线Microsoft Foundry或集成至Copilot语音功能,尚无明确时间表。调试面板可实时显示延迟数据、模型思考内容及处理步骤,样本分享功能预计在测试权限扩大后向更多用户开放。
微软正在内部测试一款名为MAI Realtime的原生实时语音模型,这是该公司首次推出具备全双工能力的自研AI语音产品。科技媒体TestingCatalog于8月2日率先披露了这一消息。所谓全双工语音,是指系统可在同一时间接收用户语音并输出回复,无需等待一方完全说完,依靠端点检测技术识别说话的开始、停顿与结束,并在用户插话时动态调整输出内容。
在语言支持方面,MAI Realtime覆盖16种语言,包括英语、中文、日语、韩语、德语、法语、西班牙语、意大利语、葡萄牙语、荷兰语、印地语、印度尼西亚语、阿拉伯语、俄语、土耳其语和越南语。用户可以手动指定对话语言,也可以启用自动检测模式,模型还支持在对话进行中途自动识别并切换语言,适应多语言混用场景。
语音风格方面,当前测试版本提供Victoria和Grant两种预设音色,据报道两者均比Copilot现有语音模式听起来更加自然。值得注意的是,MAI Realtime的定位明确为对话系统,不支持唱歌或生成非语音音效,功能边界清晰。这与微软此前发布的MAI-Voice-2语音合成模型及MAI-Transcribe-1.5语音识别模型均有所不同,后两者均为单向处理模型。
测试层面,微软已向部分合作伙伴发出邀请,在MAI Playground平台上对该模型进行封闭测试。平台配备了调试面板,可实时显示延迟数据、模型的思考内容以及各处理步骤,为开发者提供较为透明的调试环境。样本分享功能目前尚未对外开放,预计在测试权限扩大后才会向更多平台用户提供。
目前外界尚不清楚MAI Realtime何时会正式上线Microsoft Foundry,也不清楚其何时会被集成到Copilot的语音功能中。微软此前在MAI系列模型上的布局以单向能力为主,此次推出全双工模型标志着其在实时语音交互领域迈出了关键一步,也意味着微软正在加速追赶OpenAI实时语音API等竞品在自然对话体验上的优势。
要点
- MAI Realtime是微软首款全双工AI语音模型,可同步接收和输出语音,无需轮流等待,对话体验更接近真实人际交流。
- 模型支持包括中文在内的16种语言,支持手动指定或自动检测语言,并可在对话中途切换,适应多语言使用场景。
- 当前测试提供Victoria和Grant两种语音风格,定位为对话系统,不支持唱歌或非语音音效生成。
- 测试目前仅向受邀合作伙伴开放,正式上线Microsoft Foundry及集成至Copilot的时间表尚未公布。
- 此前微软MAI系列均为单向模型,MAI Realtime的推出标志着微软在实时语音交互能力上的重要跃升。
原始标题:微软测试其首款自研全双工 AI 语音 MAI Realtime 模型:支持中文等 16 种语言、2 种风格
本文由 DataHub 基于公开来源整理,用于信息发现与摘要阅读;具体事实、数据和后续更新以原始来源为准。