AI资讯 / 产业

产业 / 媒体

阿里Qwen Audio 3.0 TTS Plus登顶文本转语音排行榜

The Decoder

阿里巴巴的Qwen-Audio-3.0-TTS-Plus在Artificial Analysis的语音竞技场排行榜上以1236 Elo分位居第一,略超SpeechifyAI的Simba 3.2。该模型提供Flash和Plus两个版本,Flash专为实时交互设计,延迟约300毫秒,Plus则侧重高质量语音输出。它支持16种语言,包括他加禄语、马来语、泰语和越南语等较少覆盖的语言,以及多种中文方言。用户可通过自然语言或标签(如[angry])控制说话风格。不过,其速度仅为每秒16个字符,远低于Sonic 3.5的120个字符和Simba 3.2的30.2个字符。定价为每百万字符27.60美元。

阿里巴巴最新推出的文本转语音模型Qwen-Audio-3.0-TTS-Plus在Artificial Analysis的语音竞技场排行榜上登顶,以1236 Elo分领先于Simba 3.2(1234分)、Gemini 3.1 Flash TTS(1214分)和Sonic 3.5(1207分)。该模型提供两个版本:Flash版本针对实时交互优化,延迟约300毫秒;Plus版本则专注于高质量语音输出。

该模型支持16种语言,涵盖了他加禄语、马来语、泰语和越南语等较少被覆盖的语言,以及多种中文方言。用户可以通过自然语言指令或使用标签(如[angry]或[giggles])来控制说话风格,实现非语言提示的添加。阿里巴巴表示,在克隆语音时,该模型处理嘈杂或回声严重的参考录音的能力较之前版本有所提升。

然而,速度是Qwen-Audio-3.0-TTS-Plus的一个明显短板。其输出速度仅为每秒16个字符,远低于竞争对手Sonic 3.5的每秒120个字符和Simba 3.2的每秒30.2个字符。在定价方面,通过阿里云模型工作室,该模型的价格为每百万字符27.60美元。

这一成绩标志着阿里巴巴在AI语音合成领域的重要进展,尤其是在多语言支持和风格控制方面。尽管速度不及部分竞品,但其在语音质量上的领先优势可能吸引注重自然度和表现力的应用场景,如有声读物、虚拟助手和内容创作。

随着AI语音技术的竞争日益激烈,阿里巴巴的这款模型展示了中国科技公司在全球AI领域的竞争力。未来,速度与质量的平衡将是各厂商持续优化的方向,而多语言支持和用户控制能力将成为差异化竞争的关键。

要点

  • 阿里Qwen-Audio-3.0-TTS-Plus在Artificial Analysis语音竞技场以1236 Elo分排名第一。
  • 模型支持16种语言,包括他加禄语、马来语等较少覆盖的语言。
  • 用户可通过自然语言或标签(如[angry])控制说话风格。
  • 速度仅为每秒16个字符,远低于Sonic 3.5和Simba 3.2。
  • 定价为每百万字符27.60美元,通过阿里云模型工作室提供。
查看原始来源

原始标题:Alibaba's Qwen Audio 3.0 TTS Plus tops the competition in the text-to-speech rankings

本文由 DataHub 基于公开来源整理,用于信息发现与摘要阅读;具体事实、数据和后续更新以原始来源为准。