产业 / 媒体
阿里发布Qwen-Audio-3.0-ASR-Flash,专业词汇识别率大幅提升
阿里巴巴于2026年7月31日正式发布语音识别大模型Qwen-Audio-3.0-ASR-Flash,重点解决AI在专业场景下对行业术语和冷门词汇识别不准的痛点。新模型在上下文一致性、行业词识别和热词定制化三个维度进行了系统性优化,同时具备语音润色能力,可直接输出结构化文本,大幅降低后期整理成本。研究团队从医疗、IT编程、股票、社会名人等多个领域持续挖掘专业词汇,构建了覆盖多行业的高质量词库。内部评测显示,各行业专业词听中率均有明显提升,其中医疗场景突破95.36%。该系列模型此前已在AI评测平台Artificial Analysis上以1.7%的错字率位居全球第一。目前,Qwen-Audio-3.0-ASR系列提供Flash、Filetrans和Streaming三个版本,已通过阿里云百炼平台向外开放调用。
阿里巴巴于7月31日正式推出语音识别大模型Qwen-Audio-3.0-ASR-Flash,这是Qwen-Audio-ASR系列的最新迭代版本。与前代相比,新模型将优化重心集中在上下文一致性、行业词识别和热词定制化三个核心维度,力图让AI在专业场景下真正听懂人说的话,而不仅仅停留于通用语音转写层面。
在专业词汇覆盖方面,研究团队持续从医疗、IT编程、股票、社会名人等多个垂直领域挖掘术语,建成了一套覆盖多行业的高质量词库。这一词库的建立显著加强了模型对专业术语和冷门词的识别能力。最新内部评测结果显示,新模型在各行业专业词的听中率上均有明显提升,其中医疗场景的识别率更是突破了95.36%,在对准确性要求极高的医疗记录和问诊场景中具有重要的实用价值。
除识别精度外,Qwen-Audio-3.0-ASR-Flash还新增了语音润色能力,模型在完成语音转写后可直接输出结构化文本,减少人工二次整理的工作量。这一特性使其在会议纪要整理、教育录播和智能客服等对文本格式有一定要求的场景中更具竞争力。目前,该系列已在上述多个实际业务场景中得到验证,落地应用基础较为扎实。
在第三方评测层面,Qwen-Audio-ASR-Flash系列曾在国际AI评测平台Artificial Analysis上以1.7%的错字率拿下全球第一的成绩,这一数据为其技术实力提供了独立背书。低错字率意味着在实时字幕、法律文书转写等对准确性敏感的场景中,用户需要人工校对的工作量将大幅减少。
在产品形态上,Qwen-Audio-3.0-ASR系列现已通过阿里云百炼平台开放调用,提供三个差异化版本以满足不同业务需求:Qwen-Audio-3.0-ASR-Flash支持最长5分钟的语音识别,适合短时录音场景;Qwen-Audio-3.0-ASR-Filetrans面向离线文件转写需求;Qwen-Audio-3.0-ASR-Streaming则支持实时语音识别,适用于直播字幕、实时会议等低延迟场景。三个版本的并行推出,体现了阿里在语音AI商业化落地上的全场景布局思路。
要点
- Qwen-Audio-3.0-ASR-Flash在上下文一致性、行业词识别和热词定制化三个维度进行系统优化,医疗场景专业词听中率突破95.36%。
- 模型新增语音润色能力,可直接输出结构化文本,降低会议纪要、教育录播等场景的后期整理成本。
- 该系列曾在Artificial Analysis平台以1.7%错字率位居全球第一,具备独立第三方评测背书。
- 阿里云百炼平台同步开放Flash、Filetrans、Streaming三个版本,覆盖短时识别、离线转写和实时识别全场景。
原始标题:阿里发布 Qwen-Audio-3.0-ASR-Flash 语音识别大模型,让 AI 更好听懂专业词汇
本文由 DataHub 基于公开来源整理,用于信息发现与摘要阅读;具体事实、数据和后续更新以原始来源为准。