模型 / 官方
覆盖16语言的全模态长音频评测基准
阿里巴巴Qwen团队在GitHub上发布了Omnilingua-Bench,这是一个面向语音与音频大模型的多语言、全模态评测基准。该基准由四个子集构成:Omnilingua-LongASR专注于长音频转写,单条音频最长达200分钟,覆盖10种语言;Omnilingua-LongQA(MuLA-Bench)提供5029个跨16语言的问答对,考察模型对长音频的事实理解与时序推理能力;Omnilingua-MSpeaker评测多说话人转写与说话人归因,支持音频和视听两种模态;Omnilingua-MaXIFE则通过5387条合成语音样本,评测模型在格式、长度、关键词、语言切换等47种约束类型下的复杂指令跟随能力。整套基准采用统一的JSONL数据格式,并提供验证工具,仅供学术研究使用。
Omnilingua-Bench是QwenLM团队推出的一套系统性音频模型评测框架,旨在填补现有基准在长音频、多语言和多模态场景下的评测空白。该基准将四个功能各异的子集整合在统一的数据格式与评测体系下,覆盖从基础语音识别到复杂指令跟随的多个能力维度,为研究者提供了一个横向对比不同语音大模型的标准化平台。
在长音频转写方面,Omnilingua-LongASR包含135条音频样本,总时长约129.94小时,单条时长范围为30至200分钟,覆盖中、英、阿、西、法、印尼、日、韩、俄、泰10种语言。评测指标采用词错误率(WER)以及空白输出和无限循环等异常率,重点考察模型在超长上下文下的转写完整性与稳定性,这是当前语音识别领域的核心挑战之一。
MuLA-Bench子集(即Omnilingua-LongQA)是该基准规模最大的组成部分,包含5029个问答对,涉及1768段独立音频,总时长约1370.95小时,覆盖16种语言。每段音频时长在20至180分钟之间,评测任务涵盖事实完整性、长距离信息整合、推理以及时序定位,全面检验模型对长音频内容的深层理解能力,而非仅仅依赖局部片段的表面匹配。
Omnilingua-MSpeaker子集来源于公开社交媒体视频,包含297条样本(来自105个视频),总时长约26.27小时,覆盖西、法、日、韩、俄、泰6种语言。该子集同时提供纯音频和视听两种评测轨道,评测指标包括tcpWER、cpWER和说话人错误率(DER)。数据集仅提供视频URL和时间段索引,不直接分发媒体文件,用户需自行下载,版权归原创作者所有。
Omnilingua-MaXIFE专注于多语言复杂指令跟随能力的评测,包含5387条合成语音样本,覆盖法、印尼、日、韩、意、葡、土耳其7种语言。约束类型涵盖格式、长度、关键词、语言切换、风格、语气、引用等11个类别共47种约束,评测不仅关注答案内容的准确性,还考察模型是否严格遵循指令中的所有约束条件,这对当前语音大模型的指令对齐能力提出了更高要求。
在工程实现层面,Omnilingua-Bench采用统一的JSONL格式,每行一个样本,包含schema版本、任务类型、语言配置、输入媒体引用及参考答案等字段,并提供JSON Schema规范和validate.py验证工具,支持结构校验与媒体文件存在性检查,要求Python 3.10及以上版本。整套基准以CC BY-NC 4.0协议发布,仅限学术研究使用,第三方音视频内容的版权归属原创作者,用户使用时须遵守相关许可条款。
要点
- Omnilingua-Bench整合四个子集,覆盖长音频转写、长音频问答、多说话人理解和复杂指令跟随四大评测维度,总音频时长超1500小时
- MuLA-Bench是目前规模最大的长音频多语言问答基准之一,包含5029个问答对,覆盖16种语言,单条音频最长180分钟
- Omnilingua-MaXIFE引入47种约束类型评测复杂指令跟随能力,将语音模型的评测从转写准确性延伸至指令对齐层面
- 数据集采用统一JSONL格式并提供验证工具,第三方媒体内容仅提供索引引用,不直接分发,仅限非商业学术研究使用