研究 / 官方
用选择题重新定义视频字幕质量评估
视频字幕质量评估长期是视觉大语言模型(VLLM)领域的核心难题。现有评估指标主要依赖将生成文本与标准参考答案进行词汇匹配,但视频描述天然具有「一对多」特性——同一视频可以有多种同样高质量的描述方式,导致许多优质字幕因词汇差异或视觉焦点的合理偏移而被错误惩罚。苹果机器学习研究团队在 ACL 2026 上发表论文,提出以信息保真度重新定义字幕质量:字幕必须在确保事实准确性的前提下,最大化对视频显著视觉信息的覆盖。研究团队由此构建了无参考基准 CapQuiz,通过让字幕回答从视频中提取的人工验证细粒度选择题来衡量字幕效用,并配套提出综合指标 CapF1,融合衡量事实性的 CapP 与衡量覆盖率的 CapR,实验证明其与人类判断的相关性显著优于现有指标。
视频字幕评估的核心矛盾在于语言的多样性与评估标准的单一性之间的张力。传统指标如 BLEU、CIDEr 等依赖词汇重叠,无法识别语义等价但表达不同的描述。更深层的问题是,这类指标通常是一维的,无法区分字幕在事实准确性、细节覆盖度、时序理解等不同维度上的表现,导致模型开发者难以获得可操作的改进方向。
苹果研究团队将字幕质量重新定义为信息保真度问题:一条好的字幕,应当既能忠实反映视频中的真实内容(事实性),又能尽可能覆盖视频中的关键视觉信息(覆盖率)。基于这一定义,团队构建了 CapQuiz 基准。其核心思路是将字幕评估转化为问答任务——如果一段字幕质量足够高,它应当能够帮助回答关于该视频内容的细粒度问题,而无需直接观看视频本身。
CapQuiz 的题库设计体现了系统性的分类学思考。基准涵盖 10 种问题类型,分属描述性(Descriptive)与推理性(Inferential)两大类别,横跨 24 个多样化视频领域。所有问题均经过人工验证,以多项选择题形式呈现,确保评估结果的可靠性与可重复性。这种设计使得评估既有广度——覆盖不同类型的视觉理解能力,又有深度——能够区分模型在不同认知层次上的表现差异。
在指标层面,团队提出 CapF1 作为综合评估指标,其构成借鉴了信息检索领域经典的精确率与召回率框架。CapP 衡量字幕的事实精确性,即字幕所述内容与视频实际内容的吻合程度;CapR 衡量字幕的信息覆盖率,即视频中的关键信息有多少被字幕捕捉到。CapF1 对两者进行调和平均,提供一个平衡事实性与完整性的综合分数,同时保留两个子指标的独立可解释性。
实验结果表明,CapQuiz 与人类判断的相关性显著高于现有评估指标,验证了以信息保真度为核心的评估范式的有效性。更重要的是,CapQuiz 的层级分类设计使其能够提供细粒度的模型诊断信息——研究者可以清晰看到某个模型在描述性问题上表现优异但在推理性问题上存在明显短板,从而为模型改进提供具体方向。这种可解释性是现有一维指标所无法提供的。
这项研究的意义超出了视频字幕评估本身。随着多模态大语言模型在视频理解、视频检索、无障碍辅助等场景中的广泛应用,高质量的字幕生成与评估变得愈发重要。CapQuiz 提供的无参考评估框架,也为其他开放式生成任务的评估设计提供了方法论参考——将生成质量转化为下游任务效用,或许是突破参考依赖困境的一条可行路径。
要点
- 现有视频字幕评估指标依赖词汇匹配,因视频描述的一对多特性而存在系统性偏差,高质量字幕常被错误惩罚。
- CapQuiz 将字幕评估转化为选择题问答任务,通过字幕回答视频相关问题的能力来衡量其质量,无需标准参考答案。
- CapF1 综合指标融合事实性(CapP)与覆盖率(CapR)两个维度,提供可解释的细粒度模型诊断能力。
- 基准涵盖 10 种问题类型与 24 个视频领域,实验证明其与人类判断的相关性显著优于现有指标。
- 无参考评估框架为其他开放式生成任务的质量评估提供了方法论借鉴,具有超越视频字幕领域的通用价值。
原始标题:Putting Captions to the Test: Evaluating Video Caption Quality through Multiple-Choice Question Answering
本文由 DataHub 基于公开来源整理,用于信息发现与摘要阅读;具体事实、数据和后续更新以原始来源为准。