研究 / 官方
苹果推出长视频摘要基准LVSum 聚焦时间戳感知与多模态评估
苹果机器学习研究团队发布了名为LVSum的人工标注基准,旨在评估多模态大语言模型在长视频摘要生成中的时间戳感知与对齐能力。长视频摘要不仅需要准确把握语义,还需在长时间跨度内保持时间保真度。LVSum涵盖13个领域的72个长视频,平均时长约16分钟,每个视频包含多达10份带时间引用的高质量人类标注摘要。测试显示,当前主流模型在时间定位与跨模态一致性上仍存在明显缺陷。
多模态大语言模型在长视频理解与摘要任务中面临巨大挑战。随着视频时长的增加,模型在长跨度时间内保持时间保真度以及生成语义和时间上均准确对齐的摘要难度显著上升。传统的评估方式往往忽视了细粒度的时间定位,导致生成内容缺乏明确的时间支撑。
为了解决这一评估难题,苹果研究团队构建了LVSum基准。该数据集包含13个不同领域的72段优质长视频,平均时长达到16分钟。为了保证评测的全面性与准确性,研究人员为每个视频人工撰写了多达10份包含明确时间引用的高质量摘要,提供了细粒度的时间对齐基准。
研究团队使用LVSum对目前领先的开源及闭源多模态大模型进行了全面评估。评测不仅采用了标准自动化指标,还引入了基于大语言模型的新型评价标准,专门针对文本内容的关联度以及跨模态的一致性进行深入分析,全面揭示当前模型的能力边界。
实验评估得出了三项核心发现。首先,文本转录内容对摘要质量的贡献显著高于单独的视觉帧。其次,模型生成的摘要与人类撰写的摘要之间仍然存在巨大性能差距。最后,现有的多模态大模型在时间定位、指令遵循以及跨模态一致性方面均存在系统性缺陷。
要点
- 苹果发布长视频摘要基准LVSum,包含72个跨13个领域的视频及高精细度时间戳标注。
- 实验表明语音转录文本对长视频摘要质量的贡献远高于单一视觉图像帧。
- 当前多模态大模型在时间定位、跨模态一致性及指令遵循方面仍有明显短板。
- 模型生成的摘要与人类高水平摘要之间仍存在显著性能差距。
原始标题:LVSum: A Benchmark for Timestamp-Aware Long Video Summarization
本文由 DataHub 基于公开来源整理,用于信息发现与摘要阅读;具体事实、数据和后续更新以原始来源为准。