产业 / 媒体
LAION发布史上最大开放视频数据集,含8000万条视频共1000万小时
非营利AI研究机构LAION近日发布了大型视频数据集BVD(Big Video Dataset),这是目前规模最大的开放视频研究数据集之一。该数据集从CommonCrawl中提取13亿条视频URL,最终下载了其中8000万条视频,总时长达1000万小时,并从中提取了5500万段附带自动生成视频与音频描述的片段,以及3亿张静态图像。数据集中大多数视频来自YouTube,以英语内容为主。根据论文测试结果,基于BVD训练的模型在主流视频转文本基准测试中,比使用InternVid训练的同类模型高出最多2.1个百分点。LAION明确将该数据集限定为仅供研究使用,并援引2024年汉堡地区法院的裁决作为收集受版权保护内容的法律依据,同时呼吁用户尊重原始内容创作者的权益。数据集与相关代码均已免费开放。
LAION于2026年8月29日正式发布Big Video Dataset(BVD),将其定位为面向AI研究的开放视频数据集。该数据集的原始来源是CommonCrawl网络爬取索引中的13亿条视频URL,研究团队从中筛选并下载了8000万条可用视频,累计时长高达1000万小时,数据规模在同类开放数据集中位居前列。
在数据处理层面,团队从下载的视频中提取了5500万段短片段,并为每段片段自动生成了视频内容描述与音频描述,同时还提取了3亿张静态图像。这种多模态标注方式使数据集能够同时支持视觉、听觉与文本的联合训练,帮助模型学习视觉内容与描述语言、声音之间的对应关系。
从训练效果来看,基于BVD训练的模型在主流视频转文本基准测试中表现优于使用InternVid训练的同类模型,领先幅度最高达2.1个百分点。InternVid此前一直是该领域的主要参考基准,BVD的超越表明更大规模、更丰富的多模态数据对提升模型性能具有显著作用。
在法律层面,LAION将BVD的使用范围明确限定为非商业研究目的,并援引2024年汉堡地区法院的一项裁决作为法律依据。该裁决允许机构为非商业研究目的收集受版权保护的内容,为LAION的数据采集行为提供了一定的法律支撑。与此同时,LAION也呼吁使用者尊重原始内容创作者的权益。
BVD的数据集与相关代码目前已完全免费开放,供研究人员下载使用。数据集中的视频以YouTube来源为主,语言以英语为主,这在一定程度上反映了当前大规模网络视频数据的分布特征。未来,该数据集有望成为视频理解、多模态学习等研究方向的重要基础资源。
要点
- LAION发布的BVD包含8000万条视频、1000万小时时长及5500万段多模态标注片段,是目前规模最大的开放视频研究数据集之一
- 基于BVD训练的模型在视频转文本基准测试中比InternVid训练的模型高出最多2.1个百分点,验证了大规模多模态数据的训练价值
- BVD仅限非商业研究使用,LAION援引2024年汉堡法院裁决作为收集版权内容的法律依据
- 数据集与代码已免费开放,视频来源以YouTube为主,内容以英语为主
原始标题:LAION drops massive open video dataset with 10 million hours of footage for AI research
本文由 DataHub 基于公开来源整理,用于信息发现与摘要阅读;具体事实、数据和后续更新以原始来源为准。