跳到主内容
@wquguru
精选80Hugging Face 每日论文(json_list)论文研究

LAION发布千万小时级开放视频数据集BVD

LAION-BVD: A 10-Million-Hour Open Video Dataset for Multimodal Pre-training

原文
发到 X

我们推出了LAION-BVD,这是一个面向多模态学习的大规模开放视频数据集,包含从CommonCrawl收集的13亿个平台特定视频URL。从中,我们下载了8000万个视频,总时长达到1000万小时。该数据集专为跨视频、音频和图像模态的多模态预训练而设计。利用内容感知的场景检测,我们提取片段,并为这些片段合成生成视频和音频字幕。基于这些数据训练的模型在标准视频-文本和音频-文本基准测试中表现出竞争力,且随着训练或模型规模的增加,性能持续提升。此外,我们通过提取场景变化帧,探索了视频帧作为图像-文本数据替代来源的可能性。这些帧的视觉分布与标准网络图像语料库不同,基于此数据集训练的模型在图像-文本检索任务上取得了强劲表现。我们将LAION-BVD发布给研究社区,以前所未有的规模显著扩展了多模态视频的开放访问。

更进一步:量化金融体系

看懂新闻只是起点——沿量化金融路径,把它变成能交付的工程能力

进入量化体系 →

相似阅读

另一事件,读法相近