精选80Hugging Face 每日论文(json_list)论文研究
LAION发布千万小时级开放视频数据集BVD
LAION-BVD: A 10-Million-Hour Open Video Dataset for Multimodal Pre-training
我们推出了LAION-BVD,这是一个面向多模态学习的大规模开放视频数据集,包含从CommonCrawl收集的13亿个平台特定视频URL。从中,我们下载了8000万个视频,总时长达到1000万小时。该数据集专为跨视频、音频和图像模态的多模态预训练而设计。利用内容感知的场景检测,我们提取片段,并为这些片段合成生成视频和音频字幕。基于这些数据训练的模型在标准视频-文本和音频-文本基准测试中表现出竞争力,且随着训练或模型规模的增加,性能持续提升。此外,我们通过提取场景变化帧,探索了视频帧作为图像-文本数据替代来源的可能性。这些帧的视觉分布与标准网络图像语料库不同,基于此数据集训练的模型在图像-文本检索任务上取得了强劲表现。我们将LAION-BVD发布给研究社区,以前所未有的规模显著扩展了多模态视频的开放访问。
更进一步:量化金融体系
看懂新闻只是起点——沿量化金融路径,把它变成能交付的工程能力