LAION-BVD: A 10-Million-Hour Open Video Dataset for Multimodal Pre-training
为解决多模态预训练数据需求,通过收集和处理1.3亿个视频URL生成LAION-BVD数据集,采用内容感知场景检测和合成字幕技术,支持视频、音频及图像模态学习。
0 citationsRead paper
为解决多模态预训练数据需求,通过收集和处理1.3亿个视频URL生成LAION-BVD数据集,采用内容感知场景检测和合成字幕技术,支持视频、音频及图像模态学习。
为解决多模态预训练数据需求,通过收集和处理1.3亿个视频URL生成LAION-BVD数据集,采用内容感知场景检测和合成字幕技术,支持视频、音频及图像模态学习。