Deriving Scaling Laws for OpenEuroLLM Models: Learning Rate, Batch Size and Loss
研究了英语语料库上预训练大规模语言模型的学习率和批量大小的缩放行为,采用Warmup-Stable-Decay学习率调度,并探讨了损失与模型容量和数据集大小之间的关系。
0 citationsRead paper
研究了英语语料库上预训练大规模语言模型的学习率和批量大小的缩放行为,采用Warmup-Stable-Decay学习率调度,并探讨了损失与模型容量和数据集大小之间的关系。
为解决多模态预训练数据需求,通过收集和处理1.3亿个视频URL生成LAION-BVD数据集,采用内容感知场景检测和合成字幕技术,支持视频、音频及图像模态学习。
研究了英语语料库上预训练大规模语言模型的学习率和批量大小的缩放行为,采用Warmup-Stable-Decay学习率调度,并探讨了损失与模型容量和数据集大小之间的关系。
为解决多模态预训练数据需求,通过收集和处理1.3亿个视频URL生成LAION-BVD数据集,采用内容感知场景检测和合成字幕技术,支持视频、音频及图像模态学习。