跳到主内容
@wquguru
精选75Hugging Face 每日论文(json_list)论文研究

LLM预训练中领域数据重复次数的缩放规律

Scaling Domain Data Repetition in LLM Pretraining

原文
发到 X

随着大型语言模型的规模扩大,其训练令牌预算也必须相应增加,以维持适当的每参数令牌数比例(\(TPP\))。然而,高质量领域数据比通用网页数据更难扩展。随着模型规模和训练令牌预算的增加,其在训练混合数据中的占比往往趋于下降。重复利用现有的高质量数据是抵消这种稀释效应的有效方法,但过度重复可能导致过拟合。我们在实际的大语言模型扩展场景下研究这一权衡,其中训练令牌预算随模型规模成比例增长。对于固定领域,我们首先发现,令人惊讶的是,在固定的\(TPP\)下,最优重复次数随模型规模略有增加。在不同领域间,我们发现最优重复次数与领域最终验证损失呈强烈负相关:损失较低的领域通常能从更多重复中受益。相比之下,独特领域数据的数量与最优重复次数仅呈弱相关。这些发现表明,在相同\(TPP\)下,在较小代理模型上调优的重复次数可为较大模型提供实用估计。

更进一步:量化金融体系

看懂新闻只是起点——沿量化金融路径,把它变成能交付的工程能力

进入量化体系 →

相似阅读

另一事件,读法相近