跳到主内容
@wquguru
精选80Hugging Face 博客(RSS)论文研究

Cosmopedia:大规模预训练合成数据生成方法

Cosmopedia:如何生成大规模预训练合成数据

原文
发到 X

Hugging Face 发布 Cosmopedia 项目,旨在生成大规模、高质量的合成数据用于预训练语言模型。该项目利用 Mixtral 8x7B 模型作为教师,通过精心设计的提示模板和多样化数据源(如网络文本、书籍、代码等)生成超过 6000 亿 token 的合成文本。Cosmopedia 包含多种风格和主题的数据,覆盖从简单到复杂的推理任务,并经过严格过滤和去重。实验表明,在 Cosmopedia 上训练的模型在多个基准测试中表现优于仅使用自然数据的模型,尤其在推理和代码生成任务上。该工作为合成数据在预训练中的应用提供了可扩展的范式。

更进一步:量化金融体系

看懂新闻只是起点——沿量化金融路径,把它变成能交付的工程能力

进入量化体系 →

相似阅读

另一事件,读法相近