精选80Hugging Face 博客(RSS)论文研究
Cosmopedia:大规模预训练合成数据生成方法
Cosmopedia:如何生成大规模预训练合成数据
Hugging Face 发布 Cosmopedia 项目,旨在生成大规模、高质量的合成数据用于预训练语言模型。该项目利用 Mixtral 8x7B 模型作为教师,通过精心设计的提示模板和多样化数据源(如网络文本、书籍、代码等)生成超过 6000 亿 token 的合成文本。Cosmopedia 包含多种风格和主题的数据,覆盖从简单到复杂的推理任务,并经过严格过滤和去重。实验表明,在 Cosmopedia 上训练的模型在多个基准测试中表现优于仅使用自然数据的模型,尤其在推理和代码生成任务上。该工作为合成数据在预训练中的应用提供了可扩展的范式。
更进一步:量化金融体系
看懂新闻只是起点——沿量化金融路径,把它变成能交付的工程能力