跳到主内容
@wquguru
精选80Hugging Face 每日论文(json_list)论文研究

Abra:扩散图像训练的计算最优缩放定律研究

Abra: Scaling Diffusion Image Training

原文
发到 X

计算最优缩放定律指导着前沿语言模型的训练,但对于视觉生成领域却鲜有探索。我们使用Abra——一个受控的流匹配变换器家族,在跨越三个数量级的计算量(10^19至10^22 FLOPs)上进行训练,达到了远超以往工作的计算预算,对文本到图像扩散模型进行了系统的缩放定律研究。我们证明,扩散模型与语言模型一样可预测地扩展,但需要更多的数据才能达到最优训练:计算最优性出现在大约每参数200个图像令牌,是LLM的Chinchilla计算最优处方的十倍。我们表明,与语言模型不同,扩散模型对过度训练具有鲁棒性,实践者应倾向于更多数据而非更大模型。最后,我们展示这种可预测性不仅延伸到训练损失,还涵盖生成质量指标、最优CFG设置、表示质量,甚至训练曲线的形状,这些曲线都坍缩到一种通用形式。

更进一步:量化金融体系

看懂新闻只是起点——沿量化金融路径,把它变成能交付的工程能力

进入量化体系 →

相似阅读

另一事件,读法相近