SMELT:计算匹配下的MoE循环Transformer缩放定律
SMELT: Scaling Laws for Compute-Matched MoE Looped Transformers
这篇论文通过严格的算力对齐实验,证明了循环Transformer架构在MoE范式下的实际效率优势,给出了具体的层循环策略和缩放定律,对追求极致推理/训练效率的研究者有直接参考价值。
循环 Transformer(Looped Transformers)通过迭代共享的层块来增加有效深度,但大多数评估在固定模型规模下进行比较,将架构优势与额外的 FLOPs(浮点运算次数)混为一谈。我们在混合专家 Transformer(Mixture-of-Experts Transformers)上研究循环机制,同时严格控制每 token 的 FLOPs、非嵌入参数总量以及 KV cache 大小。通过一系列消融实验,我们得出了一种称为 SMELT(稀疏 MoE Transformer,中间层循环两次)的方案,该方案将中间一半的层循环两次,同时在三项预算指标上与未循环的基线(Baseline)保持一致。我们将 SMELT 扩展至四种规模,最大达到 54B 非嵌入参数,并为每种架构拟合了独立的 Chinchilla 风格缩放定律。SMELT 的损失随计算量的下降速度更快,在计算最优前沿上节省了 6.8--18.0% 的训练 FLOPs。这种优势转移到了下游基准测试中,且超出了验证损失所预测的范围,在代码(Code)任务上优势最大,并随着样本长度和上下文示例数量的增加而增长。机理分析表明,第二次访问减少了注意力汇聚(attention sink),并将注意力质量重定向到与内容相关的 token,这种归纳偏置可能是观察到性能提升的基础。这些结果表明,即使在预算匹配的情况下,循环也能改善 Transformer 的性能,提供了一种将深度复用转化为可衡量收益的实用方案。
更进一步:量化金融体系
看懂新闻只是起点——沿量化金融路径,把它变成能交付的工程能力