Daedalus-150M:专为CPU推理设计的卷积注意力混合模型
Daedalus-150M: A Convolution-Attention Hybrid Designed for CPU Inference
这篇论文提供了极具参考价值的端侧部署思路,通过混合架构在普通 CPU 上实现显著加速,适合关注小模型落地和边缘计算的同学深入阅读。
小型语言模型通常像大型模型一样构建,然后再压缩到 CPU 上运行。我们反其道而行之:先确定目标,一次一个用户、一个 token,4-bit 权重,普通 CPU,然后选择适合它的架构。结果仅在 18 个块中的 6 个保留了完整的注意力机制。其余 12 个使用短卷积,无论对话多长,其内存宽度仅为两个时间步,因此网络中三分之二的部分永远不会重新读取不断增长的缓存。 该模型在 599 亿个 token 上从头训练,在五项任务的基准测试中得分为 47.31,而训练开始前设定的基准线为 42.20。它击败了 GPT-2 124M、Pythia-160M、OPT-125M 和 GPT-neo-125M,这些模型都在三到六倍更多的数据上进行了训练,并且超过了 MobileLLM-125M 的公开得分,尽管后者看到了万亿级别的 token。验证集的每字节比特数为 0.8685。 为了检验架构而非训练配方,我们在相同数据上训练了一个同规模的常规全注意力模型,并在对两者进行评分之前记录了获胜条件。混合架构在选定的质量指标上以 0.81% 的优势胜出,在下沉任务中与之持平,生成的 4-bit 文件小了 6.3%,并且在 2048 个 token 的上下文中解码速度快了 1.76 倍,与外部相似规模的模型相比快了 2.08 倍。在所有测量中,速度优势在空上下文时接近零,并随长度增加而增长,这是该机制所预测的,而仅仅是更精简的模型不会表现出这一点。简单的带宽计算仅预测出 1.17 倍的提升,因此仅凭内存体积无法解释这一差距。 我们还报告了未成功的情况:未经缓解的 4-bit 质量成本,大约一半的卷积通道最终变得惰性且无法移除,以及比该模型规模所需的更大的词汇表。
更进一步:量化金融体系
看懂新闻只是起点——沿量化金融路径,把它变成能交付的工程能力