跳到主内容
@wquguru
精选70Hugging Face 每日论文(json_list)论文研究

UniMoMo:基于专家合并的推荐MoE加速压缩

UniMoMo: Expert Merging-Based MoE Acceleration for Large Recommendation Models

原文
发到 X

稀疏混合专家(MoE)层通过条件计算扩展了推荐系统的容量,但训练好的检查点仍然存储并路由其全部专家库。我们研究一个部署问题:在明确的专家预算下,将该检查点转换为更小的标准MoE,而不添加压缩专用的在线模块。为此,我们引入了UniMoMo,一种后训练压缩框架,将其表述为约束图粗化问题。UniMoMo不依赖参数距离,而是基于功能相似性对专家进行分组,使用无标签校准集来衡量专家对共享推荐状态的响应相似度。为了防止性能下降,我们引入了一种层自适应保护机制,根据路由暴露度限制高流量专家的合并。在包含2、4和6个MoE块的Amazon Beauty、KuaiRec和TenRec数据集上,最终的四专家检查点获得了相对于源模型的五次运行平均NDCG@10比率99.92%--102.30%,以及实测A100加速比1.28倍--1.63倍。一个激进的二专家、top-1操作点获得了98.36%--104.24%的比率和1.47倍--2.21倍的加速比。这些端点结果评估了完整的转换和适应工作流程,表明训练好的推荐MoE可以在多种服务预算下导出。

更进一步:量化金融体系

看懂新闻只是起点——沿量化金融路径,把它变成能交付的工程能力

进入量化体系 →

相似阅读

另一事件,读法相近