精选80Hugging Face 每日论文(json_list)论文研究
MoE-ViE:混合专家视觉编码器,高效处理图像与视频理解
MoE-ViE: Mixture of Experts Vision Encoder for Efficient Image and Video Understanding
视觉编码器是视觉-语言模型的关键组成部分,扩大其容量能有效提升性能。然而,密集扩展会增加计算成本和推理延迟。混合专家(MoE)架构提供了一种有吸引力的替代方案,已在大型语言模型中实现了高效扩展,但在最先进(SOTA)水平下,CLIP风格视觉编码器的MoE设计空间仍未得到充分探索。在本工作中,我们系统研究了用于视觉编码器扩展的MoE设计,发现细粒度MoE拓扑相比密集和标准MoE对应物能带来显著增益。我们进一步提出一种无辅助损失的平衡变体,以优化专家利用率,并设计专用MoE内核以减轻推理延迟开销。为在保留图像知识的同时增强视频能力,我们引入了帧级蒸馏配合新颖的冻结机制。我们预训练了一系列不同规模的混合专家视觉编码器(MoE-ViE),均持续优于其密集对应物。我们最大的模型在76%的延迟下,匹配了1.7倍规模SOTA编码器的零样本性能。当与大型语言模型对齐时,MoE-ViE在图像和视频基准上超越了所有对比编码器,包括那些激活参数多至5倍的模型。代码可在 https://github.com/facebookresearch/moe_vie 获取。
更进一步:量化金融体系
看懂新闻只是起点——沿量化金融路径,把它变成能交付的工程能力