NeoMME:高效多模态原生多语言基础编码器
NeoMME: A Single-Tower Multimodal-Native Multilingual Foundation Encoder for Efficient Fine-Tuning and Inference
多模态模型通常建立在为生成式视觉-语言建模设计的架构之上,通常将单独预训练的视觉编码器与因果语言模型相结合。ColPali 等视觉文档检索器将这些模型重新用作编码器,为非生成式任务带来了 VLM 的参数和计算开销。 我们引入 NeoMME,这是一个包含 2.6 亿和 8 亿参数的多模态和多语言双向编码器系列,它在一个双向 Transformer 编码器中处理多语言文本和原始图像块。这两个模型均从头开始预训练,采用掩码离散扩散文本目标,并在多模态示例中以可见图像块为条件。两者均支持 16,384 个 token 的上下文,足以编码最多两张标准的 4K UHD 图像。 为了展示其下游能力,我们使用联合训练密集和晚期交互头对 NeoMME 进行微调。在 ViDoRe v3 基准测试中,结果产生的 NeoMME-Retriever 260M 以 0.523 的 nDCG@10 得分超越了所有严格低于 8 亿参数的评估模型,而 NeoMME-Retriever 800M 达到了 0.556。在 NVIDIA L40S 上匹配 2048x2048 图像输入尺寸时,NeoMME-260M 编码页面的吞吐量约为 ColModernVBERT 的两倍。分层 token 池化和非对称量化将晚期交互多模态文档嵌入压缩了 255 倍,同时保留了超过 95% 的基线 nDCG@10。我们将 NeoMME 贡献给 Hugging Face Transformers,并在 Apache 2.0 许可下发布预训练主干网络和检索兼容的检查点,地址为 https://hf.co/collections/Hcompany/neomme。
更进一步:量化金融体系
看懂新闻只是起点——沿量化金融路径,把它变成能交付的工程能力