Google DeepMind 开源端侧多模态嵌入模型
Google DeepMind 这次要把端侧搜索和 RAG 认真地放进手机本地了!
端侧部署的关键基础设施突破,参数极小且支持多模态,做本地 Agent 和隐私搜索的同学值得重点关注。
Google DeepMind 这次要把端侧搜索和 RAG 认真地放进手机本地了!
他们最新开源发布了原生多模态、专为端侧设计的 740M 参数嵌入模型「EmbeddingGemma 2」,把文本、代码、图像、视频、音频映射进同一个 768 维向量空间。
https://blog.google/innovation-and-ai/technology/developers-tools/embeddinggemma-2
EmbeddingGemma 2 基于 Gemma 4 架构,核心设计是按模态按需加载: · 文本主干:270M,130M transformer + 140M embedder,比一代的 300M 反而更小 · 视觉编码器(可选):170M · 音频编码器(可选):300M
纯文本场景只需 270M 参数,量化后在 Pixel 11 Pro 上活跃内存约 191MB;加载全部模态也仅约 567MB。这意味着嵌入模型首次可以认真地放进手机本地运行,支撑隐私优先的端侧搜索与 RAG。
其他关键规格:8K token 上下文(是一代的 4 倍),支持 100+ 语言(训练语料覆盖 140+ 种),文档按 "title: {标题} | text: {正文}" 格式编码。各模态的 token 开销:图像 280 token(最多约 29 张)、视频每帧 140(最多 58 帧)、音频每秒 25(最长约 5.5 分钟),视觉预算还可在 70–1120 软 token 间调节。
官方核心数据(768 维):代码检索是最大跃升,多模态“以小打大” · MTEB Code (NDCG@10):78.68,比第一代约 14% 相对提升 · MTEB 多语言 v2:61.36,持平略升
官方口径是“1B 以下多模态嵌入模型中同尺寸最佳”,并能匹配或超越一些两倍以上体积的专用模型。需要客观指出:多语言文本相对一代只是持平而非大幅进步,真正的增量在代码检索(得益于 Gemma 4 词表和代码语料)和全新的音视频能力。
更进一步:量化金融体系
看懂新闻只是起点——沿量化金融路径,把它变成能交付的工程能力