跳到主内容
@wquguru
精选88AYiAI 产品与模型

Google 开源 EmbeddingGemma 2:本地多模态搜索模型解析

Google 昨天开源的 EmbeddingGemma 2,把搜索这一层直接搬进了浏览器,大多数人会因为它不会聊天直接划走,但它可能比下一个大模型更能改你的工作…

原文
发到 X
推荐理由

结构清晰拆解了模型的技术特性与应用场景,通过对比传统方案突出了本地多模态检索的优势,数据详实且逻辑完整,适合作为技术类合作稿参考。

Google 昨天开源的 EmbeddingGemma 2,把搜索这一层直接搬进了浏览器,大多数人会因为它不会聊天直接划走,但它可能比下一个大模型更能改你的工作流。

文字、图片、视频、音频都在本机算,不要服务器,不要 API key,

Hugging Face 的 Victor 说浏览器 WebGPU 上单次查询大约 20 到 70 毫秒,数据留在你自己的电脑里。

它不是聊天模型,不会写文案, 它只干一件事:把一段内容变成一串坐标,意思接近的东西挨得近, 搜索、RAG、去重,底层全靠这个。

以前跨模态搜索是裂开的, 图片先转成文字,语音先转成文字,再拿文本模型去算, 每转一次就丢一层信息,多一段延迟,多一次把数据送出门。

现在五种内容进同一个 768 维空间, 一段语音备忘录可以直接对上某段视频画面,不用先转写。

而且它是拆着装的,只要文字 270M,加图片 440M,全上才 740M,

向量还能从 768 维截到 256 维,一百万条从将近 3GB 缩到三分之一,质量只掉 1 到 2%。

最狠的是它走 Apache 2.0,能微调,能塞进自己的产品, 检索这一层的成本被打到接近零, 对卖 embedding API 的人是威胁,对做本地工具的人是零件。

但也别神化,纯文本检索几乎没进步,MTEB 61.36 对上一代 61.15, 它赢的是模态和体积,视频也还是抽帧。

下周大家还会去追会说话的模型, 真正改个人工作流的,往往是这种不会说话、只负责让你找得到东西的小模型。

铁汁们最想先让哪一堆东西变得能搜,相册、会议录音,还是收藏夹呢 https://x.com/victormustar/status/2107521244870615416/video/1

更进一步:量化金融体系

看懂新闻只是起点——沿量化金融路径,把它变成能交付的工程能力

进入量化体系 →

相似阅读

关联信息,但可能不是同一事件