谷歌开源 EmbeddingGemma 2:多模态检索端侧跑通,手机只要 191MB,但先别急着给知识库重建索引

源自252位全网作者

20:52

给私有知识库做过 RAG 的人都知道,最尴尬的从来不是大模型不够聪明,而是资料各躺各的:文字进一个向量库,图片得另配一个视觉模型,录音和视频干脆没法进检索入口。你存了三年的照片、会议录音、带截图的笔记,搜的时候只能靠文件名和手动标签。10 月 6 日,谷歌把 EmbeddingGemma 2 的权重开源了,这堵隔板被直接拆掉:文本、代码、图片、音频、视频,全部映射进同一个 768 维向量空间,一个模型管到底。

先把规格说清楚,这些都是官方文档和社区当天整理出来的口径:740M 参数,Gemma 4 架构,Apache 2.0 协议(商用没有许可障碍),支持超过 100 种语言,上下文窗口从上一代的 2K 扩到 8K token。 单次请求可以塞进最长 5.5 分钟音频、29 张图片、58 帧视频,或者这些模态的交错组合。权重已经在 Hugging Face 和 Kaggle 放出,生态覆盖 vLLM、Ollama、llama.cpp、LMStudio,浏览器端还能走 transformers.js + WebGPU。知乎

真正让端侧党兴奋的是它的模块化设计。740M 是个整体数字,拆开看是 270M 文本编码器 + 170M 视觉编码器 + 300M 音频编码器,用哪块加载哪块。官方给的量化后实测数据是:在 Pixel 11 Pro 上,纯文本模式约 191MB 内存,完整多模态约 567MB。 注意两个坑:第一,参数规模不等于运行内存,191MB 是"量化 + 只开文本模块"的结果;第二,官方同时提醒量化可能影响嵌入质量,别拿参数当部署依据。微博

谷歌开源 EmbeddingGemma 2:多模态检索端侧跑通,手机只要 191MB,但先别急着给知识库重建索引

增量到底有多大,看基准比看发布会诚实。和一代对照,MTEB Code 代码检索从 68.76 分涨到 78.68 分,提升 9.92 个点,但多语言文本项只涨了 0.21 分。 所以这次升级的实质不是"更强",而是"统一"加"代码检索补强"——如果你只做纯文本中文知识库,别指望换模型就召回率飙升。知乎

谷歌开源 EmbeddingGemma 2:多模态检索端侧跑通,手机只要 191MB,但先别急着给知识库重建索引

一代 EmbeddingGemma 已经有约两千万次下载,二代真正吃到的场景是:本地相册自然语言搜索、语音备忘录找视频片段、私有代码库语义检索,这些以前必须云端多模型串联的活儿,现在一个端侧模型就能接。

开源社区第一天就踩出了三个实测层面的坑,值得抄作业前先记住。第一个是相似度门槛:B 站 UP 主"CodingStartup起码课"把模型部署在 DGX Spark 上,用 300 张无标签动物照片做文字搜图,发现文字对图片的分数天然偏低,大致落在 0.6 到 0.76 区间,而图对图、文对文明显更高;他按惯例设了 score>0.8 的门槛,结果一张都搜不出来。 正确姿势是放弃固定阈值,排序取 top-K。要说明的是这是单人单设备的观察,分数区间不能当官方参数用,但"跨模态分数系统性偏低"这个方向值得警惕。第二个是维度裁剪的代价:模型支持 Matryoshka(MRL),768 维可以截到 512/256/128 维,原始向量体积最高省 6 倍;但官方评估里,多模态的 MMEB v2 总分从 59.01(768 维)掉到 45.65(128 维),掉得比纯文本项狠得多。 结论是文本库可以激进省空间,多模态库建议守住 256 维起步,且截断后必须重新 L2 归一化、查询和入库必须同维度。第三个是迁移本身:旧模型算的向量和新一代不互通,换模型等于全库重建索引;官方还要求推理用 bfloat16 或 float32,别图省事上 float16,有出 NaN 和静默降质的风险;用 Sentence Transformers 的话入口版本要 ≥6.1.0。哔哩哔哩知乎

谷歌自己也已经开始给这个底座找落地场景:IT之家 10 月 7 日报道,谷歌推出了搭载 EmbeddingGemma 2 的 macOS 应用,调用麦克风和系统音频,完全离线生成会议纪要。 对端侧用户来说,这比参数表更能说明问题:模型开源只是第一步,官方应用把它变成"开箱就能用"的场景。IT之家

那么谁该动、谁再等等?已经在用云端 embedding API、资料以纯文本为主的人,这次升级对你的价值最薄,继续观望中文实测就行。资料里有图、有录音、有视频,或者像相册、病历这类敏感数据不想上云的人,值得花一个周末做小规模验证:拉两三百条混合资料,先用 768 维跑基线,拿自己真实的查询词和现在的检索方式对比召回,再决定要不要全量迁移。至于买了 DGX Spark、迷你主机这类本地 AI 设备、正在愁"除了跑聊天模型还能干嘛"的人,它提供 OpenAI 兼容格式的 /v1/embeddings 接口,可能是今年最适合拿来当第一个真实用例的端侧模型。哔哩哔哩

谷歌开源 EmbeddingGemma 2:多模态检索端侧跑通,手机只要 191MB,但先别急着给知识库重建索引

把时间线拉长一点看,这不是孤立事件:小米 MiMo 端侧模型 7 月通过国家大模型备案,荣耀和高通在骁龙峰会上宣布共建端侧多模态感知和个人知识库能力,小鹏把原生多模态的 VLM 塞进了整车,Mistral 刚预告的万亿参数 LeChonk 也是原生多模态、月底开放权重。 36 氪那篇报道的标题就叫"大语言模型正式开始吞噬多模态"。 检索层正在从云端 API 往自己设备里沉,EmbeddingGemma 2 是把这条线打通底座的那块拼图。接下来值得盯的信号有三个:中文多模态检索的第三方实测、LiteRT 端侧优化版本的真机数据,以及月底各家新权重发布后"统一向量空间"会不会成为开源模型的标配。届时再看你的知识库要不要整体搬家,不迟。微博36氪

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章