微信把朋友圈背后的"找图"底座开源了:榜单只赢0.1分,这11.1分才是真信号

源自30位全网作者

06:50

8月25日,微信视觉团队开源 WeMM-Embedding 的那天,科技资讯的热度位被 GLM-5.3-Flash 的"一折"和 Qwen3.8-Flash-Next 占着。知乎知乎高赞回答的作者自己都说:"差点都没注意到这个。"十几天过去,9月6日知乎又开了新问题把它捞出来,讨论还是温的。

但这个模型的来头不小。官方口径:文本、图片、视频、扫描文档、图文交错输入五类内容编码进同一个向量空间,9B 版本在 MMEB-v2 上以 80.6 分排榜单第一(快照截至8月24日),而且它已经在视频号、公众号、微信搜索和电商内容的检索与推荐里生产运行。知乎微博上有账号直接给它带上"世界第一的AI模型"的帽子。微博这句话得先修一修:它是"MMEB 多模态榜单第一",不是"所有场景都第一"。

微信把朋友圈背后的

对做企业知识库、以图搜图、多模态 RAG 或 Agent 记忆检索的人来说,真正值得停下来的理由是:过去只有 Google 闭源的 Gemini Embedding 2 提供的"大一统多模态向量底座",第一次有了 Apache 2.0、可免费商用、且被验证过线上规模的开源平替。换不换、换哪档、怎么上车,先算清两笔账。

第一笔账:"2B 掀翻 8B"到底几成真

先拆标题党。所谓"2B 掀翻 8B",指 MMEB-v2 的 78 个数据集上,WeMM-2B 拿 77.9,阿里的 Qwen3-VL-Embedding-8B 拿 77.8——差 0.1 分,官方口径也只能写"略高于",这不是碾压。知乎9B 的 80.6(图像 81.9、视频 74.3、视觉文档 83.3)才是真登顶。

微信把朋友圈背后的

真正该盯的是另一组数字:微信内部 26 项任务(分类、搜索、跨领域内容匹配、文章相关性、视频相关性五类),WeMM-2B 平均 72.0,同规模的 Qwen3-VL-Embedding-2B 只有 60.9——差 11.1 分。知乎另外在 MMEB 口径下,2B 对同规模对手高出 4.7 分,视频分项高出 8.9 分。知乎

同一模型、同门对比,公开榜单差 0.1、内部任务差 11.1,为什么?答案在训练配方里,而不在参数量里。第一阶段用数亿组"来源—目标"匹配样本建立公共向量空间;第二阶段只用十分之一的精选数据做细活:把"搜红色跑车、负样本是猫"这种轻松负例,换成"蓝色跑车、红色轿车、跑车内饰"这类容易混淆的困难负例;给每个匹配任务下任务指令(“根据文字找图片"还是"根据任务找工具”);再用 Reranker 的排序判断和 9B 教师模型蒸馏反哺 2B、4B。消融实验很直接:把第一阶段改成任务不一致的混批,2B 小规模实验的 MMEB-v2 总分掉 3.4 分;第二阶段逐项叠加精选数据、Reranker 监督、蒸馏和更高视觉输入预算,总分从 75.7 爬到 77.9。知乎

所以这笔账的正确读法是:不是小模型大胜大模型,而是"贴着检索任务练"把同档差距拉开了。公开榜单只回答共同考题上的相对水平,微信那 14 项线上 A/B 测试的一致提升(论文未公布逐场指标、流量规模和置信区间)才更接近生产证据。知乎拿 MMEB 决定换不换模型,看的是错的列。

第二笔账:模型大小是编码成本,向量维度是存储成本

WeMM 最有工程味的是内置 Matryoshka 嵌套向量(MRL):同一份权重,截前 N 维再 L2 重归一化就能当低维向量用,不用重新前向。官方给的数字:2B 的 256 维向量,图像和视频任务保留了完整 2048 维表现的 98.7%;但视觉文档对降维更敏感,检索类任务在 64、128 维下滑明显,分类最抗压缩。知乎

微信把朋友圈背后的

翻成账单(按 fp32 粗算):一条 2048 维向量 8KB,一百万条就是 8GB 级;截到 256 维只剩约 1GB,64 维约 256MB——存储、内存驻留索引和距离计算的带宽同比例往下掉,代价是不同任务类型的损失不一样。所以选型要把两个旋钮分开拧:参数量(2B/4B/9B)决定编码成本和效果上限,维度截断(从 64 档直到模型全维:2B/9B 为 2048、4B 为 2560)决定检索侧的存储和延迟。2B 不等于"成本是 9B 的四分之一"——视频抽帧数、输入长度、并发和量化都进同一张账单。

还有一个高频翻车点:截维后必须再做一次 L2 归一化,否则余弦相似度直接失真。这是 MRL 落地里成本最低、犯的人最多的 bug。知乎

三个雷,先避开再上车

第一,不支持音频。MMEB-v3 共 190 项任务(53 文本、47 Agent、11 音频加多模态复合),WeMM-9B 总分 59.5,其中 11 项音频任务因为不支持直接记 0。“多模态"不是"全模态”,语音检索链路得另配模型。知乎

微信把朋友圈背后的

第二,embedding 是"按意思找",不是"按字面找"。评论区那句"embedding 不适合 OCR,只能提取语义"只说对了一半:向量确实搜不到票面上一串精确字符,那要留给 OCR;但 WeMM 支持视觉文档输入,表格截图、扫描 PDF 页可以直接进召回链路——搜"上个月报销的那张发票"可行,搜"发票上 2026 开头的编号"不行。

第三,版本锁得很死。官方推理要求 transformers==5.2.0,版本不一致模型照样跑,但预处理差异会让向量结果不可复现;服务侧官方测的是 vLLM 0.27.0 和 SGLang 0.5.9。知乎上生产前把推理环境固化进镜像。

谁该动手,谁再等等

建议立刻测试的:还在用纯文本向量模型硬撑图文搜索、企业知识库里表格和扫描件检索只命中正文、或者一直想搭一套统一向量空间多模态 RAG 的人。起步用 2B 就够——fp16 权重约 4—5GB 显存(按参数量折算的估算),主流消费级显卡能跑原型。

建议再观望的:链路含音频的;医疗影像、工业质检这类垂直场景(官方也要求私有数据重测,必要时微调);一直用云端 embedding API 的团队——先算自持 GPU 和数据管道的运维账,再谈省钱。

迁移三步照官方建议的顺序来:先用全维向量打通链路、和现用模型跑同题对照;再逐档截维度,每档记召回、延迟、索引体积;离线指标过了,才去对点击、转化这类线上目标——离线多一分,不保证线上赢。评论区也有现成的反例提醒:有从业者说 2B 的跑分不可信、MMEB 评测太弱,去年那代 embedding 王者的三档模型跑分没差太多、实际效果却天差地别。知乎榜单是筛子,自家数据才是裁判。

三个值得继续盯的信号:微信会不会补上音频模态;14 项 A/B 的逐场指标、流量和置信区间有没有公开版本;MMEB-v2 榜首能坐多久——Gemini Embedding 2 依然闭源,阿里的 embedding 线历来追新快,第二波反超大概率在路上。

一句话收账:80.6 负责让它进你的候选名单,11.1 分负责让你动手测试,256 维那个 98.7% 负责决定你的账单。至于"朋友圈背后的找图能力到手里了"这件事本身——先拿自己的十万张图试试,再发朋友圈。

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章