8月26日晚上,圈内都在数Qwen3.8-Flash和智谱GLM-5.3-Flash前后脚发布的间隔,同一个时间窗口里,微信视觉团队悄悄开源了一个更低调的东西:WeMM-Embedding。8月25日发布,代码和权重全开,Apache 2.0协议。
你可能没听过「Embedding模型」这个词,但你大概率已经用上它了:微信里现在能搜到「朋友半个月前发的那张截图」,搜一搜开始能理解图片和视频,底层靠的就是这类东西。
微信这次开源的是什么
一句话:把文字、图片、视频、视觉文档、图文混排这五种内容,全部压进同一套坐标系的多模态向量模型。
以前这五种内容各走各的索引:图片靠标签,文档靠OCR转字,图文混排干脆放弃。现在一个模型统一成同一套「坐标」,语义接近的内容在坐标上就挨着,搜索、推荐、去重、RAG检索都能用。它有2B、4B、9B三个尺寸,代码和权重完整开源。知乎按技术报告的说法,它已经跑在微信视频号、公众号、朋友圈、搜一搜等核心业务里,经历过14轮线上A/B测试。知乎比起「又一个开源模型」,这次更有意思的点是:它不是一个刷完榜就放出来的模型,而是先在十亿级用户身上验证过,再把底座拆出来给你看。
跑分含金量,先看三组数
先看最出圈的:9B版在MMEB-v2(当前主流的多模态嵌入评测,覆盖78项任务)上拿了80.6分,登顶总榜,压过了现有的开源和闭源商业模型。知乎但我觉得更值得说的是2B版的成绩:77.9分。
什么概念?同一个榜单上,此前最强的开源模型是8B参数级的Qwen3-VL-Embedding-8B,77.8分,WeMM用2B参数超了它0.1分。对比同尺寸的2B对手,它领先4.7分,视频任务领先8.9分(70.8对61.9)。知乎知乎

这里要说句公道话:对8B那0.1分的差距,谈不上「碾压」,这个数字真正证明的是参数效率——用更小的显存、更低的推理成本,够到之前8B才能到的线。这对真要部署模型的人来说,是比榜首更值钱的信息。
再看两个参照:同样8B参数的早期方案GME,在MMEB-v2上只有59.2分;榜单上还有一个叫DME的「幽灵」,2B版74.8分排第二,但闭源提交,没权重、没推理接口,看得到摸不着。开源榜单上真正有意义的,还是能抱回家的开源权重。
2B凭什么够到8B的线
第一个原因不玄学:底座选得对。WeMM-Embedding直接用了原生多模态的Qwen3.5架构当共享编码器,文字、图片本来就混在一条序列里进模型,而不是像CLIP那样两个塔各算各的再拼接。在HuggingFace上,它的自定义代码只有约1.2KB——继承Qwen3.5主体、加一个取向量的方法。知乎换句话说,它和Qwen的差距主要不在架构,在训练数据。
第二个原因是训练方法:两阶段「先广后深」。第一阶段在数亿级数据上做粗对齐;第二阶段换成约十分之一规模的精选集,先去重、补长尾,再加入大量「困难负例」——搜「红色跑车」时,负例不是「一只猫」这种送分题,而是「蓝色跑车」「红色轿车内饰」这种逼着模型分清细微差别的样本,最后让9B模型当老师,把自己的判断方式蒸馏给2B和4B。

第三个原因,知乎社区讨论得很多:微信坐拥截图、表情包、转账凭证这类最真实的图文混排聊天数据,这是通用爬虫里最稀缺的东西,视频和视觉文档任务分数高,大概率是喂出来的。知乎注意,这是社区推测,不是官方口径。
当然也要泼盆冷水:技术报告只说了14轮A/B「一致改进」,没公开逐场指标、流量规模和置信区间,内部26项基准外部也无法复算。严谨的表述是「论文报告一致改进」,而不是「外部已证明所有微信场景都增益」。
真想部署,先算这三笔账
如果你打算把它放进自己的项目,先把三笔账算清楚。
第一笔,参数账。别急着上9B。2B就足够做私有数据的基线,它的成绩已经够到之前8B的线,部署成本却低得多;4B是中间档,最大维度给到2560;9B是冲公开榜上限的,显存、吞吐、服务成本完全是另一个概念。
第二笔,维度账。它支持「俄罗斯套娃」式降维:满血2048维,只取前256维,图像和视频任务的性能还能保住98.7%。知乎这意味着一个模型能干两份活——粗筛用短向量,存储省到约十分之一;精排用全向量。vLLM、SGLang开箱支持,部署最后一公里不卡人。

第三笔,边界账。三件事记牢:音频不支持,技术报告里音频任务老老实实记的零分,业务里带音频的,它没法独立扛下这部分。知乎复现要锁transformers版本,别拿环境问题冤枉模型。知乎纯文本检索不是它的主场,成熟的文本嵌入模型更便宜更快,杀鸡不用牛刀。
所以适合谁:做企业知识库的团队(员工上传的文件一半是扫描件和PPT)、做多模态搜索的内容平台(「那张有猫的图」以后能直接搜)、攒了一堆多模态素材要跨格式找东西的个人开发者。不适合谁:纯文本场景、有音频检索需求的、显存紧张还硬要上9B的。
为什么这事比「又开源一个模型」大
先说最直接的:你今年在微信里翻聊天记录找人、找图变快,搜截图和表格能搜出来了,背后就是这类底座在换。
往行业说,嵌入模型升级的是RAG的地基。以前做RAG,遇到截图、PDF扫描件、视频,要么先OCR转成文字再嵌入,语义丢一半、版式全丢;要么干脆放弃检索这些内容。多模态嵌入等于把这些内容第一次纳入了统一的检索体系——地基动一动,上面的应用都受益。
但社区里有盆冷水值得原样端上来:Agent应用里检索的难点,从来不是「语义相似度算得准不准」,而是「该在什么时机、喂多少上下文」。知乎这不是换个嵌入模型能解决的,别指望换一个模型就让Agent变聪明。
后面值得盯两个信号:一是团队官方说了,下一步会拓展音频模态、在更大参数规模上继续迭代;二是外部团队能不能在私有数据上复现榜单优势——榜单只是入场券,自己数据上的对照实验才是裁判。知乎