过去72小时,多模态大模型圈像被按了快进键:10月6日,谷歌开源了原生多模态嵌入模型 EmbeddingGemma 2,量化后一部手机就能跑。 同一天,Mistral 放出总参数1万亿的 Large 4 预览版,月底开放权重。 今天上午,多模态决策模型 JEMM-27B 开源,工具调用准确率标到93.3%。微博哔哩哔哩知乎
一天三个发布,光追新闻根本追不完。知乎今天一篇讲大模型统一接入的文章里说得挺直白——模型越来越多,但真正把这些模型用起来,好像反而越来越复杂了。 这篇把三天内的发布、9月以来的路线之争和价格战排在一起,告诉你哪些现在就能动手、哪些值得再等等。知乎
今天的事件 | 一句话定性 | 现在该干嘛 |
|---|---|---|
EmbeddingGemma 2 开源(10.6) | 端侧多模态检索的"水电煤" | 可以立刻玩 |
Mistral Large 4 预览(10.6) | 万亿 MoE + 原生多模态,权重月底放 | 先别下结论,等权重 |
JEMM-27B 开源(10.7) | 多模态 Agent 决策模型,刷工具调用 | 做 Agent 的跟进 |
EmbeddingGemma 2:把"一句话搜遍照片视频录音"塞进手机
这是三天里对普通玩家最实用的一条。它干的事很纯粹:把文本、代码、图像、音频、视频映射进同一个768维向量空间——用一句话搜相册里的照片,用文字直接定位视频里的那一秒,甚至用一段语音备忘录去查找对应的画面,全部由一个模型完成,不用再给每种数据类型单独维护编码器。微博
端侧跑得动才是重点。总参数只有740M,而且是模块化的:文本编码器270M、视觉170M、音频300M,按需加载。谷歌给的量化后实测数据是:在 Pixel 11 Pro 上纯文本模式活跃内存约191MB,完整多模态约567MB。 上下文从上一代的2K扩到8K token,单次能吃下29张图、58帧视频或5.5分钟音频;代码嵌入在 MTEB Code 基准上从68.76分提到78.68分,涨了9.92个百分点——本地代码库语义搜索这条路被打通了。知乎

生态给得也齐:Apache 2.0 许可,权重在 Hugging Face 和 Kaggle 放出,vLLM、llama.cpp、Ollama、LMStudio、MLX 都支持,浏览器端可以走 transformers.js + WebGPU,手机端有 LiteRT/MediaPipe,Unsloth 已经上了微调教程。它和 Gemma 4 共享文本分词器和音频编码器,两个一起跑内存更省——"EmbeddingGemma 2 做索引 + Gemma 4 做推理"就是一个完全离线、数据不出门的本地 RAG。另外别忘了上一代纯文本版累计有2000万次下载,轻量本地嵌入模型的需求一直是真实存在的,这次只是把能力从文字扩到了全模态。 谷歌自己也已经下场示范:今天发布的 macOS 应用 AI Edge Foresight,搭载 EmbeddingGemma 做离线会议纪要。知乎微博
但三个坑得先说清。第一,官方口径是"1B参数以下多模态嵌入模型里质量-参数比最高",没有公布绝对精度,知乎上有回答专门强调应用设想属于个人判断、基准成绩均来自官方。 第二,8K 上下文对长视频、大文档仍然有限制,超出29张图/58帧/5.5分钟的范围要自己分段处理。 第三,MRL 支持把768维向量截到512/256/128维,存储最多省6倍,但截得越狠语义损失越大,128维能撑住什么任务官方没给数据;191MB/567MB 也是量化后的数字,原始精度占用更高,量化本身还会影响嵌入质量。知乎知乎
Mistral Large 4:大新闻,但现在只能信一半
10月6日 Mistral 开了 Large 4 的预览 API,昵称 LeChonk:总参数1万亿的 MoE 架构,激活只有49B,原生多模态输入,宣传口径是"在欧洲从零自建训练"、用了3800块英伟达 Grace Blackwell。B站那条加急快讯的评论区118条,热度明显高过同期新闻。
问题在于:开放权重要到10月底才放。现在的一切性能说法都建立在官方预览 API 和自家评测上,第三方还没法复测。对比一下就知道该用什么姿势追:小米 MiMo-V2.6-Pro 是9月22日开源实打实冲上榜首的——不光能处理文字,图片、视频、音频都能识别,还能一次性吃下百万字的长内容。 智谱 GLM-5.3 Flash 是8月27日发布首个原生多模态、还用了国产卡;那类"代码/权重已放出"的节点才轮到下判断。Mistral 这条,先收藏时间线,月底权重落地、看第三方跑分之后再决定要不要动你的选型表。微博
把9月至今的密集发布连起来看:三条路线已经摊牌
这是这轮刷屏里最有认知价值的一层。为什么多模态突然这么吵?因为行业刚刚打完一场"外挂还是灵魂"的辩论——7月 WAIC 上五位首席科学家的交锋议题,现在路线已经分成了三条。36氪
路线一:外挂式。 传统多模态模型=LLM+视觉编码器,视觉 token 是附加物,数量还远超文本 token——1万字文本可能转成3到6万个视觉 token,而文本 token 只有1.5万左右,效率极低。 去年10月 DeepSeek OCR 提出的正是对这个思路的反驳。微博
路线二:原生多模态。 训练起点就把图文音视频混在一起。这条线8-9月集体爆发:MiniMax H3 开源(8月3日,“又强又便宜还开源”)、DeepSeek V4-Flash"长眼"(8月21日)、GLM-5.3 Flash 发布首个原生多模态(8月27日)、DeepSeek V4.1 Flash 新架构内测(9月8日)、MiMo-V2.6-Pro 登顶开源榜(9月22日)。连一直说"多模态不是主线"的梁文锋,8月24日也发了 Vision 模型——态度反转本身就是路线判定的信号。36氪

路线三:LLM"吞噬"多模态。 9月23日发布的 Claude Opus 5.5 展示的是另一个方向:不依赖图像生成模型,直接用 Python 完成风格迁移、用 JavaScript 画完整动画、零素材生成5秒黑洞科普视频,还把 Claude Code 变成一张供开发者随手涂鸦的"餐巾纸"——民间基准"鹈鹕骑自行车"也被这套写法终结。 “一个模型通吃所有模态,生成靠写代码”,36氪那篇稿子给这代模型下的判词就是"大语言模型正式开始吞噬多模态"。36氪


我的判断是:这三条路线不是互相取代,而是分层收敛——生成上卷代码化、理解上卷原生化、检索和部署上卷端侧化。EmbeddingGemma 2 就是"端侧化"的标志性事件:竞争的门票从谁拥有 GPU 集群,变成了谁能把模型塞进用户的手机。小米 MiMo 端侧模型7月通过国家大模型备案、开源引擎 Strata 让12GB显存跑动125B量化模型,都在同一方向上。
价格是另一场该盯住的仗
路线之争之外,成本这半年被按着打:Opus 5.5 比上一代 Opus 5 便宜40%、输出快30%,同窗口期 ChatGPT-6 Sol/Luna 的 API 定价直接腰斩50%。 更早的8月,多模态版 DeepSeek V4-Flash 已经把价格标到1000张图只要1块钱。 一个可以直接落地的结论:现在任何按"特定模型调用价"签的长期成本预算都押早了,半年内大概率还要再降一档;能等 API 的别锁量,能走端侧的(比如上面那个567MB的嵌入模型)优先考虑端侧,省的不只是调用费,还有延迟和隐私成本。36氪36氪
按人给行动卡:现在动手、继续观望、以及观察信号
开发者/本地 RAG 玩家:EmbeddingGemma 2 今天就能上手——先在 PC 上用270M文本模块跑通本地知识库索引,再逐步加载视觉/音频模块,向量库接 Qdrant;手机侧等 LiteRT 官方包和更多真机实测。
等开源权重的选型党:按住,10月底 Mistral Large 4 权重放出来之前,把它的榜单宣传当作"待验证";同价位对比先看已经开源的 MiMo-V2.6-Pro 和 MiniMax H3。
普通用户:你相册里"一句话搜照片/视频/录音"的体验,接下来半年会随手机厂商集成(小米端侧备案、谷歌 Edge Foresight 已经打样)快速普及,装机前多问一句"端侧多模态检索支持到什么程度"。
内容追热点的:本周注意力窗口 EmbeddingGemma 2 > Mistral > JEMM-27B,热点周期约48小时,过完就只剩深度测评位了。
继续盯三个信号:Mistral 月底权重是否如期放出、放出后第三方评测是否兑现"法律金融超越 GPT-6-Astra";EmbeddingGemma 2 的 Unsloth 微调会跑出哪些社区案例;国产阵营(通义、混元、DeepSeek)会不会跟进端侧多模态嵌入——胡瀚离职后腾讯混元团队转向世界模型,各家的牌都会在未来两个月重新洗一次。
三天三连发,其实只讲清了一件事:2026年玩多模态,不再是谁的模型最大,而是谁能让用户在手机上、在自己的硬盘里、用最低的token成本把图文音视频一起搜起来。这一次,先跑起来的那个740M,可能比还没放权重的1万亿更有用。