10月6日,法国 Mistral 发布新旗舰:Mistral Large 4,官方昵称"Le Chonk",翻译过来大概叫"大肥猫"。宣传片也很法国:一只橘猫闯进博物馆,在《自由引导人民》面前把巨大的数字"4"撞倒。微博
排面是有的。Hacker News 一天冲到1449分,七成以上正面。"欧洲最强开源万亿模型"的标题刷了两天屏。1.05万亿总参数、490亿激活、100万token上下文、原生多模态、160多种语言,而且是在 Mistral 自家欧洲数据中心里,用3800到4000张英伟达 Grace Blackwell、花约两个月从零训出来的——HN 评论区拿它跟 xAI 二三十万张卡的集群对比,光"单位算力产出"这一条就够欧洲用户嗨一轮。知乎微博
但48小时内风向就变了。独立评测机构泼冷水,中文社区实测接连翻车,"欧洲惊雷"和"营销雷"在评论区打成一团。
我把官方自报、第三方独立实测、社区上手三套数字摆到一起了。这只大肥猫要不要进你的编程模型池,先看完能力、账单、部署这三本账再决定。
第一本账:能力——"欧美最强开源"是真的,但定语里全是学问
先看官方成绩单。注意前提:全是自报,正式基准论文没发,暂无独立复现。知乎
DeepSWE v1.1(编程):62分
Cybench(40道CTF题):解出93%
Dense200(视觉定位):42%,号称压过闭源的 GPT-6 Astra
复现真实开源软件漏洞并打补丁:82%,号称业内最高
有个细节很妙:Mistral 自己放的对比图里,Kimi K3 的 DeepSWE 是68分——比自家62分高。也就是说,官方宣传图的角落里,悄悄把"编程最强开源"的位子让给了月之暗面。哔哩哔哩
再看独立数据。Artificial Analysis(AA)的 Intelligence Index v4.3.2 给 ML4 Preview 打了38分(另有口径38.4)。这个分数放在榜单上:
开源模型里排第8,前7名全部是中国模型——MiMo、GLM-5.3、Kimi 都在它上面。哔哩哔哩
欧美开源里碾压式第一:gpt-oss 只有12分
AA 口径下"美中之外最智能的模型",大致与 GPT-6 Luna(max)持平。微博

所以"欧美最强开源"这话没毛病——毛病在定语。欧美开源本来就没人跟它抢,这个"最强"是矮子里拔将军;而放到全球开源榜,它连第一梯队都没摸到。知乎一位答主的补刀更扎心:跑分能干掉五个月前的1T模型 Kimi 2.6,但打不过各路国产最新的 flash 档。知乎
社区实测把短板进一步摊开:
独立博主 Thorsten Meyer 上手:速度116 tok/s、首响1.46秒、读文档一次能吃100张图,网安子项 CyberGym-E2E 82%压过 Luna 的78%,开源前三——这些是真强项。但他一句话判了死刑:“agentic 和长任务,别用”,实测 ML4 在 agent 场景里照样编造,幻觉在长任务里会滚雪球。知乎
B站UP主"AI产品狙击手"实测翻车现场:强约束指令生成,10句里9句不通顺;让它写个浏览器系统,光思考卡了两小时,最后桌面一片空白;3D赛车游戏直接灵魂拷问"我是谁、车在哪"。哔哩哔哩
有人拿它跑全自动狼人杀,中途卡死——原因倒简单,API太不稳定。
知乎一个16.8万浏览的问题下,高赞回答直说:非官方测试里普遍不如 GLM-5.3 和 Kimi K3,“真的不如 Mistral 之前自己(给客户)部署的 GLM-5.3”。知乎

也要说句公道话:进步是真的。AA 榜单上,Mistral Large 3 只有9分,Medium 3.5 是14分,ML4 一步跳到38——这是欧洲实验室最大的一次跨越。用那位知乎答主的话说:“至少证明了橘猫还活着。”知乎
能力账结论:ML4 不是废柴,是人设超发。它的强项(网络安全、视觉定位、多语言、超长上下文、推理速度)和编程用户日常要的"写代码、跑 agent、修 bug"重叠度不高;而重叠的部分,它目前打不过你手里那些更便宜的国产开源。
第二本账:账单——促销窗口开着,但"单任务成本"才是真账单
API 已经能用了,预览期打五折。截至10月8日官网价格页:微博
项目 | 促销价(美元/百万token) | 原价(美元/百万token) |
|---|---|---|
输入 | 0.68 | 1.36 |
缓存输入 | 0.07 | 0.14 |
输出 | 2.09 | 4.18 |
两个提醒:第一,这是限时促销价,不是批处理价、更不是永久牌价,随时可能恢复原价。第二,就算打着五折,AA 还有一笔更狠的账——ML4 平均每完成一个任务要花1美元出头,是同智力水平开源模型的4倍多。微博哔哩哔哩

为什么"只激活490亿参数"的 MoE,任务成本反而贵4倍?因为账单不按激活参数算,按"跑完一个任务要烧多少轮"算——agent 场景里的幻觉、重试、返工,全都计入任务成本。前面那句"长任务别用"的实测,就是这笔账的注脚:模型短板会直接变成账单上的数字。
知乎那位答主的观察也对上了:ML4 的消耗成本和 GLM-5.3、Kimi K3 差不多,有时候还更贵,但基准普遍不如这两个——同样的钱,买到的能力更少,性价比目前是负的。知乎
账单账结论:对成本敏感的编程用户,现在没有理由换。唯一例外是做网络安全、漏洞研究的——82%的漏洞复现能力是真本事,而且这类请求闭源模型经常拒答,ML4 是少数愿意接活的。
第三本账:部署——笔记本在"万亿"两个字出来时就出局了
权重按计划10月27日开放(也有媒体说"10月底"),许可证至今没公布。哔哩哔哩知乎

想自托管的先别激动,有实测博主把硬件账算好了:
1T 的 MoE 压到 2-bit:需要512GB统一内存的工作站才跑得动,实测速度约15–25 tok/s
想跑 4-bit:需要768GB以上内存的服务器,DDR5 机器实测只有6–10 tok/s
博主的原话很直接——你的笔记本在"万亿"两个字出来时就出局了。这里有个最容易踩的认知坑:49B 激活不等于 49B 存储。MoE 推理时全部1.05万亿参数都得装进内存,激活稀疏省的是计算量,不是显存。知乎
开源这件事背后,还有一层商业课。为什么 API 先行、权重三周后才放?Mistral 官方的说法是:先用这段时间和可信伙伴、政府机构、网络安全防守方做真实场景红队,确保权重"能用来防御,不能被拿去攻击"。而另一种解读更直接——今年6月美国政府以网络攻击担忧为由限制了 OpenAI、Anthropic 模型的分发之后,“主权AI"这个词在欧洲突然好卖了,而 Mistral 恰好有货。有评论把权重称为"高调的亏本诱饵”:真正想做的生意,是把怕断供的政府和企业客户引到自家部署栈和"欧洲主权区"里。首席科学家 Guillaume Lample 那句倒是大实话:权重在手,等于一份没人能收走的完整副本,闭源模型说下架就下架。微博知乎
这套逻辑对金融、制造、公共部门买家成立,对个人开发者只意味着一件事:10月27日那天,先看许可证条款,再喊开源万岁。
所以,这只肥猫到底用不用
分人群给结论:
你是谁 | 建议动作 | 理由 |
|---|---|---|
主力是 Claude Code / Codex / Cursor 订阅 | 无视,或促销期小额试一下 | 你的痛点它一个都没解决,迁移成本大于收益 |
国产开源 API 性价比党(DeepSeek / Kimi / GLM 用户) | 不动,观望 | 能力不如 GLM-5.3、Kimi K3,单任务成本还贵4倍多,性价比为负 |
网络安全 / 漏洞研究场景 | 促销窗口内值得试 | CyberGym-E2E 82%是实测强项,闭源模型这类请求还经常拒答 |
自托管 / 本地部署党 | 日历标记10月27日 | 许可证未公布+512GB内存起步,等开源当天看许可、量化版、推理框架支持再决定 |
往后看的观察信号,也给你列好了:
10月27日权重是否如期放出、许可证是什么条款——这是最大变量,跳票或许可证收紧,前两本账全部重算
官方正式基准论文是否发布,DeepSWE 那62分有没有第三方复现
AA 对权重版的复测——现在38分测的是 Preview API,开源版可能不是一个东西
促销价什么时候结束;vLLM、SGLang 适配后,部署成本能降到多少
CEO Arthur Mensch 说 RL 训练"看不到饱和迹象"——如果属实,ML4.5 可能不远,现在为这个版本焦虑大可不必。知乎
最后说句大场面。这一周开源圈的大新闻密得反常:美国 Reflection 前一天刚发 Beam,法国 Mistral 后一天跟上 Large 4,而榜单对面,开源前七名清一色中国模型。2026年的开放权重前沿,本质上是中国和"所有人"之间的比赛。微博知乎
对咱们围观群众,正确姿势不是站队,而是记住两点:3800张卡、两个月、从零训出万亿参数,这条效率路线是真进步,欧洲在算力不到200MW的家底上端出这盘菜,值得respect。但他们争的也不是跑分,是"单位算力产出"的定价权和主权AI的生意。至于肥猫要不要进你的模型池——对照上面那张表,等10月27日,让数字说话。知乎