自报“欧美最强开源”,独立实测38分、前7名全是中国模型:法国万亿参数“大肥猫”发布即人设翻车——进编程模型池、等10月27日开源还是无视?先看完能力、账单、部署这三本账

源自252位全网作者

09:00

10月6日,法国 Mistral 发布新旗舰:Mistral Large 4,官方昵称"Le Chonk",翻译过来大概叫"大肥猫"。宣传片也很法国:一只橘猫闯进博物馆,在《自由引导人民》面前把巨大的数字"4"撞倒。微博

排面是有的。Hacker News 一天冲到1449分,七成以上正面。"欧洲最强开源万亿模型"的标题刷了两天屏。1.05万亿总参数、490亿激活、100万token上下文、原生多模态、160多种语言,而且是在 Mistral 自家欧洲数据中心里,用3800到4000张英伟达 Grace Blackwell、花约两个月从零训出来的——HN 评论区拿它跟 xAI 二三十万张卡的集群对比,光"单位算力产出"这一条就够欧洲用户嗨一轮。知乎微博

但48小时内风向就变了。独立评测机构泼冷水,中文社区实测接连翻车,"欧洲惊雷"和"营销雷"在评论区打成一团。

我把官方自报、第三方独立实测、社区上手三套数字摆到一起了。这只大肥猫要不要进你的编程模型池,先看完能力、账单、部署这三本账再决定。

第一本账:能力——"欧美最强开源"是真的,但定语里全是学问

先看官方成绩单。注意前提:全是自报,正式基准论文没发,暂无独立复现。知乎

  • DeepSWE v1.1(编程):62分

  • Cybench(40道CTF题):解出93%

  • Dense200(视觉定位):42%,号称压过闭源的 GPT-6 Astra

  • 复现真实开源软件漏洞并打补丁:82%,号称业内最高

有个细节很妙:Mistral 自己放的对比图里,Kimi K3 的 DeepSWE 是68分——比自家62分高。也就是说,官方宣传图的角落里,悄悄把"编程最强开源"的位子让给了月之暗面。哔哩哔哩

再看独立数据。Artificial Analysis(AA)的 Intelligence Index v4.3.2 给 ML4 Preview 打了38分(另有口径38.4)。这个分数放在榜单上:

  • 开源模型里排第8,前7名全部是中国模型——MiMo、GLM-5.3、Kimi 都在它上面。哔哩哔哩

  • 欧美开源里碾压式第一:gpt-oss 只有12分

  • AA 口径下"美中之外最智能的模型",大致与 GPT-6 Luna(max)持平。微博

自报“欧美最强开源”,独立实测38分、前7名全是中国模型:法国万亿参数“大肥猫”发布即人设翻车——进编程模型池、等10月27日开源还是无视?先看完能力、账单、部署这三本账

所以"欧美最强开源"这话没毛病——毛病在定语。欧美开源本来就没人跟它抢,这个"最强"是矮子里拔将军;而放到全球开源榜,它连第一梯队都没摸到。知乎一位答主的补刀更扎心:跑分能干掉五个月前的1T模型 Kimi 2.6,但打不过各路国产最新的 flash 档。知乎

社区实测把短板进一步摊开:

  • 独立博主 Thorsten Meyer 上手:速度116 tok/s、首响1.46秒、读文档一次能吃100张图,网安子项 CyberGym-E2E 82%压过 Luna 的78%,开源前三——这些是真强项。但他一句话判了死刑:“agentic 和长任务,别用”,实测 ML4 在 agent 场景里照样编造,幻觉在长任务里会滚雪球。知乎

  • B站UP主"AI产品狙击手"实测翻车现场:强约束指令生成,10句里9句不通顺;让它写个浏览器系统,光思考卡了两小时,最后桌面一片空白;3D赛车游戏直接灵魂拷问"我是谁、车在哪"。哔哩哔哩

  • 有人拿它跑全自动狼人杀,中途卡死——原因倒简单,API太不稳定。

  • 知乎一个16.8万浏览的问题下,高赞回答直说:非官方测试里普遍不如 GLM-5.3 和 Kimi K3,“真的不如 Mistral 之前自己(给客户)部署的 GLM-5.3”。知乎

自报“欧美最强开源”,独立实测38分、前7名全是中国模型:法国万亿参数“大肥猫”发布即人设翻车——进编程模型池、等10月27日开源还是无视?先看完能力、账单、部署这三本账

也要说句公道话:进步是真的。AA 榜单上,Mistral Large 3 只有9分,Medium 3.5 是14分,ML4 一步跳到38——这是欧洲实验室最大的一次跨越。用那位知乎答主的话说:“至少证明了橘猫还活着。”知乎

能力账结论:ML4 不是废柴,是人设超发。它的强项(网络安全、视觉定位、多语言、超长上下文、推理速度)和编程用户日常要的"写代码、跑 agent、修 bug"重叠度不高;而重叠的部分,它目前打不过你手里那些更便宜的国产开源。

第二本账:账单——促销窗口开着,但"单任务成本"才是真账单

API 已经能用了,预览期打五折。截至10月8日官网价格页:微博

项目

促销价(美元/百万token)

原价(美元/百万token)

输入

0.68

1.36

缓存输入

0.07

0.14

输出

2.09

4.18

两个提醒:第一,这是限时促销价,不是批处理价、更不是永久牌价,随时可能恢复原价。第二,就算打着五折,AA 还有一笔更狠的账——ML4 平均每完成一个任务要花1美元出头,是同智力水平开源模型的4倍多。微博哔哩哔哩

自报“欧美最强开源”,独立实测38分、前7名全是中国模型:法国万亿参数“大肥猫”发布即人设翻车——进编程模型池、等10月27日开源还是无视?先看完能力、账单、部署这三本账

为什么"只激活490亿参数"的 MoE,任务成本反而贵4倍?因为账单不按激活参数算,按"跑完一个任务要烧多少轮"算——agent 场景里的幻觉、重试、返工,全都计入任务成本。前面那句"长任务别用"的实测,就是这笔账的注脚:模型短板会直接变成账单上的数字。

知乎那位答主的观察也对上了:ML4 的消耗成本和 GLM-5.3、Kimi K3 差不多,有时候还更贵,但基准普遍不如这两个——同样的钱,买到的能力更少,性价比目前是负的。知乎

账单账结论:对成本敏感的编程用户,现在没有理由换。唯一例外是做网络安全、漏洞研究的——82%的漏洞复现能力是真本事,而且这类请求闭源模型经常拒答,ML4 是少数愿意接活的。

第三本账:部署——笔记本在"万亿"两个字出来时就出局了

权重按计划10月27日开放(也有媒体说"10月底"),许可证至今没公布。哔哩哔哩知乎

自报“欧美最强开源”,独立实测38分、前7名全是中国模型:法国万亿参数“大肥猫”发布即人设翻车——进编程模型池、等10月27日开源还是无视?先看完能力、账单、部署这三本账

想自托管的先别激动,有实测博主把硬件账算好了:

  • 1T 的 MoE 压到 2-bit:需要512GB统一内存的工作站才跑得动,实测速度约15–25 tok/s

  • 想跑 4-bit:需要768GB以上内存的服务器,DDR5 机器实测只有6–10 tok/s

博主的原话很直接——你的笔记本在"万亿"两个字出来时就出局了。这里有个最容易踩的认知坑:49B 激活不等于 49B 存储。MoE 推理时全部1.05万亿参数都得装进内存,激活稀疏省的是计算量,不是显存。知乎

开源这件事背后,还有一层商业课。为什么 API 先行、权重三周后才放?Mistral 官方的说法是:先用这段时间和可信伙伴、政府机构、网络安全防守方做真实场景红队,确保权重"能用来防御,不能被拿去攻击"。而另一种解读更直接——今年6月美国政府以网络攻击担忧为由限制了 OpenAI、Anthropic 模型的分发之后,“主权AI"这个词在欧洲突然好卖了,而 Mistral 恰好有货。有评论把权重称为"高调的亏本诱饵”:真正想做的生意,是把怕断供的政府和企业客户引到自家部署栈和"欧洲主权区"里。首席科学家 Guillaume Lample 那句倒是大实话:权重在手,等于一份没人能收走的完整副本,闭源模型说下架就下架。微博知乎

这套逻辑对金融、制造、公共部门买家成立,对个人开发者只意味着一件事:10月27日那天,先看许可证条款,再喊开源万岁。

所以,这只肥猫到底用不用

分人群给结论:

你是谁

建议动作

理由

主力是 Claude Code / Codex / Cursor 订阅

无视,或促销期小额试一下

你的痛点它一个都没解决,迁移成本大于收益

国产开源 API 性价比党(DeepSeek / Kimi / GLM 用户)

不动,观望

能力不如 GLM-5.3、Kimi K3,单任务成本还贵4倍多,性价比为负

网络安全 / 漏洞研究场景

促销窗口内值得试

CyberGym-E2E 82%是实测强项,闭源模型这类请求还经常拒答

自托管 / 本地部署党

日历标记10月27日

许可证未公布+512GB内存起步,等开源当天看许可、量化版、推理框架支持再决定

往后看的观察信号,也给你列好了:

  1. 10月27日权重是否如期放出、许可证是什么条款——这是最大变量,跳票或许可证收紧,前两本账全部重算

  2. 官方正式基准论文是否发布,DeepSWE 那62分有没有第三方复现

  3. AA 对权重版的复测——现在38分测的是 Preview API,开源版可能不是一个东西

  4. 促销价什么时候结束;vLLM、SGLang 适配后,部署成本能降到多少

  5. CEO Arthur Mensch 说 RL 训练"看不到饱和迹象"——如果属实,ML4.5 可能不远,现在为这个版本焦虑大可不必。知乎

最后说句大场面。这一周开源圈的大新闻密得反常:美国 Reflection 前一天刚发 Beam,法国 Mistral 后一天跟上 Large 4,而榜单对面,开源前七名清一色中国模型。2026年的开放权重前沿,本质上是中国和"所有人"之间的比赛。微博知乎

对咱们围观群众,正确姿势不是站队,而是记住两点:3800张卡、两个月、从零训出万亿参数,这条效率路线是真进步,欧洲在算力不到200MW的家底上端出这盘菜,值得respect。但他们争的也不是跑分,是"单位算力产出"的定价权和主权AI的生意。至于肥猫要不要进你的模型池——对照上面那张表,等10月27日,让数字说话。知乎

精选参考来源

内容由AI生成

精选参考来源

1. #海外新鲜事#【法国AI公司Mistral发布迄今最大模型】法国AI明星公司 Mistral AI 这周发布了目前规模最大的模型,并给它取了一个很法国、也很互联网的名字——“Le Chonk”,意为“一只大胖猫”。所以官方宣传视频也很有意思:一只橘猫闯进博物馆,把巨大的数字“4”撞倒在《自由引导人民》前。玩笑背后,技术规格相当硬核:🔹 1万亿参数,但每个词实际只激活约490亿参数🔹 使用约 4000块英伟达GPU,训练约两个月🔹 支持 160多种语言,包括欧盟全部官方语言🔹 从研发、训练到部署,全部在欧洲完成,并可通过Mistral自己的欧洲云使用🔹 今天起向开发者开放;模型权重预计在10月底向所有人开放下载Mistral称,这是目前欧美表现最好的开放模型之一。但这款模型在一些专业任务上已经表现非常突出,例如图像中的物体识别,包括卫星照片、技术图纸等;在网络安全和金融领域的测试中也处于领先水平。更重要的是,它代表着欧洲正在尝试建立一套从模型研发、算力训练,到云端部署都掌握在自己手中的AI体系。#法兰西的故事##微博兴趣创作计划##人工智能# 漆园隐吏在巴黎的微博视频

2. Mistral新王炸Le Chonk,被Claude和GPT甩出两条街

3. Mistral 发布 Large 4:1.05 万亿参数,智能指数追平 GPT-6 Luna,权重月底开源Mistral AI 10月6日发布新一代旗舰模型 Mistral Large 4(内部代号 Le Chonk),采用细粒度混合专家架构,总参数1.05万亿、单次激活490亿,另配16亿参数视觉编码器,上下文窗口支持到100万 token,原生支持超过160种语言。Mistral 称模型从零训练,动用约3800张英伟达 Grace Blackwell GPU、在其欧洲自有数据中心训练约两个月。第三方 Artificial Analysis 测得其智能指数38分,与 GPT-6 Luna(max)持平,为该机构口径下美中之外最智能的模型。OpenAI 安全系统团队负责人辞职,公开发文称公司”文化崩坏”当地时间10月3日,OpenAI 安全系统团队负责人大卫·罗宾逊(David Robinson)离职,并在《大西洋月刊》发表题为《我离开 OpenAI,因为它的文化已经崩坏》的文章。罗宾逊在 OpenAI 任职约三年半,负责安全团队透明度工作,参与起草”准备度框架”(Preparedness Framework),并为12次前沿模型发布撰写安全报告。他在文中批评公司依赖”迭代部署”——先发布系统、事后补护栏,指出随着模型能力增强,偶发事故的影响会越来越大;主张前沿实验室应借鉴核电、航空等高危行业做法,引入多层冗余与慢节奏规划,并发展新的对齐科学。OpenAI 发言人回应称,公司确保模型能力不超过可安全管控的范围,必要时暂停训练或扣发模型,并正扩大第三方评估与实时监控。此前 OpenAI 于10月1日以”处理敏感材料”为由解雇三名研究人员。

4. 欧洲惊雷!Mistral Large 4开源炸场曝欧洲第一,开源巨兽震撼破壳,全球大模型格局彻底洗牌!

5. 怎么看英伟达重仓投资公司推出纯血美国开源模型 Beam,对标 GLM 5.2,但推理成本便宜 4 倍?

6. Mistral Large 4.0 测评报告!中美之外的法国黑马?

7. 如何看待法国AI公司Mistral发布的最新模型Mistral Large 4?

8. #Mistral##多模态模型##Token价格#【行业动态:Mistral Large 4开放API预览,当前官网显示五折促销价】Mistral于10月6日开放Mistral Large 4的API公开预览。模型支持百万Token上下文和多模态输入,权重计划在本月底公开,目前不能写成已经可下载部署。截至10月8日,官方价格页显示,每百万Token输入、缓存输入、输出促销价分别为0.68美元、0.07美元和2.09美元,对应划线列价为1.36美元、0.14美元和4.18美元。页面标注的是促销价,不能把半价直接解释为批处理价,也不能当作永久牌价。采购比较应将预览API与未来权重部署分开,后者仍须等待实际发布与许可条件。

9. Mistral大肥猫万亿参数每次只醒五百亿,为什么一个任务反而贵四倍多

10. 《Mistral 扔出 1 万亿参数"胖猫":这年头,"开源"是个生意词》

11. 1 万亿参数,4000 张 Nvidia GPU。 法国 Mistral 刚发布的 Mistral Large 4(内部昵称 Le Chonk),完全在自有算力上训练,周期约两个月。按 Mistral 科学副总裁 Pierre Stock 的说法,这个投入比中国竞争对手少两到三倍。 参数结构上,1 万亿是总参数量,每个 token 只激活约 490 亿——稀疏专家模型的常规做法,总参数管知识容量,激活参数管单次计算量。 但注意时间差:ML4 现在不是开放权重的,只通过带护栏的公开端点预览,权重三周后才放。Mistral 的说法是先用这段时间和可信伙伴、政府机构一起测,确保权重"能用来防御,不能被拿去攻击"。开源在这里变成了一笔需要预付时间的交易。 自评"中国以外最强开源权重模型",但正式基准还没发,编码方向也承认落后前沿。 #AI##Mistral##开源模型##算力# 少用算力算不算真本事?评论区聊聊。

12. "大块头"的底气:4000 块芯片自家炼,Mistral 要把"欧洲制造"卖给全世界

13. #AI论道# 【海外开源模型重新提速:Reflection发布Beam,Mistral推出Large 4】大模型之家讯 近日,西方开放模型阵营开始提速。当地时间10月5日,被称作“美版DeepSeek”的美国创业公司Reflection发布首款开放权重模型Beam;一天后法国Mistral推出迄今最大的Mistral Large 4。两家发布时的主要比较对象高度一致:GLM、Kimi、DeepSeek、Qwen。Beam为MoE模型,每Token激活230亿,使用23.8万亿Token预训练。横向对比,Beam距中国最新一代模型仍有差距:DeepSWE v1.1中Beam得44.4,低于GLM-5.3的61.0、Kimi K3的68.0和DeepSeek V4.1 Flash的74.2。 #开源大模型##Mistral#

0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章