美版开源模型"比GLM便宜4倍"刷屏这三天:砍的是FLOPs不是账单,追平的是上代GLM-5.2,权重要到月底才有——Reflection和Mistral的自报成绩我摆成两张表
美西时间10月5日,英伟达重仓投资的Reflection AI交出首个开放权重模型Beam,公告里直接点了智谱的名:部分高级推理任务上,推理算力约为GLM-5.2的四分之一到三分之一。一天之后,Mistral Large4跟进,在一场代码质量盲测里把分数压到了GLM-5.3之上。再往后三天,国内平台开始传"美国开源模型杀到GLM斩杀线",B站和知乎接连出现各自的"斩杀线"视频和长文。36氪
最扎的一句其实出自知乎问题区的评论区:“还在跟GLM 5.2比价格,咋不跟GLM 5.3F比啊?”——一句话,把整场热闹里最关键的错位点破了。知乎
先把判断给完:这一轮不是"被杀",是美欧开源模型被资本和算力重新拉回牌桌附近——而它们坐回去的,是上一代的座位。公告真正值得读的,是三处口径错位,我一条条摆给你看。
口径错位一:说"便宜4倍",砍的是FLOPs,不是你的账单
Reflection的原话口径是generation FLOPs(生成算力)降到GLM-5.2的约1/4到1/3——这是一个物理量,不是价格。截至目前,Beam仍处于early access加最终红队测试阶段,权重要等本月晚些时候才以Apache 2.0放出,API价目表一个字都没公布。36氪微博
也就是说,现在能被"便宜4倍"的,只有公告里的算力,不是你账单上的钱。等权重落地、有人真把它跑出速度、有人开始报价,这个"4倍"才有翻译回你的月费的可能。

口径错位二:对标的基准是上代GLM-5.2
全部是Reflection自报的成绩,但摆成表以后,差距自己会说话:
评测(自报口径) | Beam | GLM-5.2 | GLM-5.3 | Kimi K3 | DeepSeek V4.1 Flash |
|---|---|---|---|---|---|
DeepSWE v1.1 | 44.4 | 44.0 | 61.0 | 68.0 | 74.2 |
TerminalBench v2.1 | 80.1 | — | 88.2 | 88.3 | 90.6 |
HLE | 36.2 | — | 42.3 | 46.9 | — |
第一行最直白:44.4对44.0,差0.4——这叫"持平",不叫"反超"。而同一份表上,GLM-5.3是61.0、Kimi K3是68.0、DeepSeek V4.1 Flash是74.2。TerminalBench和HLE同理:80.1对88.2、36.2对42.3,都不是半步的事。Reflection自己也没回避,官方直接承认Kimi K3在绝对能力上仍然领先,顺手把卖点改成"单位算力能换多少智能"。36氪
公告挑GLM-5.2对标、不挑5.3——这个选择本身,就是评论区那句"新闻学的魅力"。知乎

口径错位三:把"已发布"和"还没发生"混着说
这套自报成绩全部建立在:权重未公开、技术报告未放出、第三方独立复现数量为0。这几天B站几支"AI日报"转述的是同一组数字,都老老实实带了"第三方尚未复现"的限定;但到了标题接力里,限定被一层层磨掉了,只剩"4倍"“杀到”。36氪微博

Mistral Large4也是同样的状态:API预览已开,完整权重要等10月底。但平心而论,它在单项上比Beam咬得狠——和SurgeAI合作的盲测里,代码质量3.74,高于GLM-5.3的3.60和GLM-5.2的3.40(低于Claude Opus 5的4.22);AutomationBench的657个跨应用业务工作流里,超过Kimi K3和DeepSeek V4Pro,但仍低于GLM-5.3。注意"和SurgeAI合作"这个措辞:比纯自报可信,但还够不上完全独立第三方。36氪
真实的图景是:美欧开放模型和中国头部开放模型之间的差距,从"看不见车尾"缩到了"一代左右、单项偶尔咬人"。

真正定性的,是这两条统计
HuggingFace数据:过去一年,中国模型占平台模型下载量约41%,月度和累计下载都超过美国模型。36氪
Vercel AI Gateway:今年8月,开放权重模型已经处理其平台56%的token流量,去年12月这个比例还不到10%。
开放模型是全球增长最快的盘子,而这个盘子的重心在中文阵营这边。Reflection两位创始人出自DeepMind(一位做过Gemini的奖励建模,一位参与过AlphaGo/AlphaZero),这次为Beam烧了23.8万亿预训练token、动用超过1万张GB300连续四周高算力强化学习、跑了一亿多次rollout——砸这么大,选的对标线是GLM-5.2。“被当成对标对象”,本身就是上牌桌的证明。这才是这三条新闻合在一起讲的完整故事。36氪知乎

三类人,三笔账
1)118元套餐/API用户:先别动。10月底之前,"搬家"没有"家"可搬。这个月真正要算的账,是10/7免费窗口收掉之后的续费成本、effort档位和FlashX那档2.5倍定价——这些都跟Beam无关,别把两本账混着算。
2)自部署玩家:兜里揣好这道算术。Beam总参数501B、每token激活约23B(激活比例4.59%),按4bit估算权重约250GB量级——注意,这是知乎拆解放里明写的"算术估算,不代表实测文件大小或最低显存要求"。它到底进不进得了你的机箱、首token几秒、1M上下文并发下稳不稳,全是权重放出后的实测题。值得等的不是那个"4倍",是"同硬件、同精度、可复现"的第三笔实测。知乎
3)转发"GLM被杀"标题的人:先问三个问题——“比谁便宜4倍”(GLM-5.2)、“4倍是什么单位”(FLOPs,不是钱)、“数字是谁的表”(自报,权重未放)。三个答案凑齐,标题基本就没法原样转了。
接下来盯什么(都已有日历位)
10月底:Beam的Apache 2.0权重与技术报告、Mistral Large4的完整权重。两场落地之后,等第三方同硬件实测出现,再谈换不换。36氪
路线信号:Reflection已经明说,2027年要发更大模型,并继续走"基座模型+多个RL增强版本"——这正是GLM们已经跑通的发布节奏。
价格信号:GLM这端会不会用降价或新Flash档,回应"单位算力智能"叙事——这是套餐用户最该盯的一条。
开源的护城河从来不是"没人追得上",而是"你追上来的时候,我的价格已经降过一轮"。效率这个故事,美欧模型刚开始学着讲,GLM的用户过去三个月已经算得滚瓜烂熟。这一轮,对面刚发完公告,我们这边已经算完账了。