美版开源模型"比GLM便宜4倍"刷屏这三天:砍的是FLOPs不是账单,追平的是上代GLM-5.2,权重要到月底才有——Reflection和Mistral的自报成绩我摆成两张表

源自168位全网作者

12:29

美版开源模型"比GLM便宜4倍"刷屏这三天:砍的是FLOPs不是账单,追平的是上代GLM-5.2,权重要到月底才有——Reflection和Mistral的自报成绩我摆成两张表

美西时间10月5日,英伟达重仓投资的Reflection AI交出首个开放权重模型Beam,公告里直接点了智谱的名:部分高级推理任务上,推理算力约为GLM-5.2的四分之一到三分之一。一天之后,Mistral Large4跟进,在一场代码质量盲测里把分数压到了GLM-5.3之上。再往后三天,国内平台开始传"美国开源模型杀到GLM斩杀线",B站和知乎接连出现各自的"斩杀线"视频和长文。36氪

最扎的一句其实出自知乎问题区的评论区:“还在跟GLM 5.2比价格,咋不跟GLM 5.3F比啊?”——一句话,把整场热闹里最关键的错位点破了。知乎

先把判断给完:这一轮不是"被杀",是美欧开源模型被资本和算力重新拉回牌桌附近——而它们坐回去的,是上一代的座位。公告真正值得读的,是三处口径错位,我一条条摆给你看。

口径错位一:说"便宜4倍",砍的是FLOPs,不是你的账单

Reflection的原话口径是generation FLOPs(生成算力)降到GLM-5.2的约1/4到1/3——这是一个物理量,不是价格。截至目前,Beam仍处于early access加最终红队测试阶段,权重要等本月晚些时候才以Apache 2.0放出,API价目表一个字都没公布。36氪微博

也就是说,现在能被"便宜4倍"的,只有公告里的算力,不是你账单上的钱。等权重落地、有人真把它跑出速度、有人开始报价,这个"4倍"才有翻译回你的月费的可能。

美版开源模型

口径错位二:对标的基准是上代GLM-5.2

全部是Reflection自报的成绩,但摆成表以后,差距自己会说话:

评测(自报口径)

Beam

GLM-5.2

GLM-5.3

Kimi K3

DeepSeek V4.1 Flash

DeepSWE v1.1

44.4

44.0

61.0

68.0

74.2

TerminalBench v2.1

80.1

—

88.2

88.3

90.6

HLE

36.2

—

42.3

46.9

—

第一行最直白:44.4对44.0,差0.4——这叫"持平",不叫"反超"。而同一份表上,GLM-5.3是61.0、Kimi K3是68.0、DeepSeek V4.1 Flash是74.2。TerminalBench和HLE同理:80.1对88.2、36.2对42.3,都不是半步的事。Reflection自己也没回避,官方直接承认Kimi K3在绝对能力上仍然领先,顺手把卖点改成"单位算力能换多少智能"。36氪

公告挑GLM-5.2对标、不挑5.3——这个选择本身,就是评论区那句"新闻学的魅力"。知乎

美版开源模型

口径错位三:把"已发布"和"还没发生"混着说

这套自报成绩全部建立在:权重未公开、技术报告未放出、第三方独立复现数量为0。这几天B站几支"AI日报"转述的是同一组数字,都老老实实带了"第三方尚未复现"的限定;但到了标题接力里,限定被一层层磨掉了,只剩"4倍"“杀到”。36氪微博

美版开源模型

Mistral Large4也是同样的状态:API预览已开,完整权重要等10月底。但平心而论,它在单项上比Beam咬得狠——和SurgeAI合作的盲测里,代码质量3.74,高于GLM-5.3的3.60和GLM-5.2的3.40(低于Claude Opus 5的4.22);AutomationBench的657个跨应用业务工作流里,超过Kimi K3和DeepSeek V4Pro,但仍低于GLM-5.3。注意"和SurgeAI合作"这个措辞:比纯自报可信,但还够不上完全独立第三方。36氪

真实的图景是:美欧开放模型和中国头部开放模型之间的差距,从"看不见车尾"缩到了"一代左右、单项偶尔咬人"。

美版开源模型

真正定性的,是这两条统计

  • HuggingFace数据:过去一年,中国模型占平台模型下载量约41%,月度和累计下载都超过美国模型。36氪

  • Vercel AI Gateway:今年8月,开放权重模型已经处理其平台56%的token流量,去年12月这个比例还不到10%。

开放模型是全球增长最快的盘子,而这个盘子的重心在中文阵营这边。Reflection两位创始人出自DeepMind(一位做过Gemini的奖励建模,一位参与过AlphaGo/AlphaZero),这次为Beam烧了23.8万亿预训练token、动用超过1万张GB300连续四周高算力强化学习、跑了一亿多次rollout——砸这么大,选的对标线是GLM-5.2。“被当成对标对象”,本身就是上牌桌的证明。这才是这三条新闻合在一起讲的完整故事。36氪知乎

美版开源模型

三类人,三笔账

1)118元套餐/API用户:先别动。10月底之前,"搬家"没有"家"可搬。这个月真正要算的账,是10/7免费窗口收掉之后的续费成本、effort档位和FlashX那档2.5倍定价——这些都跟Beam无关,别把两本账混着算。

2)自部署玩家:兜里揣好这道算术。Beam总参数501B、每token激活约23B(激活比例4.59%),按4bit估算权重约250GB量级——注意,这是知乎拆解放里明写的"算术估算,不代表实测文件大小或最低显存要求"。它到底进不进得了你的机箱、首token几秒、1M上下文并发下稳不稳,全是权重放出后的实测题。值得等的不是那个"4倍",是"同硬件、同精度、可复现"的第三笔实测。知乎

3)转发"GLM被杀"标题的人:先问三个问题——“比谁便宜4倍”(GLM-5.2)、“4倍是什么单位”(FLOPs,不是钱)、“数字是谁的表”(自报,权重未放)。三个答案凑齐,标题基本就没法原样转了。

接下来盯什么(都已有日历位)

  • 10月底:Beam的Apache 2.0权重与技术报告、Mistral Large4的完整权重。两场落地之后,等第三方同硬件实测出现,再谈换不换。36氪

  • 路线信号:Reflection已经明说,2027年要发更大模型,并继续走"基座模型+多个RL增强版本"——这正是GLM们已经跑通的发布节奏。

  • 价格信号:GLM这端会不会用降价或新Flash档,回应"单位算力智能"叙事——这是套餐用户最该盯的一条。

开源的护城河从来不是"没人追得上",而是"你追上来的时候,我的价格已经降过一轮"。效率这个故事,美欧模型刚开始学着讲,GLM的用户过去三个月已经算得滚瓜烂熟。这一轮,对面刚发完公告,我们这边已经算完账了。

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章