别人都在卷万亿参数,唐杰却说那是弯路:GLM-5.3的“不加参数”路线还能走多远

源自157位全网作者

07:33

8月19日,智谱创始人唐杰在 X 上发了一篇专门聊 Scaling Law 的长帖,其中一句话在 AI 圈刷屏:万亿参数的军备竞赛,是行业走过又折回来的一段弯路。微博这句话之所以炸,是因为时间点:五天前,智谱刚发布 GLM-5.3,而这个模型和上一代 GLM-5.2 用的是同一个基座,总参数同样是 753B,激活参数同样是 40B,智谱一个新参数都没加。小红书在 Artificial Analysis 综合智能指数上,GLM-5.3 从上一代的 53 分涨到了 60 分,一步迈进前沿档,和 Claude Fable 5 这些闭源旗舰站在一起,跟 Kimi K3 并列开源第一。知乎

别人都在卷万亿参数,唐杰却说那是弯路:GLM-5.3的“不加参数”路线还能走多远

而同一时间窗里,36氪盘点的是另一种画风:过去一个月,月之暗面、DeepSeek、阿里相继发布的新旗舰,参数规模是 GLM-5.3 的 2-4 倍。36氪于是出现了这么一幕:别人都在堆参数,刚靠“不加参数”赢下榜单的智谱,站出来说堆参数是弯路。这不是单纯的技术口水仗,它决定了下一代 GLM 长什么样,也决定了把工作流和订阅费押在 GLM 上的人,押的到底是不是一条能走通的路。今天把这条路的逻辑、收益和疑点,一次说清楚。

唐杰到底说了什么

别被“否定大模型”的标题党翻译吓到,原帖其实讲了三层。

第一层:参数量单独拿出来,说明不了什么。评价一个模型,还得同时问三个问题:用了多少数据训练、算力花在了哪、在什么条件下运行。

第二层:万亿参数确实走了弯路。2020 年 Kaplan 的缩放定律认为参数增长应该比数据快 2.7 倍,行业照着这个公式堆出了万亿参数模型;2022 年 DeepMind 用四百多个模型重新实验,得出算力最优分配更接近每个参数 20 个 token。知乎回头看,那一代万亿参数模型参数堆得太快、数据没跟上,恰恰是算力分配最失衡、效果打折扣的一批。

第三层最关键:把推理成本算进账里。Chinchilla 算的是“训一次、评一次”的账,但今天的模型上线后每天被调用几十亿次,上线后的推理成本远远大于那一次训练。微博把这笔账加进去,最优解必然往更小、训练更久的模型移动。

而 GLM-5.3 就是照这个逻辑做的一次控制变量实验:基座不动,提升全部来自后训练和长周期强化学习。36氪唐杰在帖子里还给了一个关键判断:总参数量大致决定模型能装下多少知识,激活参数和前向计算的有效深度决定长程推理能力。知乎GLM 用 753B 总参数扛知识容量、40B 激活参数扛推理效率,这套 MoE 架构本来就是为省算力设计的。

这场实验证明了什么

先看成绩。提升集中在编程和 Agent 长程任务这类硬核评测上:DeepSWE 从 46.2% 提到 66.9%,Terminal-Bench 3.0 从 4.6% 提到 28.3%,翻了五倍多。36氪同时 API 定价和 5.2 一模一样:输入每百万 token 1.4 美元、输出 4.4 美元,缓存输入只要 0.26 美元——分数涨了,价格没涨。再看智谱官方放出的 effort-accuracy 曲线,GLM-5.3 整体压在上一代之上。

别人都在卷万亿参数,唐杰却说那是弯路:GLM-5.3的“不加参数”路线还能走多远

少有人关注的安全方向,变化更大:CyberGym 评测拿了 84.5%,超过 Anthropic 今年 4 月发布的 Mythos 5(83.8%)。知乎考察真实漏洞利用能力的 ExploitBench,上一代只有 24.4%,这次直接干到 54.4%。36氪智谱官方把这叫作网络安全能力的“涌现”。

也正因为这项能力,原定的权重公开时间被往后推了大约两周,先做安全评估与加固。36氪

别人都在卷万亿参数,唐杰却说那是弯路:GLM-5.3的“不加参数”路线还能走多远

GLM-5.2 发布后,智谱连总部大楼外墙的汉字 LOGO 都换成了单个字母“Z”。这条路线的切换,其实那时候就已经摆在明面上了。

别人都在卷万亿参数,唐杰却说那是弯路:GLM-5.3的“不加参数”路线还能走多远

为什么智谱敢这么笃定地走这条路?看商业账就明白了。36氪独家获悉,今年 7 月智谱的 ARR(年度经常性收入)已到 10 亿美元,两个月几乎翻倍,年底预期提到 25 亿美元,智谱对此暂无回应。36氪阿里云、火山引擎这些云厂商卖 GLM 比智谱自己还狠,卖点就是“前沿档能力、旗舰里最低价”。MaaS 生意的命门是性价比,堆参数意味着堆推理成本、堆订阅价,用后训练换效率既是技术选择,也是商业上的生死线。单纯放大模型尺寸来求性能固然可行,但并不经济。知乎

质疑也要听进去

这场实验没有证明所有事,疑点得说清楚。

一是知识天花板。唐杰自己分过工:总参数管知识容量,后训练练的是怎么干活——模型脑子里装了多少知识,后训练补不了。知乎“如何评价 GLM-5.3”下有个高赞回答说得很直白:K3 让用户直观感受到超大尺寸模型带来的丰富知识和审美,而 GLM-5.3 重新证明,做好编程并不需要太大尺寸。知乎编程可以靠后训练补,长尾知识和写作手感靠基座给,这条路理论上是有天花板的。

二是提升的形状。分数暴涨集中在编程和安全,推理能力的升级不算激进,一部分是更长更深入的思维换来的。知乎这是单点突破,不是全面追平。

三是标尺本身。AA 指数一直有社区开发者质疑,直言排行曾被刷过、含金量存疑。知乎60 分值得当重要参考,但不必当信仰。

盯着 GLM 的人,值得看四个信号

这条路能不能走通,其实不用吵,盯住接下来几个版本自然有答案。

  1. 看后训练增量的大小。GLM-5.2 发布于 6 月 13 日,GLM-5.3 在 8 月 14 日,节奏大概两个月一个版本。如果下一代还是同一基座,涨幅明显小于这次的 7 分,说明边际递减真的来了;如果还能挤出差不多的提升,这条路就比想象中能走。

  2. 看知识密集型任务的表现。拿长尾知识、多语言、写作类任务让 GLM 和 K3 对跑,差距如果持续拉大,说明基座知识在老化——这个病后训练治不了,只能重新训基座。

  3. 看开源权重的落地。权重发布推迟了大约两周,但迟早会来,届时社区拉回自己机器跑出的第三方复现,是对官方分数最诚实的交叉验证。

  4. 看算力供给和价格。这次 API 比原定 8 月 18 日晚了一天,客户围着智谱销售催上线,直言内部预算和开发运维都到位了,delay 一天管理成本就多好几万。36氪算力供给直接决定 Coding Plan 的额度和限流体验,模型再好,供给跟不上,实际体验也好不了。

最后说结论

唐杰的“万亿参数弯路论”,是一次押注,不是结论。他押的是:基座的知识容量暂时够用,下一阶段拼的是“把已有能力用更低的成本交到用户手里”。押注的人不是没见过大模型——早在 2021 年,他就主导过万亿参数大模型“悟道 2.0”的训练。36氪训过万亿参数的人说万亿参数是弯路,他反对的不是大模型,是不算成本地堆参数。

至少眼下,GLM-5.3 把这次押注兑现了:前沿档的分数、没涨的价格、夺回来的开源并列第一。但押注都有期限:等基座知识开始老化,等超大参数模型在编程之外的任务上持续露出优势,智谱终究要回头训新基座。

所以落到实用判断:如果你的主场景是编程、Agent 长程任务、带工具调用的工作流,这条“不加参数”路线的红利现在是实打实的,而且是前沿档里最便宜的那档;如果你期待它在全能知识和手感上追上超大模型,别急,先让上面四个信号飞一会儿。

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章