这周的GLM时间线被劈成了两半。一半在传"智谱GLM-5.5参数要干到3T",笔记底下吵成锅粥,有人把上一轮传闻都翻出来了:之前传的说是1t,8月发布,这真的是各种坊间消息不断。另一半则是"牛来"登顶、中报收入涨近4倍、夜间免单、周末3亿token,一副"效率路线赢麻了"的画风。小红书
到底哪个是智谱?看坊间爆料没用。两份一手材料足够把这事说清:8月31日晚2026年中期业绩会上,智谱首席科学家唐杰念给投资者的发言全文,和财报里的技术表述。把数字抄下来对一对你会发现,智谱自己讲的scaling故事,从头到尾就没在讲参数。
一、业绩会纪要里的三组硬数字,没有一组靠"做大"实现
第一组:同一个基座,只改后训练,完成率+50%。唐杰念得很直白:同架构、同总参数、同激活参数,仅扩大后训练规模,端到端完成率提升超过 50%。他在会上顺手给了判词——Scaling不只有参数这一项,训练是当前提升空间最大的因素。知乎
翻译成人话:8月底那个被叫做"最强开源编程模型"的GLM-5.3,本质上不是一个新模型,是同一块基座换了更狠的组织方式——更长程的强化学习轨迹、更接近真实专业工作单元的任务环境。参数表上看不出来,自建编程评测里端到端完成率涨了一半。安全那边是同一逻辑的验证场:CyberGym拿到84.5%、超过WABO5与GPT-5.6 SOLO,靠的是把漏洞复现当成可反复验收的任务环境,不是把模型做大。
第二组:320B总参数、18B激活、单任务4.5美分。GLM-5.3-Flash是"专为降低成本设计"的新架构,总参数 320B、激活参数 18B,融合稀疏注意力与线性注意力,价格为 GLM-5.2 的 1/10。知乎
整场纪要里最该被记住的成本句是这个:单任务成本稳定在0.2 美元档位,而GLM-5.3 Flash 更以 0.045 美元的单任务成本进入智能成本前沿。知乎
发布方式本身就是这套路线的注脚:先以匿名模型OxAlpha(社区昵称"牛来")丢上OpenRouter挨打,上线首日登顶 OpenRouter,并刷新单日 Token 用量纪录,6 天调用总量超过 62 万亿。知乎
官宣认领时还有个细节容易被刷走:这轮匿名测试全部跑在国产芯片上,36氪给的谜底是全部国产卡承载,价格仅为Opus 4.8的1/40。唐杰在纪要里把这条叫"国芯推国模",18B激活+混合注意力+国产卡serving,凑齐的是一整套"用得起"的工程账。36氪
第三组:11个月六次迭代,节奏代替参数。GLM 系列在约 11 个月内完成六次迭代,智能指数从 32 提升至 60。财报把智谱的scaling拆成了四个变量:基座模型规模、有效深度、训练深度、任务环境。参数只是第一个旋钮,后面三个才是这一年真正在动的东西。知乎知乎
三组数字摆完,再看"3T参数"传闻:没有任何一手信源支撑。作为对照,友商是真的在卷参数——阿里Qwen3.8-Max-0902以1691分登顶CodeArenaWebDev,总参数2.4T。两条路线同框,"大模型竞赛换了评判标尺"这句评价,才不像是粉丝滤镜。知乎
二、LoopTransformer:财报里一句"初步验证",怎么就被玩成了全民玄学
真正让"效率路线"从财务话题变成技术话题的,是财报里只有一句话的东西:Loop Transformer。这里必须替智谱降降温:公告并未宣布某个已发布 GLM 型号采用了 Loop Transformer,也没有给出下一代模型的循环层数和性能数据。唐杰的原话也只有半句"让模型在推理过程中思考得更深,我们近期也在推进相关工作"。官方口径克制成这样,照样架不住这周同行的衬托:字节十月底开源了个2.6B的小模型,在好几项评测上追平了8B的Qwen3,数学题那一栏甚至反超一大截。紧接着清华、字节Seed陆续给出等预算对照实验,再加上OpenAI的GPT-6-Astra采用了recurrent depth,也就是Loop Transformer这一类循环深度思路的小道消息沸沸扬扬——“原地转圈"突然就成了比堆参数性感的叙事。注意,Astra这一条至今只是社区流传,OpenAI没有官宣,智谱这边也只是"早期实验初步验证”,两边都不能当产品事实用。知乎知乎知乎
原理一句话说穿:普通Transformer是80层楼每层一套权重,Loop是20层楼把同一套权重跑4遍,有效深度接近80层,但只需要存20层的参数。它省下的主要是参数存储和权重读取压力,计算量并没有凭空消失。简单token一两轮退出、难token多转几圈,这个"动态早退"能不能产品化,才决定平均成本压不压得下来。学术前史也得讲公道话:2018年就有Universal Transformer,字节Ouro把它推进到大规模预训练,MoE×循环的路由稳定性还有专门的scaling law在解。这条路上没人发明轮子,智谱的差异化动作是把它连同"训练深度"一起,写进了一家上市公司的能力路线图。知乎
更有实感的是9月10日前后刷屏的Z.ai×清华论文《Trace as State》——循环计算的推理侧近亲。长上下文的老毛病"模型读过了但没记住",论文的解释很扎心:第一次读的时候,模型还不知道自己该记什么。解法简单到不像论文:让模型先读一遍、想一遍,把第一轮的推理痕迹塞回上下文最前面再读一遍。DeepSeek V4 Pro在GraphWalks任务上首轮29.2分、痕迹放文末43.0、放最前81.8;GLM-5.2从66.4直接打满100.0。对照组也做了:单纯把上下文重读一遍远达不到这个效果,随机塞一段别的推理痕迹还会变差——起作用的确实是"任务状态"本身。小红书
顺带一个能白嫖的实操:这套东西不改架构、不改训练,理论上你现在就能在agent里自己搭——让模型先粗读仓库生成一份推理笔记,把笔记放最前、代码放后面再正式跑任务。论文还没进官方API,先动手的人先吃螃蟹。
三、这场路线仗,跟你的钱包什么关系
对每天在zcode里蹬GLM、纠结要不要续费Coding Plan的人来说,技术路线不是玄学,是你账单的底层逻辑。便宜是真有底的:18B激活、混合注意力、国产卡serving,才撑得起"Flash价格是GLM-5.2的1/10"、0.045美元单任务,进而才有力气搞夜间免单——官方给的时间窗是9月3号到9月20号,付费的coding plan订阅用户在zcode里夜间无限畅用。36氪管这叫"低价增长时代",更准确的说法是:效率路线的账面收益,第一次以价格战的形式漏到了用户侧。知乎
但社区反证同样真实,而且很具体。很难想象5.3和5.3Flash是同一家公司在同样的Infra架构下跑的模型5.3动不动给我卡住,5.3Flash倒是几乎不卡。还有人给Flash泼冷水:5.3 flash 是真没啥亮点 除了快。有效深度是要付延迟的,循环做深和"快"在物理上就是矛盾体,动态退出没有落地之前,体验就还有锯齿。知乎
适用性直接给结论:深夜跑批量任务、刷重构、喂长文档的,你就是错峰+低成本架构的精确受益人,免单窗口和周末3亿token值得排进日程;白天要实时结对、对延迟敏感的,别看智能指数,先把自己的工作负载压测一遍再决定切不切主力——“斩杀”"登顶"是周更的叙事,崩不崩才是日用的体验。
四、接下来盯四个信号
下一版GLM(不管叫5.5还是6.0)的模型卡里,有没有循环深度、动态退出这些字段——从"初步验证"到"已用于产品",就差这一句;
Trace-as-State这类推理侧方案会不会进官方API,还是继续留给社区手搓;
同基座+50%这个训练深度红利还剩多少——如果后续版本还在同一块基座上白嫖完成率,说明路线没撞墙;
Astra的recurrent depth小道消息,被OpenAI确认还是打脸。
可以确定的是:"scaling=堆参数"这条唯一路线,已经被智谱自己财报里的数字动摇了。至于是不是终局,9月20日夜间免单到期那天,和下一个GLM发布那天,都会再给一次证据。参数军备竞赛的好处永远只进GPU厂商的账单,而效率路线的进步,是目前唯一会以降价形式漏到你手里的那一种——这也是你值得多看智谱这份技术叙事几眼的真正原因。