ZCode的登录弹窗还在致歉、8张重置卡刚发到账户的这几天,智谱放出了今年最科幻的一条技术叙事:GLM-5.3,这个你正在用的模型,开始参与搭建它自己赖以运行的推理系统。首席科学家唐杰的说法是"智谱已经实现了最小的闭环。模型优化系统,系统服务模型"。36氪
评论区照例裂成两半:一半在刷"这是摸到RSI(递归自我改进)的门道了",一半在问"是不是又一次叙事融资"。 这篇文章不替任何一方喊口号,只把官方披露的数字逐个摊开——哪些是硬的、哪些是自报的,以及这个"闭环"离真正的"模型自我进化"还差哪几步。哔哩哔哩
一、先看事:两周、十万张卡、三倍吞吐
9月17日,Z.ai(智谱海外站)发了一篇技术文章《How GLM Built Its Own Inference Infrastructure》:团队用GLM-5.3驱动一个"Infra Agent",去搭建GLM-5.3-Flash的生产推理服务。 公开口径里有四个数字:知乎
十万张以上:GLM-5.3-Flash的全部生产推理,跑在一个超过十万张国产AI加速卡的集群上。Z.ai称此前没有人在这种规模的国产卡上部署过同类集群。
不到两周:从模型第一次跑通,到具备上线条件、承接全部线上流量,用时不到两周。
约3倍:端到端吞吐量达到初始基线(W8A8)的约3倍。注意,这是调度、并行、通信、量化、Kernel多项优化叠在一起的系统级结果,不是模型单独"变聪明"的倍数,官方也没有列出与主流GPU逐款对照的配置。
62万亿token:这套服务一度以匿名模型"Ox-Alpha"的名字挂在OpenRouter和OpenCode上,团队称上线一周内成为两平台使用量最高的模型,六天处理超过62万亿token。 这个数目前没有第三方对账,而且OpenRouter的total口径里含前缀缓存的重复读取,token总量不等于计算量——看热闹之前,先把这条口径记住。微博

配套的还有唐杰在社交媒体上的表述和智谱《通往递归自我改进》长文:模型从SGLang、DeepGEMM、FlashLinearAttention这些现成kernel里提炼"优化骨架",验证过的做法沉淀回库,下一轮更省力——训练由此变成一种"复利"。36氪
二、模型到底干了什么:不是会思考,是两个具体的bug
把官方案例拆到能看懂的粒度,"模型给自己干活"其实是这个样子:
案例一:KV传输被一把锁堵死。工程师先定了验收条件:同样负载下,“Prefill加KV传输"对比"纯Prefill”,差距不能超过5%。Agent实测发现某些场景差距超过20%。这个反馈没告诉它原因,只把排查范围收窄到KV传输的额外开销和并发交互上。它顺着执行时间线一路追进Python和C++的交界处:DeepEP的节点内路径没有显式释放GIL,同一进程里负责传输的Python线程抢不到锁,本该与计算重叠的传输被调度卡住。修完之后,差距从两成以上压到1%以内。Z.ai

案例二:tf32造成的精度漂移。CP和非CP两条路径的结果对不上,查下去发现是kernel里tl.dot默认用tf32计算求快——更低的精度在KDA状态矩阵的链式合并里逐段累积误差,序列越长漂得越明显。
这类活为什么值得"有经验的基础设施团队花数周"?GLM-5.3-Flash的架构本身就不是标准件:45个主干层里34层用KDA把变长历史收成固定大小的循环状态,另11层走稀疏注意力,把百万token上下文的注意力计算压到约三分之一、每层平均KV cache缩小4.4倍(据公开技术拆解,与官方架构口径一致)。 新架构叠国产卡、软件栈不成熟、部分kernel缺说明,很多行为只能边跑边查——这恰恰是Agent最需要"能验证"的工程场景。哔哩哔哩

三、"最小闭环"的真实含义:门槛不是聪明,是裁判
唐杰这篇长文里最反常识的一点,是他对RSI的定义:让循环转起来的不是"模型变聪明了",而是"闭环"本身。他给了三块拼图:
一个可被改进的对象——模型碰不到自己的权重,但可以优化服务它的推理系统(kernel、并行、通信、内存、调度)。这次闭环的就是这块。
一个可验证的裁判——改完得有人立刻拍板对不对,而且这把尺子要又便宜又硬。所谓"密集反馈",就是给Agent三类接口:正确性反馈(算对了吗)、系统行为反馈(时间花在哪了)、性能反馈(哪个方案在什么条件下更好)。 唐杰的原话是,Infra Agent卡住时很少是因为写不出代码,而是不知道"事情为什么变坏了"——"吞吐掉了20%"是典型的稀疏奖励,而干了10年的老工程师看一眼时间线、跑个microbenchmark,一小时解决的直觉,得被拆成模型能调用的验证接口。知乎
一个能自我供给的回路——这一轮的任务经验,成为下一轮的训练场。

按官方自己的边界说法:目前展示的是早期工程案例,不能据此认定完全自主的RSI已经实现。目标、红线、风险判断仍然由工程师定,模型也没有参与设计下一代模型的训练方法。所以"最小闭环"是实的——闭环转起来的是成本的下降,不是智能本身。推理更便宜、系统更稳,意味着同样的预算里能留更多算力给训练,下一代模型站在更平的台阶上。仅此而已,也值得仅此而已。
四、争议的另一面:别家也在讲RSI,怎么分辨成色
RSI正在变成全行业话术。9月22日小米开源MiMo-V2.6,同样宣称这是"探索RSI路线的关键一步",并在ArtificialAnalysis综合智能指数上以46.32分拿到开源权重第一,把Kimi K3和GLM-5.3按在身后。 同一天前后,Anthropic发了《衡量前沿实验室内部AI的发展速度》,给了一个可以直接抄来分辨叙事的框架——三块仪表盘:AI承担了多少研发工作、Agent行动受到怎样的监督、算力在研发和安全之间怎么分。它披露的自家数字是:截至8月,Claude在人的监督下"主导"了26%的模型研发工作(2月还不到1%),但没有任何一类工作达到完全自主。微博36氪
把这套尺子拿来量各家话术,区分方法很朴素:给了可核查的工程细节(案例、验收条件、失败过程)的,是唐杰这篇;只给发布会口号加一个榜单分数的,让子弹先飞一会儿。
五、跟你有关的三笔账
如果你是GLM订阅用户或正在观望的编程党,这个故事落到你的账本上是三笔:
第一笔:单价和速度的空间。吞吐3倍、每token成本"达到与主流GPU相当水平"(官方自报),意味着Flash档后续降价、放额度、卷速度的底气更足——前面FlashX敢用2.5倍价格卖5倍出字速度,本质是成本结构在动。 但智谱目前没有给任何新的价格承诺,别把"闭环"提前折算成"我要降价了"。微博
第二笔:迭代节奏。你在等的GLM-5.4或下一代,更可能先体现在"上线周期变短"上——这次是两周从零到全量。值得盯的信号不是闭环故事本身,而是新模型卡和推理服务版本的发布频率。
第三笔:信任账不能被技术叙事抵销。此刻正处在ZCode风波的补救期(9月28日智谱推出Trust.patch:移除上传链路、数据不留存、开源、发8张重置卡和Token补偿,社区仍在骂)。 做去留决定时,把"能力叙事"和"数据信任"两本账分开算:RSI故事再硬,也不改变你上一批Git历史去哪了还没完全对账这个事实。哔哩哔哩

继续观察四个信号:①智谱是否补齐与主流GPU的逐款对照数据;②Ox-Alpha的62万亿token能否和公开榜单口径对上;③"验证接口"从推理域扩到训练域没有(这是第二块拼图真正合上的标志);④Anthropic的三维度框架会不会变成下一轮国产发布会的标准话术。
一句话收束:智谱确实把闭环转起来了,但转的是"成本飞轮",不是"智能飞轮"。对GLM用户,这个故事值得认真跟——它是你未来看到更便宜、更快模型的原因;但也先别替它补完剩下两块拼图,"自我进化"这四个字,现在还只是唐杰手里的一张路线图。