唐杰官宣GLM-6.0“全自训练”,我劝你先别等:智谱的路线图里,还有更实在的一步

源自120位全网作者

04:57

8月31日晚的业绩发布会上,面对“只会后训练”的财务追问,唐杰扔了个大的:下一代模型GLM-6.0,定位Fully Self-Training,全自训练,海外叫RSI(递归自我改进)。微博

圈里一下就炸了。宝玉那条“GLM6这么牛的吗?都能自训练了”,半天时间转发50多次、点赞130多。微博但大多数转发停在了这四个字的科幻感上。如果你是真的在买CodingPlan、真的在调API的GLM用户,应该看看这四个字背后的完整路线图——更关键的是:在这张路线图上,6.0并不是下一款模型。

唐杰官宣GLM-6.0“全自训练”,我劝你先别等:智谱的路线图里,还有更实在的一步

“全自训练”到底训的是什么

唐杰的原话是:让模型自主学习预训练、中训练和后训练,并自主搭建训练框架(Harness)。知乎翻译一下,就是从“人训模型”走向“模型训模型”,人退到定目标和做验收。

他自己点出的最难一处,值得多看一眼:“最大挑战不是简单把模型训大或持续训练,而是让模型能够判断自己、知道何时停止,并在出错时自主纠正。”懂的都懂——这恰恰是全球RSI研究都还没解决的问题:Agent会跑,但不知道什么时候该停。知乎

智谱不是纯画饼,有三件事已经在跑:

一是Infra Agent。GLM-5.3在国产芯片上的推理引擎优化,就是由GLM-5.3自己驱动的Infra Agent完成的:自主修正优化方案,算子开发周期缩短一半,端到端服务性能比初始基线提升3倍。微博“AI优化AI自己的运行环境”已经是生产环节。

二是数据自产。刘德兵在会上说,数据质量的上限不再取决于人类标注速度,而取决于模型自身的验证能力,model vs. model的自我对弈管线已经跑起来了。知乎

三是环境制造。研究智能体采集任务模式,裁判智能体逐一试做,验证器和训练环境自动合成——“训练场”本身成了流水线上的标准产品。

刘德兵的总结很直白:下一代GLM,将在上一代GLM搭建的环境中实现自训练。知乎

放到全球坐标里,智谱不是唯一在做的:按社区整理的海外公开信息,OpenAI的Astra多Agent系统自动编写、迭代调优CUDA算子,部分算子性能达到人类顶尖工程师版本的1.5-1.8倍;Anthropic论文披露的AAR系统,用Claude智能体完整闭环做对齐研究,以4美元时薪跑赢28位人类安全研究员。知乎B站但注意——这些都是分项突破。系统级的“全自训练”闭环,地球上还没有人做出来。智谱押的是一个方向,不是交出一个成品,这个区别决定你该用什么态度对待它。

下一款模型,不是6.0

这是GLM用户最该知道的部分。

会上唐杰确认:下一代大基座模型已在训练,具体参数未披露,方向有三个——更大的有效规模、更长的原生上下文、原生多模态统一建模。推理预研已经提前开始,目标是“发布第一天即可满量使用”,不让用户发布后再等工程适配。知乎

分析师的业绩会纪要(东方计算机等转发)把路线图说得更明确:11个月迭代6代模型,节奏不会放缓;GLM-5.3是开源SOTA,5.3-Flash是性能-成本帕累托最优;下一代基座是更大参数、原生多模态;年底的GLM-6.0实现Fully Self-Training。注意,“年底”是分析师纪要口径,官方没有给精确时间表。微博

唐杰官宣GLM-6.0“全自训练”,我劝你先别等:智谱的路线图里,还有更实在的一步

社区里还有一个流传较广的推测:按智谱此前“每0.5代参数量翻倍”的节奏,中间这一代可能是GLM-5.5,参数量到1.5T左右。官方未确认,先当推测看。知乎

但这一代值得盯,有个实在的理由:GLM-5.3用的是年初训练好的7450亿参数基座,一开始就规划复用半年以上,5.1、5.2、5.3都是在同一个基座上做后训练——这是智谱被质疑“参数克制”的原因,也是它能11个月迭代6代的原因。知乎而下一代,恰恰是第一次“换基座”:新的参数规模、原生多模态、原生长上下文一起到位。如果你要等一次实质升级,等这一代比等6.0更靠谱。

三种人,三种动作

把路线图落到钱和时间上:

1)CodingPlan、API写代码的用户:不用等6.0。它最快也是年底的事,而且6.0革的是训练范式的命,日常coding体验未必因此大涨。反倒是中间代新基座的“原生多模态+更长原生上下文”,会直接改变用法。现阶段把5.3用足,盯住新基座的参数和命名官宣。

2)成本敏感的用户:盯窗口期。两个数字:GLM-5.3-Flash API限时五折,到9月9日24点;API平均定价上半年已经上调约101%(业绩会披露)。B站管理层在会上明确说,行业未来是“两条价格曲线”:同等智能的价格持续下降,但能打开新任务边界的frontier能力,会获得溢价甚至提价。知乎大白话:今天的白菜价,不一定是明天的价格。

顺手说一句:截至本文发稿,ZCode的第二波白嫖还在进行——10000份、每份1亿GLM-5.3-Flash token,美东时间今晚10点截止(北京时间9月2日上午前后),客户端活动卡片里领取。微博另外CodingPlan一周年,付费用户发了一张额度重置卡,免费用户有限量的一天有效期1亿Flash token,该领的领。微博

唐杰官宣GLM-6.0“全自训练”,我劝你先别等:智谱的路线图里,还有更实在的一步

3)开源、本地部署的玩家:GLM-5.3权重已上HuggingFace,许可证是智谱自家协议(不是MIT),商用条款相对宽松,但大平台请细读条款。B站这一代7450亿全量基座都放出来了,下一代基座是否延续同样的开源节奏,值得跟踪。

把起哄换成这三个观察信号

一,官方何时正式披露下一代基座的参数规模和命名——那是中间代的发令枪;

二,“发布首日满量使用”能否兑现——上一代Flash发布首周出现过配置异常和性能波动,大家都看到了,新一代首日的稳定性是检验;

三,自训练的落点——Infra Agent这类应用如果从“优化推理”扩展到“参与训练”,同时第三方评估、漏洞披露等治理动作跟得上,说明“自训练”的故事是真的在推进;反之,如果只剩发布会上的概念复读,当预告片听就行。

最后一句:全自训练是值得认真关注的方向,但它是年尺度的事(社区保守估计,官方口径也只说是“重要研究方向”)。真正值得你安排钱包和时间的,是下一款,不是下下款。

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章