当前位置:
AIGC文章详情

GLM-5.3发布一周口碑盘点:技术圈沸腾、资本观望、用户分裂,三个温差区该信哪一句

源自25位全网作者

04:29

GLM-5.3 发布满一周了。

如果你和我一样盯着智谱这条线,大概会感觉到这一周的微妙:一边是技术圈热闹得不行,AA 综合智能指数 60 分的讨论刷了一屏又一屏;另一边资本市场完全不买账,发布日跌、API 上线日还在跌;再打开社区,夸的、吐槽的、等视觉功能的,又各有各的说法。

同一个模型,为什么会出现三个完全不同的温差区?这两天我把知乎、微博、B站、小红书,甚至海外 OpenRouter 上的讨论都翻了一遍,今天把这一周的口碑摊开来讲清楚——哪些是热闹,哪些是真东西,我们各自该信哪一句。

温差区一:技术圈,这次夸得有理有据

传播最广的是这组数字:GLM-5.3 在 Artificial Analysis 综合智能指数里拿到 60 分,前代 GLM-5.2 是 53 分,与 Kimi K3 并列开源权重模型第一,距离 GPT-5.6 Sol 只差 1 分,和 Claude Fable 5 这些闭源旗舰坐进了同一档。知乎

GLM-5.3发布一周口碑盘点:技术圈沸腾、资本观望、用户分裂,三个温差区该信哪一句

但真正让技术圈兴奋的,不是分数本身,而是这个分数怎么来的——GLM-5.3 一颗参数都没加。它沿用 GLM-5.2 的基座,744B 总参数、40B 激活的 MoE 架构,全部提升来自后训练:多花约一个月做长程任务环境与强化学习。36氪具体到方法,是更大规模的长程任务强化学习、SAO 和 slime 这类训练框架,以及让 Research Agent 自动出题、试做、验题,再把合格的题送进训练。

翻译成人话:不是给模型读了更多书,而是让它做了更多题,做的是真题,做完还会给它纠错。

效果直接体现在「干实事」的基准上。测长程软件工程的 DeepSWE v1.1,从前代的 46.2 提到 66.9;智谱内部 Code Bench 的最高难度,GLM-5.3 用平均约 7.5 万输出 token 拿到 34.5% 的成绩,前代要用约 9.6 万 token,成绩只有 23.4%。知乎完成率更高、消耗反而更低,这一点比单纯涨分更值钱:它说明模型学会了更有效地探索,而不是靠堆更长的思考时间硬换结果。

GLM-5.3发布一周口碑盘点:技术圈沸腾、资本观望、用户分裂,三个温差区该信哪一句

安全方向更扎眼:测漏洞利用推理的 ExploitBench 从 24.4% 提到 54.4%,翻了一倍还多。智谱还披露,从 GLM-5.2 时代起联合安全机构用模型挖真实项目漏洞,到 5.3 发布时累计发现 2436 个,覆盖 269 个项目,其中 1097 个属于中高危。

技术社区也用自己的方式投了票。知乎「如何评价 GLM-5.3」下 331 赞、151 条评论的高赞回答写道:「至少在做好编程这件事上,并不需要太大 Size和太高成本,让多数人用得起仍然必要」。知乎B站上一条 GLM-5.3 技术报告精读视频,播放量超过 5 万。高盛本周的分析也认可了这条路线:性能提升主要来自更长的训练周期、强化学习框架升级,以及更复杂的任务环境。微博

温差区二:资本市场,为什么数字打动不了它

再看另一组数字。4 月 GLM-5.1 发布,智谱股价当天收涨 11.5%;6 月 GLM-5.2 发布,当天收涨 32.8%。但 GLM-5.3 发布当天(8 月 14 日),智谱股价收跌 3.6%。知乎API 上线日(8 月 19 日)又跌了 2.97%,收在 1012 港元。

不是模型不强,是市场的评价体系变了。

第一,升级方向太「专业」。这次押注两个方向:编程服务开发者,网络安全服务安全研究员和企业客户。能力都实在,但受众都窄,话题天然不如多模态好传播。

第二,新鲜感被密集发布磨掉了。不到一个月,Kimi K3、Qwen3.8-Max、DeepSeek V4 Pro 正式版、GLM-5.3 四款国产旗舰接连亮相,「第一」的门槛变高了,跑分已经很难再上头条。

第三,也是最根本的:技术路线市场已经听懂了,接下来想看变现。摩根大通 8 月中旬把智谱目标价上调到 1800 港元、维持增持,理由是「后训练实现能力跃升」。36氪但市场明显还在观望——智谱 MaaS 平台 ARR 约 17 亿元、一年增长约 60 倍,可本地化部署收入仍占 73.7%。知乎「中国版 Anthropic」的故事有了商业底座,但从项目制收入走到标准化订阅,这段路还没走完。

把时间拉长看会更清楚:智谱股价从 6 月 2980 港元的高点算起,已跌去逾 66%,市值蒸发超过 8000 亿港元。36氪在这个背景下,GLM-5.3 的「强而不涨」,其实是市场对整个大模型板块的统一表态——能力在趋同,接下来拼的是收入。已经有值得买科技这样的公司宣布接入 GLM-5.3,资本想看到的,是这份名单越来越长。

温差区三:用户端,分裂但分裂得有道理

好评比较一致。小红书有用户重度用了几天后说「确实强,宣传说体验接近 Fable,本来觉得夸张,用下来还真挺接近」;独立开发者反馈 ZCode 的 Goal Mode 感受最深——给一个目标,它会自己持续推进、检查、验证,长任务可靠性明显比上一代高。有受访开发者给出了更细的对比:常规代码任务好用,水平高过 Kimi K3、略逊于 GPT-5.6 Sol。知乎

吐槽主要集中在三处。

一是稳定性。B站出现了 GLM-5.3 在 Agent 任务里疑似陷入无限循环的个例,不普遍,但如果你要无人值守跑长任务,建议留好人工检查点,或者给单任务设好 token 上限。

二是视觉缺位。发布前唐杰在 X 上征集新模型期待,多模态是呼声最高的方向之一,这次没给。实测里,GLM-5.3 在游戏生成、创意编码这类依赖视觉反馈的场景表现一般,甚至出现过生成的页面按钮是歪的情况。对很多人来说,这是本次更新最大的遗憾。

三是额度和价格情绪。这不是 5.3 带来的新问题,但它是这次发布的背景板:GLM Coding Plan 7 月底全面开放购买后,Lite 版涨到 118 元/月、改为积分制并设每 5 小时和每周的额度上限,社区里「额度缩水」「升级反而额度变少」的抱怨一直延续到今天。知乎模型变强了,但钱包的账是另一回事。

那么,现在各路人该怎么办

把结论理清楚。

已经是 GLM Coding Plan 用户:5.3 已向全部 Coding Plan 用户开放,ZCode、Claude Code、OpenCode 等主流编程工具也都上线了,直接切过去就行。知乎长程软件工程任务是最值得重测的部分,顺手观察 token 消耗和偶发的循环问题;纯文本问答场景,维持原习惯即可。

还在观望的 API 开发者:GLM-5.3 定价与 GLM-5.2 持平,按 Artificial Analysis 的单任务成本统计属于同档低成本选手。小项目可以先低成本试起来,主流工具都已接入,切换成本很低。

等开源自部署的:官方口径是模型权重下周五(8 月 28 日)开源。知乎这个日期此前已经调整过一次,媒体当时的说法是「因为AI新版本太强,强到智谱暂时不敢开源了」。36氪对自部署党来说总算看到了头。744B 的参数体量不小,量化之后对硬件要求依然不低,建议别急着预下载,等社区实测的部署需求出来再动手。

等「下一代」的:三个信号盯着。其一,8 月 20 日空降 OpenRouter 的匿名模型 OxAlpha,下面细说;其二,视频端有 GLM-5.3-Flash 轻量版的传闻,官方暂无消息,但按智谱两个月一个版本的节奏,并非空穴来风;其三,Kimi、DeepSeek 在长程编程上的回应——现在领先的窗口期,是按周计算的。

最后说说 OpenRouter 上那头「牛」

本周最有意思的支线剧情,是 OxAlpha。8 月 20 日,OpenRouter 用一个忍者表情放出了这款匿名模型,Ox 本身就是「牛」的意思,国内网友很快给它起了个更接地气的名字:「牛来」。微博它的定位是面向高效编程、长时间 Agent 任务和真实生产环境的前沿模型,100 万 token 上下文、支持文本/图像/视频输入,输入输出全部免费。36氪OpenCode 同步宣布限时免费一周,准备了每天 100 万亿 token 的容量,联合创始人直接喊话开发者:「快来猜猜是啥模型吧!」

GLM-5.3发布一周口碑盘点:技术圈沸腾、资本观望、用户分裂,三个温差区该信哪一句

社区没闲着,立刻开始查户口。目前线索最集中的指向是智谱:有人用 25 组完全不同的 Prompt 对比 Token 数,OxAlpha 的原始 token 数与 GLM-5.3 几乎一模一样、每条固定多 75 个,底层分词器高度重合;OxAlpha 报错会返回 1210 状态码,据社区测试这是智谱接口独有的。知乎再加上智谱在 OpenRouter 匿名测模型有「前科」——之前的 Pony Alpha 后来被证实就是 GLM-5 系列。Ox 对 Pony,牛对马,这代号确实不像想藏的样子。当然名单上还有别的嫌疑人:小米 MiMo、腾讯混元,甚至 Gemini 也有人猜,身份至今没有官宣。

GLM-5.3发布一周口碑盘点:技术圈沸腾、资本观望、用户分裂,三个温差区该信哪一句

它到底有多强?社区实测可以当个参考:某测评博主自己的 Kingbench 上它拿到 87.5%,另一个 10 个任务的基准子集上拿了 80%,比 GLM-5.3、Grok 4.6、GPT-5.6 都高。知乎经典的「鹈鹕骑自行车」SVG 测试,15 次对照基本都能稳定画出主体——但最高推理档有明显「过度思考」倾向,模型花几十倍的推理字符和十几倍的时间,换来的主要是装饰细节,而不是结构准确性的根本改善。36氪

两句冷静的提醒:匿名模型是测试版,随时可能改参数或下架,别拿生产刚需任务去赌;社区目前比较一致的态度是,免费、上下文够长,可以试,但在身份、稳定性和真实能力确认之前,别拿它替代成熟的生产模型。36氪

回头看 GLM-5.3 这一周:技术圈的兴奋是真的,资本的冷淡是真的,用户的分裂也是真的。三个温差区其实指向同一件事——2026 年,单靠「跑分第一」已经撑不起一次刷屏了。真正管用的,是把那 60 分变成你日常任务里的稳定输出、账单里能接受的数字,以及一个值得继续关注的理由。

技术这张牌智谱已经打出来了,产品和商业的牌还在后面。接着看。

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章