这几天模型圈是真热闹。上周五(8月14日),智谱正式发布了GLM-5.3。36氪DeepSeek的新定价也恰好在这周生效,高峰时段价格翻了几倍。微博社区里这两天最常见的问题就是:GLM-5.3,到底要不要换过去用?
与其看官方战报,不如看看第一批真实用户的实测。先说结论:GLM-5.3确实强,但别急着封神——它有赢得干脆的地方,也有目前还打不过Kimi K3的项目,还有几个没人提醒你的坑。
先看跑分,确实猛
这次GLM-5.3的跑分亮点:Terminal-Bench 3.0从4.6分冲到28.3分,DeepSWE v1.1从46.2分升到66.9分,两项都拿下开源第一,其中DeepSWE压过DeepSeek V4 Pro正式版(62.7分)。知乎36氪测漏洞复现的CyberGym拿到84.5%,登顶全球,超过Claude Mythos 5(83.8%)和GPT-5.6 Sol(83.6%)。知乎

放一张官方放出的对比表,GLM-5.3、GLM-5.2、Kimi K3、DeepSeek V4 Pro、Qwen3.8-Max、Opus 4.8、Fable 5、GPT-5.6 Sol八个模型,编程、网络安全、Agent三组科目横着排,智谱精准狙击DeepSeek,跑分八项赢了七项,安全科目上甚至能和最顶级闭源坐一桌。36氪
最反直觉的一点:它和5.2是同一个基座,参数一个没加,提升全部来自后训练。36氪顺带还有个意外收获——发布前两周,智谱联合安全团队用GLM-5.3扫了220个开源项目,发现2404个潜在漏洞,其中1088个是中高危,甚至挖出了DNS协议里潜伏40多年的协议级风险。知乎
生态这边也在跟进:荣耀笔记本和平板上的YOYOClaw已正式接入GLM-5.3。微博京东云也首发接入,并已在模型服务平台完成适配上线。知乎
跑分是一回事,实测是另一回事
跑分测的是标准环境下的上限,用户真正在意的是交付下限。这三天实测内容不少,最有参考价值的是一组对照横评——统一提示词、统一在Claude Code里跑、全接官方API,GLM-5.3、Kimi K3、DeepSeek V4 Pro三个模型跑了四个任务:前端网页GLM-5.3与K3打平、明显好于V4 Pro;3D场景GLM-5.3一次直出;网站开发K3略胜;游戏开发只有K3能从头玩到通关,GLM-5.3在第二关操作失效,V4 Pro第一关就报错。知乎四个任务综合下来,K3最夯,GLM-5.3次之,V4 Pro垫底。
耗时也有意思:同一个游戏任务,V4 Pro十来分钟跑完,GLM-5.3花了43分钟,K3花了67分钟。快不等于靠谱,但要是赶交付,这是个必须考虑的变量。海外科技博主42分钟的实测也指向同一个短板:跑分直逼顶级闭源,但写游戏频频翻车。哔哩哔哩两份独立实测都说明,复杂游戏里的长程一致性,目前还不是GLM-5.3的强项。
当然,上限这边也有硬数据:AutomationBench从26.2分涨到48.2分。36氪在覆盖44种职业的GDPval-AA v2评测里,GLM-5.3拿到1769分。知乎下面这张多模型对比图里,这两项它都排在Fable 5和GPT-5.6 Sol前面,Agents’ Last Exam也超过Fable 5。

但也别急着下结论说它不行
正面阵营的硬案例同样不少。有人用GLM-5.3把《泰拉瑞亚》1:1复刻到了网页——7天时间、16个Claude Code进程并行,烧掉约300亿token,沿用原版光影算法。小红书有人拿它做了3D战棋游戏,还有人搭出一套A股投研工作流。社区放出的实测里,GLM-5.3已经能产出FPS游戏、3D场景探索这类可运行的完整作品。知乎

一句话总结:展示型任务(页面、官网、3D场景)和结果可验证的任务(跑代码、过测试、复现漏洞),GLM-5.3已经是一梯队;复杂游戏和超长自主Agent,K3目前还是更稳。
第一批用户踩过的三个坑,切换前先避开
坑一:token消耗比你想象的凶。有订了GLM Max套餐的用户吐槽,用下来感觉比Claude Max 20x还贵,3天就刷没了,评论区立刻有人共鸣,自己一天不到干了三分之一,还是半夜跑的。小红书前面那个泰拉瑞亚项目更是工业级消耗的典型。长思考链、多进程并行、高峰时段消耗系数,是三个主要的烧token放大器。建议很直接:别随手开多进程;批量任务尽量挪到非高峰;订阅套餐的消耗规则,用之前先看清楚。
坑二:在Claude Code里接GLM,上下文可能被悄悄砍到200K。这个坑跟GLM本身无关,但所有在Claude Code里用第三方模型的人都可能中招:CC遇到不认识的模型名,会保守地按200K上下文触发自动压缩——而GLM-5.3的真实窗口是1M,等于白白损失五分之四的上下文,而且不报错,你只会觉得“这模型怎么老忘事”。知乎解法就写在CC自己的警告文案里:模型名后面加[1m]后缀,CC就会按1M窗口来管理压缩。两个注意:这是客户端侧标记,要由网关把后缀吃掉再传给上游;另外只给确认有1M窗口的模型加,别猜。
坑三:纯文本模型,没有视觉。GLM-5.3基于5.2基座后训练而来,输入输出都是纯文本,本身不具备视觉识别能力。知乎横评里就出现了二维码图片被压扁的案例——这不全怪它,但如果你工作流里有图片输入需求,得另配视觉模型,别指望它直接搞定。
那么,谁适合切换?

建议切换的:主力活儿是页面、官网、3D演示和模拟、终端与Agent类任务;有长上下文需求,1M窗口是真实可用的。知乎还有API预算被这波涨价打痛的开发者——智谱这次没跟着5.3涨价,而DeepSeek全计费项涨幅区间在50%到1100%。36氪
想玩开源权重的值得再等两周:官方承诺发布两周后开放模型权重。知乎
建议再观望的:主战场是复杂游戏开发、超长自主Agent,K3目前还是更强;离不开多模态视觉能力的。
不想花钱也可以先试水:官方入口是ZCode,GLM Coding Plan用户可直接用。知乎Qoder、TRAE Work这类第三方平台目前对GLM-5.3有新用户免费试用活动,不过这类活动随时可能下线,试个手感就好。知乎
最后留三个值得持续盯的信号:权重开放后的第三方复测能不能撑住这份跑分;K3和V4 Pro的后续动作;Coding Plan高峰时段的额度消耗细则。这三个问题有了答案,换不换自然就有数了。
就像一位实测作者说的:现在的跑分,看看就好,拿你自己的活跑一遍才算数。知乎