GLM-5.3 API 上线的第二天,国产 AI 圈基本吵成了两派。
一派拿着榜单:Artificial Analysis(AA)智能指数上,GLM-5.3 拿了 60 分,和 Kimi K3 并列开源阵营最高,咬住 GPT-5.6、Claude Fable 5 这些闭源旗舰——开源模型第一次在综合智能指数上和顶级闭源坐到同一张桌子。微博
另一派翻开实测帖直接开骂:写作倒退、不说人话、拒绝甲还变厚了。
关键是——两派都是真上手测过的,都不是云玩家。这 60 分到底什么含金量?我把微博、知乎、B站、小红书这两天的信号对照了一遍,给你捋清楚做决定前该知道的事。
先看这 60 分的全貌
先交代下 AA 智能指数是什么:它把编程、Agent 长任务、科学推理、复杂问答等 9 套测试揉成一张"综合卷",是目前业内引用最多的榜单之一。
国产阵营目前的排位(微博博主@阑夕 整理)是这样的:
T1(60 分):Kimi K3、GLM-5.3,上面只剩 GPT-5.6 Sol(61 分)和 Claude Fable 5(62 分)
T2:Qwen3.8 Max 58 分、DeepSeek-V4-Pro 53 分、Qwen3.8 27B 52 分
T3:MiniMax-M3 45 分、小米 MiMo-V2.5-Pro 43 分、腾讯 Hy3 42 分
T4:蚂蚁 Ling 3.0 Flash 38 分、美团 LongCat 2.0 34 分、阶跃 Step 3.7 Flash 31 分
这张表里有两个值得咂摸的细节。
第一,GLM-5.3 是 T1 里"个子最小"的。按 Z.ai 技术博客的说法,5.3 和 5.2 用的是同一个底座,约 743B 总参数的 MoE,每次推理只激活约 40B——而 Kimi K3 是 2.8 万亿参数,DeepSeek V4 Pro 是 1.6 万亿。用四分之一的体量跑到同一档分数,这也是社区管这次叫"后训练的神迹"的原因。微博
第二,别忘了时间维度:Kimi K3 已经上线一个多月,被全网反复验过;GLM-5.3 上榜还不到一周。同样是 60 分,含金量的验证程度不一样。
没换底座,7 分的提升从哪来
智谱联合创始人唐杰专门在 X 上解释过这件事:GLM-5.3 的提升全部来自后训练——底座不动,在更长程、更复杂的任务环境里做了一个月的强化学习。编码能力比 5.2 提升约 50%,官方口径的 DeepSWE 基准从 46.2 涨到 66.9。知乎

他有句话我觉得说得挺透:总参数量决定模型学过多少知识,激活参数量和深度决定模型能想多深。Scaling 不止堆参数这一条路,后训练的潜力还远没挖完。
这其实也解释了这次升级为什么这么"偏科":分数主要加在编码和长任务上,不是全面加水。
榜单之外还有个值得单独说的小测试。Command Code 团队故意设了 15 个循环陷阱,看模型能不能自己意识到在原地打转。以前的 GLM 会一直卡在死循环里,5.3 第一次做到停下来、判断"不对劲"、换条路走。知乎他们还提到配合自家工具后,普通会话 token 消耗降了 50%~60%——这个样本很小,还需要更多验证,但方向挺诱人:任务做得更复杂,反而更省 token。
强的地方,是真的
社区正面共识主要集中在 coding 和 Agent。
知乎博主小林的实测比较硬核:他给 5.3 一份钱包计费系统的 PRD(10 个接口、7 条业务规则、4 个页面),做完之后直接上对抗:
200 个并发扣费,余额只够成功 100 笔——结果正好成功 100 笔,一笔不多一笔不少;
同一个 requestId 并发重发 50 次,全部返回成功,流水只记一条;
持续扣费时直接 kill -9,重启后 401 条流水首尾相接,对账差额为 0;
6 种越权场景全部被拦住;
最后让它自审代码,交出的 7 条发现他逐条复验,零误报,里面包括一个真能注入的 XSS 和一个登录时序侧信道。知乎
还有个细节:同一个从零做的等距解谜游戏,Claude Fable 5 用 23 分钟,GLM-5.3 用了 49 分钟。知乎慢在哪?盯着过程看,大量时间花在自测、发现问题、返工上。慢是慢了点,安全感是真给足了。
B站雷达图横评视频下有条很有代表性的评论:Coding 非常好用,从 5.1 用到 5.3,一直是主力模型。哔哩哔哩知乎也有用户说 5.3 是"勤劳典范,做的东西不容易有低级错误,因为它至少会调用工具先看一眼"。
还有个更出圈的:多方消息说 GLM-5.3 在安全测试里揪出了一个潜伏约 40 年的 DNS 相关老漏洞,智谱还同步公布了开源项目漏洞清单。知乎具体细节官方还没完整披露,先按待核实处理,但"AI 挖老漏洞"这个场景,看起来是真跑通了。

有争议的地方,也是真的
先给"追平闭源"这个说法划条边界。ExploitBench 安全基准上,GLM-5.3 是 54.4%,Claude Fable 5 是 78.0%,GPT-5.6 Sol 是 76.5%——在开源阵营里很有竞争力、个别安全任务能拿第一,但说全面追平顶级闭源,证据还不够。知乎

其次,这次吵得最凶的其实不是榜单,是写作。
小红书一位写作博主(130+ 赞、113 条评论)的实测挺扎心:5.3 的文笔不如 5.1/5.2,“在不说人话方面取得了长足进步”,拒绝甲史诗级加厚,写点少年少女的纯真悸动被严防死守,“防早恋比我妈还严格”;还爱跟用户抬杠。小红书但同一位博主也承认,GLM 的世界知识依旧强得离谱——沙俄末期这种冷门史实考据都拿捏得住。
有意思的是,同平台另一位用户的体验恰好相反:绝对是我最近用到的中文语言和思维上最棒的模型,讨论问题、梳理逻辑简直不要太舒服。小红书
把两边放在一起看,结论其实清楚了:逻辑和讨论没变弱,变弱的是文风,以及内容安全边界收紧了。还是那条 B站评论里的原话:GLM 5.3 炼的有点走火入魔了,跟它对话,感觉它都有点开始不讲人话了。哔哩哔哩特化的代价,已经有人付过了。
另外两个观望信号:知乎有实测提到"个别项目修改上 Kimi K3 仍领先一筹";AA 开分不到一周,分数本身也可能波动。
那它适合谁,谁该再等等
1)Coding / Agent / 长任务开发者 → 值得试。提升主要落在你头上,横评里 ZCode 组合口碑最好。小红书不想花钱可以先薅羊毛:GLM-5.3 已上线 Qoder,新人送一个月会员;百度千帆也 Day0 上架,API 直接可用。知乎知乎

2)创意写作 / 角色扮演用户 → 别急着换。文风倒退、甲变厚是重度用户的实测,这个场景 5.2 的文笔目前更顺,可以等智谱后续小版本怎么修。
3)本地部署党 → 等权重。官方承诺安全评估后再开放权重(技术博客口径是发布后两周内),社区预计月底前能开源;Unsloth 这些已经排队等着做量化版了。小红书"开源第一"成色如何,等权重落地再验。
值得继续盯的四个信号:①权重开放后的独立复现和量化情况;②"更省 token 干更多活"有没有更多第三方证实;③AA 分数在新模型波动期后是否站得稳;④写作风格的官方回应。
最后说一句
GLM-5.3 最大的价值,可能不是证明"开源追平了闭源",而是实测证明了一件事:不换底座、纯靠一个月后训练,就能把模型在综合卷上往上推 7 分。这意味着国产模型的迭代只会更快,榜单刷新也会更频繁。
对我们用的人来说,启示就一条:周更时代,别让榜单替你做决定,你自己的负载才是唯一的 benchmark。
你上手 5.3 了吗?体验是夯还是拉?评论区聊聊。