智谱GLM-5.3今日开放API、定价持平:先看清这三组没被重点讲的数据,再决定换不换订阅

源自9位全网作者

08-19 23:08

今天(8月19日),智谱正式开放了 GLM-5.3 的 API,定价和 GLM-5.2 保持一致,主打复杂编码、防御性网络安全和长程任务。知乎关注 ChatGLM 的朋友应该对这个名字不陌生——它 8 月 14 日就发布了,但这一周发生的事,比"新模型上线"本身有意思得多:跑分涨了六倍、开源权重却推迟两周、红队挖出两千多个漏洞、Coding 用户还在吐槽服务掉线。

与其再复述一遍通稿,不如把智谱没重点讲的几个地方拆开看看,顺便回答一个实在问题:要不要换订阅、怎么换成本最低。

这一周到底发生了什么

先把时间线捋一遍,很多判断要放回时间线里才看得清:

  • 8月14日,GLM-5.3 发布。它和 GLM-5.2 用的是同一个基座,没有重新预训练,所有提升都来自后训练——官方说法是喂的不再是传统编程题,而是"即使由经验丰富的工程师完成也需要数天"的完整长程任务。知乎

  • 同一天宣布:完整权重推迟约两周开放,预计落在 8 月 28 日前后。理由是模型在训练中展现出超出预期的网络安全能力,需要评估开放权重的风险。一个长期靠开放权重吸引开发者的国产模型,第一次因为"太会找漏洞"踩了刹车。36氪

  • 8月17日前后,PhanRouter、万界方舟等生态陆续接入;程序员鱼皮等开发者开始在同一工具链下做横向实测。知乎

  • 8月18日,Z.ai Coding Plan 向 Lite/Pro/Max 全档用户开放,支持 Claude Code、Goose、Codex 接入。同一天,知乎上出现 GLM Coding Max 用户"一天下来每轮对话都在重连"的吐槽。

  • 8月19日(今天),API 正式开放,定价与 5.2 持平;Artificial Analysis 竞技场开分,GLM-5.3 与 Kimi K3 并列 60 分,成为挤进 T1 阵营的仅有的两个国产模型。微博微博

跑分:哪些能信,哪些要打个问号

先看官方自测的几个关键数字:Terminal-Bench 3.0 从 4.6 涨到 28.3,这就是"涨六倍"说法的来源;DeepSWE v1.1 从 46.2 到 66.9;安全侧 CyberGym 从 77.2% 到 84.5%,ExploitBench 从 24.4% 到 54.4%。微博数字确实吓人,但有三个细节值得挤一挤水分。

智谱GLM-5.3今日开放API、定价持平:先看清这三组没被重点讲的数据,再决定换不换订阅

第一,"六倍"有地板效应。4.6 分本身接近地板,从地板起跳,倍数天然好看。真正该问的是 28.3 能排到什么位置,而不是涨了几倍。知乎

第二,官方那张基准表,几乎每一行都是智谱自己跑的。据 explainx.ai 统计,约 19 行基准里只有 2 行有具名的第三方执行方。这里有个容易混的点:"公开基准"只说明题目是公开的,不代表这次跑分是第三方独立跑的。在真正的第三方公开榜上,截至 8 月 17 日的快照里 GLM-5.3 还没进榜,榜首是 Claude Opus 5 的 42.7%。知乎拿智谱自测的 28.3 去和公开榜的 42.7% 比,是两个不同源的数据,直接比不成立。

智谱GLM-5.3今日开放API、定价持平:先看清这三组没被重点讲的数据,再决定换不换订阅

第三,智谱自建的 Z.ai Code Bench 上 GLM-5.3 拿 34.5%、对面 Claude Opus 是 29.5%,看起来赢了,但两边算力预算不一样——智谱每题约 50K token,对面约 120K,而且这套评测的数据集和评测包都没公开。知乎一套别人跑不了的评测,数字只能当参考。

那相对独立的第三方坐标是什么?目前最有参考价值的是 Artificial Analysis 竞技场:GLM-5.3 拿到 60 分,和 Kimi K3 并列,国产模型里只有这两个挤进了 T1,咬住了 GPT-5.6 和 Claude Opus 5。微博另外在 Design Arena 上它以 1351 Elo 排总榜第三,是设计任务上第二强的开放权重模型。知乎要判断 GLM-5.3 现在站在哪个位置,看这两个榜,比看官方表格靠谱。

社区实测和服务吐槽,都是真的

好评这边:程序员鱼皮把 GLM-5.3、DeepSeek V4 Pro、Kimi K3 放进同一个 DeepSeek Harness,完全相同的提示词、完全不做人工干预,让它们各做一个 3D 跑酷游戏和一个全栈 AI 绘图工具。结果是 GLM-5.3 两个任务的完成度都明显领先——游戏有多关卡、多技能、剧情还原,绘图工具甚至把 draw.io 的编辑能力深度融合进了自己的界面。知乎另外有运维背景的博主把自己生产环境的主 agent 从 GPT-5.6 换成了 GLM-5.3,JavaGuide 也用它从零做了款 agent 游戏。

智谱GLM-5.3今日开放API、定价持平:先看清这三组没被重点讲的数据,再决定换不换订阅

差评这边同样真实:有 GLM Coding Max 用户在知乎吐槽,ZCode 里"一天下来每轮对话都在重连",怀疑和 DeepSeek 调价后用户涌入有关。知乎对订阅用户来说,这个信号和能力跑分一样重要——模型强是一回事,服务供给跟不跟得上是另一回事。

关于那 2436 个漏洞,也要说清楚口径:智谱联合清华 NISL、南开及绿盟、奇安信、腾讯玄武等十余家安全团队做红队测试,在 269 个真实开源项目里找出 2436 个去重漏洞,平均潜伏 26.6 年,最早的一处写于 1981 年,其中最扎眼的是 1983 年 DNS 协议里的缺陷,智谱称可把服务器压力放大近 8 万倍。36氪但注意两点:一是发布时只有 53 个拿到 CVE 编号,其余还在协同披露禁令期;二是中文材料里的"1097 个中高危",对应的其实是英文口径里危急加高危的总和,看数据分布比看形容词稳妥。知乎

至于"GLM-5.3 在 Cursor 里发现严重漏洞"这条,目前既无 CVE 也无 Cursor 官方确认,只能当单方说法。知乎

两个直接影响决策的事

权重推迟两周,而且会"加固"。 8 月 28 日前后放出的将是把安全约束训进权重本身的版本,最敏感的网络安全能力走"可信访问",只对验证用户开放。知乎这对等权重做本地部署的人是实打实的成本。反对延期的声音也有道理:API 当天就开了,真想拿它找漏洞的人只需要愿意付 token 钱,风险并没有跟着权重晚两周。

怎么判断这两周是真评估还是公关缓冲?有个现成的验证办法:对比 API 版本和两周后放出的权重在安全类任务上的能力画像,如果基本一致,那这两周更像姿态。这个方法可以先收藏,月底见分晓。

服务稳定性还在被检验。 今天的 API 开放和 Coding Plan 全档放开叠加,如果重连类吐槽持续超过一周,那能力分再高也要打折。

成本账和分人群建议

先说价格:GLM Coding Plan 分 $18/$72/$160 三档月费,年付更省;API 定价与 GLM-5.2 持平,有快讯称与 Kimi K3 同级但价格更低。知乎微博另外几个用起来会碰到的变化:GLM-5.3 的思考关不掉了,只能在三档强度里选(默认拉满),上下文窗口 1M token,单次输出上限 128K,只吃文字不看图。

分人群说:

如果你是 Claude Code/Codex 订阅用户:值得用最低档尝鲜,接入成本几乎为零。但验证方法有讲究——编程基准测不到读老仓库、守项目代码风格这些真实工作里最耗人的环节,行内的老办法是拿自己项目最近的历史提交让它跑,别看别人的榜。知乎也别把全部任务迁过来,至少等月底权重和服务稳定性这两个变量落地。

智谱GLM-5.3今日开放API、定价持平:先看清这三组没被重点讲的数据,再决定换不换订阅

如果你是 API 用户:定价没涨,agent 类、长程任务可以直接试,注意思考不可关闭带来的 token 消耗变化。

如果你是本地部署党:别急。等 8 月 28 日前后权重落地,先验证加固版和 API 版的能力差距,再决定值不值得部署。

最后留三个值得持续盯的信号:一是 8 月 28 日前后权重开放及 API/权重能力对比;二是 ZCode 和 Coding Plan 的服务稳定性,看吐槽是否消退;三是智谱能不能把"安全"讲成第三条商业化曲线——发布日股价先涨 9% 再跌 9% 收跌 3.6%,市场暂时还在观望。

一句话总结:GLM-5.3 用"同一个基座、只改后训练"挤进了第一梯队,这件事本身比分数更有意义;但它的分数大半是自拍,第三方坐标目前只有一个 AA 竞技场。值得试,别急着全换。

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章