这两天AI编程圈刷屏的是GLM-5.3。先把时间线捋清楚:智谱在8月14日发布了GLM-5.3。哔哩哔哩8月19日凌晨,新一代基座模型GLM-5.3的API正式上线。微博
价格摁住了:输入1.40美元、输出4.40美元每百万token,和上一代GLM-5.2完全同价。知乎知乎在"四处收紧"的这个月,新旗舰走"同价升级"路线,对正在找性价比出路的编程用户来说,这是一个值得认真算账的选项。
为什么说它值得单独写一篇?看看这个月大家过得怎么样:DeepSeek涨价落地,有用户按自己的同类任务算,V4 Flash涨价前大约花10元,现在放在空闲时段跑大约22元。微博OpenCode Go深夜把Flash额度砍了94%(此前已单独报道)。Claude Code那边,每周上限提高50%的措施延长到了8月31日。知乎
60分是真60分,但先把跑分这件事说透
先看硬指标。GLM-5.3和GLM-5.2用的是同一个基座,总参数753B、激活40B,所有提升都来自后训练。知乎Artificial Analysis智能指数从5.2的53分跳到60分,一颗参数没加。微博
分项基准涨得更凶:Terminal Bench 3.0从4.6分跳到28.3分,DeepSWE v1.1从46.2升到66.9。哔哩哔哩后续更新成绩到了69%±3%,平均成本3.99美元、平均124个Agent步骤。微博在智谱自研的Z.ai Code Bench上,编程性能比上代提升了50%。知乎

但丑话说在前面:社区对这类跑分的争议不小。知乎上"怎么看GLM5.3 AA追平KimiK3"的高热度讨论里,就有人直言AA没有任何含金量,当时mimo都能刷成国模第一。知乎榜单只能当索引,不能当结论。
那真实手感怎么样?在浏览量235万的知乎问题"如何评价GLM-5.3"下,用户反馈比较集中:一是"稳",有评论说,基本放工作流里干两下就能找出bug或做好性能优化。知乎但思维链有些长,“拿来调单片机时效不够”,对时效敏感的任务并不合适。

没有视觉和多模态,是被反复点名的硬伤,但仍有用户觉得它是用起来手感最好的国模。知乎另外在Z.ai Code Bench上,GLM-5.3 max档34.5%的成绩,距离Claude Fable 5的39.5%仍有差距。知乎"对标旗舰"和"超过旗舰"是两回事。
一个意外亮点是安全能力:在官方评测图里,CyberGym等三项安全基准上GLM-5.3都明显强过上一代;智谱披露自GLM-5.2起与国内多支安全团队合作,把模型用于真实代码库,经过专家审查、筛选和去重后,识别出269个项目里的2436个漏洞,其中1097个是中高危问题。知乎做代码审计、安全扫描的团队可以多看一眼,当然能力越强,权限和隔离越要做严。

迁移前必读的3个坑
坑一:reasoning_effort默认是max,这一个参数能让账单差出几十倍。GLM-5.3的推理是恒开的,关不掉,只能选low/high/max三档,而默认档是max。有第三方用短分类任务实测:max的输出中位数105个token,low只有3个,两边答案一模一样,计费的那一半差35倍,折算下来同样100万次调用max要533美元、low只要85美元,顺手传个medium或none还会直接收到400报错。知乎从别家迁过来的用户很容易踩。建议在所有请求封装里显式写上这个参数,交互式轻任务优先low或high。注意这组数据来自单一第三方对两个prompt的实测,不是全面基准,倍数随负载变化,上线前拿自己的任务跑一遍。
high这一档也别急着跳过:代码任务上它比low贵26%,但中位延迟反而更短。知乎

坑二:订阅过GLM Coding Plan的账号有协议限制。只要你买过Coding Plan——哪怕订阅已过期——目前模型API只能通过OpenAI Chat Completions协议访问。知乎Responses协议和Anthropic协议会直接失败,如果你打算用老套餐账号走Anthropic协议接Claude Code,报错了别怀疑key,先核对自己的账号类型和订阅路径。知乎
坑三:base URL别信发布当天的教程。官方模型页自己就列了两个地址(open.bigmodel.cn和api.z.ai两套端点),文档示例还互相打架;公告后24小时内写的任何教程,引的base URL都不是最终落地的那个。知乎第一个404了先试另一个,别急着换key。
两个省钱开关和一个限时福利
API侧:缓存输入只要0.26美元/百万token,是冷读价格的19%,促销期存储费还免费,重复使用的system prompt和项目上下文走缓存基本是白捡的便宜。知乎
Coding Plan侧:套餐改成了积分制配额,模型调用在低峰时段只消耗50%标准积分,周末全天也算低峰。知乎而高峰只有工作日14:00到18:00这四个小时。小红书批量代码生成、自动化测试修复这类异步任务,丢到低峰跑就是打五折。
另外两个动态:七夕活动里,从未购买过Coding Plan的用户可以免费领一张7天体验卡。小红书8月20日起GLM-5.1面向所有Coding Plan用户开放,老套餐能跑的模型又多一个。知乎
智谱还同步推了自家Agent工具ZCode(macOS/Windows/Linux,支持SSH、WSL和Docker工作区),用BigModel账号或API Key登录即用,订阅了Coding Plan会自动走套餐额度。官方口径是同一个模型换上ZCode,任务整体通过率比搭配Claude Code高2.39%,缓存命中率超过98%。知乎这是官方数据,我没看到独立复现,当参考别当结论。
谁该换,谁再等等
值得动手的:被这波涨价直接伤到、以终端编程和长任务为主、按API量付费的用户。那份评测的价格表里,GPT-5.6 Sol的输出价是209.11美元/百万token。知乎GLM-5.3官方牌价输出4.40美元,差了近50倍,拿它做主力或至少做A/B对照,账是算得过来的。动手前先领7天体验卡,把reasoning_effort显式设好。
不用动的:Claude订阅用得稳、重度依赖Fable/Opus、或者必须要视觉多模态的场景,这次没有非换不可的理由,等开放权重发布再看。还有一类:大批量低精度任务,DeepSeek V4 Pro输入价0.05美元/百万token仍然是地板价。知乎涨价后也便宜,没必要迁。
接下来值得盯的信号。一是开放权重的发布时间:官方表示团队正对模型权重展开更全面的审查,以推进负责任的开放权重发布,目前模型先以API形式提供。知乎
二是9月之后容量是否收紧:Claude官方承认由于模型需求旺盛,未来数周容量可能紧张。知乎顺带盯一下7天体验卡会不会变成常态福利,以及Kimi K3追平60分之后会不会跟进降价。这三件事任何一件落地,性价比的天平都会再动一次。