暑期这波国产大模型混战,总算打完了。8月中旬开始,Kimi、智谱、通义、DeepSeek轮番发新版,记分牌上最后一块拼图这周才补上:8月18日第三方评测机构Artificial Analysis(下称AA)把GLM-5.3收进榜单,8月20日第三方编程榜单DeepSWE也更新了统一复测数据。知乎DeepSeek则顺手调了价——8月23日起,API周末不再区分峰谷,全天按低谷价计费。微博
分数齐了,价格定了。对用智谱清言的人来说,这是个整理自己AI工具箱的好时机。但先别急着下结论,三套分数是三把不同的尺子,社区口径也没打架完毕,我帮你捋一遍。
一、三套分数,三把尺子
先看官方口径。智谱自己披露:GLM-5.3的基座模型和5.2完全一样,提升全部来自后训练强化学习。微博最扎眼的三组数字:DeepSWE从46.2涨到66.9,Terminal-Bench 3.0从4.6冲到28.3,Agents’ Last Exam(CLI)从23.8提到28.5。知乎涨幅大到有AI博主直接在微博上问「分数是怎么翻6倍的」——Terminal-Bench里的任务是实打实的难,所以大家更想看第三方复测。微博
官方还提了一项涌现能力:网络安全。官方口径是,在代码审查、漏洞发现这类防御场景中,5.3开始展现出潜力,并随发布放出了安全基准对比图。微博

第三方复测基本坐实了这次提升。AA当前版本v4.1.1的Intelligence Index(8月22日截图的14模型对比):Claude Opus 5以63分居首,GPT-5.6 Sol和Grok 4.6都是61分,Kimi K3和GLM-5.3同积60分——K3排第4,GLM-5.3排第5,再往下是58分的Qwen3.8和53分的DeepSeek V4 Pro。知乎国产模型里,是「唯二挤进第一阵营」的格局。

AA还有一个单独的Agentic Index,专测工具调用、规划和长程任务执行,更接近我们说的「干活」。这个榜上GLM-5.3拿59分,与Opus 5、Grok 4.6并列前三,领先Kimi K3(54分)和DeepSeek V4 Pro(50分)一个身位。知乎
DeepSWE(Datacurve)则完全不看自报分,所有模型在mini-swe-agent统一环境里跑:113个任务、91个仓库、5种语言。第一梯队是74%–69%:Claude Opus 5、GPT-5.6 Sol、Fable 5、GLM-5.3、Kimi K3。GLM-5.3以69%±3%和K3(69%±5%)同档,而上一代GLM-5.2在同一口径下只有44%——提升方向和官方口径一致。知乎
这里要提醒三件事,不然容易被标题带偏:
三套数字(官方66.9、AA 60、DeepSWE 69%)来自不同基准、不同评分体系,互相之间不能比大小;
AA分数绑定版本,v4.1.1更新后分数会变,别把今天的截图当永久结论;
最实在的数字是成本:DeepSWE单任务平均成本,GLM-5.3约28元,是第一梯队五款里最低的;Kimi K3约33元,其余三款都在56元以上。
二、社区口碑吵什么、认什么
分数是一回事,上手是另一回事。翻了一圈最近一周的讨论,两个共识比较清楚:
第一,「干活」是真变强了。改代码、跑文档、多步骤长任务这类场景,是第三方榜单和实测评价方向最一致的地方。AA的Agentic Index上5.3拿59分、排第2,就是这份共识的量化注脚。

第二,短板也一样清楚。一个是世界知识:知乎上高赞回答说得挺直白,这个模型「干活很强,但需要世界知识时会弱」,好消息是瞎编概率比Opus 5低(Opus知识题分数高,但有「敢答题」的嫌疑)。知乎另一个是慢:有实测用户吐槽5.3的思考时间明显长,「很慢,但效果顶级」,习惯秒问秒答的人会有点难受。知乎
争议最大的是「追平Kimi K3」这个说法。有人觉得K3已经发布超过一个月、打磨更久,「含金量更高」。微博我的判断是:两者综合同档,但GLM-5.3在Agentic榜上领先一个身位,K3在通用对话的稳定性上口碑更成熟,没必要争单一胜负。
还有一个容易忽略的背景:DeepSeek V4 Pro这次口碑平平(AA只有53分)。DeepSeek还在8月17日宣布涨价,高峰时段输出价涨到27元/百万token。微博8月23日又调整为周末全天低谷价。微博对普通用户来说,「随便抓一个国产头部模型又便宜又好」的窗口期在慢慢收窄,按场景挑比按价格挑更靠谱。
三、三种人,三种做法
如果你主力是干活——写长文、做报告、写代码、处理文档,那GLM-5.3值得当主力:Agentic榜第2,第一梯队里成本最低(在DeepSWE的成绩-单任务平均成本散点图上,5.3落在第一梯队分数带,成本明显低于同档的K3)。知乎开发者不用等,GLM Coding Plan已经全量跑5.3,API也早在8月19日开放、定价和5.2持平。

如果你用AI主要是查资料、问事实、整理背景——留一个备胎。世界知识不是5.3的强项,更合理的分工是:别的工具负责「找料」,GLM负责「把料做成成品」。
如果你在观望、等开源——官方计划8月28日放出完整权重,放出前要先做完安全评估和模型加固,截至8月23日还没放。知乎私有化部署可以等权重落地和第三方复测再评估,日常使用用现有的免费、低价渠道先上手就够了。App端更不用等:智谱清言已经上线5.3,社区里已经有人晒出App内「GLM-5.3 正式上线清言」的卡片截图。
最后留三个继续观察的信号。一是AA榜单版本更新后排名会不会变。二是GLM-5.5什么时候端上来——有测评人直言,「真要看综合实力,还得看5.5」。知乎三是生态侧的接入动向:荣耀笔记本和平板上的YOYO Claw已经接了5.3。微博
记分牌上谁第一,其实没那么重要。重要的是这轮大战打完,你清楚自己的哪件活,该交给哪个工具。