当前位置:
AIGC文章详情

暑期国产AI大战收官,第三方分数齐了:智谱清言用户的工具箱该留谁换谁

源自86位全网作者

03:22

暑期这波国产大模型混战,总算打完了。8月中旬开始,Kimi、智谱、通义DeepSeek轮番发新版,记分牌上最后一块拼图这周才补上:8月18日第三方评测机构Artificial Analysis(下称AA)把GLM-5.3收进榜单,8月20日第三方编程榜单DeepSWE也更新了统一复测数据。知乎DeepSeek则顺手调了价——8月23日起,API周末不再区分峰谷,全天按低谷价计费。微博

分数齐了,价格定了。对用智谱清言的人来说,这是个整理自己AI工具箱的好时机。但先别急着下结论,三套分数是三把不同的尺子,社区口径也没打架完毕,我帮你捋一遍。

一、三套分数,三把尺子

先看官方口径。智谱自己披露:GLM-5.3的基座模型和5.2完全一样,提升全部来自后训练强化学习。微博最扎眼的三组数字:DeepSWE从46.2涨到66.9,Terminal-Bench 3.0从4.6冲到28.3,Agents’ Last Exam(CLI)从23.8提到28.5。知乎涨幅大到有AI博主直接在微博上问「分数是怎么翻6倍的」——Terminal-Bench里的任务是实打实的难,所以大家更想看第三方复测。微博

官方还提了一项涌现能力:网络安全。官方口径是,在代码审查、漏洞发现这类防御场景中,5.3开始展现出潜力,并随发布放出了安全基准对比图。微博

暑期国产AI大战收官,第三方分数齐了:智谱清言用户的工具箱该留谁换谁

第三方复测基本坐实了这次提升。AA当前版本v4.1.1的Intelligence Index(8月22日截图的14模型对比):Claude Opus 5以63分居首,GPT-5.6 Sol和Grok 4.6都是61分,Kimi K3和GLM-5.3同积60分——K3排第4,GLM-5.3排第5,再往下是58分的Qwen3.8和53分的DeepSeek V4 Pro。知乎国产模型里,是「唯二挤进第一阵营」的格局。

暑期国产AI大战收官,第三方分数齐了:智谱清言用户的工具箱该留谁换谁

AA还有一个单独的Agentic Index,专测工具调用、规划和长程任务执行,更接近我们说的「干活」。这个榜上GLM-5.3拿59分,与Opus 5、Grok 4.6并列前三,领先Kimi K3(54分)和DeepSeek V4 Pro(50分)一个身位。知乎

DeepSWE(Datacurve)则完全不看自报分,所有模型在mini-swe-agent统一环境里跑:113个任务、91个仓库、5种语言。第一梯队是74%–69%:Claude Opus 5、GPT-5.6 Sol、Fable 5、GLM-5.3、Kimi K3。GLM-5.3以69%±3%和K3(69%±5%)同档,而上一代GLM-5.2在同一口径下只有44%——提升方向和官方口径一致。知乎

这里要提醒三件事,不然容易被标题带偏:

  • 三套数字(官方66.9、AA 60、DeepSWE 69%)来自不同基准、不同评分体系,互相之间不能比大小;

  • AA分数绑定版本,v4.1.1更新后分数会变,别把今天的截图当永久结论;

  • 最实在的数字是成本:DeepSWE单任务平均成本,GLM-5.3约28元,是第一梯队五款里最低的;Kimi K3约33元,其余三款都在56元以上。

二、社区口碑吵什么、认什么

分数是一回事,上手是另一回事。翻了一圈最近一周的讨论,两个共识比较清楚:

第一,「干活」是真变强了。改代码、跑文档、多步骤长任务这类场景,是第三方榜单和实测评价方向最一致的地方。AA的Agentic Index上5.3拿59分、排第2,就是这份共识的量化注脚。

暑期国产AI大战收官,第三方分数齐了:智谱清言用户的工具箱该留谁换谁

第二,短板也一样清楚。一个是世界知识:知乎上高赞回答说得挺直白,这个模型「干活很强,但需要世界知识时会弱」,好消息是瞎编概率比Opus 5低(Opus知识题分数高,但有「敢答题」的嫌疑)。知乎另一个是慢:有实测用户吐槽5.3的思考时间明显长,「很慢,但效果顶级」,习惯秒问秒答的人会有点难受。知乎

争议最大的是「追平Kimi K3」这个说法。有人觉得K3已经发布超过一个月、打磨更久,「含金量更高」。微博我的判断是:两者综合同档,但GLM-5.3在Agentic榜上领先一个身位,K3在通用对话的稳定性上口碑更成熟,没必要争单一胜负。

还有一个容易忽略的背景:DeepSeek V4 Pro这次口碑平平(AA只有53分)。DeepSeek还在8月17日宣布涨价,高峰时段输出价涨到27元/百万token。微博8月23日又调整为周末全天低谷价。微博对普通用户来说,「随便抓一个国产头部模型又便宜又好」的窗口期在慢慢收窄,按场景挑比按价格挑更靠谱。

三、三种人,三种做法

如果你主力是干活——写长文、做报告、写代码、处理文档,那GLM-5.3值得当主力:Agentic榜第2,第一梯队里成本最低(在DeepSWE的成绩-单任务平均成本散点图上,5.3落在第一梯队分数带,成本明显低于同档的K3)。知乎开发者不用等,GLM Coding Plan已经全量跑5.3,API也早在8月19日开放、定价和5.2持平。

暑期国产AI大战收官,第三方分数齐了:智谱清言用户的工具箱该留谁换谁

如果你用AI主要是查资料、问事实、整理背景——留一个备胎。世界知识不是5.3的强项,更合理的分工是:别的工具负责「找料」,GLM负责「把料做成成品」。

如果你在观望、等开源——官方计划8月28日放出完整权重,放出前要先做完安全评估和模型加固,截至8月23日还没放。知乎私有化部署可以等权重落地和第三方复测再评估,日常使用用现有的免费、低价渠道先上手就够了。App端更不用等:智谱清言已经上线5.3,社区里已经有人晒出App内「GLM-5.3 正式上线清言」的卡片截图。

最后留三个继续观察的信号。一是AA榜单版本更新后排名会不会变。二是GLM-5.5什么时候端上来——有测评人直言,「真要看综合实力,还得看5.5」。知乎三是生态侧的接入动向:荣耀笔记本和平板上的YOYO Claw已经接了5.3。微博

记分牌上谁第一,其实没那么重要。重要的是这轮大战打完,你清楚自己的哪件活,该交给哪个工具。

内容由AI生成

精选参考来源

1. GLM-5.3在AA14模型对比中综合第5,Agentic第2:双榜成绩出炉

2. GLM-5.3,前沿编程与安全能力涌现今天,我们发布GLM-5.3。基座模型与GLM-5.2相同,但通过更大规模、更长周期、更多样的长程任务环境进行后训练,进一

3. 智谱AI(Z.ai)今天发布了GLM-5.3,和GLM-5.2共用同一个基座模型,所有提升都来自后训练阶段的强化学习(RL)。【1】编程:开源阵营里最强,但离闭

4. 不儿?GLM-5.3的测试分数是怎么翻6倍的?有一说一这个分数飞升有点猛了,按我对TerminalBench3.0的理解,里面的任务是实打实的难的.比如这个ex

5. 怎么看GLM5.3ArtificialAnalysis追平KimiK3?

6. 为什么Qwen3.8-27B和GLM-5.3都要想那么久?

7. 智谱的GLM-5.3终于也在AA竞技场开分,暑期档的这一轮国产模型上新基本上算是告一段落了,目前的成绩如下:KimiK3和GLM-5.3并列60分,是中国唯二能

8. 算力涨价的“蝴蝶效应”:八大细分赛道全梳理8月17日,DeepSeek一声涨价令,V4-Pro高峰时段输出价格直接飙到27元/百万Token,还首次搞起了峰谷分

9. 【#今天0点起DeepSeek调价#】DeepSeekAPI开放平台于2026年8月23日(周日)00:00起,优化峰谷计费规则。调整后,周末(周六及周日)全天

10. 和大家分享一个好消息:#荣耀笔记本#和#荣耀平板#上的YOYOClaw,已正式接入智谱最新GLM-5.3大模型。通过更大规模、更长周期、更多样任务环境的后训练,

0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章