当前位置:
AIGC文章详情

GLM-5.3发布一周:跑分登顶之外,智谱清言这次真正变的是“干活”,先搞清楚适不适合你

源自72位全网作者

07:45

上周四(8月14日),智谱发布了GLM-5.3,圈里热闹了好几天。微博关注智谱清言的朋友大概率刷到过新闻,但大多数报道到"跑分登顶""开源第一"就停了。今天这篇不聊跑分本身,聊聊报道没告诉你的事:这次升级到底改变了你在智谱清言里能体验到的什么,没改变什么,以及它适合谁。

先说一个反直觉的事实:GLM-5.3不是传统意义上的"新模型"。

多方信息交叉确认过:GLM-5.3和GLM-5.2用的是同一个7430亿参数基座,模型架构、参数规模都没动,所有提升全部来自后训练阶段的强化学习。知乎微博翻译成人话:脑子还是那个脑子,但被送去刷了一轮高强度"真题特训",动手能力变强了。

这对使用者意味着什么?两条预期要摆正:

第一,别指望它"懂得更多"。基座没换,知识库没变,如果你平时主要用它闲聊、问常识、查信息,5.3和5.2的体感差距不会大。

第二,可以期待它"更能干活"。这轮分数暴涨全部集中在编程、终端操作、Agent长程任务上:Terminal Bench 3.0从上代的4.6分直接跳到28.3分,拿下开源模型第一;DeepSWE v1.1从上代46.2涨到66.9,超过了DeepSeek V4 Pro正式版的62.7;智谱官方口径是编程能力较上代提升50%。微博微博博主"宝玉"的总结比较中肯:编程是开源阵营最强,但离闭源前沿还有距离。微博

GLM-5.3发布一周:跑分登顶之外,智谱清言这次真正变的是“干活”,先搞清楚适不适合你

还有一个连智谱自己都没预料到的"涌现"。官方原本只是想让它练练找漏洞,结果训练规模上去之后,GLM-5.3开始能把漏洞利用的多个阶段串成完整攻击链,在网络安全基准CyberGym上以84.5%拿了全球第一,压过了Claude Mythos 5和GPT-5.6 Sol。微博落到普通人能用的层面:拿它做代码审查、检查小脚本有没有风险,算是多了一个免费的安全搭子。

那么这些能力落到智谱清言App里,体感是什么?结合这一周微博、知乎、小红书三边的用户反馈,我把它分成"感受得到"和"感受不到"两类:

感受得到的:让它执行长任务的时候。比如写一段脚本、批量处理文档、让它一步步完成一个多环节任务,这类"派活"场景是这次提升的主场。知乎有充值会员的用户评价"编程、智能体不错";荣耀的YOYOClaw也已经官宣接入了GLM-5.3,生态在往外铺。微博微博博主阑夕关注的AA竞技场(Arena)开分后,GLM-5.3和Kimi K3并列60分,是仅有的两个挤进T1阵营的国产模型。微博

GLM-5.3发布一周:跑分登顶之外,智谱清言这次真正变的是“干活”,先搞清楚适不适合你

感受不到的:日常问答、文案写作、情绪陪伴。这些场景吃的是基座的知识储备和语言风格,这次没动,别抱过高期待。

然后是避坑提醒,都是社区里真实的负面信号:

一是稳定性。微博上有用户直言智谱清言"简直乱来",吐槽它偶尔不按指令办事。微博跑分强不等于每一次输出都稳,重要内容请务必自己核对。

GLM-5.3发布一周:跑分登顶之外,智谱清言这次真正变的是“干活”,先搞清楚适不适合你

二是表格导出。小红书上有不少用户吐槽智谱清言生成的表格导出后格式错乱,甚至有第三方小程序专门靠解决这个痛点引流。小红书如果你的工作流重度依赖导出表格,先小批量测试,别直接上重要数据。

三是信息噪音。最近小红书涌出大量"用智谱清言做海报"的模板化教程,文案高度雷同,明显是推广内容而非真实用户口碑,看的时候注意分辨。小红书

最后说说它适合谁,不适合谁:

适合:想找个免费国产AI"干活"的效率党——写脚本、审代码、跑自动化任务,GLM-5.3是当前开源阵营里最能打的选择之一,而且这次升级没涨价(对比一下:DeepSeek的API刚在8月17日生效新一轮调价,涨幅50%到1100%)。知乎微博

不适合:主要拿AI闲聊、写作、查资料的用户,这次升级跟你的使用场景关系不大,没必要特意切换。

观望:纠结要不要为高级功能花钱的,先看站内前几篇把积分账算透的文章再做决定,这篇就不展开了

GLM-5.3发布一周:跑分登顶之外,智谱清言这次真正变的是“干活”,先搞清楚适不适合你

后面值得继续盯的信号:智谱清言App内模型切换的放量节奏、积分消耗规则有没有新变化,以及Kimi、DeepSeek下一轮的跟进动作。有进展我会再来更新。

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章