10月4日,B站那条10.9万播放、749条评论的DeepSeek对比视频评论区,还在更新一条刚领完免费额度的差评,原话是感觉送的 5.3flash 又慢又垃圾,还不如花钱用 ds。同日的微博上,一位PiAgent用户写道,终端里换用DeepSeek官方模型速度飞一样,而他平常用的智谱的 glm-5.3-flash 一对比明显慢一截。哔哩哔哩微博
而智谱官方这一侧,9月18日刚刚"踩了一脚油门":推出GLM-5.3-FlashX,官方口径比现有GLM-5.3-Flash快5倍,定价提到原来的2.5倍。
一边说"又慢又垃圾",一边说"更快更流畅、加钱提速"。两句话对不上。过去三周,至少有四件不同的事被用户塞进了"GLM降智了"这一个句子里。我把智谱官方技术博客、三条独立实测视频及其评论区、海外开发者的整月账单实验、两份榜单数据拼成了下面这四本账——手里拿着118元CodingPlan、又赶上10月7日每日1亿Token免费到期这个节点的人,先分清自己在哪本账里,再决定续不续。
第一本账:官方承认过的"变笨",是Bug,而且修过
今年4月底,智谱发了一篇画风反常的官方技术博客《Scaling Pain》,没有炫技,专门大倒苦水:GLM-5系列在高负载CodingAgent场景出现过三类异常——乱码、复读、罕见字符。本地回放相同请求数百次无法复现,说明问题不在模型权重;调高系统负载后,大约每10000个请求能复现3-5个,真凶是PD分离架构下KVCache的复用竞态。修复后,异常输出率从约万分之十几降到万分之三以下。知乎
这条线今天还没完全断:9月15日B站有用户反馈,5.3flash偶尔"会重复用户和AI对话的黑历史"——和官方博客里的"复读"异常对得上号。哔哩哔哩
所以"降智"一词目前唯一有官方实证的落点,是这种低概率的推理链路异常,而且官方结论很明确:模型没变笨,是机房在高并发下偶发故障。

第二本账:官方没认的"变慢",用2.5倍价格回应了
现在的抱怨主要不是能力,是速度。官方没有正面解释过Flash为什么慢,但给过两次反应:6月被问升级付费Pro仍限速时,官方口径是算力紧张。9月18日,直接发布FlashX——官方公告里写着"最高200tokens/s"和"10万张国产芯片提供的推理算力"。知乎微博

FlashX的数字有意思。官方口径是"推理速度最高200tokens/s,比现有GLM-5.3-Flash快了5倍",而知乎对比帖给的实测口径是:GLM-5.3-Flash此前速度不到100tokens/s,FlashX最高200——差不多翻倍,"5倍"和"2倍"两个口径官方没有对齐。价格表倒是说得直白:Flash输入0.8元/输出2.8元(每1M tokens),FlashX输入2元/输出7元,正好2.5倍,加钱提速,明码标价。知乎知乎微博
为什么要花2.5倍买速度?要看Flash自己是怎么火的。今年8月下旬,匿名模型Ox-Alpha(中文社区叫"牛来")在OpenCode、OpenRouter双双登顶、创调用量新高,8月26日智谱官方认领:它发布的每个请求流量,全部由国产芯片提供算力。官方公告给出的画像是:320B总参数,ArtificialAnalysis综合智能指数57分与ClaudeOpus4.8持平,定价是GLM-5.3的1/10、限时折扣内1/20、Opus的1/40。转发这份公告的快讯写得直白:使用量已达DeepSeek两倍以上。便宜得不像实力派,用量自然爆炸——智谱自己的说法是"需求涨得太快",于是在国产芯片集群上继续加Infra投入,首席科学家唐杰的说法是,GLM-5.3-Flash从登上国产AI加速器到扛住全部生产流量只用了两周,端到端吞吐提升了3.2倍。微博知乎

海外有一个独立样本可以对照。Wagtail核心开发者九月份做了个公开实验:整月写代码只用GLM-5.3-Flash,账单68美元、烧了20亿token。他帖子里对"慢"的描述是——这款模型在性价比曲线上的位置太好,用的人太多,高峰期供应商算力顶不住,速度肉眼可见地变慢,他不得不临时切到DeepSeek和通义救急。他还把这条抱怨写成了表扬——被挤得排不上队,才是真正的实力认证。知乎
需要说清的是:官方算力叙事、英国开发者的账单帖、以及9月3日至20日"夜间无限畅用"、9月19日"3亿免费token"、每日1亿Token畅薅到10月7日这条免费活动线——三者时间高度重叠,慢的抱怨峰值恰好压在免费活动窗口上。但这是分布观察,不是因果结论:智谱至今没有公布高峰期负载或调度数据,"免费活动把池子挤爆了"目前只是与"降智"同样未经证实的一种解释。知乎哔哩哔哩
第三本账:你的体感确实变差了——那是价格账
把三周的体验变化全部算到模型头上,会漏掉账单。7月30日CodingPlan改版积分制,Pro档涨幅超150%,那个知乎问题下有68万浏览。9月2日B站横评还在说GLM-5.3-Flash"5折优惠期间综合最好"(3.1万播放)。9月20日夜间活动结束;9月29日已有用户说"最近glm5.3降智非常严重,怀疑是国庆节活动搞的,用起来感觉和glm5.0差不多";10月7日,每日1亿Token到期。知乎哔哩哔哩
同一笔钱,在不同时间窗口买到的服务含量本来就在变。那条9月13日拿到117个赞的评论说的与其说是降智,不如说是成本——经常雷霆大思考,速度虽然快但是完成任务久。楼下有人接了一句"同样的事保守贵了3倍"。哔哩哔哩
而隔壁的账本写得清清楚楚:同一条视频下335个赞的评论:“zcode+deepseekv4.1flash缓存命中能到99.8%,1亿token还不到3块钱”(发帖人自报11.5亿token花33元)。438个赞的长评给出了社区自发形成的混编阵型——主力用V4.1(快、缓存便宜),子代理挂5.3f后台验证思考,理由也具体:“思考深度不如5.3f,输入输出价格是5.3f的几倍,只有缓存价格低。”哔哩哔哩
第四本账:被抢先写好的"不行了"叙事
最后一本账最隐蔽:为什么"降智"这个词9月底突然变得可信?因为三件不相干的事恰好凑齐了。
ZCode传包风波后,“Zcode塌房了”"OK,现在0个人在意glm模型智力了"这类评论都在同一条对比视频下拿了高赞——信任危机给差评加了杠杆。哔哩哔哩
9月29日Anthropic前沿红队发布报告,原话把GLM-5.3称为"迄今发布的网络能力最强的开源权重模型"。长安街知事把它解读为"中国最强模型,距美国前沿只剩4个月差距"——对手认证反而坐实了"它很强,那你觉得它变笨一定是偷偷降了"。微博微博
10月2日,ArtificialAnalysis开源大模型智能指数更新:小米MiMo-V2.6-Pro以46分登顶,智谱GLM-5.3以45分第二,KimiK3 44分第三;10月3日阶跃Step5Preview又在DeepSWEv1.1拿下67.7%“略超GLM-5.3”。微博

但把数字拿近看:46对45,差1分。而"降智"阵营自己交出的证据其实叫"雷霆大思考"——那是出结果的时长问题,不是对错问题,同一条评论区里31个赞的说法是"在我目前的工作上感觉不到区别"。更关键的是,社区置顶的科普帖已经把提速的本质说透了:FlashX是服务侧推理优化,不是新的模型权重版本,也没有独立开源权重——连"变快"都不是换模型换来的,"偷偷换成小模型"的降智论没有任何一端有过实证。还有反方观点更直接:“这种对比完全没有意义,真正的工作,界面长什么样、交互如何都是定死的。”哔哩哔哩微博
官方没说降智,榜单不支持降智,评测差的是1分。"GLM不行了"是挤兑、信任、排名三件事的混合叙事,不是能力结论。

那么,118元到底续不续?
先对号,再动手:
你的用法 | 症状归属 | 现在该做什么 |
|---|---|---|
短任务、高频执行(跑脚本、改格式、批量页面) | 第二本账:Flash的"大思考"气质与你的活儿错配 | 先翻自己的思考档位设置(评论区69赞的原话:“说雷霆大思考的,开high,别一天天盯着那max看了”),再考虑按社区混编阵型把GLM挪到验证位;不必急着在10月7日前后做任何动作 |
长上下文深度思考、大项目重构 | 能力证据仍在(对手认证+开源榜前二),痛的是高峰期 | 把FlashX理解为"花钱买时间"的付费快车道再决定,2.5倍价格是官方给提速开的价;注意官方至今没解释免费路线为何不能快 |
轻度使用、想继续薅 | 第三本账:价格账 | 官方定价页还压着永久免费的GLM-4.7-Flash(200K上下文),填缝够用;118元档买的是额度稳定,别拿它和DeepSeek的缓存价硬比 |
被ZCode劝退中 | 第四本账:叙事污染 | 传包和降智是两本账,开源整改是一回事,模型慢不慢是另一回事,别合并判决 |
接下来三个可验证的观察信号,比任何一方的说法都值钱:
10月7日免费额度结束后48小时:"又慢"类抱怨量若肉眼可见回落,"活动挤兑"解释力增强;若继续刷屏,就该逼官方给负载口径了。
FlashX的口碑曲线:这是"慢"第一次被官方用真金白银定价。若2.5倍价格买到的体验不再被吐槽,说明之前真是算力调度问题;若付费档照样慢,"降智"叙事就会从段子变成质询。
智谱下一篇ScalingPain式博客:上次他们承认了KVCache竞态,这次值得盯他们是否第一次给出高峰期调度、限流口径的正面说明。
这个月智谱真正在卖的东西,不是降级的模型,而是把"慢"定价成了一档可以买断的服务。对118元的持有者,续费的正确姿势不是听段子,也不是等官方公告——先打开自己的effort设置,再打开自己这个月的账单。四本账里分不清自己在哪本的时候,恰恰是谁的结论都别信的时候。
(本文事实口径截至2026年10月4日;用户体感类表述均标注来源与点赞量,不代表本文结论。)