GLM变慢、降智了?三周的抱怨其实是四本账:官方Bug报告、2.5倍价格的油门和10.9万播放的评论区,摆完再决定118元续不续

源自415位全网作者

21:02

10月4日,B站那条10.9万播放、749条评论的DeepSeek对比视频评论区,还在更新一条刚领完免费额度的差评,原话是感觉送的 5.3flash 又慢又垃圾,还不如花钱用 ds。同日的微博上,一位PiAgent用户写道,终端里换用DeepSeek官方模型速度飞一样,而他平常用的智谱的 glm-5.3-flash 一对比明显慢一截。哔哩哔哩微博

而智谱官方这一侧,9月18日刚刚"踩了一脚油门":推出GLM-5.3-FlashX,官方口径比现有GLM-5.3-Flash快5倍,定价提到原来的2.5倍。

一边说"又慢又垃圾",一边说"更快更流畅、加钱提速"。两句话对不上。过去三周,至少有四件不同的事被用户塞进了"GLM降智了"这一个句子里。我把智谱官方技术博客、三条独立实测视频及其评论区、海外开发者的整月账单实验、两份榜单数据拼成了下面这四本账——手里拿着118元CodingPlan、又赶上10月7日每日1亿Token免费到期这个节点的人,先分清自己在哪本账里,再决定续不续。

第一本账:官方承认过的"变笨",是Bug,而且修过

今年4月底,智谱发了一篇画风反常的官方技术博客《Scaling Pain》,没有炫技,专门大倒苦水:GLM-5系列在高负载CodingAgent场景出现过三类异常——乱码、复读、罕见字符。本地回放相同请求数百次无法复现,说明问题不在模型权重;调高系统负载后,大约每10000个请求能复现3-5个,真凶是PD分离架构下KVCache的复用竞态。修复后,异常输出率从约万分之十几降到万分之三以下。知乎

这条线今天还没完全断:9月15日B站有用户反馈,5.3flash偶尔"会重复用户和AI对话的黑历史"——和官方博客里的"复读"异常对得上号。哔哩哔哩

所以"降智"一词目前唯一有官方实证的落点,是这种低概率的推理链路异常,而且官方结论很明确:模型没变笨,是机房在高并发下偶发故障。

GLM变慢、降智了?三周的抱怨其实是四本账:官方Bug报告、2.5倍价格的油门和10.9万播放的评论区,摆完再决定118元续不续

第二本账:官方没认的"变慢",用2.5倍价格回应了

现在的抱怨主要不是能力,是速度。官方没有正面解释过Flash为什么慢,但给过两次反应:6月被问升级付费Pro仍限速时,官方口径是算力紧张。9月18日,直接发布FlashX——官方公告里写着"最高200tokens/s"和"10万张国产芯片提供的推理算力"。知乎微博

GLM变慢、降智了?三周的抱怨其实是四本账:官方Bug报告、2.5倍价格的油门和10.9万播放的评论区,摆完再决定118元续不续

FlashX的数字有意思。官方口径是"推理速度最高200tokens/s,比现有GLM-5.3-Flash快了5倍",而知乎对比帖给的实测口径是:GLM-5.3-Flash此前速度不到100tokens/s,FlashX最高200——差不多翻倍,"5倍"和"2倍"两个口径官方没有对齐。价格表倒是说得直白:Flash输入0.8元/输出2.8元(每1M tokens),FlashX输入2元/输出7元,正好2.5倍,加钱提速,明码标价。知乎知乎微博

为什么要花2.5倍买速度?要看Flash自己是怎么火的。今年8月下旬,匿名模型Ox-Alpha(中文社区叫"牛来")在OpenCode、OpenRouter双双登顶、创调用量新高,8月26日智谱官方认领:它发布的每个请求流量,全部由国产芯片提供算力。官方公告给出的画像是:320B总参数,ArtificialAnalysis综合智能指数57分与ClaudeOpus4.8持平,定价是GLM-5.3的1/10、限时折扣内1/20、Opus的1/40。转发这份公告的快讯写得直白:使用量已达DeepSeek两倍以上。便宜得不像实力派,用量自然爆炸——智谱自己的说法是"需求涨得太快",于是在国产芯片集群上继续加Infra投入,首席科学家唐杰的说法是,GLM-5.3-Flash从登上国产AI加速器到扛住全部生产流量只用了两周,端到端吞吐提升了3.2倍。微博知乎

GLM变慢、降智了?三周的抱怨其实是四本账:官方Bug报告、2.5倍价格的油门和10.9万播放的评论区,摆完再决定118元续不续

海外有一个独立样本可以对照。Wagtail核心开发者九月份做了个公开实验:整月写代码只用GLM-5.3-Flash,账单68美元、烧了20亿token。他帖子里对"慢"的描述是——这款模型在性价比曲线上的位置太好,用的人太多,高峰期供应商算力顶不住,速度肉眼可见地变慢,他不得不临时切到DeepSeek和通义救急。他还把这条抱怨写成了表扬——被挤得排不上队,才是真正的实力认证。知乎

需要说清的是:官方算力叙事、英国开发者的账单帖、以及9月3日至20日"夜间无限畅用"、9月19日"3亿免费token"、每日1亿Token畅薅到10月7日这条免费活动线——三者时间高度重叠,慢的抱怨峰值恰好压在免费活动窗口上。但这是分布观察,不是因果结论:智谱至今没有公布高峰期负载或调度数据,"免费活动把池子挤爆了"目前只是与"降智"同样未经证实的一种解释。知乎哔哩哔哩

第三本账:你的体感确实变差了——那是价格账

把三周的体验变化全部算到模型头上,会漏掉账单。7月30日CodingPlan改版积分制,Pro档涨幅超150%,那个知乎问题下有68万浏览。9月2日B站横评还在说GLM-5.3-Flash"5折优惠期间综合最好"(3.1万播放)。9月20日夜间活动结束;9月29日已有用户说"最近glm5.3降智非常严重,怀疑是国庆节活动搞的,用起来感觉和glm5.0差不多";10月7日,每日1亿Token到期。知乎哔哩哔哩

同一笔钱,在不同时间窗口买到的服务含量本来就在变。那条9月13日拿到117个赞的评论说的与其说是降智,不如说是成本——经常雷霆大思考,速度虽然快但是完成任务久。楼下有人接了一句"同样的事保守贵了3倍"。哔哩哔哩

而隔壁的账本写得清清楚楚:同一条视频下335个赞的评论:“zcode+deepseekv4.1flash缓存命中能到99.8%,1亿token还不到3块钱”(发帖人自报11.5亿token花33元)。438个赞的长评给出了社区自发形成的混编阵型——主力用V4.1(快、缓存便宜),子代理挂5.3f后台验证思考,理由也具体:“思考深度不如5.3f,输入输出价格是5.3f的几倍,只有缓存价格低。”哔哩哔哩

第四本账:被抢先写好的"不行了"叙事

最后一本账最隐蔽:为什么"降智"这个词9月底突然变得可信?因为三件不相干的事恰好凑齐了。

ZCode传包风波后,“Zcode塌房了”"OK,现在0个人在意glm模型智力了"这类评论都在同一条对比视频下拿了高赞——信任危机给差评加了杠杆。哔哩哔哩

9月29日Anthropic前沿红队发布报告,原话把GLM-5.3称为"迄今发布的网络能力最强的开源权重模型"。长安街知事把它解读为"中国最强模型,距美国前沿只剩4个月差距"——对手认证反而坐实了"它很强,那你觉得它变笨一定是偷偷降了"。微博微博

10月2日,ArtificialAnalysis开源大模型智能指数更新:小米MiMo-V2.6-Pro以46分登顶,智谱GLM-5.3以45分第二,KimiK3 44分第三;10月3日阶跃Step5Preview又在DeepSWEv1.1拿下67.7%“略超GLM-5.3”。微博

GLM变慢、降智了?三周的抱怨其实是四本账:官方Bug报告、2.5倍价格的油门和10.9万播放的评论区,摆完再决定118元续不续

但把数字拿近看:46对45,差1分。而"降智"阵营自己交出的证据其实叫"雷霆大思考"——那是出结果的时长问题,不是对错问题,同一条评论区里31个赞的说法是"在我目前的工作上感觉不到区别"。更关键的是,社区置顶的科普帖已经把提速的本质说透了:FlashX是服务侧推理优化,不是新的模型权重版本,也没有独立开源权重——连"变快"都不是换模型换来的,"偷偷换成小模型"的降智论没有任何一端有过实证。还有反方观点更直接:“这种对比完全没有意义,真正的工作,界面长什么样、交互如何都是定死的。”哔哩哔哩微博

官方没说降智,榜单不支持降智,评测差的是1分。"GLM不行了"是挤兑、信任、排名三件事的混合叙事,不是能力结论。

GLM变慢、降智了?三周的抱怨其实是四本账:官方Bug报告、2.5倍价格的油门和10.9万播放的评论区,摆完再决定118元续不续

那么,118元到底续不续?

先对号,再动手:

你的用法

症状归属

现在该做什么

短任务、高频执行(跑脚本、改格式、批量页面)

第二本账:Flash的"大思考"气质与你的活儿错配

先翻自己的思考档位设置(评论区69赞的原话:“说雷霆大思考的,开high,别一天天盯着那max看了”),再考虑按社区混编阵型把GLM挪到验证位;不必急着在10月7日前后做任何动作

长上下文深度思考、大项目重构

能力证据仍在(对手认证+开源榜前二),痛的是高峰期

把FlashX理解为"花钱买时间"的付费快车道再决定,2.5倍价格是官方给提速开的价;注意官方至今没解释免费路线为何不能快

轻度使用、想继续薅

第三本账:价格账

官方定价页还压着永久免费的GLM-4.7-Flash(200K上下文),填缝够用;118元档买的是额度稳定,别拿它和DeepSeek的缓存价硬比

被ZCode劝退中

第四本账:叙事污染

传包和降智是两本账,开源整改是一回事,模型慢不慢是另一回事,别合并判决

接下来三个可验证的观察信号,比任何一方的说法都值钱:

  1. 10月7日免费额度结束后48小时:"又慢"类抱怨量若肉眼可见回落,"活动挤兑"解释力增强;若继续刷屏,就该逼官方给负载口径了。

  2. FlashX的口碑曲线:这是"慢"第一次被官方用真金白银定价。若2.5倍价格买到的体验不再被吐槽,说明之前真是算力调度问题;若付费档照样慢,"降智"叙事就会从段子变成质询。

  3. 智谱下一篇ScalingPain式博客:上次他们承认了KVCache竞态,这次值得盯他们是否第一次给出高峰期调度、限流口径的正面说明。

这个月智谱真正在卖的东西,不是降级的模型,而是把"慢"定价成了一档可以买断的服务。对118元的持有者,续费的正确姿势不是听段子,也不是等官方公告——先打开自己的effort设置,再打开自己这个月的账单。四本账里分不清自己在哪本的时候,恰恰是谁的结论都别信的时候。

(本文事实口径截至2026年10月4日;用户体感类表述均标注来源与点赞量,不代表本文结论。)

内容由AI生成

精选参考来源

1. DeepSeek V4.1 Flash对比GLM 5.3 Flash,哪个更值得用,性价比更高?

2. 有 Pi Agent 的终端中用 DeepSeek官方的模型,这速度飞一样~~因为平常用的智谱的 glm-5.3-flash,一对比,明显慢一截~要是DeepS

3. 智谱公布“降智”的秘密:Scaling不可避免的痛

4. 智谱付费套餐升级Pro仍限速,官方称算力紧张,这种行为是否合理?

5. 智谱 GLM-5.3-FlashX,最高200 tokens/s“在10万张国产芯片提供的推理算力基础上,进一步加大对Infra侧的投入与推理优化。”

6. 牛来不降价了,智谱给你踩了一脚油门

7. GLM-5.3-FlashX上线,如何评价该模型?

8. #智谱GLM5.3FlashX模型上线# 价格大概普通版的2.5倍

9. 大家好像已经习惯把前沿智能和前沿价格绑在一起,并认为这是技术进步必须支付的成本。但今天,GLM-5.3-Flash 来了。发布前,它以匿名模型Ox-Alpha

10. 只用GLM一个月,输的不是模型

11. 智谱GLM-5.3-Flash夜间免费使用,GLMCodingPlan用户专属福利

12. 智谱GLM-5.3-Flash3亿免费token活动又来了,速来

13. 智谱GLMCodingPlan改版:Pro档涨幅超150%!老用户Max还能按原价续多久?

14. 四大Flash模型测试,GLM-5.3-flash | Qwen3.8-flash | DeepSeek-V4-Flash | Gemini3.7-flash

15. 智谱GLM-5.3是“迄今发布的网络能力最强的开源权重模型”

16. #来自“对手”的认证:中国最强模型,距美国前沿只剩4个月差距#长安街知事消息,美国当地时间9月29日,美国人工智能企业Anthropic前沿红队发布GLM-5.

17. 震撼,小米Mimo 登顶全球开源大模型第一说实话,这个榜单一出来,我盯着看了好一会儿——排在第一行的那面旗,是小米。 Artificial Analysis 最

18. FlashX是服务侧推理优化,不是新的模型权重版本,没有独立开源权重,仅API调

1
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章