9月26日,小红书一篇《求助!为何GLM 5.3如此恐怖!!!》的帖子底下挂了168条评论:同一个任务,在WorkBuddy上用DeepSeek v4.1 Flash扣十几积分,切到GLM 5.3就是几百积分。很多人第一反应是"智谱卖贵了"。小红书
但翻完智谱开发者文档、GLM-5.3-Flash模型卡和Artificial Analysis的实测数据,我发现钱主要不是花在单价上——从你发出第一次请求开始,智谱就替你选了最贵的那一档。先把结论放这儿:GLM-5.3系列的reasoning_effort默认值就是max,思考还被强制开着关不掉;官方effort曲线显示,从high到max,每任务输出token翻一倍,完成率只涨0.9分。你感觉"烧积分",多半不是模型贵,是配置贵。

官方自己承认的三件事
智谱开发者文档Core Parameters页白纸黑字:reasoning_effort允许值为max、high、low三档,GLM-5.2及以后支持,默认值就是最重的 max。Z.AI开发者文档
Thinking Mode页写明:GLM-5.3和GLM-5.3-Flash是"强制思考",thinking.type只支持enabled,不能关闭——上一代GLM-4.6还留着可开关的混合思考,这代把开关收走了。Z.AI开发者文档

模型卡的Recommended Settings里,推荐值依然写着reasoning_effort: max。默认即推荐,推荐即最重。
而第三方会怎么看,Artificial Analysis现在的GLM-5.3-Flash页面写得直白:输出速度52.5 tokens/s,116个模型里排47;跑完官方智能指数全套题共输出1.8亿token,冗长度排28/116;评语原话是"notably slow and very verbose"(明显慢,且非常啰嗦)。一个名字里带Flash的模型,被实测挂上"慢"和"话多",问题不在320B总参/18B激活的架构本身——在默认档位和计费的乘法上。Artificial Analysis
"雷霆大思考"的价格:三档到底差多少
智谱8月底发布Flash时给出的Z.ai Code Bench effort曲线大致长下面这样。模型卡原文确认max档29.0几乎追平Opus 4.8的29.5。各档完成率与每任务平均输出由开发者对着官方图核对:Z.AI开发者文档
effort档 | 完成率 | 每任务平均输出 | 输出侧成本(按$0.5/百万token) |
|---|---|---|---|
low | 约21.5% | 约4万token | 约$0.020 |
high | 28.1% | 约6.7万token | 约$0.034 |
max | 29.0% | 约14万token | 约$0.070 |
两个数字值得盯着看:low到high是能力主跳段,涨6.6个点,token×1.7;high到max是奢侈段,涨0.9个点,token×2.1。
再乘上速度:52.5 tok/s的出字速度意味着max档一份任务14万token的"纯等待"就是四十分钟的量级。这正好解释了社区里的两条吐槽为什么会并排出现——横评里的"太啰嗦,慢,爱长思考,效率低"和"简单任务全被塞进重思考"。不是模型分不清轻重,是默认配置就是最重的一档,而你看到的"卡",是max档十万级思考token撞上50 tok/s的叠加结果。知乎知乎
三类用户,三笔账
按API付费的:这笔账最简单。输出单价$0.5/百万token,同一条任务high档比max档便宜一半还多。智谱的缓存价更狠——AA记录里缓存折扣83%,且官方建议thinking.clear_thinking:false保留上一轮思考内容,Coding Plan端点默认开启、标准API默认关闭,保留得越全、缓存命中越高、越省token(官方原话"saving tokens in real tasks")。前提是你的调用代码把reasoning_content原样回传,别改名别重排。Z.AI开发者文档

Coding Plan订阅的:官方口径Flash额度是GLM-5.3的3倍;一个小红书用户两周实测更夸张——Lite套餐1万积分/周,全用GLM-5.3一周吃1.5亿token,全用Flash一周10.1亿,按"每积分可用token"算是6.9倍效率(个体口径,受任务结构影响)。同一帖还有两个规则要用起来:闲时(含周末全天)只扣50%积分(官方文档口径);他自己14天17.6亿输入token里,57%靠夜间畅用5.2亿+闲时任务4.8亿扛下来的,缓存命中率97.3%。也就是说:默认max × 烧积分最狠的档 × 白天计费费率,才是"积分掉得恐怖"的完整组合。动effort之前,先动时段。小红书
在DS/Qwen之间摇摆的:必须把反例放上来。同一篇求助帖评论区高赞不是站队退款,而是"上次改bug,便宜模型来回三轮没改对,换5.3一把过,算下来反而省了"“简单活丢给flash,硬仗再上5.3”。口径要算整个任务,不是单次扣费——发帖人对比的几百积分还是满血GLM-5.3,Flash本身更省。第三方900次rollout统计(社区转述):Flash pass@1 63.4对满血69.0,差距在"一次做对的概率",但单次rollout成本$0.24对$3.99。重试便宜的个人项目,high档Flash绰绰有余,没有验收门禁的生产管线,才轮到max档或满血版出场。小红书知乎

智谱为什么把默认放在右上角
模型卡里每个亮眼的分数都绑定max档——“29.0接近Opus 4.8"是max档跑出来的,帕累托图上$0.045单任务成本也是这个前提。而绝大多数用户不改参数,默认档就是第一体验。行业方向其实是反的:Anthropic的使用指南最近被社区转译热议,核心是"头脑风暴类任务建议effort开low”,且effort影响的不只是思考token,还包括正文、工具调用、读多少文件、验证几轮才回头反馈。GPT-6 Luna支持从none到max全档位;DeepSeek、Qwen这一代思考基本都可开关。GLM-5.3系列是少数"强制思考+默认max"的组合。Z.AI开发者文档知乎
证据到这儿,结论只能说这一句:这套默认对官方跑分有利,对多数用户的账单不利——它不是缺陷,是厂商把"复杂agent任务想深一点更稳"这条曲线,默认卖给了所有人,包括只想改两行CSS的人。
现在就能做的五件事
检查你的请求里有没有显式传reasoning_effort。没传,就是在按官方默认max消费;日常编码任务显式改high,硬仗再给max。

ZCode用户在8月底更新后思考强度可选(社区反馈),打开设置确认当前档位,别让它悄悄躺在max。小红书
套餐用户把大任务挪到夜间和周末(积分5折),简单活全部切Flash——额度效率按社区实测能差数倍。
保留历史reasoning_content吃缓存(clear_thinking:false),长会话里这是折扣最大的一项。
被"慢"而不是"贵"卡住的,再考虑FlashX——2.5倍价格买5倍速度那笔账我之前算过,适合等待焦虑重度患者;多数人其实先用"改档"就够了。
最后留个观察清单:智谱后续是否会在套餐端点把effort做成可选默认、AA的verbosity榜单会不会随着社区改档回落——这两个是官方松口的信号。骂"GLM积分恐怖"之前,先把自己那根旋钮拧到中间档:那168条评论里真正的答案,其实就一句——简单活low/high,硬仗才max。