5倍提速、2.5倍定价:GLM-5.3-FlashX 每秒单价其实砍半,但套餐用户今晚先蹭完最后一晚免费

源自86位全网作者

03:26

9月18日,智谱把 GLM-5.3-FlashX 挂上了开放平台:最高 200 tokens/s,比 GLM-5.3-Flash 快约 5 倍,价格涨到 2.5 倍。 开发者群和股票群一起刷屏——发布当天智谱港股涨 5.34%(据证券时报口径)。知乎

5倍提速、2.5倍定价:GLM-5.3-FlashX 每秒单价其实砍半,但套餐用户今晚先蹭完最后一晚免费

但真正自己掏钱订 GLM Coding Plan 的人,第一反应不是"快",而是三连问:我这个套餐用得上吗?我手上这个 Flash 是不是在被降速?今晚 23 点开始的那波免费,还赶得上吗?

三个问题,三笔账。跑完你再决定要不要为这个"X"多掏钱。

第一笔账:你买的是同一个模型的时间折扣,不是新智

先把最容易误会的一件事说清楚:FlashX 不是新模型。

官方文档把 glm-5.3-flash 和 glm-5.3-flashx 写在同一页:320B 总参数、18B 激活、100 万 token 上下文、最长输出 12.8 万 token,参数完全一致。"X"是智谱既有的提速命名线(GLM-4.5-AirX、GLM-4.7-FlashX、GLM-4.6V-FlashX),这次快 5 倍全部来自推理侧:10 万张国产芯片,SGLang 之上的专用引擎(节点内张量并行、W8A8 量化、混合缓存量化、Layer Split),加 EPD 分离架构。哔哩哔哩

另一个背景彩蛋:两周前以匿名马甲"Ox Alpha"在评测榜上出现、6 天吞了 62 万亿 token 的那个模型,官方认领了——就是 GLM-5.3-Flash 这个基座。知乎

智谱官方公告给这条基座的定位口径很直白:GLM-5.3-Flash 长期保持同尺寸最强智能水平,本次提速"进一步形成智能、价格、速度的全面竞争力"。微博

注意,官方说的"端到端性能是同硬件基线的 3 倍"是集群吞吐账,不是你的体感账。而体感这边,B站两个独立实测给的速度拔草:一个六维能力综合测试的结论是无性能提升。另一个拉满思考深度的实测发现生成速度确实大幅提升,但指令生成部分句子为凑数字结尾牺牲通顺度、复杂图形仍有结构细节错误、Trello 拖拽会剧烈闪烁,作者推测这是主打速度优化的版本。单个 UP 主的样本强度有限,但两个方向一致的信号够说明一件事:智能水平别按新模型预期,你付的是时间费。哔哩哔哩哔哩哔哩

第二笔账:2.5 倍价格 × 5 倍速度,谁赚了谁亏

按社区对照官方国际站核出来的价格:FlashX 输入 $0.37/百万 token、输出 $1.25/百万、缓存命中 $0.075;国内对应约 2 元/7 元,是 Flash 的 2.5 倍。哔哩哔哩

5倍提速、2.5倍定价:GLM-5.3-FlashX 每秒单价其实砍半,但套餐用户今晚先蹭完最后一晚免费

这里有个反直觉的算法。你按 token 付费,单价确实贵了 2.5 倍;但如果你把成本折算到每秒——2.5 除以 5,每秒产出单价其实是原来的一半。所以 FlashX 值不值,只取决于一件事:你的时间是不是比 token 贵。

三笔钱算下来,三类人直接升级:

  1. 人机结对写代码的:40 t/s 读一条长回复要等两分半,200 t/s 只要三十秒,你的上下文保温成本直接降 5 倍。

  2. 跑 Agent 长链任务的:一个任务串行几十轮,每轮尾延迟压 5 倍,整条链路从"挂机等一小时"变成"十几分钟出结果",占的卡、排的队都是钱。

  3. 输出密集的批量生成:单位时间产出翻倍还省排队。

三类人先别动:

  1. 套餐党——Coding Plan 暂时用不上 FlashX,已有多方实测确认。只订了 118 元/月套餐的,这波提速对你暂时只是标题。知乎

  2. 夜猫子和白嫖党——华为云码道「码力续航计划」每天免费送 1000 万 Token 的 GLM-5.3-Flash,当日清零,DeepSeek V4 系列同池。夜间跑批用送的额度不香吗?知乎

  3. 等本地部署的——FlashX 没有放权重,开源的是基座 GLM-5.3-Flash(MIT)。本地党继续按 245GB 满血/小盒子 Flash 那套账本来。哔哩哔哩

第三笔账:三个风险点,查完再付钱

一,你的 Flash 是不是在被"让路"。 社区流传一种"精准降速"说法:平台为支撑 FlashX 将算力倾斜,原本的快速版 glm-5.3-flash 被降速至 40 t/s。注意,这个 40 是回答者自己拿 200÷5 算的,属于推断,智谱没有回应;而另一位自称深度用户的答主拉了一个月的 token 速度表,表示一直是一个稳定区间。两种声音打架,证据不足以定罪——正确动作是自查:现在这个时段让 Flash 连打 10 万 token 输出,和你上周的体感对比,降没降你自己的表知道。知乎知乎

5倍提速、2.5倍定价:GLM-5.3-FlashX 每秒单价其实砍半,但套餐用户今晚先蹭完最后一晚免费

二,信任折扣。 ZCode 静默上传风波还没完全落地:太原承明科技公开发函称已独立取证,发现修复效果存疑,要求智谱作出 12 项答复。9月20日晚,智谱开放平台宣布近期将上线数据内容不留存机制:任何用户均可以申请开通,生效后输入输出不做静态存储、仅用于当次模型调用。但这不是"绝对不留存":Batch API、File API 不在范围内,违规核查等情况还可能留存 30 天以上。这是个有必要开的隐私开关,不是免死金牌。知乎微博微博

三,价格表没出全。 ZCode 更新后放出了一个 Start Plan 付费体验套餐,没有透露进一步的价格信息,只表示支持独立使用。参考个人版 Coding Plan 最低 118 元/月(包年平均低至约 82.6 元/月),体验版大概率更低。急着上车的不如等价签。知乎

今晚该干嘛,接下来盯什么

第一件事最实在:"夜间畅蹬"活动 9 月 3 日开跑、9 月 20 日截止,今晚 23 点就是最后一个免费窗口——23 点到次日 9 点,套餐内 GLM-5.3-Flash 在 ZCode 免费用、在其他套餐支持的 Agent 里额度翻倍,覆盖所有付费套餐用户。在决定要不要花钱升级之前,先把这晚免费额度烧干净,顺便测测 Flash 的当前速度还够不够你用——够,就不急着掏钱;不够,才是 FlashX 的目标客户。知乎哔哩哔哩

5倍提速、2.5倍定价:GLM-5.3-FlashX 每秒单价其实砍半,但套餐用户今晚先蹭完最后一晚免费

然后盯三个信号:

  1. FlashX 什么时候进 Coding Plan、按什么额度折算——ZCode 用户数已超过 100 万,这是他们最该关心的一天。知乎

  2. "Flash 降速"到底是体感错觉还是算力倾斜,等更多人的速度表,而不是等一纸公告。

  3. DeepSeek V4.1 Flash 跟不跟价——它在 FlashX 发布前八天刚完成用户迁移,轻量模型竞争正式进入卷速度与性价比的深水区。哔哩哔哩

5倍提速、2.5倍定价:GLM-5.3-FlashX 每秒单价其实砍半,但套餐用户今晚先蹭完最后一晚免费

一句话收个尾:这波 FlashX,买的不是模型,是一张"时间折扣券"。每秒单价砍半是真,智能没有代际差也是真。你的时间比 token 贵,它是好生意;你的夜比白天多,它跟你没关系。

内容由AI生成

精选参考来源

0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章