9月18日,智谱上线GLM-5.3-FlashX:峰值200 tokens/s,官方口径"较前代提速5倍",API定价输入2元/百万tokens、输出7元/百万tokens——正好是GLM-5.3-Flash(0.8/2.8)的2.5倍。微博

先把微博、知乎评论区最先吵明白的那件事说清:FlashX不是新模型,是一档"速度服务"。底座还是8月26日MIT协议开源的那套GLM-5.3-Flash(320B总参、激活18B的MoE、1M上下文、原生多模态),智能水平没变,变的是出字速度和每token成本。官方公告里的来龙去脉也直白:GLM-5.3-Flash此前以"OxAlpha"代号与全球开发者见面,调用量涨太快,于是"在10万张国产芯片提供的推理算力基础上,进一步加大Infra侧投入"——本质是把一次扩容做成了一个收费档位。知乎微博
评论区的第一反应正好分成两派:“还变贵了”“翻倍还不止”,另一边是"flash确实不够快"。后者戳中了coding Agent用户的真实痛点:一条几十步的调用链,每步都要多等几十秒。到底值不值,看下面三笔账。
第一笔账:2.5倍的钱,买到的到底是什么
把厂商口径拆开看,这档服务由三层构成:
底座能力:与Flash完全一致。Artificial Analysis口径下,底座Flash的GPQA Diamond 91.2%、MMLU-Pro 86.1%,综合接近Claude Opus 4.8一档——注意,这些分数Flash同样有,FlashX一分不多给。知乎
推理栈:约10万张国产AI加速器上从零搭建,手段包括W8A8量化、INT8/FP8/BF16混合缓存量化、Layer Split、Encode–Prefill–Decode三段分离,官方称端到端吞吐较同硬件基线约3倍。

自优化叙事:由GLM-5.3驱动的Infra Agent参与kernel补丁与服务栈修改建议,即被热议的"RSI最小闭环",官方称两周吞吐提升3.2倍。微博

两个数字必须打折扣听:3倍吞吐、3.2倍自优化、200 tok/s峰值,目前全部来自智谱自家基准,尚无独立复现;有实测者指出,部分服务商的普通Flash单端点已经跑到过约250 tok/s。所以更稳妥的说法是:FlashX卖的是"在国产卡集群上稳定交付高速",而不是"全网最快"。换算成人的体感:输出2000 tokens,从近一分钟降到十秒上下。如果你是离线批处理任务,这笔钱买了个寂寞。知乎
第二笔账:同一种负载,三档月费差多少
拿一个最常见的中型团队coding Agent负载估算:月调用6万次,单次平均输入6万tokens、输出3千tokens,即月输入约36亿tokens、输出约1.8亿tokens。三档官方定价(元/百万tokens)为:旗舰GLM-5.3输入8、输出28;FlashX输入2、输出7;Flash标准价输入0.8、输出2.8(限时五折更低)。按此算月费:知乎
档位 | 输入/输出单价 | 月费估算 | 适合什么 |
|---|---|---|---|
旗舰GLM-5.3 | 8 / 28 | 约3.4万元 | 难题攻坚、低并发 |
FlashX | 2 / 7 | 约8460元 | 实时交互、高并发Agent |
Flash | 0.8 / 2.8 | 约3384元 | 离线批处理、海量调用 |
两个关键读数:FlashX比Flash每月多花约5000元,等价于把解码等待时间压缩到约1/5;比旗舰便宜约4倍,能力只差在"难任务上限"。而社区实测给日常coding场景投了票——知乎"如何评价GLM-5.3"相关问题下,出现频率最高的评价是"代码四平八稳、擅长处理屎山",且指的是Flash档。也就是说:多数团队的日常负载,Flash本来够用,升FlashX买的不是更聪明,是更快。知乎

第三笔账:9月下旬是价格密集变动期,智谱只是其中一格
把视野从智谱挪开,同期全网的价格动作很密集:
Anthropic发布Claude Opus 5.5,Artificial Analysis智能指数58分居首的同时,价格下调约40%。微博
Kimi K3的OpenRouter折扣到期,9月22日被监测到列价跳回输入3美元/输出15美元;同一批数据里,GLM-5.3-Flash列价从输入0.09美元升至0.15美元,GLM-5.3反而小幅下调。微博
火山方舟Coding Plan已收录GLM-5.3系列,包月订阅叠加活动价低至个位数元。微博
智谱自家AutoClaw赶在中秋放出5亿GLM-5.3-Flash Token,面向付费与非付费用户免费领。知乎

同一把AA的尺子下,各家分数咬得很紧——价格战打成这样,底座能力却没有断代。
信号很清楚:旗舰档在降价、开源档在送量、订阅套餐在抢API直客。如果你的月账单已经上四位数,在决定升不升FlashX之前,至少把"订阅套餐、API直付、开源自部署"三条渠道各算一遍,单看智谱价目表会算亏。
谁该动、谁先别动
该动的:实时对话、代码补全、被用户催超时的高并发Agent。但先把200 tok/s当作宣称值而不是SLA——用自己的真实流量画像测首token延迟(TTFT)和P99长尾,达标再切。
先别动的:离线批处理、长文抽取、对单token成本敏感的负载。Flash限时五折还在生效,对你来说升级FlashX是纯负收益。
数据不能出门的:底座MIT开源,Ollama一行命令或vLLM即可自部署(INT4量化单张4090可跑,全量FP8约328GB);但FlashX这个速度档不在开源权重里,只有托管API有。另外ZCode风波之后,"托管还是自建"多了一个价格之外的信任变量——信通院与绿盟的首轮核查已完成、第三方审计仍在企业追责阶段,合规敏感的团队建议等审计结论落地再做迁移决定。36氪
接下来盯这四个信号
独立基准是否复现200 tok/s,官方会不会公布持续吞吐而非峰值口径;
Flash限时五折何时收回——收回后FlashX的性价比会瞬间好看很多;
FlashX是否上架OpenRouter及后续榜单变化;
ZCode第三方审计的最终结论。
榜单会过时,账单和实测不会。这一轮升级决策,值得你先花十分钟把自家负载的输入输出比算出来,再决定要不要为那5倍速度付2.5倍的钱。