9月18日,智谱把开源的GLM-5.3-Flash推上了一个叫FlashX的"高速档":峰值生成速度约200 tokens/s,跑在约10万张国产AI加速器上。 一周过去,B站六维能力测试的标题干脆起了个问句——“无性能提升?”,评论区吵得比视频本身还热闹。 这篇把官方数字、社区实测和价目表摊开,讲清楚三件事:FlashX到底是什么、多花的钱买到了什么、以及你现在该不该切过去。微博哔哩哔哩
一、先泼冷水:FlashX不是新模型,是给"出字速度"换挡
很多人被"新模型上线"的新闻带偏了。FlashX不是重新训练的底座,它不是一个新的底座模型,而是此前开源的GLM-5.3-Flash的"高速推理档":底层权重还是8月26日开源的那套——320B总参数、每token仅激活18B的MoE,原生多模态,1M上下文,MIT协议可商用。 FlashX做的事情,是在同一套权重上把推理服务打得更快、更稳。知乎
所以"无性能提升"这个测试结论不算黑,它本来就不提升能力。B站评论区的说法很精准:这就是类似GPT的fast模式,不是新模型,只是5.3flash在infra层面做了加速,速度乘2、价格乘2.5。 能力没变,变的只有两样:出字速度,和每token的价格。哔哩哔哩
二、200 tokens/s的成色:官方口径和用户体感之间有条缝
官方口径很漂亮:峰值约200 tokens/s,约为Flash标准档的5倍;这套速度靠的是约10万张国产AI加速器从头搭起来的推理栈,同硬件端到端吞吐约为初始基线的3倍,单token成本逼近英伟达GPU的经济区间。 中信建投研报同步转述,智谱把2026年末ARR预期从24亿美元上调到了30亿美元。知乎微博
但有三点要打折扣听。第一,200是峰值宣称值,独立团队尚未给出可复现的基准,知乎技术博主也提醒底座Flash在某些第三方服务商上已经跑到过约250 tok/s,所以FlashX真正的卖点是"在国产卡集群上稳定交付Flash级速度",不是比谁峰值高。 第二,"十万卡"是厂商自报,芯片型号、单卡吞吐、集群绝对量都没披露。 第三,用户侧的体感落差是真实存在的:有B站网友直言,工作日Flash档的速度基本上就20~30 tokens/s,如果你是从这个体感切过去的,FlashX的提升就不是"5倍"能概括的爽感。知乎知乎哔哩哔哩
三、三档价目表:多花的2.5倍,买的是"等待时间"
按智谱官方定价页(2026年9月口径,元/百万tokens):旗舰GLM-5.3输入8、输出28;FlashX输入2、输出7;Flash标准价输入0.8、输出2.8,限时五折更低。 换算一下:FlashX相对底座Flash贵约2.5倍,相对旗舰便宜约4倍。知乎
判断标准其实很朴素——你的场景里,"等"有没有成本。交互式Agent、实时对话、流式生成界面、写代码时盯着它吐字,这类"等得越久越亏"的场景,FlashX的2.5倍价能回本。反过来,离线批处理、跑数据清洗、日结任务,晚上跑完早上看结果,那Flash闭眼用,五折价基本等于白送。至于复杂代码重构、长链路分析这类重难任务,别指望速度补能力差,直接上旗舰。顺带一个背景数据:有科技博主算过,GLM-5.1输出4.4美元/百万tokens,Claude Opus 4.7是25美元,国产模型价格基本是海外的1/6甚至更低,FlashX即便贵2.5倍,放在全球价目表里依然便宜。微博
四、Plan用户的坏消息:FlashX进不了你的套餐
B站评论区一句高赞回复道破了关键:plan没有,要API才能用。 Coding Plan订阅用户目前调不到FlashX,只有API按量付费能碰。叠加今年Plan的涨价潮——有知乎用户吐槽,套餐政策修改之前400多就是最高档,现在500多只能买中杯。 还有人抱怨连跑5小时只能用25%的滚动窗口,不是在排队就是在重试。 如果你是重速党,可能得API和Plan两条腿走路:Plan扛日常量,FlashX按量付费救急。哔哩哔哩知乎知乎
五、ZCode风波的信任余波还在,但有一条自己的路
不能回避:FlashX相关视频的评论区,"偷数据"的梗仍然挂在最高赞,那句"测试一下zcode偷数据的效率吗"拿了60个赞。 前两周的ZCode风波已经进入企业追责阶段,情绪不会因为一个新产品上线就消散。哔哩哔哩
如果你的顾虑也是数据,记住一条分界线:FlashX是托管档,你的请求要过智谱的服务器;而底座Flash是MIT开源、可商用的,想数据完全不出门,可以走自部署。B站有UP主用8张二手3080(20GB改装卡)加768GB DDR4内存跑GLM-5.3满血版INT4量化,49K长上下文纯decode稳定在11.05 tok/s。 慢是慢了点,但每一行数据都留在自己硬盘里,这对某些行业用户是硬需求。哔哩哔哩
六、顺手薅一把:这周还能领的免费额度
决策归决策,白送的token别客气,以下活动都对过官方页面:
夜间额度全免延长到10月7日:智谱的夜间免费窗口还没收,跑批任务的大可以安排上。哔哩哔哩
AutoClaw新用户礼包:注册送1亿GLM-5.3-Flash token(约60元),中秋充能季9月21日到23日每日登录再领,合计最高6亿,无门槛不绑卡。 注意每日额度当日24:00清零,别攒着。哔哩哔哩
3亿免费token活动又开了一轮:9月19日起,B站教程视频一堆,照着领就行。哔哩哔哩
一个提醒:B站上出现的"8亿token免费号池"是第三方共享账号池,不是官方活动,账号安全和数据风险自己掂量。
七、接下来盯这三个信号
独立基准:200 tokens/s什么时候等来第三方可复现数据,届时"5倍"才有定论;
FlashX会不会进Coding Plan:一旦进套餐,按量付费的存在意义就变了,Plan用户值得等一等再决定要不要单买;
国产卡型号和集群披露:这事关"国产卡跑出性价比"这个叙事的成色,型号一天不披露,就还是自报口径。
一句话收尾:FlashX不玄学,它就是把"等"明码标价了。等得起,继续用Flash,五折价真香;等不起,2.5倍价买个爽;既不想等又不想数据出门,开源底座自己部署,显卡会辛苦一点,但心里踏实。
校验提示文案
校验提示文案