“牛来”50万亿token流量,全跑在10万张国产卡上:这个1/40的价格不是烧钱,但两个问题还没答案

源自56位全网作者

04:00

这周智谱揭开“牛来”(GLM-5.3-Flash)的身份,最大的料其实不是价格。

价格已经被聊烂了:输入每百万token 0.8元、输出2.8元、缓存命中0.23元,上线前两周再打半价——算下来是Claude Opus 4.8的四十分之一,比刚涨过价的DeepSeek V4 Flash还便宜一截。华尔街见闻这笔账全网都有人算过,不重复。

真正值得单独说一篇的,是智谱在官方技术文档里确认的那句话:匿名测试期间的全部流量,由超过10万张国产芯片组成的集群承载。5天、累计超50万亿token,一张英伟达的卡都没用。华尔街见闻

半导体研究机构SemiAnalysis马上在X上评论,认为继OpenAI自研推理芯片Jalapeño之后,CUDA护城河再度受到考验。华尔街见闻

“牛来”50万亿token流量,全跑在10万张国产卡上:这个1/40的价格不是烧钱,但两个问题还没答案

8月27日,智谱(02513.HK)港股盘中一度涨超11%,报1149港元。微博全天收涨超8%,IPO以来累计涨幅超800%。微博壁仞科技、天数智芯这些国产芯片股也跟着一起涨,市场显然是把这个披露当“算力叙事”在买账。微博

先说明一下,此“牛来”不是那部刷屏的动画电影。模型代号Ox Alpha,Ox是牛,恰逢电影《牛来》走红,中文开发者社区就顺手给它起了这个外号。

那么问题来了:作为要迁工作流的用户,或者盯着智谱这家公司的人,这个故事你该信几分?我把它拆成三块说。

便宜不是补贴,是三个杠杆一起压下去的

很多人看到“1/40”的第一反应是:这补贴能撑多久?这次可能真不是补贴。智谱的低价,其实是三个杠杆同时压下来的,含金量完全不一样。

第一个杠杆:架构。GLM-5.3-Flash总参数320B,但每个token只激活18B,层数45层——对比总参数相近的GLM-4.5(355B、激活32B、92层),层数几乎砍半。更关键的是,它是首个用“稀疏注意力+线性注意力”混合架构的开源前沿模型:和GLM-5.3比,注意力计算量降到约1/3,KV缓存降到约1/4.4。华尔街见闻翻译成人话就是:回答同一个问题,它要做的计算、要占的显存,天生就比普通前沿模型少一大截。这是写在权重里的便宜,收不回去。

“牛来”50万亿token流量,全跑在10万张国产卡上:这个1/40的价格不是烧钱,但两个问题还没答案

第二个杠杆:工程。国产卡不是拿来就能跑前沿模型的,单卡的算力和显存带宽都有限,100万上下文尤其难。智谱在开源推理框架SGLang基础上做了一套专用推理引擎:W8A8量化、INT8/FP8/BF16混合缓存量化、节点内张量并行,还上了生产级的EPD分离架构——把多模态编码、prefill、decode拆成三个可以独立调度的工作池。官方口径是:同一批硬件上,端到端服务性能做到了初始基线的3倍。华尔街见闻

第三个杠杆:硬件,也是水分争议最大的一层。智谱官方的说法是“硬件效率及单token成本已经达到了与主流英伟达GPU相当的水平”,SemiAnalysis的赞叹也是基于这份文档转述的。但注意两件事:第一,目前没有任何第三方独立复现这个效率数字;第二,智谱至今没公布芯片型号,《晚点LatePost》的报道说供应商可能包括华为、摩尔线程、海光,智谱官方未置评。华尔街见闻

所以准确的说法是:架构和工程这两层是可验证的(权重已经在HuggingFace开源,MIT协议,SGLang、vLLM都能部署),硬件这一层目前是“官方自述+第三方转述”。信可以信,但要打个标记。

还有两个问题没答案

问题一:免费转付费,容量扛不扛得住?

匿名期完全免费,用户普遍反馈“一点不卡随便用”;8月26日晚正式发布转付费后,小红书已经有用户吐槽遇到“服务繁忙”。小红书这未必说明国产集群不行——免费期的洪峰和付费首日的新用户涌入叠在一起,谁都可能出现挤兑——但它至少提示:10万张国产卡的容量弹性还没经过商业负载的验证。匿名期是开卷考试,付费之后才是真上线。

问题二:它快,但不适合所有场景。

一份开发者实测挺有代表性:在播客剧本压缩任务里,GLM-5.3-Flash比step-3.7-flash慢6倍,但语义分高6.1分。小红书原因是它思考链很长——单案思考token峰值7.7万,延迟以几百秒计。这跟芯片无关,是模型性格:干精品活、长程Agent任务,值得等;但如果你要的是盯着屏幕等秒回的量产场景,别指望“Flash”这个后缀字面意义上的快。

能力本身倒不用担心:Artificial Analysis综合智能指数里,GLM-5.3-Flash拿了57分,与Claude Opus 4.8打平,还高于DeepSeek旗舰V4 Pro的53分,低价档里是实打实的第一梯队。华尔街见闻

“牛来”50万亿token流量,全跑在10万张国产卡上:这个1/40的价格不是烧钱,但两个问题还没答案

你该怎么办

  • 如果你在用或者打算用它的API:前两周半价期(9月上旬前)就是最好的评测窗口。拿半价测你自己负载的吞吐和稳定性,尤其是长上下文和多模态场景;半价结束后如果出现明显的峰谷差价或限流,那就是需要重新评估的信号。

  • 如果你盯的是智谱这家公司:这个叙事确实修复了一部分情绪——它的股价两个月里从高点跌了逾66%,市值从一度突破1.3万亿港元回落到不足五千亿港元。36氪摩根大通8月中旬还把它目标价上调到了1800港元。但叙事只贡献第一波估值,后面要看两个验证点:芯片型号/供应链什么时候官宣落地,付费期的容量和留存撑不撑得住。

  • 如果你只是想看个热闹:记住一个变化就够了——大模型的竞争正在从“谁更大”转向“谁的推理更便宜”。8月19日,智谱联合创始人、首席科学家唐杰发文坦言,万亿参数这一轮,回头来看,是整个领域一起走了一段弯路,然后又一起折返。36氪GLM-5.3-Flash这种押注低成本推理的新模型,恰恰是顺着这个反思做出来的。而同一周,英伟达交出了962亿美元的单季营收,同比直接翻倍。微博两个画面叠在一起,就是此刻AI算力最真实的切面。

最后说一句:牛来值得看的点,从来不是它匿名期霸过榜,而是第一次有一个前沿模型,在国产芯片上承接了全球规模的真实流量。站没站稳,不看今天的股价,看半价期结束之后你每天的调用体验。

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章