GLM跑在国产卡上:10万卡、两周3.2倍、A800套件开源,三笔账分别跟谁有关

源自126位全网作者

02:21

9月21日这天,智谱有两件事同时在"开源"。一件是闹到第五天的ZCode:太原一家公司先发出正式法律函件追责、直指数据出境质疑,当天智谱正式道歉、开放ZCode源代码、上线"数据不留存"机制。另一件关注度低得多——一位开发者把GLM-5.3-Flash在8×A800上调到了可上生产的状态,整套补丁和脚本挂上了GitHub。哔哩哔哩微博知乎

两件事指向同一个变化:ZCode风波之后,"数据不出自己机房"第一次从情怀口号,变成了可以被写进采购需求、也能被自己算账的选项。对一直在用GLM写代码的人来说,围绕它的三个新问题这两天集中冒了出来:官方说的10万张国产卡到底实不实、管理层讲的"两周3.2倍"跟自己有什么关系、自己买卡跑GLM到底值不值。这三笔账得一笔一笔分开算,因为每一笔对应的不是同一群人。

第一笔账:10万张国产卡,哪句是官方确认,哪句只是厂商抢答

先把实锤和推测拆开。实锤的部分:8月26日晚,智谱发布并开源GLM-5.3-Flash,320B总参数、18B激活的MoE,原生多模态,支持1M上下文。官方同时确认,这款模型的推理服务跑在超过10万张国产AI加速卡组成的集群上。科创板日报微博

市场投票也是实打实的:这模型发布前以"Ox Alpha"的匿名身份在OpenRouter和OpenCode上实测,一周内调用量冲到OpenRouter第一,智谱的说法是国产卡的硬件效率和单token成本已经追平主流英伟达GPU。价格是白纸黑字:API定价输入0.8元/百万tokens、输出2.8元、缓存命中0.23元,官方口径为GLM-5.3的十分之一。微博微博

推测的部分:这10万张卡到底是谁家的。官方说法始终停在"国产芯片集群";晚点财经8月27日的报道口径是算力供应商"或来自华为、摩尔线程与海光",海光DCU宣称在GLM-5.3发布当天就完成了"Day0适配",多家厂商抢着认领适配。但截至发稿,智谱没有官方确认过供应比例,社区里也早有冷水:“10万国产卡还是没有官方证明”,单卡性能弱于英伟达卡,靠的是系统工程堆总吞吐。所以对"全国产"这个说法,比较诚实的理解是——集群是真跑起来了、扛了真流量,硬件成色是"多供应商混搭+系统补短板",而不是某一家国产卡单挑赢了。销售话术要是拿"10万张全某牌"来报价,知道这一层就知道该问什么了。晚点财经微博微博

第二笔账:"两周3.2倍"是真的,但它省下来的快,先卖给了FlashX

9月16-17日,智谱创始人唐杰发了一篇讲RSI(递归自我改进)实践的文章,管理层多个场合给出的数字是:由GLM-5.3驱动的Infra Agent,用两周时间让GLM-5.3-Flash在国产加速卡上从"跑通"走到"承接全量线上流量",端到端吞吐提升3.2倍,过程中把KV传输开销从约30%压到1%以内,重构Decode算子实现1.71倍加速。这套叙事里最有信息量的不是数字,而是方法:Agent把顶尖工程师的调优经验拆成正确性、系统行为、性能三类可验证反馈,人不再手写内核,只负责设约束和校验输出——国产卡最缺的算子工程师短板,正在被"模型调芯片"的自动化流程填。微博

但普通API用户感受到的,是另一头:此前有人公开吐槽GLM-5.3-Flash只有约50tps,同档对手"起码都跑到150tps了,甚至有的能到300Tps",留下一句经典质问:怎么你只能跑50?三天后的9月18日,智谱上线FlashX:同一基座、同样的智能,最高200 tokens/s,API定价输入2元/百万tokens、输出7元、缓存命中0.57元,约是Flash的2.5倍。再往前看,9月10日到18日九天里智谱连出六个动作——补贴、融资、上调ARR指引、InfraAgent发文、FlashX上线、ZCode致歉——基础设施优化省出来的成本,第一站是变成更贵的新SKU,不是老用户账单自动变便宜。想验证"国产卡到底有没有反哺用户",别盯着发布会,盯两个信号:一是Flash基础档什么时候免费提速,二是实际账单——智谱此前交流会上关于老套餐价格的口径已经给过预期,指望"国产化=大降价"的可以先歇了。知乎知乎哔哩哔哩

第三笔账:自己买卡跑GLM,开源套件给出了真实门槛

这是ZCode之后被问得最多的一笔:不想把代码交给别人机房的,自己跑行不行?先纠正一个误会——GLM-5.3-Flash的官方部署方案只支持Hopper及以上的卡,A800是sm80架构,没有FP8 Tensor Core、没有TMA、没有wgmma,全靠社区overlay补丁把缺的能力一块块补出来。真实数据比参数表诚实:8张A800-80GB(每卡约占72.6GB)跑TP=8加专家并行,上下文262K,短对话32路并发下TPOT全程不超过28ms,长prompt建议压到16路,256K全长度请求受KV池限制只够约9路并发,单流约48.8 tokens/s。对,自己烧一台8卡服务器,换来的体验基本就是官方API那个被吐槽过的"50tps"水平。而且这套活是踩着一层层坑出来的:一个忘了回收的调试环境变量(CUDA_LAUNCH_BLOCKING)把聚合吞吐打差过17.5倍;社区补丁里的FORCE_DENSE开关导致"所有指标看着都正常、输出其实已经坏了",模型大量吐感叹号才被抓包。"跑得对"和"跑得快"是两回事,这个开源仓库最大的价值,恰恰是把这两件事分开标了价。知乎

所以结论分人群,别混着抄作业。手里有闲置卡、想折腾的个体玩家:值得拉下来玩,但先认清这是实验室,不是省钱方案。有真实数据不出域需求的企业:值得评估的是5.3-Flash的开源权重——权重开源和集群国产化是两码事——但算子适配、版本漂移、重启演练这些人力成本要一起进账,ZCode风波暴露的恰恰是,托管方案里"省人力"从来不是无价的。而只写代码不碰部署的大多数:这笔账与你无关,你的版图上只剩一个选档问题。

剩下那个问题:API用户现在到底怎么选档

把前因后果收拢,GLM这一家已经把模型拆成了能力(5.3旗舰)、性价比(5.3-Flash)、速度(FlashX)三个变量,同一个基座、改个model参数就能切换。决策可以很朴素:对时延敏感的场景——代码补全的流式手感、Agent多步调用每轮省下的那两三秒——FlashX的溢价买的是真东西;离线批跑、不赶时间的任务,Flash足够,为速度多掏的钱一分都赚不回来。至于"能不能放心用",ZCode事件给整个品类加了新的检查项:任何云端工具先看默认开关和留存条款,再谈体验。

接下来值得收藏观察的四个信号:智谱哪天官方确认那10万张卡的供应商成色;InfraAgent下一轮迭代吞吐会不会超过3.2倍;ZCode的"数据不留存"机制与第三方审计落地后,社区会复测出什么结果。还有那个最重要的:Flash基础档第一次免费提速的通知——到那天,"国产卡反哺用户"才算从叙事变成了账单。36氪

你属于哪一档?评论区聊聊,你的代码最后跑在谁的机房里。

内容由AI生成

精选参考来源

1. 智谱官方正式道歉并开源ZCode,同步推出数据不留存机制

2. 智谱被质疑数据出境至新加坡,太原承明科技发函追责

3. A800 适配跑通 GLM-5.3-Flash:榨干 A800 的理论极限性能

4. 10万张国产算力卡扛起牛来:智谱开源GLM-5.3-Flash

5. GLM-5.3Flash推理全切国产卡

6. 神秘模型OXAlpha被确认是智谱GLM-5.3-Flash,调用量冲到OpenRouter第一

7. 智谱推出对标DeepSeek的轻量旗舰模型,由10万国产卡支持

8. 晚点独家丨智谱推出对标DeepSeek的轻量旗舰模型,由10万国产卡支持

9. 智谱GLM-5.3发布当天海光DCU完成Day0适配

10. 对智谱业绩的总结:10万国产卡尚无官方证明

11. 国产大模型开始调国产AI大芯片:唐杰披露RSI递归自我改进实践

12. 怎么看智谱 CEO 表示 GLM-5.3 两周内把国产卡推理吞吐调高 3.2 倍?

13. 刚刚,智谱GLM-5.3-FlashX模型上线,更快、更流畅

14. 智谱这几天怎么了?ZCode安全信任引争议

15. 从道歉到"用完即焚":智谱掏出"数据不留存",ZCode的信任窟窿能补上吗

0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章