8月14日智谱发布GLM-5.3的时候,第一时间能用的只有API和订阅。完整开源权重官方给的说法是"两周后开放",算下来大概落在8月28日前后——今天8月19日,还剩9天。知乎
这9天对一类人特别关键:不打算长期给API交租、想把模型搬进自己机房的本地部署玩家。为什么这次值得等?两件事。
第一,这代模型的账算得过来。GLM-5.3和GLM-5.2用的是同一个744B参数基座,所有提升都来自后训练:官方自测里Terminal-Bench 3.0从4.6拉到28.3,DeepSWE v1.1从46.2到66.9,安全方向的CyberGym从77.2%升到84.5%。知乎跑分含金量有争议(第三方公开榜截至8月17日的快照里GLM-5.3还没进去,榜首是Claude Opus 5的42.7%),但"同基座、后训练把编程和Agent执行拉高50%"这个说法,多家实测作者都认。也就是说,硬件预算不变,白捡一代能力提升——这正是本地部署最划算的升级形态。


第二,API侧的价格环境在变差。DeepSeek V4上周价格涨了300%,高峰输出到了27元/百万token;智谱自己也被吐槽"算力不够根本买不到,现在又涨价"。微博微博社区里已经有人在算"coding plan和按量计费哪个便宜"这种账。当租不如买的临界点越来越近,自建就从极客爱好变成了正经选项。
但先泼盆冷水:这台机器的"体重",你得先称清楚。
744B是什么概念?三笔硬件账
GLM-5.2总参数约744B,是MoE架构,每次推理激活的参数据实测作者估算约40B——激活参数决定算力需求,总参数决定内存需求。本地部署卡脖子的永远是后者。目前全网跑通的路线有三条,我都翻了实测记录:
路线一:8×A100-80GB + vLLM + NVFP4量化,这是目前最"生产级"的方案。有作者完整记录了部署过程:GLM-5.2-NVFP4权重下载下来约433GiB,8张A100共640GB显存,张量并行8加专家并行,8K上下文下最大并发能到15.9倍,服务稳定。知乎注意是"约433GB权重+640GB显存"——KV Cache、运行时buffer都要额外占,余量其实不算宽裕。这条路的坑也密集:A100(SM80架构)需要给vLLM打TRITON_MLA_SPARSE补丁;Transformers的GlmMoeDsaConfig有个head_dim映射bug,会把MLA维度错解析成704,必须启动参数显式覆盖成576,否则要么加载失败要么结果出错;CUDA 13.0的构建和535系驱动不兼容,得退回12.9。总结就是:能跑,但这是一条需要专人伺候的企业路线,适合有GPU预算或者愿意租云的团队。
路线二:GGUF量化 + 多机异构内存池,这是个人玩家的极限操作。有作者用Mac Studio M3 Ultra加两台DGX Spark(单台128GB统一内存),通过llama.cpp的RPC后端把三台机器拼成一个512GB级的逻辑推理实例,跑GLM-5.2的UD-Q4_K_S量化——GGUF文件约406.44GiB,10个分片。注意这个反常识的点:512GB是三台机器的物理内存总和,不等于你有406GB的权重预算,系统、运行时、KV cache、compute buffer全都要占地方。更关键的是速度:这套组合跑起来TG128稳定在约2.76 tok/s,初始decode 3.43 tok/s。知乎什么概念?打字机水平,能用,但跟"生产"没关系,而且为了兼容还得关FA、禁用融合算子,计算图被切成106段。这条路的价值不在快,在于"用桌面级设备跑下任何单机装不下的超大MoE"——它是容量方案,不是速度方案。

路线三:等权重、等生态,先不动硬件。截至8月16日的社区追踪,GLM-5.3还没上OpenRouter的稳定模型页,Together显示"即将上线",SiliconFlow、Fireworks都还没影,vLLM也没有原生支持。知乎这意味着权重开放初期,第三方推理平台的竞争会让调用成本快速下探——如果你没有现成硬件,这可能是最省的路:先观望8月28日权重放出后一周内各平台的上线和定价,再决定自建还是租用。
这9天,想动手的人该做什么
我的建议很明确:用GLM-5.2排练。两代同基座,意味着部署流程、显存预算、框架版本这些"体力活"完全一致。GLM-5.2在HuggingFace月下载270万+,MIT协议,权重随时能拿。知乎现在把环境搭通,8月28日权重一到,换个模型文件就是热切换;如果等到那天再从零开始,光是踩MLA维度、驱动兼容这些坑就够耗一周。

具体几件事:一是锁定框架版本,llama.cpp和vLLM对GLM系的支持都在快速迭代,多机RPC方案还遇到过"一个RPC服务器的远端buffer指针被错误序列化给另一个服务器"这种未合入主线的bug,三台机器版本不一致直接报错,现在就固定commit。知乎二是备存储,无论NVFP4的433GiB还是GGUF的406GiB,加上测试用的其他量化版本,预留1TB磁盘不亏;三是跑一遍iperf3验网络,多机方案里10GbE和高速直连的差距在冷启动加载数百GiB权重时是"几分钟"级别的。
最后给三个持续观察信号。其一,8月28日前后权重是否如期开放,智谱给的理由是要先做安全评估和模型加固(这批红队测试挖出了2436个漏洞,其中还包括1983年就埋进DNS协议的缺陷),延期并非没有可能。知乎其二,vLLM何时原生支持GLM-5.3,这决定生产部署的成熟度。其三,第三方推理平台的上架速度和价格战烈度,这决定"租"的底线在哪。
一句话收尾:有GPU预算的团队,现在就该用GLM-5.2把8卡方案排练起来;手头有Apple Silicon和DGX Spark的极客,异构方案能跑但别指望速度;什么都没有的,等8月28日之后看一周生态再做决定,大概率更便宜。这台744B的巨兽确实要来了,先称好自己的秤。