GLM-5.3整包权重756GB,我把5档家庭自建账目拼成一张表:0.05 tok/s和102 tok/s都是真的,"跑得动"和"能干活"差着一整个显存

源自269位全网作者

13:15

这周智谱/GLM圈子里最密集的一簇讨论,不在股价上,也不在套餐涨价上,而在一个很具体的动作上:把GLM-5.3自己装进机器里。

时间线很能说明问题——10月7日,B站刚挂出"8卡RTX PRO 6000原生FP4装下GLM-5.3"的工程课,小红书同一天又有人发"把GLM-5.3-Flash装进算力舱,token自由";往前数两周,4台DGX Spark跑Flash的实测帖已经攒了54赞30条评论;今天,知乎"本地部署大模型有必要吗"底下还在进新回答。免费额度线10月7日收网、限流还在、权重早在8月底就开放——"自己装一台"突然从玩票变成了有真实成本的决策。

但把这些散在B站、小红书、知乎、公众号的实测数据挨个对过之后,我的结论是先泼两盆冷水:"跑得动"和"能干活"是两件事,"能干活"和"跑得稳"又是另一件事。下面把五个档位的账一次摊清。

先把模型卡拆对:40B激活,不代表你只需要装40B

动手算硬件之前,先把三个容易混淆的口径钉死(全部来自公开仓库和模型卡信息):

  • 8月14日Z.ai公告"两周后公开权重",8月28日141个safetensors分片如约出现在Hugging Face,按文件API求和约755.63GB,模型页取整756GB;模型卡标注753B参数量,坊间通稿常写744B——同一件东西的两种数法,不影响你掏钱。知乎

  • GLM-5.3完整版是超大规模MoE:每个token实际激活只有约39-40B参数,但19456个路由专家必须随时"找得到"。MoE省的是算力,不是显存。vLLM给5.2 FP8的最低显存需求是893GB——因为756GB权重只是账单的起点。量子位

  • GLM-5.3-Flash约320B(FP8权重约180GB),是桌面档真正要算的对象;官方模型卡写明5.3与5.2共用基座、增益全部来自后训练。为什么值得馋这坨权重:Semgrep的IDOR越权检测基准里,开源GLM-5.2在"裸跑无脚手架"条件下拿F1 39%,超过Claude Code和Claude Opus 4.8,每发现一个漏洞0.17美元、约顶尖闭源模型的六分之一。知乎

一句话:完整版和Flash是两个物种,硬件账目完全不同,看攻略前先确认你装的到底是哪一个。

五档自建账本:从25GB内存的旧笔记本到350万的机房

档位

装法

实测速度

大致花费

一句话判定

T0 收藏档

Colibrì分层推理,int4专家放SSD按需捞

冷缓存0.05-0.1 tok/s;128GB内存CPU机1.8 tok/s;6×5090约5.8-6.8 tok/s

有台16GB内存的机器就算数

跑得动,不能干活

T1 统一内存档

Mac/GB10级大内存+社区量化版(llama.cpp、exl3等)

社区实测帖为主,无标准口径

数万元级(整机)

单人轻度可用

T2 算力舱档

4×DGX Spark组TP4跑Flash

20.4-102 tok/s(见下)

国产现货约3.35万/台×4≈13.4万

单人生产力成立

T3 专业显卡档

8×RTX PRO 6000原生FP4装完整版;官方NVFP4量化

取决于并发目标

十万元级

数据中心的下放

T4 企业单节点档

2×H200跑Flash / 8×H20或8×B200跑完整版

以TTFT+吞吐验收

8×H200服务器约350万

别按帖子抄,按业务反推

T0:32k Star的小蜂鸟证明了"能跑"的下限,顺便证明了下限不能干活。纯C实现的分层推理框架Colibrì把744B模型拆成两层:每次必用的Dense部分(约17B,int4后9.9GB)常驻内存,海量路由专家(int4后约370GB)整个扔在NVMe SSD上,Router点到谁才现场捞谁,再加LRU缓存和"提前一层预测专家"(可预测性71.6%)。结果是最低16GB内存、12核CPU的开发机真能把744B跑起来——冷缓存时约0.05-0.1 tok/s。这个数字翻译一下:让它写一个300行的函数,够你下班再上班。堆到128GB内存的纯CPU台式机约1.8 tok/s,喂满6张5090才来到5.8-6.8 tok/s。想收藏权重当摆件,这一档免费证明你"拥有";想拿它干活,免谈。量子位

T2:这周讨论最热的"家用主力"档,账要算到秒。小红书"极算门"9月22日发的4×DGX Spark TP4跑GLM-5.3-Flash实测(单流、输出400 token、5次取中位数):关闭投机解码20.40 tok/s,开DFlash2(k=7)后结构化输出102.22 tok/s、自然文本41.65 tok/s。小红书注意这个"5倍"只在结构化输出成立,别拿它换算你的日常聊天速度。更值得记住的是长文档冷请求:128K输入的预填充吞吐1399 tok/s,首字要等93.71秒——发帖人自己都注明"85万token是当前服务的配置上限,不是完成等长性能验收的结果"。跑起来也不等于跑得住:他们遇到过引擎已经STALL、`/health`接口却仍然返回200的事故,最后改成监控"生成token是否推进"。

GLM-5.3整包权重756GB,我把5档家庭自建账目拼成一张表:0.05 tok/s和102 tok/s都是真的,

钱的部分正处在一个窗口期:128GB版DGX Spark首发3999美元,今年2月涨到4699,10月2日官方涨到6950美元(国内9月21日现货价约33550元/台);同一天英伟达发布了64GB版、4999美元起,由宏碁、华硕、戴尔、惠普等OEM在10月23日上市,两台64GB可QSFP直连组成128GB内存池、官方称支持最高2000亿参数。内存砍半、价格反超当年128GB首发价1000美元——这不是商家发疯,是内存通胀写进了定价页。“现在上128GB还是等10/23的64GB现货”,就是本周最实际的决策分歧。华尔街见闻知乎

GLM-5.3整包权重756GB,我把5档家庭自建账目拼成一张表:0.05 tok/s和102 tok/s都是真的,

顺手给"算力舱上限"一个参照系:AMD资深技术专家Patrick Moorhead晒出自己的4台Spark环形QSFP直连(中间连交换机都不要),跑的是DeepSeek V4.1-Flash——单流代码暖机后稳定72 tok/s、32并发聚合494 tok/s、首token仅0.27秒。这是另一款模型的数据,不能算到GLM头上,但它划出了"4台Spark这一物理形态"的天花板在哪里:同样的盒子,装不同的模型,体验差一个数量级,关键变量是权重体积和内存带宽(GB10单台约273GB/s)。知乎

T3:英伟达把"腰斩"做成了官方路线。6月25日nvidia在Hugging Face悄悄上架GLM-5.2-NVFP4:用自家Model Optimizer把权重+激活从FP8压到FP4,显存直接减半,且只量化MoE专家层的线性算子、共享专家保留原始精度——GPQA Diamond从89.52掉到89.39(0.13分,误差范围内),IFBench和τ²-Bench Telecom反而涨分。官方支持SGLang、vLLM,原生FP4算力要吃Blackwell(B200/B300),Hopper能跑但吃不到红利。本周B站的"8卡RTX PRO 6000原生FP4装下GLM-5.3"课,就是把这条数据中心路线搬进了准桌面形态。至于社区帖里"V100解锁NVFP4、145 toks逆天输出"——Volta架构没有原生FP4单元,这类"解锁"实验的数字,请自行打个折再看。知乎

T4:企业档只给一个提醒——别问"几张卡够",先问业务。知乎那篇传播很广的《8张H20够吗》给的答案是:完整版Native FP8、8×141GB H20-3e、TP8是128K上下文的单节点基线;完整1M必须8×B200。Flash则是2×H200(282GB)里装约180GB权重、留约100GB给KV Cache的活儿。短请求SGLang首字更快、长Prompt vLLM的TTFT更低但持续吞吐仍是SGLang略高——框架党不用站队,拿自己的prompt做A/B才是正解。预算口径:一台8×H200服务器,去年还能压在300万内,今年内存硬盘暴涨、老章原话"350万都打不住";上下文拉到1M还要双节点加200G交换机、高密机柜供电改造。真到这一步,买的不是显卡,是"数据不出边界"的控制权——受监管的金融客户买的就是这个。知乎知乎知乎

GLM-5.3整包权重756GB,我把5档家庭自建账目拼成一张表:0.05 tok/s和102 tok/s都是真的,

四个坑,比显卡更贵

  1. 显存除法陷阱。756GB权重÷单卡141GB得到的只是算术下限,KV Cache、并发、激活、运行时开销全不在里面。上下文越长,装得下模型≠开得起1M。

  2. "能响应"陷阱。`/health`返回200但token不推进的事故真实发生过。自建监控要盯"生成是否在推进",而不是接口状态码。

  3. 行为不一致陷阱。小红书帖子标题写得直白:“本地部署GLM-5.3-Flash别再丢掉思考”——本地版混合推理/思考档位默认行为与云端API不同,别拿云端手感直接换算;同理,云端"永久免费""夜间免费"那些营销口径也不自动跟到你家机房里。

  4. 许可陷阱。GLM-5.2是MIT,GLM-5.3换成了自定义许可:使用、修改、部署、微调、衍生都放开,但如果你的业务落入其MaaS定义、且任意连续12个月累计总收入超100亿美元,商用前须过Z.ai的安全审查。想"套壳转售"的先读许可原文;另外别忘了5.3发布时那2436项漏洞披露的叙事——开放权重把控制权交给你的同时,权限、网络边界、日志、人工接管这些设计责任也一并交了过来。知乎

划不划算:先过四类人名单,再谈买卡

今天知乎"本地部署有必要吗"下面的回答把账拆成三笔(硬件折旧、时间、工程量),结论很克制:先用云端把事跑通,真遇瓶颈再下本地——顺序反了的人,剧本是"周二拍脑袋、周三修依赖、周四发现不如API、周五默默放弃"。而真把自建跑成主力的人长什么样?另一篇实操帖给了样本:洋垃圾双路X99+4张解锁显存的老卡、合计256GB显存,TP2×PP2跑一个中小MoE,单流60 tok/s、16并发450 tok/s,成了他的生产主力——代价是每天11度电和全部排障时间。知乎知乎

对齐到2026年10月的行情,判断其实很简单:

  • 单人、用量在套餐限额内:官方118元档订阅(月费折合国际版约$18档)依然是唯一答案,13万自建对98%的人只是更贵的玩具。知乎

  • 数据不能出内网:本地不是选项,是必须项,直接跳T3/T4按业务反推;

  • API账单肉疼的高频大户:自建摊硬件才成立,但要按"权重体积×并发"选档,不是按跑分;

  • 要微调、要研究、要断网环境:权重开源的真正受益人就是你,756GB随你拆。

接下来盯什么

GLM-5.3整包权重756GB,我把5档家庭自建账目拼成一张表:0.05 tok/s和102 tok/s都是真的,

  • 10月23日:64GB版Spark各OEM实售价,看$4,999标尺能不能压住国内现货溢价;英伟达同步放出Sync Model Launcher(月底)简化集群启动,两台64GB组池的模型兼容清单值得翻一遍;

  • 10月30日:订阅侧社区反复提的那个日期,套餐端如果再动价格/额度,自建vs订阅的平衡线会跟着挪;

  • NVFP4下放节奏:nvidia的官方量化版目前挂在5.2名下,5.3对应版本和社区engine(llama.cpp-glm-fast、exl3双机方案)谁先把"半显存"路线跑通,桌面档的性价比会再变一次;

  • 开源节奏本身:这次"带日期的承诺按期落地"(14天、141分片、756GB可验证)是智谱给自己攒的信用分——下一张模型卡还兑不兑现,比任何一次跑分都更能决定你今早要不要开始装。

一句话收口:GLM-5.3的本地时代是真的,门槛也是真的——旧笔记本上的0.05 tok/s和算力舱里的102 tok/s是同一枚硬币的两面。先弄清自己落在四类人名单的哪一格,再决定动显卡还是续套餐。

(档位数据均来自各帖作者本人公布口径,标"实测"的都有明确测试条件,转引时请以原文为准。)

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章