GLM-5.3-Flash开源了,但"18B激活"骗了想跑本地的人:显存这笔账,先看48小时实测

源自40位全网作者

06:54

8月26日晚,智谱认领了霸榜OpenRouter一周的匿名模型Ox-Alpha,正式名GLM-5.3-Flash。发布前,它以匿名模型Ox-Alpha在OpenCode和OpenRouter上测试,迅速成为当周最受欢迎的模型,创下双平台调用量新高。哔哩哔哩 320B总参数、每token激活18B、GLM-5系列首个原生多模态、1M上下文、MIT协议开源,官方技术拆解里写得很直白:真身叫GLM-5.3-Flash,320B总参数,MIT协议开源。知乎 跑分解读和价格战欢呼已经刷屏,这篇不重复。这篇写给一类具体的人:手里有一两张闲卡、盯着ModelScope和Hugging Face、习惯对新开源前沿模型Day-1上手的人。你关心的不是榜单,是三个问题:我的卡跑不跑得动、现在跑起来没有、值不值得继续等。

"激活18B"先骗到你:那是算力数字,不是内存数字

MoE模型推理时每个token确实只走18B参数——所以它的每token计算量小、API才敢卖那么便宜。微博 但320B的全部专家权重必须常驻显存,没人能提前知道下一个token调用谁。“只算18B"不等于"只存18B”,本地部署的入场券按320B算:

  • 原生FP8权重约320GB量级,BF16约640GB;

  • 社区做的weight-only NVFP4量化,实测约182GiB,要靠两台DGX Spark(合计256GB)才塞得下;

  • KV cache另算。它相对GLM-5.3把注意力计算量压到约1/3.0、KV cache压到约1/4.4,这是官方对比口径。哔哩哔哩 长上下文的"账单"确实便宜了,但"便宜"不是"没有"——官方也承认KV缓存仍略高于Kimi-K3和DeepSeek-V4-Flash,并明确说这是后续优化方向。知乎

把话说死:单张16GB、24GB甚至48GB消费卡,目前没有任何跑通GLM-5.3-Flash的路子。Qwen3.8-27B热潮时那种"16G显存96K上下文"的社区量化版,这次还没出现——300B级MoE对消费卡的门槛,一个周末还越不过去。

而能力这边不用怀疑:官方六项基准随权重放出,对比对象直接列着Claude Opus 4.8和GPT系列,Terminal-Bench 2.1拿到84.3分、DeepSWE 63.4分,数字就印在下面这张官方图表里。

GLM-5.3-Flash开源了,但

48小时里真跑通的三条路,每条都有坑

双DGX Spark + NVFP4。 量化用的是LibertAI的weight-only NVFP4,权重182GiB,正好塞进双机256GB,关键启动参数:–block-size2304(必须,DeepGEMM的64-entry pool page对齐要求)、–gpu-memory-utilization0.85。哔哩哔哩 结构上head节点持权重通过NFS共享给worker,先起worker等25秒再起head。跑是跑通了,但这个输出速度比deepseekv4flash慢一半。哔哩哔哩

8张"矿卡"。 CMP170HX(GA100/SM80/64GB解锁版)×8。官方支持清单上只有H100/B200/gfx950,没有SM80?没关系,我们自己做了一个829行/22文件的vLLMoverlay。哔哩哔哩 这类方案能证明"跑得通",撑不起"用得稳"——框架一升级可能就碎。

企业级路线。 H100/B200之外,国产芯片这边FlagOS让"牛来"模型跑在更多国产芯片上:GLM-5.3-Flash Day0适配9款AI芯片,模型镜像已发布到魔搭及HuggingFace平台。知乎 智谱这次把全部线上流量跑在了10万张国产芯片上,十万张国产算力卡扛起"牛来"。微博 配合W8A8量化、INT8/FP8/BF16混合缓存量化和Layer Split这套组合拳,结果是端到端服务性能比同一硬件的初始基线提升3倍。知乎 但那是它的集群,不是你能在家复现的配方。

顺手提醒:GLM-5.3和GLM-5.3-Flash是两个东西,别下错

后缀只差一个词,产品线完全不同。最容易踩的坑是把已经能下载的GLM-5.3-Flash当成它。两个名字只差一个后缀,官方定义却很清楚:前者是纯文本旗舰,后者是原生多模态、低成本的独立产品线。知乎 GLM-5.3旗舰8月28日上午十点放出权重,且有社区回答指出,这批权重没有继续用MIT,用的是GLM-5.3License。知乎 准备商用的话,这一步先核清楚再动手。权重分发也值得看一眼:截至8月28日早间,ModelScope上FP8权重下载由14,994增至15,309,而同文件在HuggingFace的下载数还停在两位数——真打算本地跑的人,主力就在国内生态,选魔搭镜像顺手得多。知乎

开源"热闹"的另一面:托管铺得快,本地还在修补期

有个把证据分级(A=官方/可复现,B=有结果缺参数,C=仅存在)做得很较真的每日追踪,记录了这两天最有信息量的数据:最新完整日8月26日,OpenRouter当日输入356.67B token、输出4.09B token,合计360.76B token,请求527.24万次;到8月27日近收盘,token量已经冲到约1.37T、请求6.7倍于前一天,缓存输入占输入token的86.86%,公开应用榜由Hermes Agent、Claude Code这类agent负载领跑。知乎

而本地推理栈?vLLM的架构加载问题未找到正式修复版本,SGLang支持PR仍呈开放状态(页面带有4×GB300和8×H100验证记录),Ollama Cloud有重复输出问题,Vercel AI Gateway特定路由503仍能访问到原报告。知乎 追踪者的结论原话很冷静:本地推理栈仍处于修补期,而托管接入跑得比本地部署快。

GLM-5.3-Flash开源了,但

对想本地跑agent工作负载的人,这张官方effort曲线还多给了一层信息:模型支持低、高、最大三档推理深度,默认最大,精度换token的曲线明码标价——从两成出头爬到接近29%的准确率,代价是输出token翻几倍。知乎 便宜模型不等于白嫖,预算开关在你手里。

这笔账最诚实的算法:开源省的不是钱

API标准价输入$0.15/百万token、输出$0.50,前两周五折,官方口径是GLM-5.3的1/10、限时优惠期内为1/20。微博知乎 Artificial Analysis把几十个模型摆到"智能指数-每任务成本"坐标系里,GLM-5.3-Flash(折扣价$0.045/任务、57分)就钉在左下角的"最有吸引力象限"里。

GLM-5.3-Flash开源了,但

另一边,智谱Coding Plan用户的实测帖给出了更狠的数:一周额度内总共使用5065w token,其中缓存输入4858w,命中率96.2%,折算混合成本百万token约0.0687元(低谷折扣档)。哔哩哔哩 拿这个价去对比:搭一条能跑Flash的最低实用路线——8张64GB矿卡或者两台DGX Spark——光硬件就是数万元级,还没算电费和"每次vLLM升级先救overlay"的时间。

所以这波"开源"对个人玩家的真实含义变了:它不是把API账单变成免费,而是把"前沿模型进内网、离了网也能跑、数据一个字不出去"的选择权第一次给到了320B级别。成本账算不过来,隐私账和合规账才算得过来。

按你手里的卡,对号入座

  • 16–32GB显存的个人玩家: 先别去动FP8/BF16仓库。盯三个信号,任何一个落地再动手:SGLang支持PR合并发版、vLLM加载问题出修复版本、社区出现50GB以下的成熟量化(GGUF或MLX路线)。以Qwen3.8-27B那波的节奏看,这个窗口大概率是几周,不是几个月。

  • 有双Spark/多卡服务器的玩家: 走官方支持清单(H100/B200/gfx950)最稳;坚持用SM80这类非清单硬件的,先评估自己养不养得动一套vLLM overlay,再谈部署。

  • 企业在评估私有化: 用"注意力账单"四个数字对比候选模型——注意力计算量、KV cache、激活参数、单token成本;1M上下文是理论最大值,实际可用长度受部署硬件约束,私有化部署要自己压测。Flash定位是放量主力,超高难任务留旗舰档。这个价格跳水的时代,选型时真正该盯的是切换成本,别被任何单点报价锁死。

"开源"和"能本地用"之间,以前隔着几个月;GLM-5.3-Flash把这段压缩到了几周——但48小时的实测证明,这段差距还没归零。在动手下载320GB权重之前,先记住那句话:激活18B省下的是算力,不是你的显存。

内容由AI生成

精选参考来源

0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章