过去几天,OpenRouter 榜单上一个叫「Ox Alpha」的匿名模型,是本地模型圈最大的悬案:匿名霸榜 6 天、使用量超 DeepSeek 两倍、背后靠 10 万张国产算力卡撑着。知乎 昨晚智谱揭晓谜底:它就是圈内喊了好几天的「牛来」,大名 GLM-5.3-Flash,官宣即开源。Artificial Analysis 综合智能指数给它打出 57 分,与 Claude Opus 4.8 持平,编程体感相当。知乎 基准测试里它和 Opus 4.8 打成三胜三负,而价格只有 Opus 4.8 的 1/40。知乎 AI 圈连夜炸锅,但对我们本地玩家来说,第一个问题不是「强不强」,而是——这个 320B 的模型,我的机器装得下吗?

先分清:明早要下的和今天能下的,是两个模型
最容易被忽略的坑在这里:明早(8 月 28 日)十点开放权重的,和现在已能下载的,不是一个模型。GLM-5.3 是纯文本旗舰,GLM-5.3-Flash 是原生多模态、低成本的独立产品线。知乎 Flash 不是 GLM-5.3 的量化版或轻量后缀版,抢错模型的后果很具体:官方分数复现不出来,一晚上时间全耗在显存、框架和部署脚本上。
显存这道线:320B 不属于单卡时代
先看架构。GLM-5.3-Flash 是 320B-A18B 的 MoE,总参数 320B,但每个 Token 实际只激活约 18B。知乎

本地部署的门槛由总参数决定。按量化位宽估算:FP8 约 320GB,常见 Q4 量化约 160~185GB,再叠加长上下文 KV 缓存和框架开销,总内存 192GB 只是起步线,256GB 才谈得上从容,512GB 才能上更高精度。按这条线,我把本地玩家分成四档:
单张消费级显卡(8G~48G 显存):装不下就是装不下。别指望超低比特量化创造奇迹,320B 压到 Q2,骨架都不剩,不值得浪费电费。
192GB 档(24G 多卡、大统一内存机型):Q4 量化勉强能进,但要接受 offload、调度折腾和紧巴巴的上下文余量。
512GB 档:社区第一批实测已经出来了。B站有团队把它装进 8 张 64GB 解锁的 CMP170HX 矿卡,跑出单流解码 26.1 tok/s、4 路并发聚合 49.9 tok/s。哔哩哔哩 要知道官方推理框架的支持清单原本只有 H100、B200 这类数据中心卡,这批 SM80 架构的老核心是打了 829 行补丁才跑通的。320B 在矿卡上能有这个速度,靠的就是 18B 激活——这是 Flash 型 MoE 对本地部署最大的善意。
国产卡用户:摩尔线程发布当天完成 Day-0 适配,官方也明确面向国产卡做了推理优化。知乎
对大多数人:五折 API 才是正确打开方式
说实话,这次的定价把「自己装」逼到了必须认真算回本线的地步。按每百万 tokens 计,输入 0.075 美元、输出 0.25 美元,约为 GLM-5.3 正价的 1/10,限时优惠期内只有 1/20。知乎

什么概念?就算你一个月跑 1 亿 tokens,按输入输出 4:1 估算,账单也就 11 美元上下。一台多卡机器几百瓦的功耗 24 小时开着,一个月电费都未必比这便宜,还没算硬件折旧。官方还备了 GLM Coding Plan 7 天体验卡,接下来一周每天限量发 1 万张,注册再送 2000 万 tokens。知乎 注意,五折属于限时活动,不是长期价格,活动范围和扣费方式以智谱开放平台控制台显示为准。知乎
但有个反方观点,值得认真听
也别急着把 API 全选成这一家。有开发者把账算得很细:两家谁更便宜,取决于缓存命中率。他的结论是编程任务里无论峰谷,DeepSeek V4 Flash 仍然更具性价比,GLM-5.3-Flash 的半价期更适合当 DeepSeek 峰时的替代。知乎 榜单测试环境发挥不出缓存优势,所以「跑分性价比」从来不等于「你的场景性价比」——五折这两周,拿自己的真实任务做并行测试,比看任何榜单都靠谱。
谁才值得真的下载权重?
捋完这几层,真正该下权重的人其实很清楚:一是数据不能出内网的合规刚需,本地部署是铁律;二是日均 token 消耗极大、自家电费能跟 API 掰手腕的重度用户;三是做基准验证和生态适配的开发者。另外明早十点先确认下载的是 GLM-5.3,而不是名字更早亮起下载按钮的 Flash。知乎
其余大多数人,我的建议直白点:用两周五折窗口和免费额度跑自己的真实任务,记录「单个成功任务的总成本」,而不是盯着每百万 tokens 的单价。知乎 然后等两个信号:一是明早 GLM-5.3 权重开放后的第三方独立复跑成绩,二是社区把 320B 的 GGUF/MLX 量化版跑进 256GB 级设备的实测。等量化版真把门槛打下来,再下载也不晚。
一句话收尾:模型够强、价格够狠,但 320B 的体量不属于单卡时代。显存决定你下不下载,缓存命中率决定你用哪家 API,明早十点决定你别抢错模型。