GLM-5.3权重放出两周,账本很诚实:满血版245GB内存劝退个人,Flash被塞进小盒子跑得很欢

源自164位全网作者

05:52

8月28日深夜,智谱把GLM-5.3的完整权重挂上了Hugging Face和ModelScope,兑现了"发布两周后开源"的承诺,本地运行与个性化定制的大门算是打开了。两周过去,我把B站、小红书、知乎、头条上的部署实测帖翻了一遍,发现一个挺反直觉的事实:真正晒744B满血权重的人寥寥无几,玩得起劲的是小它一号的GLM-5.3-Flash——被塞进一台DGX Spark、八张矿卡、两台小盒子的,都是它。"开源第一"是真的,但"你用不用得上"是另一本账。这本账,得拆开算。IT之家

满血744B:免费下载只是成本的开始

先看官方权重加独立量化方的口径:BF16原始精度约1.5TB,FP8约750GB起步;即便是Unsloth做的、号称还能保住约86%top-1准确率的2-bit量化版,也需要245GB内存,只有256GB统一内存的Mac装得下,8-bit量化则要810GB内存。社区里晒配置的开发者说得更直白,744B满血权重个人电脑就别想本地跑,得8卡H200级别才扛得住,这波主要是给有卡的公司、高校实验室和独立黑客爽的。一句话:对个人和homelab玩家来说,"满血开源"不存在路径,只存在悬崖。这波开源的真正受众是有卡机构——不是你的显卡至顶科技今日头条

还有一个细节,是这两周社区吵得最凶的:GLM-5.2还是MIT,到了5.3,智谱换成了自定义的"GLM-5.3许可证"。实际生效的硬条款只有一条:年营业额超过100亿美元(约合674亿元人民币)的机构,想把GLM-5.3作为外部模型服务对外提供时,必须先通过Z.ai的安全审查。做路由、嵌在自己产品里都不算托管,所以个人和中小企业照常跑、照常微调、照常商用——对多数开发者和创业公司来说实际影响并不大,整体依然是一份相当宽松的协议,条款卡的是云巨头而不是你。IT之家小红书

但The New Stack的分析也提醒得中肯:这份许可证既没有可接受使用条款,也没有对攻击场景做任何规范,“安全评估"和"把旗舰推理收入攥在自己手里"两种叙事之间,动机值得继续观察。另外避个小坑:8月20日前后不少中文教程按预告把许可证写成"Apache 2.0、可商用”,实际放出的却是GLM-5.3 License——商用项目落地前,去仓库读一遍LICENSE原文,别抄教程。至顶科技今日头条

被塞进homelab的其实是Flash

Flash这边才是个人玩家的真现场:官方模型卡口径是约320B总参数、约18B激活参数的MoE,支持文本、图片和视频输入,上下文窗口写到1,048,576 tokens,权重以MIT许可发布——这代开源里最宽松的一份反而是它。它此前以匿名马甲Ox-Alpha亮相时,仅上线12小时就冲上OpenRouter调用量榜首,在OpenCode上终结了DeepSeek连续56天的霸榜纪录。按智谱管理层在半年报交流中的口径,它还是第一个全面跑在国产芯片集群上的旗舰级模型,靠自研推理引擎和分离式架构,单位Token推理成本较年初降了80%。今日头条伯虎财经

跑分之外,这两周三组社区实测的质量相当高,双机小盒子把长上下文压到接近百万级、连量化方案都直接开源在GitHub上的,就有现成案例。连把320B模型硬塞进8张矿卡的野路子方案,都完成了1M上下文的验证。小红书哔哩哔哩

设备

方案

实测结果

单台DGX Spark(128GB统一内存)

Q2量化GGUF,96.5GB权重常驻

从写Dockerfile到服务可用,除去下载不到10分钟;开200K上下文,KV缓存只占2.28GB

双DGX Spark

EXL3 4bit量化,约176GB

900K上下文通过压测,prefill 874 tok/s,单流约63 tok/s,4路并发155 tok/s

8×CMP170HX 64GB"矿卡"

自制829行vLLM overlay补上SM80支持

单流26.1 tok/s,4路并发49.9 tok/s,重负载聚合59.8 tok/s,1M上下文验证通过

这里真正的钥匙不是量化本身,是DSA稀疏注意力:它不维护完整KV缓存,实测下来这份KV几乎不随上下文长度线性增长——16K时只有0.18GB,拉到200K也才2.28GB。这就是"320B模型凭什么塞进128GB小盒子"的技术原因;还在用"参数量×精度"老公式估显存的同学,账本需要更新了。微信

另一本账:1.7元对1.5TB的电费

本地部署最大的幻觉是"省了API钱"。有独立开发者9月11日实测:用Flash改后台UI,每轮对话5分钟上下,一整套改动全部加起来只花了1.7元、前后不到20分钟。同量级的活交给Claude或GPT,这位作者的原话是很难在10美元以内收住——在这种任务密度下,自部署的硬件折旧加电费,根本打不过按量计费。知乎

值出自建的只有三种人:

  1. 数据不能出机房的:法务合同、病历、未公开财报、内部代码库——已经有开发者帮法务同事在一台闲置工作站上部署了GLM-5.3-Flash,断网跑300页合同的风险标注,全程数据不出机房。今日头条

  2. 7×24高频长任务的:批量审计、自动化流水线,调用量大到API月账单超过硬件折旧;

  3. 要微调的:只有权重在手,才谈得上注入领域数据。

三条都不占的话,旗舰能力最划算的姿势还是付费:GLM-5.3 API定价为每百万输入/输出Token 1.40/4.40美元,Flash低至0.15/0.47美元,在同类竞品里几乎是最能打的性价比。要知道智谱自GLM-5发布以来已经调过三轮价,海外API调用价一度上涨67%到100%,这次5.3"能力涨一半、价格没动"才显得格外反常。至顶科技今日头条

Artificial Analysis综合智能指数给了GLM-5.3一个60分:进入全球前沿模型能力区间,与Claude Fable 5、GPT-5.6 Sol同处一档,并与Kimi K3并列开源模型第一。更能影响账单的是执行路径:Z.ai Code Bench上,GLM-5.3在High档拿到31.4%的准确率,超过Claude Opus 4.8最高档的29.5%,而每项任务平均输出约5万Token,Opus要12万——按任务算钱的时候,执行路径短就是省钱。IT之家今日头条

不想自己配环境的,国家超算互联网也上线了GLM-5.3 API调用服务,兼容OpenAI和Anthropic接口规范,登录就能一键调用。但跑分要分开看:编程榜单有第三方指数背书,安全能力这边,CyberGym的84.5%目前仍是智谱自行披露,还没有外部机构复现验证。微信至顶科技

智谱敢把价格锚在这儿,底气写在半年报里:截至8月底ARR已到16亿美元,Coding Plan调用量较年初增长超过23倍,API平均售价反而提高了约101%——量价齐升,说明用户没有为涨价出走。伯虎财经

国内订阅走GLM Coding Plan:7月31日起取消限售、改成完全透明的积分制,每月118元起。但老用户的体感复杂——Pro档从每月149元直接变成了538元,Max档牌价到1078元/月。今日头条抖音微信

眼下还有两个条款要看清:高峰期消耗3倍、平时非高峰2倍,只有9月底前非高峰按1倍计——折扣窗口只剩两周多,大任务尽量放晚上和周末跑;老套餐用户的价格权益冻结、可按原价续订,一旦手滑退订换档,原价格就回不来了。微信

接下来两周,盯这三件事

  1. "开源第一"的成色会不会被复现。编程侧的跃升是实打实的:Terminal-Bench 3.0从4.6分跳到28.3分,DeepSWE v1.1从46.2涨到66.9;安全侧则要再等等——"开源之盾"计划已经拿它给重点开源项目做免费审计,发布前两周的联合安全测试也报出了2404个潜在漏洞、其中1088个中高危,包括一个潜伏40余年、可把服务器压力放大约8万倍的DNS协议级风险。但对照智谱宣称在269个开源项目里发现的2,436个漏洞,可公开查阅的结果目前只有数十项——防御价值是真的,"漏洞猎神"的标签,等证据覆盖到哪里,再信到哪里。千龙网至顶科技

  2. GLM-5.5会不会继续"非MIT"路线。智谱在业绩会上确认下一代基座已在稳步推进,但许可证的走向没人担保:如果旗舰线从此固定自定义许可、只给Flash留MIT,那"开源"对个人的含金量会持续变薄——Flash是不是永远有得玩,要看智谱对"获客层"的定价策略。今日头条

  3. 9月底的非高峰1倍权益是否延期。不延的话,订阅用户的真实高峰成本直接回到3倍计价,118元档的性价比要重算。实测还有个细节值得留底:有开发者反映经第三方渠道调用时,中文提示下模型输出会夹杂大量英文,官方版是否如此尚未验证——重度用户接入前,先拿自己的真实任务过一遍。

一句话结论,按人对号入座:只有一台机器的,直接上Flash的Q2档,96.5GB权重、128GB统一内存的小盒子就能常驻;有双Spark或者一桌子矿卡的,EXL3量化加DSA,900K上下文就是你这间客厅的天花板;不折腾硬件的正常写码,9月底前把重活丢给API或118元档的夜间时段,比什么都划算;真要私有化满血744B的,先数数机房里有没有8张H级卡——没有的话,那不叫部署方案,叫收藏方案。

内容由AI生成

精选参考来源

1. 智谱开源GLM-5.3模型权重,主打智能体编程与网络防御

2. Z.ai开源GLM-5.3权重,新授权条款剑指云计算巨头

3. 智谱 GLM-5.3 开源了,大家有福了!旗舰权重甩到 Hugging Face 和 ModelScope

4. GLM-5.3 已开源,但开源协议有变化

5. 智谱GLM-5.3 API上线:定价不变权重下周开源,AAII 60分开源第一

6. GLM-5.3-Flash本地部署:先算显存,再选路径

7. 智谱“既要又要”

8. 我花 1 小时在 DGX Spark 上跑通 GLM-5.3-Flash

9. GLM-5.3 Flash双DGX部署实测

10. GLM-5.3-Flash 本地部署实测,把 320B 旗舰大模型硬塞进 8 张矿卡?

11. 实测 glm-5.3-flash:20 分钟改完 UI,只花 1.7 元,太好用了!

12. 把 GLM-5.3-Flash 请进你的显卡:一份本地部署账本

13. 智谱正式发布GLM-5.3:编程能力最强开源模型

14. 智谱发布新旗舰模型GLM-5.2

15. 智谱 GLM-5.3 API 上线:纯后训练跑出开源第一,但权重还没开

16. 智谱 GLM Coding Plan 回归:透明积分制,月费 118 元起

17. 智谱 Coding Plan不用抢了,Pro却涨到538?

18. 智谱GLM Coding Plan开放订阅,终于不用抢了!

19. 智谱发布新一代基座模型GLM-5.3

20. 营收同比激增近400% 智谱业务结构彻底切换 大模型迎来爆发拐点

0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章