昨晚对本地部署党来说有点热闹。上周在 OpenRouter 匿名霸榜、被大家叫作"牛来"的 OxAlpha,真身揭晓了——就是智谱昨晚上线并开源的 GLM-5.3-Flash,上线即登顶,创下双平台调用量新高,还把 DeepSeek 在 OpenCode 上 56 天的垄断给终结了。知乎智谱认领之后,这头"牛"的使用量已经是 DeepSeek 的两倍以上。知乎同一晚,阿里也把 Qwen3.8-Flash 端了出来,两款旗舰级开源模型同夜落地,这阵仗一年也见不到几次。微博
热闹归热闹,这篇想替大家回答一个更实际的问题:这两款"Flash",家里的机器到底能不能跑、值不值得跑。先说结论:Flash 这个词,挺骗人的。
Flash 这名字别轻信,两位都不是小模型
先看智谱这边:新开源的 GLM-5.3-Flash 是 320B 总参、18B 激活的 MoE,也是 GLM-5 系列第一个原生多模态,智谱官方的口径是能力追平 Claude Opus 4.8、价格只有它的 1/40。知乎开源协议给的是 MIT,上下文支持 1M。哔哩哔哩社区汇总的 Artificial Analysis 智能指数里它拿 57 分,反超 DeepSeek V4-Pro 的 44 分。哔哩哔哩

再看阿里这边:Qwen3.8-Flash 是多模态 MoE,主模型 125B,外加 51B 的 N-gram Embedding,每 token 只激活 6B。知乎训练开销只有上一代 Qwen3.7-Plus 的约 1/9。微博

两家在架构上想到了一块:Qwen3.8-Flash 用的是 GDN+Attention 的混合架构,每四层里三层用 GDN 做循环压缩,一层保留全局注意力并配上 QSA 稀疏注意力,为的是把超长上下文的推理开销打下来。知乎GLM 同样是混合注意力思路,线性加稀疏,再配 IndexPool 压缩索引缓存。知乎这说明两款模型从设计第一天起就是奔着"在云端跑得便宜"去的,本地跑起来的门槛,得另算。
还有一个容易踩空的信息差:这次阿里开源的权重其实是 Qwen3.8-Flash-Next,官方定位是 Qwen4 新架构的雏形;Qwen3.8-Flash 本尊是带 1M 上下文和内置官方工具的生产版本,在千问平台上提供服务。知乎所以想拉权重回家玩的,搜索时认准 Flash-Next,别下载错了。
能不能装下:先对这三条内存线
本地部署看的东西很朴素:量化后的权重,你的内存加显存装不装得下。按社区最常用的 Q4 量化、每参数约 0.5 字节估算:Qwen3.8-Flash-Next 总参数 125B+51B=176B,权重约 90-100GB;GLM-5.3-Flash 320B,权重约 160-180GB。这是只算权重的下限,还没算 KV 缓存。Qwen 原生支持 262,144 token 上下文,并可通过 YaRN 扩展至 1M token,GLM 直接标称 1M。知乎上下文拉得越长,KV 这项额外开销越大,不能只按权重估。

对着自己的机器,画三条线:
线 1,内存+显存不到 128GB:两个都装不下,别惦记。这俩的 Flash 指的是"跑起来便宜",不是"个头小"。
线 2,128GB 统一内存的 Mac,或 192GB 内存的工作站:Q4 的 Qwen 176B 勉强能进,但上下文和 KV 要省着用;320B 的 GLM 装不下。
线 3,256GB 以上内存,或 384GB 级统一内存:两个模型都进入可跑范围,剩下的问题是跑多快。
比硬件更麻烦的,是两个坑
坑一,工具链还没跟上。这两套架构全是新组件,混合注意力、N-gram Embedding 都需要推理框架专门适配。截至发稿,Ollama、llama.cpp 还没有可确认的官方适配信息,想尝鲜的话,KTransformers 是目前最确定的路子,它已经宣布适配 GLM-5.3-Flash。知乎
坑二,KV 缓存容易被忽略。智谱官方也承认,GLM-5.3-Flash 的 KV 缓存仍略高于 Kimi-K3、DeepSeek-V4-Flash,是下一步优化方向。知乎想开着长上下文跑的,这部分内存要单独留出来。
再泼一句冷水:云端强不等于拉回家一样强。官方成绩是满精度加官方推理栈跑出来的,量化、换框架之后总会有折损,建议先看社区复测的口碑,再决定掏不掏硬件钱。
算笔账:这个价格,本地只剩三个理由
两家的 API 价格都打到了地板上。GLM-5.3-Flash 是输入 0.15 美元/百万 tokens、输出 0.50 美元、缓存 0.03 美元。小红书Qwen3.8-Flash 则是每百万 Tokens 输入 1 元、输出 3 元。知乎

这个价位下,不是重度用户的话,本地跑的电费加硬件折旧,未必比买 API 便宜。本地部署真正站得住的理由只剩三个:隐私,数据不出本机;离线,不依赖网络和服务可用性;高频 Agent,全天候调用不怕限流和按次计费。三条都不沾的,云端方案其实更省钱,智谱的 GLM Coding Plan 每天还限量发放 10000 张体验卡。知乎
行动清单,按硬件对号入座
线以下(128GB 不到):别盯着权重,盯 API。免费额度、体验卡先领起来,等社区量化版成熟再说。
线中间(128-192GB 档):盯两个信号,一个是两款模型的 GGUF 量化版什么时候出现,一个是 Ollama、llama.cpp 什么时候官方适配,两个都齐了,再优先试 Qwen 176B。
线以上(256GB+):现在就可以跟进 KTransformers 对 GLM-5.3-Flash 的适配进度,CPU+GPU 混合推理跑 320B MoE,能跑起来,但别指望速度。
值得继续盯的信号
llama.cpp、Ollama 对这两套新架构的适配进度,这直接决定本地使用的真实门槛;
GLM 的 KV 缓存优化版本,官方已经认了这是下一步;
Qwen3.8-Flash-Next 和 27B 的对比,官方评测的口径是明显更强,但不是全面碾压,权重落地后社区怎么复测值得看。知乎
DeepSeek、Kimi 们会不会跟进降价,价格战才刚开始。
最后
这两款 Flash 最大的意义,不是多了两个能玩的模型,而是前沿智能开始按分计价了。本地部署第一次要面对这么直白的问题:能不能跑,大概率能;值不值得跑,得看你自己的账。三条内存线放在这里,拉权重之前,先对一对。