这周的大模型圈,是真的疯了。
周一 Meta 突然重回开源路线,放出 Muse Glimmer 30B;周三阿里端出 2.4T 参数的 Qwen3.8-2.4T-A95B;周四 DeepSeek-V4 Pro 正式版上线(注意,只开了 API,权重没放出来);周五更热闹,智谱 GLM-5.3 和 Qwen3.8-27B 前后脚发布,一个拿下开源编程 SOTA 的头衔,一个直接冲上热搜——千问全球下载量顺势破了 30 亿。微博
我知道你现在的状态:看着满屏"开源"“SOTA”“对标 Opus”,手已经放在下载键上了,但又说不上来该下哪个。
先说结论,这周放出来的五个重磅模型里,真正能塞进普通玩家电脑的,只有两个半。剩下那些参数吓人的,跟你桌子底下那台机器没什么关系。
第一个判断规则:别看"开源"俩字,先看总参数和激活参数
这次阵容里有个特别容易迷惑人的点——MoE 架构的"激活参数"。Qwen3.8-2.4T-A95B,名字里这个 A95B 是"激活 95B"的意思,乍一看好像跟百 B 级模型差不多。但本地部署时,2.4T 的权重是一个字节都不能少的,全量加载。魔搭社区就算量化到 4bit,那也是 TB 级的存储和显存需求。

刚发布的 GLM-5.3 沿用了 GLM-5.2 的基座:743B 总参数、约 40B 激活参数的 MoE 架构,支持 1M 上下文,输入输出纯文本、没有视觉模态。知乎它的编程能力号称开源模型第一,但现在只上线了 API,完整权重要等官方完成安全评估后才会在两周内开源。智谱但就算放出来,743B 的体重量化压到底也得集群多卡才装得下,属于"开源是给行业看的,不是给你单卡跑的"。更彻底的是 DeepSeek-V4 Pro,它连权重都不开放——周四正式版上线只提供官方 API 和 app 入口,根本没有下载通道。DeepSeek顺便澄清一个误会:B 站流传的那个"四张 RTX Pro 6000 凑 384GB 显存"实测,跑的其实是 V4-Flash 满血版,那是工作室的配置单,不是玩家的购物清单。
所以这俩的定位很明确:GLM-5.3 值得追,等两周后权重落地再看社区的优化和蒸馏;V4 Pro 值得试 API——它甚至不用你腾硬盘,因为压根没有权重可下。

第二个判断规则:27B-30B 稠密模型,才是本周真正的主战场
这次最对本地玩家胃口的,是周四晚上开源的 Qwen3.8-27B:270 亿参数、稠密(Dense)架构、原生多模态、262K 原生上下文、Apache 2.0 协议随便商用。官方自己都说,27B 是"全球 AI 社区呼声最高的模型尺寸"——因为它是单张消费级显卡能够到的上限甜点。千问为什么说 27B 是甜点?参考同尺寸前代 Qwen3.6-27B 的社区实测:FP8 权重 28.75GB,一张 4090 48GB 单卡就能跑,非优化模式 26.5 tok/s,开了 MTP 推测解码后短文本能冲到 68-79 tok/s;llama.cpp 跑 Q8 量化也有 25-27 tok/s。知乎社区共识是 Q4 量化版约 18GB(LM Studio 里 Q4_K_M 是 18.03GB),24GB 显存的 4090/3090 正好放下。知乎这次 3.8-27B 架构规格跟前代几乎一致(64 层、hidden 5120、支持 MTP),这些数据基本可以直接平移参考——当然,首日实测还没铺开,具体速度等社区跑出来。
另一个选手是 Meta 的 Muse Glimmer 30B,同样主打单卡:官方直接给了适配 24GB/32GB 显卡的量化版,B 站已经有 5090 32GB 的部署实测。哔哩哔哩Mac 的 MLX 移植也有人跑通了。它跟 Qwen3.8-27B 正面撞位,社区已经在拿两者对轰跑分了。

这俩就是本周的"下载区"。二选一的简单逻辑:你用中文多、要编程办公场景、看重多模态,Qwen3.8-27B 的纸面更完整,第三方核实 SWE-bench Pro 61.7,接替前代成为本地可跑尺寸的新旗舰。知乎你想试试 Meta 重回开源的第一枪,Muse Glimmer 的官方量化做得省心。不想碰命令行的话,用 LM Studio 这类图形化工具最省事,搜到模型名后直接挑一个和自己显存匹配的量化版本,点一下就下载。

第三个判断规则:显存的大头是权重,但第二个吃显存的坑是上下文
很多人下完模型发现"明明装进去了怎么还爆显存",问题多半出在上下文长度。27B 这个级别的稠密模型,KV cache 按 token 线性涨:前代实测,28.75GB 的 FP8 权重加上 262K 上下文的 KV cache,刚好塞满一张 4090 48GB。知乎上下文是仅次于权重的第二个显存大户。所以 24GB 显存跑 27B 的正确姿势是:Q4 量化权重 + 把上下文限制在 32K-64K,而不是一上来就拉满 262K。真想玩超长上下文,那是 48GB 显存起步的事。
顺带说一句,Qwen3.8-27B 新增的 reasoning_effort 参数值得留意——它能按任务难度控制思考深度,简单问题少烧 token,这对本地机器来说就是实打实的响应速度和电费。千问
还有"半个":DeepSeek-V4-Flash,给折腾党的
V4-Flash-0731 是 157B 的 MoE 架构,权重约 85GB,单张消费级卡谁都吞不下,但社区已经蹚出了两条 offload 路线。一条是大显存卡 + 大内存:B 站那位 UP 主先下载了 150 多 GB 原生权重,才发现 MXFP4 路线要约 200GB 系统内存,改用约 97GB 的量化版才跑通,一路踩过显存闲置、上下文被限 8K、Think 模式不生效、推理不收敛等 11 个坑。哔哩哔哩另一条更平民:知乎"亚伦的笔记"用开源调度器 moe-l2 做 CPU offload,24GB 显存的卡就能跑起来,显存只占 17.4GB,GPU 利用率从 13% 拉到 86%,生成速度 10.1 tok/s。知乎这个速度不快,但属于单张消费级卡够得着的"真能用"。这套流程我只推荐给"折腾本身就是乐趣"的人,如果你的时间比电费贵,建议跳过。
另外提醒一句 V4 Pro 的瓜:正式版上线后官方又把公告撤了,社区还在吵它疑似在 Harness 基准上过拟合。官方基准表确实猛,编程、agent 几项跟顶级闭源模型坐一桌,但这实力只能看,下不回家。

如果你打算用 API 接它,再说个实在信息:8 月 16 日 UTC 16:00 起官方执行峰谷计价,闲时价格直接是峰时的一半。DeepSeek晚点开跑,顺便多看几天热闹,两头不亏。

对号入座时间,按你的配置抄作业:
24GB 显存(3090/4090):Qwen3.8-27B 的 Q4 量化版,上下文开 32K-64K,这是本周最优解;Muse Glimmer 30B 官方 24GB 量化版同级可选。
16GB 显存及以下:这周的热闹先看看,27B 的 Q3 量化勉强能塞但体验打折,不如等社区蒸馏出小尺寸版本。
32GB 显存(5090):Muse Glimmer 官方 32GB 量化,或 27B 的 Q8 版本,速度和质量都往上走一档。
Mac 用户:32GB 统一内存装下 17GB 的 Q4 版完全没问题,还有充足的上下文余量,但稠密模型的输出速度要有心理准备。知乎64GB 以上舒服;24GB 的 Mac mini M4 建议绕道,显存太紧。MLX 生态这周明显活跃,Muse Glimmer 已有移植实测。
128GB+ 内存 + 大显卡的折腾党:V4-Flash offload 路线,记得先去翻那 11 个坑的记录。
最后说点实在的。这周的"开源盛宴"里,真正改变本地玩家日常的就一件事:27B 稠密这个档位,从 Qwen3.6-27B 换到了 Qwen3.8-27B,顺手多了个 Meta 竞争者。社区有人算过账,单卡跑 27B 做固定场景的自动化,一个月能省下一千美元的 API 费用——当然也有月烧四千美元的企业说这个尺寸干不了 agent 的活。两边都对,差别在于你的场景是不是"固定、高频、单一"。最后补一句社区老玩家的实在话:现在内存、显卡都在涨价,非刚需别买——27B 这个档的需求,眼下用 API 其实挺划算,等硬件价格回落再上车也不迟。
接下来值得盯的信号:unsloth 首日就放出了 Qwen3.8-27B 的 NVFP4 量化,有人用 DGX Spark 配 vLLM 测出约 15 tok/s。知乎GGUF 量化版这两天在陆续补齐;MTP 推测解码在 3.8 上能不能复现前代短文本 +211% 的加速,以及 GLM-5.3 后续会不会出适合本地的小尺寸衍生版。这几件事一出,咱们再更新清单。
硬盘腾好了吗?这周末,有的忙了。