8 月 10 日,Meta 把 Muse-Glimmer-30B 的权重直接放上了 Hugging Face:29.6B 稠密参数加 1.8B 视觉编码器,Apache 2.0 协议,BF16、量化版、连 DFlash 投机解码 drafter 一并放出。三天里知乎、B站的部署实测一篇接一篇,评论区问得最多的是同一类问题:我的 Mac 能不能跑、值不值得跑。这篇就服务于已经在 Ollama、LM Studio 上跑过本地模型的你:先把 3 个落差看清楚,文末给你按内存分档的结论。
Muse Glimmer 约有 296 亿参数,采用 Dense Causal Transformer 架构,同时加入约 18 亿参数的 ViT-G/14 Perception Encoder,用来理解图像、截图、图表和文档,上下文长度达到 131,072+ tokens。知乎定位也足够性感:一个能调工具、看屏幕、写代码的 Agent 模型,全程跑在自己的设备上。但官方数据越漂亮,越要把落差看清楚再动手。
落差一:官方 50 tok/s,不是 MLX 的成绩单
先看流传最广的官方测速表:RTX 5090 加 DFlash 从 74.9 token/s 到 233.4 token/s,3.1 倍提升;Apple M4 Max 从 23.7 token/s 到 37.8 token/s;M5 Max 从 26.6 到 50.2 token/s。
但这张表有一行小注,多数转述都没提:官方图表底部注明,M4/M5 的数字是用 ExecuTorch 测的,5090 是用 llama.cpp 测的。也就是说,Mac 端 37.8、50.2 token/s 是苹果自家 ExecuTorch 路线跑出的天花板,不是你现在实际会用的 MLX、Ollama 的成绩。

MLX 路线的真实状态还在施工中。B站 UP 主鲲鹏Talk 8 月 11 日做了 Mac 真机部署实测:目前测试环境基于 MLX 相关分支代码(尚未完全合并),因此仍然存在一些兼容性问题和 Bug。B站实测约 30 Token/s,Agent 工具调用流程也还没完全跑通,等 mlx-lm 原生支持的人,拿到的是未合并分支,速度和工具可用性都还有变数。
好消息是 Ollama 路线两天内就追了上来:v0.32.8 给 NVIDIA、AMD 和更多平台补上了 Muse Glimmer 支持,Mac 端则是 Ollama MLX 引擎在 Apple Silicon 上支持 Muse Glimmer。小红书0.32.7 起 MLX 引擎已支持 DFlash 和图像输入,恰好补上前面真机实测的两个短板:速度和多模态输入。
落差二:24GB 显存门票是 GPU 端的账,Mac 要重算
Meta 的量化答案是 K-Quant-17GB,可以把语言模型权重压缩至大约 17GB 级别,目标就是让整个系统能够放入 24GB 显存环境;另一个版本面向 32GB 环境。知乎这个 24GB 指的是 N 卡这类独显显存,Mac 玩家要算的是统一内存:17GB 权重、数 GB 级别的视觉编码器、上下文占的 KV cache,全在同一池子里。粗估分档:24GB 机器别想;32GB 是入门线,日常还得把上下文老实压在几十 K;48GB 及以上才能让 Agent 工作流跑得从容。这个分档是估算,不是官方结论,要准星就等 MLX 社区的真机帖。

落差三:131K 上下文和稠密架构,两个隐性成本
131K 上下文纸面不小,但 Agent 消耗上下文的方式和聊天不一样。B站评论区有一线体感:写代码体验不错,但 128k 上下文不太够,很小的任务很快就跑满,有人直言如果 256k 会不错。B站工具调用返回值、截图解析、文件内容一起堆上来,131K 没想象中耐烧。
第二个成本是带宽。稠密模型每个 token 都要读全部权重,生成速度被内存带宽钉死,这正是“只激活一部分”的 MoE 成为本地主流选择的原因。评论区有人从 MoE 换跑这个稠密模型,速度落差大到直接放弃。官方表格也没藏着任务能力的短板:OSWorld-Verified 65.9 对 Qwen3.6-27B 的 75.6,TerminalBench 2.1 51.7 对 60.7,这两项恰恰是“真的会操作电脑”和“终端里干活”的作业。

现在 Mac 上谁该动手?
路线上,现在最省心的是 Ollama:`ollama run muse-glimmer` 一行跑起来,`ollama launch claude --model muse-glimmer` 直接接进编码 Agent,Ollama MLX 引擎在 Apple Silicon 上支持 Muse Glimmer。小红书MLX 原生(mlx-lm)一侧建议再等等:llama.cpp、MLX、ExecuTorch的优化集成也会陆续落地。知乎

内存分档:48GB 及以上,直接上量化版跑 Agent 流程;32GB 当入门机,压住上下文跑聊天加轻量工具;24GB 及以下,建议老实等社区进一步量化和 MLX 侧优化,现在折腾性价比不高。
留三个观察信号,任一变化时再评估要不要深入:MLX 分支是否合入主线并修好工具调用;新一代稠密 Qwen3.8-27B 落地后必来的 Mac 实测对比潮,社区已经有 27B 稠密模型在 4090 上的 MTP 推测解码完整数据。知乎以及 Meta 自己的权重更新节奏,Muse Spark 1.2 刚发布,Meta 又把模型权重交出来了,权重线的更新并不慢。
最后说一句价值观。Muse Glimmer 真正卖的不是跑分,是“全程跑在自己设备上”:日程、截图、文件都不出本地。你要的是一个随时待命、不上传数据的个人 Agent,现在这个还不完美的 MLX 生态值得上手折腾;你只是想聊天,云端前沿模型更省心。值不值得,从来取决于你想把什么留在自己机器里。