这周智能体圈的话题几乎被 DeepSeek 包圆了,但 Meta 在旁边悄悄干了件大事。8 月 10 日,Meta 超级智能实验室开源了 Muse Glimmer——一个专门为"常驻本地的智能体"打造的 30B 参数模型,权重当天挂上 Hugging Face。知乎它能看屏幕、调工具、失败了会自己重试,单张消费级显卡或一台 Mac 就能跑。微博发布一天内,Hacker News 和国内社区同时炸锅:这一次不是又一个"开源大模型"发布,而是一个准备在你自己电脑里干活的模型。
不是聊天的,是干活的
先看基本面。Muse Glimmer 约 29.6B 参数,其中约 27.8B 是语言模型本体,外加一个 1.8B 的视觉编码器,能读截图、图表和文档,上下文 13 万+ token。知乎它不是从头训练的,而是基于 Meta 自家闭源旗舰 Muse Spark 预训练蒸馏,再针对 Agent 能力专门强化——用大模型的能力浓缩出一个小模型。微博
许可是这次真正的亮点:Apache 2.0,商用、修改、再分发全放开,没有月活上限。对比之前 Llama 系列的"社区许可"(月活超 7 亿要单独谈),这是 Meta 给得最痛快的一次。能力上,官方定位很窄:不追通用最强,只做智能体循环里的事——拆任务、调工具、查结果、错了自己诊断重试,训练覆盖 100 多种语言,断网也能跑。

为什么"本地跑"才是智能体的真卖点
很多人的第一反应:我用云端智能体不香吗,为什么要把模型搬回自己电脑?答案在账单上。聊天是一问一答,智能体是一个循环:每一次工具调用、每一次重试、每一次失败重来,都是一笔单独的账单,跑得越勤,交得越多。有开发者实测 DeepSeek V4 Pro 跑一轮智能体任务,4139 万 token,总消费 8.5 元——这还是缓存命中率 96% 的旧价格。知乎本地运行把这笔账整个反转:可变成本变成你已经买下的硬件,最私密的那些东西——日程、邮件、文件——一步都不用出设备。知乎延迟也没了:每一步都等云端往返的智能体像工单系统,本地秒级响应的才像个助手。

硬件门槛:24GB 显存是门票
全精度的 Muse Glimmer 需要超过 55GB 内存,比任何一张消费级显卡都大。知乎Meta 动了两刀。第一刀是量化:把权重压到约 4-bit,语言本体缩到 20GB 以内,正好塞进 24GB 或 32GB 显存,还给上下文缓存和视觉编码器留了余量;官方口径是压缩后能力平均只退化 0.2%,17GB 版本退化 1.0%。社区还在继续往下压,Unsloth 的 2-bit 动态量化把模型压到 12.4GB,14GB 内存的笔记本也能跑——代价是效果进一步打折,适合"先跑起来再说"的人。哔哩哔哩第二刀是提速:自带的 DFlash 草稿模型一次起草 16 个 token,主模型并行验证,官方实测 17GB 量化版在 RTX 5090 上每秒生成 233 个 token,Mac M5 Max 也能跑到 50 token/s。知乎翻译成门票:RTX 3090/4090/5090 这一档 24GB 以上显存的显卡,或者 M4 Max、M5 Max 统一内存的 MacBook。

跑分很热闹,别只看赢的那一半
官方跑分对标的是 Gemma4-31B 和 Qwen3.6-27B 两个同尺寸模型,且都是 Meta 自测:智能体类项目领先明显,MCP-Atlas 拿到 75.5 分,比 Qwen3.6-27B 的 62.5 高出一大截。知乎但编码类反过来:SWE-Bench Verified 和 TerminalBench 两项,Qwen3.6-27B 反而更高。知乎更准确的说法是:工具调用、任务流程强,写代码和 Qwen 互有胜负。第三方机构 Artificial Analysis 的聚合实测给出智能指数 35/100,在 132 款同尺寸模型里排第 2——不错,但不是顶尖。社区实测口径也在打架:有人说"速度和能力都跟 Qwen 27B 差不多",也有人在小红书吐槽"好久没看到这么笨的 AI 了"。小红书

谁该上手,谁该等等
按人群给判断。你已经有 24GB 显存的显卡或 M4 Max 以上的 Mac,且手上有一堆高频、重复、边界清晰的活——整理文件、管日程、批量处理文档——值得装,Ollama 一条命令上手,重试不要钱,成本只剩电费。你主要拿来写代码:先别急着换掉 Qwen3.6-27B,两个都留着,按任务挑。你的电脑不满足门票线,想专门为它买一张显卡:先想清楚你买的是硬件,模型只是票根,算一算你能省下的订阅费多久能回本。你指望它当"全能助理"的大脑:建议等。也要管好预期:今天能在高端笔记本上跑的模型,大约相当于 12-18 个月前的前沿模型,硬推理、冷门知识、复杂写作照样打不过云端旗舰,混合使用才是现在的正解。知乎
再给几个值得持续盯的信号。安全与稳定性:发布当天就出现了拆掉安全护栏的去对齐版本,HN 上也有用户报告模型写出安全漏洞、陷入循环行为,长程智能体任务的稳定性还有待更多实测。知乎云端价格:DeepSeek API 8 月 17 日起改峰谷定价,高峰输出最高 27 元,闲时只收一半,云端智能体的账单只会越来越敏感,这会直接影响本地方案的性价比。知乎同段位竞争:社区消息显示,Qwen3.8-27B 在 Glimmer 发布四天后跟进,"Muse Glimmer 30B 和 Qwen 3.6 27B 都是目前很值得关注的本地 Agent 模型"这场同尺寸对攻,才刚开始。小红书
Meta 这一步的意图其实很清楚:云端前沿竞赛暂时追不上,那就换一个计分方式——把智能体从云上搬下来,搬到每一台设备上,用 Apache 2.0 占住这块还没人插旗的地。同一天,扎克伯格还发了篇 6500 字长文,宣布将开源旗舰 Muse Spark 1.2 的权重,说超级智能"应该分发到每个人手里"。知乎门票这次是真免费了。但免费不等于好用,先看看你手里的硬件和需求,再决定要不要上这张车。