Meta开源MuseGlimmer 30B,24GB显卡就能跑本地Agent:首批实测分歧巨大,你的卡上车还是再等等

源自6位全网作者

06:09

8月10日晚,Meta发布了MuseGlimmer 30B。这个模型的定位有点反常——它不追聊天跑分,而是明牌做"本地个人Agent的基础模型":整理文件、管理日程、起草消息、写代码、调工具,全部可以在自己电脑上离线完成。Apache 2.0协议,权重直接挂上HuggingFace,图灵奖得主杨立昆都在扎克伯格的官宣评论区鼓掌。36氪

Meta开源MuseGlimmer 30B,24GB显卡就能跑本地Agent:首批实测分歧巨大,你的卡上车还是再等等

它能在本地部署圈炸开,原因很直白:官方口径,量化后体积不到20GB,单张24GB显存的显卡就能跑,部分Mac也行。知乎也就是说,一张4090、甚至一张二手3090,就能在家里养一个AI智能体,不联网、不按token收费。

但发布四天,首批实测出炉,评价是割裂的。有开发者说,这是第一次觉得"离线操作电脑"真正可用;也有人在B站评论区只留下一句:“简单测了下,拉完了。” 我把两边的账都算了一下。

一、先把散在全网的首批实测数据拼起来

目前能查到的实测主要来自三条线:X平台的开发者、B站UP主和知乎玩家。

PC显卡这边(llama.cpp路线):

  • RTX 4090(24GB)跑UD-Q4_K_XL量化版:占用约19.34GB显存,可配置13万token上下文,输入预处理超过3100 token/s,生成约50 token/s;加上DFlash推测解码,生成能提到75 token/s,但显存会吃满到23.93GB。36氪

  • RTX 5090(32GB):AI平台AtomicChat用它一次生成三款复古街机游戏,全部可玩、无崩溃,但消耗了8.34万token、耗时17.7分钟。同样三个游戏,Qwen3.6 27B只用2.37万token、5.4分钟,Gemma4 31B用1.78万token、4.5分钟。

  • 2080 Ti(11GB):17 token/s,当事人自嘲"跑不动"

  • DGX Spark:有人单节点试跑,稠密模型扛不住带宽,放弃

Mac这边(MLX路线):

  • B站UP主鲲鹏Talk实测Apple Silicon上约30 token/s,但MLX支持还没合入主线,分支版本有兼容性bug,需要踩坑。哔哩哔哩

官方跑分(22项,对比同级别的Gemma4 31B和Qwen3.6 27B):

  • 拿下12项SOTA,优势集中在Agent任务:MCPAtlas(多工具串联调度)75.5分、DeepSearchQA(深度检索问答)74.6分,均超过另外两款;SWE-Bench Pro编程51.2分,略胜Qwen3.6的50.2分;AIME2026数学94.7分排第一

  • 但在部分桌面操作、编程和多模态测试里输给Qwen3.6;两项安全测试中,Gemma4的违规率更低

Meta开源MuseGlimmer 30B,24GB显卡就能跑本地Agent:首批实测分歧巨大,你的卡上车还是再等等

二、"跑分强"和"实测拉"为什么同时存在

把实测放在一起看,分歧不是玄学,基本就是三个坑:

第一,不开工具和检索,幻觉很重。B站评论区有玩家直言:不开联网检索和工具调用,这个模型的幻觉"一塌糊涂,完全不能用";开了就非常好,但速度变慢,思考强度开到medium就够。哔哩哔哩这其实和它的训练目标有关——它就是为"调用工具干活"训的,拿它当纯聊天模型用属于错位。想下载来当聊天替身的,可以省了。

第二,128K上下文对Agent任务真的紧。多个独立反馈都是"很小的任务很快就跑满"。哔哩哔哩Agent执行时,工具定义、屏幕截图、系统状态全在吃上下文,X平台的开发者甚至要先精简工具接口,任务才能顺利跑完。36氪想让它当那种挂机一整晚、处理大项目的Agent,128K是目前看得见的硬顶。

第三,中文日常不是强项。实测反馈是prefill超级快、回复延迟很低,但中文生成质量不如Qwen3.6 27B,可能和中文数据占比有关。哔哩哔哩也就是说,你手里的Qwen未必会被它淘汰。

还有一个容易被忽略的隐性成本:时间。同样一个任务,MuseGlimmer的token消耗大约是Qwen3.6的3.5倍。本地跑不烧钱,但烧时间——一个任务等17.7分钟,老显卡和Mac上延迟更高,急性子慎入。

三、你的硬件能跑到什么档

  • 16GB显存(4060 Ti 16G、5060 Ti 16G):官方门槛是24GB,量化后本体就接近20GB,就算塞得进去,KV缓存和视觉编码器也没地方放,基本不用试

  • 24GB(3090、4090):主力目标用户。UD-Q4_K_XL加长上下文是已验证路线;追求质量可以试UD-Q8_K_XL,实测写代码体验不错,但显存更紧张

  • 32GB以上(5090):可以舒服地开DFlash推测解码,官方测试5090解码提速3.1倍,生成速度能到75 token/s

  • Mac(M4 Max、M5 Max):官方口径推测解码分别提速1.5倍、1.8倍,实测30 token/s上下,适合"不急速度"的任务,但MLX分支还不成熟。<#&!53#&!>36氪

  • 无独显:不用勉强,这一波是给"手里有卡的人"准备的

Meta开源MuseGlimmer 30B,24GB显卡就能跑本地Agent:首批实测分歧巨大,你的卡上车还是再等等

四、上车还是等等?三类人三个建议

  1. 有24GB显卡、本来就玩llama.cpp或LM Studio:值得花一晚上。它是目前开源里Agent任务完成率最能打的一档,离线+隐私+不按token收费这个组合,暂时只有本地部署能给。配置建议:UD-Q4_K_XL量化,联网检索和工具打开,思考强度medium。

  2. 主力是中文聊天、日常写代码,手里Qwen3.6 27B用得好好的:不用换。它的强项是长流程、带工具调度的任务,不是中文日常对话,换了可能体验倒退。

  3. 没卡、或者不想折腾:等。扎克伯格的长文里已经预告了连Meta自己都读不到数据的"完全私密模式"个人Agent。36氪旗舰模型MuseSpark 1.2的权重开放也在预告里,Ollama、LM Studio的支持陆续接入,等生态成熟,入门门槛会比现在低得多。

Meta开源MuseGlimmer 30B,24GB显卡就能跑本地Agent:首批实测分歧巨大,你的卡上车还是再等等

五、最后照例算笔账

本地部署的持续成本只有电费:整机满载按600W、居民电价0.6元/度算,一小时约0.36元。对照一下,官方演示里"找到局域网Home Assistant并写一个控制面板"这种单条指令长流程任务,token消耗是几万起步的量级。36氪换成按token计费的云端API,每天跑几个Agent任务,一个月账单不会小。你已经有一张卡的话,MuseGlimmer相当于用接近零的边际成本,体验一线大厂的Agent能力——这张票值得上,前提是你接受上面三个坑。

继续观察三个信号:Ollama和LM Studio的正式支持时间、llama.cpp与MLX的优化进度、后续版本会不会放开上下文上限。这三件事到位,才是它真正全面上车的时候。

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章