凌晨被群消息炸醒:Meta把30B模型塞进20GB,二手3090能再战三年
昨晚十一点多,胜哥准备关电脑睡觉。
手机震了一下。群里老陈甩了个链接,配了三个感叹号。
"兄弟们快看这个!!!!!!!"
胜哥点开。HuggingFace 页面。Muse Glimmer。往下翻——30B参数,Apache 2.0开源。往下翻——4-bit量化后不到20GB,24GB显存的显卡就能跑。往下翻——DFlash投机解码,RTX 5090上从每秒74.9个token蹦到233.4个。三倍。
胜哥放下手机,想了想,又拿起来,把链接转发到了另一个群。
然后可能是老陈的猫跳上了他的键盘,发了一条全是"asdfghjkl"的消息。老陈回了句:
"猫在我键盘上跑,可能猫也觉得能跑哈。"
就是这种时候,垃圾佬的直觉会告诉你——有什么东西变了。
结果第二天早上刷新闻,蚂蚁百灵 Ling-3.0-tiny 也开源了——7.9B参数,MoE架构,M4 Pro MacBook 上跑到每秒86-90个token。
两个模型,24小时之内。一个说"30B能本地跑",另一个说"笔记本也能跑得很聪明"。
胜哥觉得,这事儿值得坐下来好好聊聊。
图片30B模型怎么塞进一张游戏显卡里的
8月10号,Meta 超级智能实验室把 Muse Glimmer 放上了 HuggingFace。Apache 2.0协议——免费下载,免费商用,随便你怎么改。
30B参数什么概念?去年大家还在说"7B能跑、13B勉强、30B想都别想"。30B全精度需要大约55GB显存,一张消费级显卡根本装不下——RTX 4090才24GB。
Meta 这波用了4-bit量化。
量化说白了就是压缩——把模型的数字精度从16位砍到4位。牺牲一点点精度,换来内存占用砍到原来的四分之一不到。Meta自己的数据:精度损失只有0.2%到1%——说实话这个数字小到胜哥都有点怀疑,但反正先信着。
结果就是:
语言模型权重压缩到不到20GB
剩下的显存放视觉编码器 + 上下文缓存 + DFlash投机解码器
全部塞进一张24GB显卡里
具体给你列清楚:
K-Quant-17GB版本:目标24GB显存。RTX 3090(24GB)、RTX 4090(24GB)都能跑。精度损失约1%
K-Quant-Dynamic版本:目标32GB显存。RTX 5090(32GB)。精度损失仅0.2%
Mac这边:M4 Max/M5 Max MacBook Pro,32GB统一内存就能跑
Reddit上已经有老哥实测了——RTX 3090单卡,实际占用22到23GB显存,跑起来了。社区反应也快,Unsloth当天就做了GGUF镜像,Ollama、llama.cpp、LM Studio、vLLM全适配了。
速度方面,DFlash投机解码器(一个小模型一次猜16个token,主模型再一次性验证)把速度拉了一大截:
RTX 5090:每秒74.9 → 233.4个token(3.1倍)
M5 Max:每秒26.6 → 50.2个token(1.8倍)
M4 Max:每秒23.7 → 37.8个token(1.5倍)
这些是Meta自己的数据。独立测试还没大规模出来。但胜哥多说一句——就算打八折,这个速度也够日常用了。
Muse Glimmer不只会聊天。它的能力列表你自己看:
131072 token上下文——一本技术手册从头看到尾
能读图片——图表、截图、文档都能理解
能调用工具——MCP Atlas得分75.5,比同级别的Google Gemma4-31B高了二十多个点
写代码——SWE-Bench Pro 51.2分,30B级别目前最高
超过100种语言
老陈在群里补了一句:
"意思是我3090终于不用只跑Stable Diffusion了。"
图片同一天,另一个模型也来了——门槛更低
8月11号,蚂蚁百灵在HuggingFace开源了Ling-3.0-tiny。
跟Muse Glimmer走的不是一条路——它更轻、更省、门槛更低:
总参数7.9B,MoE架构,每次推理只激活1.3B参数
提供BF16、FP8、INT4三种精度版本
M4 Pro MacBook实测每秒86-90个token
8K上下文下峰值内存才8.34GB
用了Kimi Delta Attention和MLA混合架构,128个路由专家
翻译成人话:一台MacBook就能跑,不需要买显卡,不需要装机。
胜哥看了一眼自己的设备。又看了一眼。默默打开了HuggingFace。
两个模型放一起看,趋势太清楚了——
开源模型正在从"需要一间机房"变成"需要一张好显卡",再变成"一台好笔记本就够了"。
Muse Glimmer把30B的AI能力带到了消费级GPU上。Ling-3.0-tiny把"够用的AI"带到了笔记本上。两条路,一个方向:本地,离线,你的机器。
对咱们垃圾佬来说,这件事到底意味着什么
群里的兄弟大部分是捡旧工作站、组NAS、几百块淘准系统的主。RTX 3090二手多少钱?
海外市场:800到1000美元。 国内闲鱼:大概4500到7000块(2026年8月行情)。
这笔钱不是小数目。胜哥不跟你画饼说"人人都能跑30B模型"——你得先有张24GB的卡。
但关键是,门槛在降低这件事本身。
半年前,想本地跑一个能用的AI,要么花几万块买A100,要么老老实实付API月费。现在呢?
一张用了五六年的二手RTX 3090 + 一个免费开源的30B模型 = 无限次调用。不用联网,数据不出你家门。写代码、读文档、分析表格、做研究——全部在你自己机器上跑。
图片DDR5内存涨到16G一千多块,存储涨到1T SSD五百起步。但AI模型的推理能力,正在从"按月付费的服务"变成"一次投入的硬件功能"。
你的老工作站插上一张二手3090,它就不是文件服务器了——它是一台AI服务器。
老陈的3090是三年前花九千多买的。
"本来想卖了换50系,现在不卖了。这卡能跑30B模型,比换新卡值。"
当然,不是每个人都要买3090。如果你手头有M系列MacBook、内存32GB以上的,直接用MLX跑Muse Glimmer,Mac的统一内存这时候就是显存。如果是M4 Pro MacBook,Ling-3.0-tiny能跑到你打字都跟不上的速度。
如果你还在用老工作站、没独显、也没MacBook——那就先跑Ling-3.0-tiny。INT4版本在8GB内存的设备上就能跑起来。先体验,再决定要不要升级。
胜哥今天就把话说明白:
24GB显存是本地AI的"入场券"。你不需要最新最贵的卡,二手3090就是现阶段性价比最高的选择。16GB内存是"起步线"——Ling-3.0-tiny这种轻量模型在这个配置上就能流畅跑。
现在该干嘛?三步
① 先别冲动买显卡。
Muse Glimmer才发布两天,社区适配还在进行中。等Ollama/llama.cpp上的实际表现出来、等独立测试数据。二手3090价格目前还算稳,不需要抢。
② 手上有什么用什么,先跑Ling-3.0-tiny。
门槛低。MacBook、台式机都能跑。INT4量化版本8GB内存起步。先体验一下"本地AI是什么感觉",再决定值不值得投钱升级。
③ 如果你已经有了24GB显存卡,现在就去下载。
HuggingFace搜"Muse Glimmer GGUF",Ollama或LM Studio加载,几分钟就能跑起来。胜哥建议先试K-Quant-17GB版本——社区反馈在3090上22GB左右的占用,很稳。
下载地址给你:
Muse Glimmer:huggingface.co/meta-models/Muse-Glimmer-30B
(GGUF量化快速上手版:huggingface.co/meta-models/Muse-Glimmer-30B-GGUF)
Ling-3.0-tiny:huggingface.co/inclusionAI/Ling-3.0-tiny
(另有FP8版:huggingface.co/inclusionAI/Ling-3.0-tiny-fp8
INT4版:huggingface.co/inclusionAI/Ling-3.0-tiny-int4)
几个容易踩的坑,提前说清楚
① 量化版别下错。HuggingFace上一堆GGUF变体,K-Quant、Q4_K_M、Q5_K_M……看着差不多,精度和速度差距挺大。胜哥的建议是第一次跑就用官方推荐的K-Quant-17GB,跑通了再换别的折腾。
② DFlash要单独装。它是个独立的小模型,不是自动配套的。你要么下载DFlash权重文件,要么用支持它的运行时(llama.cpp的某些版本、ExecuTorch)。否则你只跑到原始速度,看不到那个3.1倍加速。
③ 视觉功能吃显存。Muse Glimmer能看图,但一旦开了视觉编码器,22-23GB显存基本就顶满了。如果你本来在跑30B还想同时处理图像,24GB卡会吃紧。32GB版本(RTX 5090)才真正游刃有余。
④ Mac的统一内存不是显存,是共享池。MacBook跑的时候系统本身要占一部分内存,所以32GB的MacBook留给模型的实际可用内存可能只有28-29GB。打算用Mac跑的朋友,提前看一下Activity Monitor。
⑤ Reddit/Hacker News这两天会吵翻天。这模型8/10才放出来,独立评测、各家量化版本、社区调优建议,会在接下来一周内陆续冒出来。胜哥建议你收藏这文章,过两天再回来看评论区,会比现在信息全得多。
这不是那种"赶紧冲冲冲"的新品。胜哥反而不建议你今天就去下单显卡——等独立测试出来、等社区踩完坑,结论会更清晰。
写完这篇,胜哥想说句大实话。
2025年,本地AI是极客的玩具。2026年8月,两个模型在24小时内同时宣布"你能在自家电脑上跑"。Meta把一个30B模型塞进了一张游戏显卡,蚂蚁把一个8B模型塞进了一台笔记本。
都是Apache 2.0商用协议——随便用,不要钱。这不是巧合。
开源本地AI的时代,真的他妈来了。
你的电脑不再是"终端"。它正在变成"大脑"。一张三年前的旧显卡,现在是一台AI工作站的核心。这事儿搁去年谁敢信?
懂的都懂,不懂的说了也不懂。
(胜哥科技数码聊,专治各种硬件选择困难症。关注胜哥,下期接着聊。)
