Mac跑284B大模型只占79GB内存:这波MoE模型潮进来前,先收好这份内存准入公式

源自16位全网作者

10:15

这周刷B站和知乎,Mac跑大模型的消息有点密集:8月8日,有人用M3 Ultra实测DeepSeek V4 Flash 0731,一个284B的模型,20万上下文时还能输出20.8 tok/s;8月11日,30B的Agent模型Muse-Glimmer在MLX分支上跑出约30 Token/s;再往前几天,月之暗面Kimi K3——总参数2.78T的多模态MoE——也被移植到了MLX。

评论区最热的问题出奇一致:我的Mac能跑吗?

这个问题现在真的可以算出来,不用猜。这周三个案例恰好横跨三个档位,把它们放在一起看,你能得到一份相当完整的“Mac内存准入地图”。

本周三个案例,正好卡在三个档位

先看DeepSeek V4 Flash 0731这个最炸的。284B参数,跑在M3 Ultra 80核GPU、512GB统一内存的机器上,用的是2.4bit-mixed量化版。实测1K上下文时Prompt处理458 tok/s、生成27.9 tok/s;上下文拉到128K,生成还有21.8 tok/s;接近200K上下文时,生成依然能保持20.8 tok/s。整场会话平均生成约21 tok/s,而模型实际内存占用只有79GB左右。哔哩哔哩

再看Muse-Glimmer-30B。这是个主打代码、推理和复杂任务执行的30B级Agent模型,目前MLX适配还在分支代码阶段(没完全合并),实测生成约30 Token/s,Agent工具调用流程暂时还没跑通。哔哩哔哩 30B稠密模型4bit量化后十几个GB,一台主流配置的MacBook Pro就能装下。

最后是Kimi K3。总参数2.78T、激活104B的多模态MoE,社区项目PipeNetwork/kimi-k3-mlx做了MLX移植,用流式转换器避免一次性加载5.6TB权重,还支持REAP专家剪枝。但项目写得很直白:最低需要870GB内存,普通Mac无法运行。小红书

三个案例摆在一起,图景很清楚:30B进笔记本,284B进Mac Studio,2.78T基本告别单台Mac。中间那条线,到底画在哪?

Mac跑284B大模型只占79GB内存:这波MoE模型潮进来前,先收好这份内存准入公式

你需要的只有一个公式

跑一个模型,权重占的内存约等于:总参数量 × 量化位宽 ÷ 8。

用本周的数据验证一下这个公式:

  • DeepSeek V4 Flash 284B × 2.4bit ÷ 8 ≈ 85GB,和实测的79GB基本对上(mixed量化里各层位宽有差异,略低很正常);

  • Kimi K3按项目给出的最低870GB倒推,2.78T参数对应约2.5bit的平均量化位宽——也就是说,就算压到极致,2.78T也需要八百多GB;

  • 再看小一号的:Gemma 4 26B MoE用Unsloth量化版大约需要18GB内存,4bit算出来13GB,加上embedding和运行开销,吻合。知乎

公式之外,这波MoE模型潮真正要理解的是“双线规则”:内存占用看总参数,生成速度看激活参数。

Mac本地推理的解码速度主要被统一内存带宽卡住,每个token生成时只需要把被激活的那部分权重读进来。MoE模型每个token只激活一小部分专家,所以DeepSeek V4 Flash虽然总参数284B,但跑起来的速度接近一个小得多的稠密模型——20万上下文还有20 tok/s,靠的就是这个机制。反过来,如果是284B的稠密模型,4bit量化就要142GB内存,解码速度更会被带宽彻底压垮,根本不会有这种体验。

这也是社区里“MoE + 4bit是Apple Silicon上的正确组合”这个说法一直在流传的原因:MoE负责把速度做出来,量化负责把内存压下去,正好都踩在统一内存架构的脾性上。

按内存对号入座:你的Mac能进哪个档

把近期各平台的实测案例按统一内存归拢一下,大概是这么一张准入表:

6GB左右:Gemma 4 E2B/E4B这类端侧小模型的领地。Unsloth量化版约6GB内存就能跑,甚至能支撑一个搜网页、执行代码的小Agent——放两年前没人信。

16GB:4B-8B稠密模型4bit量化的舒适区,Qwen3-4B配合DFlash投机解码这类优化能在MacBook上冲到186 tok/s。知乎 Gemma 4 26B MoE(约18GB)已经顶到天花板,属于“挤一挤能进”。

24-32GB:14B-32B稠密模型4bit的主战场。本周的Muse-Glimmer-30B就在这个档(约30 Token/s),Gemma 4 31B Dense也能住进来。这是大部分MacBook Pro用户的现实档位。

48-64GB:开始能碰“非常规”模型。33B的视频+音频联合生成模型MiniMax-H3在48GB级Mac上能跑,生成一段720p的5秒视频约30分钟——官方ComfyUI路径要求64GB以上,MLX重写版硬是压进了51GB的M5 Pro。知乎

96-128GB:DeepSeek V4 Flash这个级别的284B MoE,2.4bit量化后权重约79GB,理论上够得着。但要提醒一句:这是“装得进”,长上下文的KV缓存还要另算,实际跑长会话会紧张。

256-512GB:284B长上下文自由。实测512GB跑200K上下文还有20.8 tok/s,本地Coding Agent、私有化部署才真正成立。

870GB以上:Kimi K3的门槛。这已经不是单机游戏,普通用户可以直接死心,等社区做专家剪枝版本。

这张表有两个必须打的折扣。第一,macOS不会把全部统一内存交给你的模型,系统和其他应用要吃掉一块,社区普遍的保守做法是至少留两成余量——“装得进”和“跑得稳”是两回事。第二,KV缓存是第二个内存黑洞:上下文从1K拉到200K,缓存占用会显著膨胀,DeepSeek V4 Flash之所以敢测20万上下文,512GB的内存底子是关键前提。

Mac跑284B大模型只占79GB内存:这波MoE模型潮进来前,先收好这份内存准入公式

三个反直觉的坑,最近都有人中招

位宽越低不等于越快。 有用户在M3 Ultra上对比发现:MLX 8bit的解码TPS约25,反而比GGUF q4km的约20更高;但q4km的首字延迟(TTFT)又更短。知乎 拆解下来的结论是:预填充和解码的瓶颈根本不是一回事,4bit在prefill阶段靠更低的带宽压力占优,到了decode阶段,解包反量化开销、内核成熟度、GPU offload是否打满都会反过来吃掉优势。在Apple Silicon上比速度,先确认是不是同一条后端路径,“4bit永远更快”这种口号可以直接扔了。

“2GB内存跑26B模型”是标题党。 8月初有视频宣传TurboFieldfare能用约2GB运行内存执行Gemma 4 26B-A4B,但有人实测戳穿:完整文本模型实际是37个文件、约14.3GB。“消失”的12GB去哪了?被交换到磁盘上了。这种mmap磁盘置换的玩法能“跑起来”,但速度完全不可用,看到远低于模型体积的内存宣传,先问一句是不是swap。哔哩哔哩

框架不同,同一个模型的内存门槛能差出一个档位。 还是MiniMax-H3的例子:官方ComfyUI实现要64GB以上统一内存,MLX重写版48-51GB就能跑。知乎 区别不在魔法,在于MLX版本做了权重预计算、量化kernel融合这些针对性优化。所以“我的内存跑不动X模型”这个结论,有时候要加一句“用哪个框架跑不动”。

KV压缩正在改写准入线,这是值得盯的信号

内存不够的问题,软件侧正在补。今年3月,oMLX发布时就打出“128K上下文KV省79%”的旗号。知乎 Gemma 4发布当天,mlx-vlm 0.4.3配合TurboQuant KV缓存压缩,31B模型在128K上下文下的内存表现大幅改善,代价是解码速度约1.5倍的下降(内核启动开销导致,官方说后续版本修复)。知乎

更早一点,MLX宣布完整支持CUDA后端,同一套代码也能跑在英伟达GPU上。知乎 Ollama的MLX引擎也从3月底的预览一路迭代到6月的正式版,推理速度提升20%。知乎

Mac跑284B大模型只占79GB内存:这波MoE模型潮进来前,先收好这份内存准入公式

这些动作合起来说明一件事:MLX生态正在把“Mac能跑什么”的天花板持续往上顶。官方层面同样在加码——WWDC26上Apple把CoreAI与MLX并列推台前,专门设了“用MLX在Mac上本地运行智能体AI”的议题,设备端模型和本地Agent被摆到了主旋律位置。哔哩哔哩 今天算出来“装不进”的模型,半年后可能因为KV压缩、专家剪枝或新量化格式变得够得着。Kimi K3移植项目里的REAP专家剪枝,本质上就是在为“砍掉用不上的专家、压低内存门槛”探路。

最后给两类人各一句实话

如果你已经有Mac:别拿内存硬刚,按上面的档位找模型,优先MoE、下载前先看量化位宽和文件体积,遇到远低于常识的内存占用宣传先怀疑swap。

如果你正打算为了本地AI买Mac:统一内存是这台机器上唯一不可升级的东西,也是本地大模型时代真正的入场券。32GB是认真玩稠密模型的起步线,48-64GB能摸到视频生成这类新玩法,想追DeepSeek V4 Flash这种百亿激活参数的MoE,128GB往上才谈得上从容。方向上也已经明牌:下一个进Mac的模型浪潮是“能干活”的本地Agent——这周刚测完MLX分支的Muse-Glimmer,和苹果官方在Xcode里演示的agentic coding工作流,都把本地智能体当成了主角。哔哩哔哩

Mac跑284B大模型只占79GB内存:这波MoE模型潮进来前,先收好这份内存准入公式

这波MoE模型潮最大的意义,是把“Mac能跑什么模型”从玄学变成了算术题。公式和档位表都在上面了,下次再看到“XXX模型登陆Mac”的新闻,你可以先算一下,再决定是收藏还是划走。

内容由AI生成

精选参考来源

1. Mac竟然能本地跑284B!DeepSeekV4Flash0731实测:M3Ultra512G,20万上下文还有20tok/s

2. Muse-Glimmer-30B本地部署实测!Mac跑30Token/s,30BAgent模型终于能装进电脑?MLX分支踩坑记录

3. Kimi K3 MLX移植:2.78T

4. Gemma4全系列本地部署指南:Ollama/llama.cpp/MLX/vLLM,附TurboQuant显存优化

5. 苹果MLX完整移植DFlash,Qwen3-4B在MacBook上直接跑到186tok/s!

6. MiniMax-H3的MLX移植实录

7. 为什么在M3Ultra上8bit(MLX)会比4bit(GGUFq4km)更快:一次“反直觉”本地推理现象拆解

8. 大模型本地部署最新压缩算法,三大框架vLLM、llama.cpp、MLX全部跟进

9. AppleMLX深度学习框架完整支持CUDA

10. Ollama在Apple芯片上采用全新MLX引擎,推理速度提升20%

11. ollama支持mlx了

12. 2GB内存跑26B模型,M芯片真成神了?

13. WWDC26:借助CoreAI与MLX将设备端模型带到Apple平台|与Apple会面交流

14. 用MLX在Mac上构建本地AI智能体

15. Apple 推出全新智能框架与先进工具助力 App 开发

16. Apple 推出新一代 Apple 智能、Siri AI 等新功能

0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章