这周刷B站和知乎,Mac跑大模型的消息有点密集:8月8日,有人用M3 Ultra实测DeepSeek V4 Flash 0731,一个284B的模型,20万上下文时还能输出20.8 tok/s;8月11日,30B的Agent模型Muse-Glimmer在MLX分支上跑出约30 Token/s;再往前几天,月之暗面Kimi K3——总参数2.78T的多模态MoE——也被移植到了MLX。
评论区最热的问题出奇一致:我的Mac能跑吗?
这个问题现在真的可以算出来,不用猜。这周三个案例恰好横跨三个档位,把它们放在一起看,你能得到一份相当完整的“Mac内存准入地图”。
本周三个案例,正好卡在三个档位
先看DeepSeek V4 Flash 0731这个最炸的。284B参数,跑在M3 Ultra 80核GPU、512GB统一内存的机器上,用的是2.4bit-mixed量化版。实测1K上下文时Prompt处理458 tok/s、生成27.9 tok/s;上下文拉到128K,生成还有21.8 tok/s;接近200K上下文时,生成依然能保持20.8 tok/s。整场会话平均生成约21 tok/s,而模型实际内存占用只有79GB左右。哔哩哔哩
再看Muse-Glimmer-30B。这是个主打代码、推理和复杂任务执行的30B级Agent模型,目前MLX适配还在分支代码阶段(没完全合并),实测生成约30 Token/s,Agent工具调用流程暂时还没跑通。哔哩哔哩 30B稠密模型4bit量化后十几个GB,一台主流配置的MacBook Pro就能装下。
最后是Kimi K3。总参数2.78T、激活104B的多模态MoE,社区项目PipeNetwork/kimi-k3-mlx做了MLX移植,用流式转换器避免一次性加载5.6TB权重,还支持REAP专家剪枝。但项目写得很直白:最低需要870GB内存,普通Mac无法运行。小红书
三个案例摆在一起,图景很清楚:30B进笔记本,284B进Mac Studio,2.78T基本告别单台Mac。中间那条线,到底画在哪?

你需要的只有一个公式
跑一个模型,权重占的内存约等于:总参数量 × 量化位宽 ÷ 8。
用本周的数据验证一下这个公式:
DeepSeek V4 Flash 284B × 2.4bit ÷ 8 ≈ 85GB,和实测的79GB基本对上(mixed量化里各层位宽有差异,略低很正常);
Kimi K3按项目给出的最低870GB倒推,2.78T参数对应约2.5bit的平均量化位宽——也就是说,就算压到极致,2.78T也需要八百多GB;
再看小一号的:Gemma 4 26B MoE用Unsloth量化版大约需要18GB内存,4bit算出来13GB,加上embedding和运行开销,吻合。知乎
公式之外,这波MoE模型潮真正要理解的是“双线规则”:内存占用看总参数,生成速度看激活参数。
Mac本地推理的解码速度主要被统一内存带宽卡住,每个token生成时只需要把被激活的那部分权重读进来。MoE模型每个token只激活一小部分专家,所以DeepSeek V4 Flash虽然总参数284B,但跑起来的速度接近一个小得多的稠密模型——20万上下文还有20 tok/s,靠的就是这个机制。反过来,如果是284B的稠密模型,4bit量化就要142GB内存,解码速度更会被带宽彻底压垮,根本不会有这种体验。
这也是社区里“MoE + 4bit是Apple Silicon上的正确组合”这个说法一直在流传的原因:MoE负责把速度做出来,量化负责把内存压下去,正好都踩在统一内存架构的脾性上。
按内存对号入座:你的Mac能进哪个档
把近期各平台的实测案例按统一内存归拢一下,大概是这么一张准入表:
6GB左右:Gemma 4 E2B/E4B这类端侧小模型的领地。Unsloth量化版约6GB内存就能跑,甚至能支撑一个搜网页、执行代码的小Agent——放两年前没人信。
16GB:4B-8B稠密模型4bit量化的舒适区,Qwen3-4B配合DFlash投机解码这类优化能在MacBook上冲到186 tok/s。知乎 Gemma 4 26B MoE(约18GB)已经顶到天花板,属于“挤一挤能进”。
24-32GB:14B-32B稠密模型4bit的主战场。本周的Muse-Glimmer-30B就在这个档(约30 Token/s),Gemma 4 31B Dense也能住进来。这是大部分MacBook Pro用户的现实档位。
48-64GB:开始能碰“非常规”模型。33B的视频+音频联合生成模型MiniMax-H3在48GB级Mac上能跑,生成一段720p的5秒视频约30分钟——官方ComfyUI路径要求64GB以上,MLX重写版硬是压进了51GB的M5 Pro。知乎
96-128GB:DeepSeek V4 Flash这个级别的284B MoE,2.4bit量化后权重约79GB,理论上够得着。但要提醒一句:这是“装得进”,长上下文的KV缓存还要另算,实际跑长会话会紧张。
256-512GB:284B长上下文自由。实测512GB跑200K上下文还有20.8 tok/s,本地Coding Agent、私有化部署才真正成立。
870GB以上:Kimi K3的门槛。这已经不是单机游戏,普通用户可以直接死心,等社区做专家剪枝版本。
这张表有两个必须打的折扣。第一,macOS不会把全部统一内存交给你的模型,系统和其他应用要吃掉一块,社区普遍的保守做法是至少留两成余量——“装得进”和“跑得稳”是两回事。第二,KV缓存是第二个内存黑洞:上下文从1K拉到200K,缓存占用会显著膨胀,DeepSeek V4 Flash之所以敢测20万上下文,512GB的内存底子是关键前提。

三个反直觉的坑,最近都有人中招
位宽越低不等于越快。 有用户在M3 Ultra上对比发现:MLX 8bit的解码TPS约25,反而比GGUF q4km的约20更高;但q4km的首字延迟(TTFT)又更短。知乎 拆解下来的结论是:预填充和解码的瓶颈根本不是一回事,4bit在prefill阶段靠更低的带宽压力占优,到了decode阶段,解包反量化开销、内核成熟度、GPU offload是否打满都会反过来吃掉优势。在Apple Silicon上比速度,先确认是不是同一条后端路径,“4bit永远更快”这种口号可以直接扔了。
“2GB内存跑26B模型”是标题党。 8月初有视频宣传TurboFieldfare能用约2GB运行内存执行Gemma 4 26B-A4B,但有人实测戳穿:完整文本模型实际是37个文件、约14.3GB。“消失”的12GB去哪了?被交换到磁盘上了。这种mmap磁盘置换的玩法能“跑起来”,但速度完全不可用,看到远低于模型体积的内存宣传,先问一句是不是swap。哔哩哔哩
框架不同,同一个模型的内存门槛能差出一个档位。 还是MiniMax-H3的例子:官方ComfyUI实现要64GB以上统一内存,MLX重写版48-51GB就能跑。知乎 区别不在魔法,在于MLX版本做了权重预计算、量化kernel融合这些针对性优化。所以“我的内存跑不动X模型”这个结论,有时候要加一句“用哪个框架跑不动”。
KV压缩正在改写准入线,这是值得盯的信号
内存不够的问题,软件侧正在补。今年3月,oMLX发布时就打出“128K上下文KV省79%”的旗号。知乎 Gemma 4发布当天,mlx-vlm 0.4.3配合TurboQuant KV缓存压缩,31B模型在128K上下文下的内存表现大幅改善,代价是解码速度约1.5倍的下降(内核启动开销导致,官方说后续版本修复)。知乎
更早一点,MLX宣布完整支持CUDA后端,同一套代码也能跑在英伟达GPU上。知乎 Ollama的MLX引擎也从3月底的预览一路迭代到6月的正式版,推理速度提升20%。知乎

这些动作合起来说明一件事:MLX生态正在把“Mac能跑什么”的天花板持续往上顶。官方层面同样在加码——WWDC26上Apple把CoreAI与MLX并列推台前,专门设了“用MLX在Mac上本地运行智能体AI”的议题,设备端模型和本地Agent被摆到了主旋律位置。哔哩哔哩 今天算出来“装不进”的模型,半年后可能因为KV压缩、专家剪枝或新量化格式变得够得着。Kimi K3移植项目里的REAP专家剪枝,本质上就是在为“砍掉用不上的专家、压低内存门槛”探路。
最后给两类人各一句实话
如果你已经有Mac:别拿内存硬刚,按上面的档位找模型,优先MoE、下载前先看量化位宽和文件体积,遇到远低于常识的内存占用宣传先怀疑swap。
如果你正打算为了本地AI买Mac:统一内存是这台机器上唯一不可升级的东西,也是本地大模型时代真正的入场券。32GB是认真玩稠密模型的起步线,48-64GB能摸到视频生成这类新玩法,想追DeepSeek V4 Flash这种百亿激活参数的MoE,128GB往上才谈得上从容。方向上也已经明牌:下一个进Mac的模型浪潮是“能干活”的本地Agent——这周刚测完MLX分支的Muse-Glimmer,和苹果官方在Xcode里演示的agentic coding工作流,都把本地智能体当成了主角。哔哩哔哩

这波MoE模型潮最大的意义,是把“Mac能跑什么模型”从玄学变成了算术题。公式和档位表都在上面了,下次再看到“XXX模型登陆Mac”的新闻,你可以先算一下,再决定是收藏还是划走。