48G MacBook跑起33B视频大模型:MLX生态半年换血,Mac本地AI玩家该不该切换

源自12位全网作者

13:21

这几天,Mac 本地 AI 圈里有一条值得停下拇指的帖子:有人把 MiniMax-H3——一个 33B 参数的视频生成大模型——移植到了苹果 MLX 框架上,在 48G 左右统一内存的 MacBook 上真正跑了起来,生成一段 720p、5 秒的片子大约要 30 分钟。知乎官方 ComfyUI 实现要求至少 64GB 统一内存,量化 kernel 只提供 Linux 和 Windows 安装包,Mac 路线此前不是"慢",是"加载不进去"。移植者重写了 4100 行代码,修了 6 个真 bug,验证后放弃了 9 个优化方向,全程靠 AI 编程助手完成。

48G MacBook跑起33B视频大模型:MLX生态半年换血,Mac本地AI玩家该不该切换

很多人对 MLX 的印象还停在"Mac 上跑聊天模型的那个东西"。但往回看这半年,生态其实发生了几件结构性的变化。

半年里真正改变格局的五件事

1、Ollama 把 MLX 接进了底层。 3 月底 Ollama 0.19 预览版全面接入苹果 MLX 框架,6 月中旬正式版落地,它充分利用了 Apple 统一内存架构、官方机器学习框架 MLX,并将 Ollama 云端优化技术搬到设备端,在 Apple 芯片上推理速度更快、内存使用更低。知乎这件事很重要——社区过去吵"Ollama 还是 MLX",现在两者合体了:你继续用 Ollama,底层跑的已经是 MLX,提速约 20%,还支持 NVFP4 量化格式。

2、MLX 打通 CUDA,杀进 NVIDIA 主场。 5 月,MLX 维护者 zcbenz(对,就是 Electron 的创始人)确认 CUDA 后端全部测试通过,同一套代码 Mac 和 NVIDIA 显卡通吃,MLX 不再是"Apple Silicon 独占玩具"。哔哩哔哩

3、苹果推出 Core AI,但不是来取代 MLX 的。 WWDC26 上亮相的 Core AI 将进入 iOS 27,承担产品侧推理,早期第三方基准里 Qwen3-0.6B 的解码速度明显快于 MLX,8B 几乎追平。但分工很明确:Core AI 服务系统和应用推理,想训练、微调、玩新模型,还是得靠 MLX。同一场大会上,MLX 还宣布支持多台 Mac 用雷电口互联组集群;而对 M5 新芯片,MLX 会自动识别 M5 硬件并启用专用的乘法与注意力内核。知乎

4、投机解码全面开花,聊天速度一再翻倍。 dflash-mlx 把 Block Diffusion 投机解码带到 MLX,实测官方千问3模型速度直接提升4倍,本地部署千问3.5-4B 也轻松实现2倍以上提速。哔哩哔哩mlx-dspark 则在 DeepSeek 开源 DSpark 仅一周后,就推出了首个苹果芯片原生版本,在 M4 Pro 上把 Gemma-4 和 Qwen3 的生成速度分别提升 1.6 倍和 1.4 倍。微博

48G MacBook跑起33B视频大模型:MLX生态半年换血,Mac本地AI玩家该不该切换

原理不复杂:一个小"草稿模型"先一口气猜若干个 token,再由目标模型一次验证,被接受的结果与正常解码完全一致,提速幅度取决于接受率。社区也摸出了分场景的用法:开放式聊天 DSpark 更稳,代码、数学这类结构化输出 DFlash 的整块猜测更吃香,长多轮对话则加上 prefix cache 避免重复 prefill 的开销。

48G MacBook跑起33B视频大模型:MLX生态半年换血,Mac本地AI玩家该不该切换

5、聊天之外:视频、3D 都来了。 7 月有人把 TripoSplat 完整迁移到 MLX,这个项目完成了从文本提示到 3D Gaussian Splat 的端到端管线:FLUX.2-klein-9B 生成图像→BiRefNet 抠图→TripoSplat 重建,全部跑在 Mac 的 MLX 上。知乎8 月初就是前面说的 MiniMax-H3。Hugging Face 上 mlx-community 的现成模型已经超过 4000 个,微调也不再是门槛——Unsloth-MLX 把 SFT、DPO、GRPO 训练都搬上了 Mac,目前SFT训练,DPO训练,GRPO训练都支持。微博

现在到底能跑什么?把账算清楚

把各处社区实测汇总成内存档位,供对号入座:

统一内存

大致能跑

体验参考

16GB

4B–8B Q4 聊天模型

日常助手流畅

24GB

8B–14B Q4

主流甜点档

32GB

14B Q4 或更大模型深量化

轻度多任务有余量

48GB

32B 级 Q4、MiniMax-H3 视频模型

视频生成"能跑",需要耐心

64GB 以上

70B Q4

M4 Max 社区实测约 12–18 token/秒

聊天速度有一组参考实测:7B Q4 在 M4 Max 上约 87 tokens/秒(MLX 框架,llama.cpp 约 50-60),13B Q4 约 38,而 70B Q4 在 M3 Max/M4 Max 上大约 12 到 18 tokens/秒。知乎视频生成则要把话说透:720p 5 秒约半小时,作者那条 62 秒短片是 12 个分镜跑了 5.8 小时。这是"能跑",不是"生产力工具"——但它免费、跑在你已有的笔记本上,全链路开源,对个人创作者做创意验证已经足够。

不同玩家,不同路线

  • 已经用 Ollama 用得很顺的:不用折腾,新版底层已经是 MLX,白捡提速。

  • 要更快、要 OpenAI 兼容 API 的(接 Cursor、Claude Code 之类):mlx_lm.server 之外,可以看今年两个更激进的新项目。Rapid-MLX 是一个专门为 Apple Silicon Mac 打造的本地 AI 模型运行工具。知乎它利用统一内存和 Metal 计算内核,在大多数模型上跑得比 Ollama、llama.cpp 还快,主打速度;oMLX 主打服务场景,它巧妙地将KV缓存块持久化到SSD上,通过LRU机制管理热块与冷块,将首次令牌生成时间(TTFT)压缩至5秒以内,并发下最高 4 倍吞吐。哔哩哔哩

48G MacBook跑起33B视频大模型:MLX生态半年换血,Mac本地AI玩家该不该切换

  • 想微调的:Unsloth-MLX 换包名即可沿用原 API,训完导出 HF 或 GGUF 格式;mlx-lm 自带 LoRA 路线。

  • 想玩视频、3D 新玩具的:盯住 Hugging Face 的 mlx-community 组织和 GitHub 上的 MiniMax-H3 移植项目。移植者留了一条实用建议:中文 prompt 写到 30–50 字,太短的话文本在两千多行序列里注意力质量不够,画面就不听 prompt 的话。知乎

最后两个提醒

第一,别把模型格式搞混:MLX 用自家权重格式,GGUF 不能直接喂给 mlx_lm,下载模型认准"-MLX"后缀,必要时用社区转换工具。第二,别因为早期"Core AI 基准碾压 MLX"就急着下结论——那是小模型推理场景的故事,想折腾微调、玩新模型,MLX 仍是 Mac 上唯一严肃的路线。

接下来值得盯的信号:Ollama MLX 引擎稳定版铺开、MLX CUDA 后端正式发版、M5 专用 kernel 被第三方工具跟进的速度。这三件如果年内都落地,Mac 本地 AI 会是另一番样子。

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章