关注Mac本地大模型的朋友,五月中旬应该都被同一条新闻刷过屏:MLX的CUDA后端测试全部通过,苹果向英伟达"投降"了。截图传了两天,热度过去之后,大多数人记住的只剩两个字:投降。
三个月后的现在,恰恰是回头看这件事的好时机。情绪的潮水退了,进展也跟上了,剩下的才是真正对判断有用的部分。
先把时间线捋清楚
把微博、小红书、知乎上的帖子串起来,这件事的脉络大致是这样:
2023年12月:苹果开源MLX,为Apple Silicon而生,深度结合自研芯片、吃统一内存的红利,主打在Mac上跑模型、做微调。
2025年7月:MLX官方宣布增加CUDA后端支持,Hacker News引发热烈讨论,国内媒体则普遍解读为苹果向英伟达生态妥协。知乎
2026年5月中旬:MLX维护者zcbenz(Electron的创始人)宣布CUDA后端测试全量通过、支持基本完成,这就是五月中那波刷屏。微博
2026年7月下旬:一条相关但方向相反的新闻——科学计算项目OpenFPM把为CUDA设计的程序几乎不改内核代码地跑在了M3 Pro的Metal GPU上,三维流体模拟比CPU顺序计算快约10倍。知乎
注意最后这条和前面几条很容易搞混,下面会专门说。

误解一:“测试通过"不等于"马上能用”
维护者宣布的是"测试通过"。具体哪些算子覆盖、在英伟达卡上性能如何、正式稳定版什么时候出,目前公开信息里都查不到。
更准确的理解是:路修通了,但车跑多快、能拉多少货,还没人给出实测数据。社区里有博主说"以后苹果的硬件和英伟达硬件都能用同一套代码跑了",这是方向性表述,不是可以立刻迁移的表述。微博如果你打算在生产里用MLX,等官方文档和benchmark出来再动手,这一步省不了。
误解二:这不是"投降",是"开正门"
"投降论"传得最广,但看官方给出的理由,逻辑其实是反过来的:其一,CUDA本身有统一内存机制,和MLX的设计哲学对得上;其二,更重要的,英伟达硬件在学术研究和大规模计算中用得太多了,支持CUDA意味着开发者可以在Mac上开发调试,去英伟达GPU服务器上训练,再把成果部署回Mac、iPhone这些设备。知乎
也就是说方向是"让用英伟达卡的人来写MLX代码",而不是"苹果硬件去用CUDA"。再补一个背景会更清楚:2024年英伟达已经在CUDA 11.6的许可条款里明确规定,不允许在非英伟达平台上逆向工程、反编译或反汇编CUDA SDK生成的任何结果。知乎所以苹果走的是"主动去适配CUDA"这条路,而不是"想办法让CUDA跑在自己硬件上"。
结合2018年macOS切断英伟达显卡支持的旧怨,这一步确实像妥协。知乎但从策略上看,更像是开正门迎客:你写的代码、跑的模型,更可能回流到苹果的设备生态里。
误解三:框架打通不等于硬件追上
这是最容易踩的误区:看到"MLX能跑英伟达卡",就以为"苹果AI全家桶追上来了"。
并没有。知乎有回答算了一笔很直白的账:苹果GPU算力大概30 TFLOPS上下,而英伟达卡bf16已经能到2000 TFLOPS,差着两个数量级。知乎MLX通过CUDA测试是框架层的事件,一点都没有改变硬件层的差距。
也别把它和7月那条OpenFPM新闻混为一谈。那件事是CUDA风格程序经由HIP/SPIR-V/MoltenVK等转换层跑在苹果GPU上,方向和MLX的CUDA后端(MLX代码→英伟达卡)正好相反。而且苹果Metal目前对高精度浮点计算支持不足,专业科学计算场景英伟达依然占优。知乎
开发者的回应很坦率:最大的用处是"好玩,以及工作顺手"——大仿真跑集群,小仿真本地调试,两边代码通用。知乎

那么,这件事和你有什么关系?
分三类人说:
在Mac上跑本地推理的你(用Ollama、LM Studio、mlx-lm跑Qwen这些):说实话,这波和你关系不大。你的工具、模型、速度都不会变。但有个间接红利:用MLX的开发者变多,mlx-community的模型供给会更快、周边生态更丰富——Ollama 0.19已经正式集成了苹果MLX框架,推理性能大幅提升。微博WWDC26上苹果还专门开了两场MLX的session,一场讲在Mac上本地运行AI智能体,一场讲多Mac分布式推理和训练。哔哩哔哩哔哩哔哩苹果不会因为支持CUDA就荒废自家基本盘,反而是在加固。

需要云端英伟达卡做训练的开发者/研究者:这件事本来就是为你做的。"Mac上开发、N卡上训练、回到Mac部署"正是官方给出的场景。值得关注,但建议等稳定版和benchmark出来再动手迁移,现在冲进去成本不低。
想看"MLX会不会取代PyTorch"的围观者:短期内不会。CUDA生态按福布斯的数据已拥有超500万开发者、4万家公司,一个后端测试通过动摇不了它。知乎但小红书那条264赞的帖子里有句话可以留在这里:很多历史性变化,刚开始都像玩具。小红书
值得继续盯的几个信号
最后留一份清单,判断这件事是否真正落地,看这几个动向:
MLX官方仓库何时推送CUDA后端稳定版、文档补齐;
是否出现MLX CUDA对PyTorch+CUDA的第三方benchmark;
训练(目前重心仍在推理)能否完整跑通,多卡分布式是否跟进;
mlx-community模型供给增速是否加快——这是生态是否真的吸引人的最直观信号。
这件事不会让你的Mac一夜之间更值钱或不值钱,但它决定了你手里这套本地AI生态接下来几年往哪个方向走。值得在关注列表里留一个位置。