今天刷到一条知乎提问:「苹果放着这么好的硬件能力,为什么就是不抓紧好好搞一搞他们的 MLX?」问题下面答案还不多。知乎但这份焦虑是真实存在的——自从 WWDC26 之后,不少在 Mac 上跑本地大模型的玩家心里都在打鼓。
焦虑的来源是三件事。第一,苹果在 WWDC26 上发布了全新的端侧推理框架 Core AI,正式接替服役 9 年的 Core ML。知乎第二,媒体基准测试出炉:M4 Mac 上,Core AI 跑 Qwen3 0.6B 的解码速度是 MLX 的 2.47 倍,「快了两倍多」的标题一传,看上去 MLX 像是被拍在沙滩上了。微博
第三,国行 Apple Intelligence 定档 9 月上线,iOS 27 / macOS 27 今秋就会带着 Core AI 落地,iOS 27 Beta5 的发布说明里,Core AI 板块已经在修 Qwen3.5/3.6 模型的问题了。知乎小红书

三件事叠在一起,很容易得出「苹果官方新框架来了,MLX 要过气」的结论。但我的判断是:如果你平时就是在 Mac 上跑开源大模型,不用切换,也不用慌。不过这事的逻辑确实变了,值得掰扯清楚。
一、Core AI 到底是什么:它不是给玩家的玩具,是「产品化流水线」
很多人以为 Core AI 是「苹果官方版 Ollama」,这个理解偏了。Core AI 和我们熟悉的 mlx-lm、Ollama、LM Studio 走的完全是两条路。
它的工作流是这样的:开发者把训练好的 PyTorch 模型导出,用官方转换器转成 .aimodel 格式,再用 xcrun coreai-build 做 AOT(提前)编译,产出 .aimodelc 文件,像编译产物一样打包进 App。知乎用户装上 App 时模型已经编译好了,设备端只做一层很薄的芯片适配就能直接跑。
一句话总结:Core AI 是「交付流水线」——你要把 AI 功能做进 App 卖给用户,苹果帮你提前编译好、把 CPU / GPU / 神经引擎的效率榨干。API 层只有 AIModel、InferenceFunction、NDArray 三个概念,连多轮对话的 KV Cache 管理都直接做进了框架。
它服务的不是「今天社区发了个新模型,我今晚就要跑起来」这种场景。从模型转换到 AOT 编译,整条链路都是对着产品交付去的。
二、2.47 倍是真的,但只说了半个故事
这个数字出自 Wccftech 的报道,原始数据则来自开源基准项目 apple-silicon-llm-bench——目前第一个在真实设备上独立测试 Core AI 的基准。它的图表很直观:M4 Max 上跑 4-bit 量化的 Qwen3-0.6B,Core AI(GPU)解码 1121 tok/s,MLX 是 455 tok/s,正好差出 2.47 倍。微博但换到 Qwen3-8B,就是 94 对 90,差距只剩 1.05 倍。同一项目的另一组数据更有意思:M4 Max 跑 Gemma-4-12B int4,MLX 是 55.1 tok/s,Core AI 是 37.9 tok/s——到了 12B 这个量级,MLX 反而是领先的那个。

所以这份基准的完整结论是八个字:小模型强、大模型接近持平。还有一个很多转载没提的细节:基准项目自己后来修正过数据——iPhone 17 Pro 上 MLX 早期的 112 tok/s 是 Debug 构建污染的数值,替换后同场次实测是 158.8 tok/s,和 Core AI 的差距缩到了一倍出头。GitHub同一份 README 里还写着,Core AI 的热启动复测目前被 macOS 27 beta 上 coreai-build 的工具链 bug 卡住,暂时出不了新数据。换句话说,全网刷屏的「2.47 倍」,是特定条件下最好看的那个瞬间值,而且 Core AI 官方至今没发布任何基准数据。知乎
为什么小模型快?其实不难理解:小模型推理的瓶颈不在算力,而在调度和启动开销,Core AI 的 AOT 编译、针对 Transformer 深度优化的算子、CPU / GPU / ANE 统一调度,恰好都是冲着这层开销去的。但模型一大到 20B、30B 甚至几百 B,瓶颈就回到内存带宽和算力本身——那是 MLX 的主场。给个参照:社区实测 MLX 在 M4 Max 上跑 7B Q4 约 87 tok/s,70B Q4 约 12~18 tok/s,这个量级 Core AI 目前还没有公开数据。
三、苹果官方的定位:三层分工,不是替代
这一点从官方口径到媒体拆解都对得上。WWDC26 之后,苹果设备端 AI 是三层结构:
Core ML 进入维护模式,不再加新功能,只管决策树、表格模型这类经典机器学习,存量模型走兼容层继续可用。Core AI 接棒神经网络和 Transformer 推理,是未来 App 里 AI 功能的主力框架,走产品化部署路线。MLX 则继续由苹果机器学习研究团队维护,面向训练、微调和实验,官方明确它不走生产部署路线。
WWDC26 开发者 session 的原话写得很直白:「了解如何利用 MLX 及其社区生态系统进行模型训练、研究和实验」。哔哩哔哩换句话说,在苹果的版图里,MLX 不是「被替换的旧框架」,而是「另一条产线上的车间」。知乎Core AI 是总装车间,MLX 是研发车间,两者根本不抢活。
四、Mac 玩家为什么不用切:看看 MLX 生态这半年的成绩单
如果 MLX 真的要凉,生态会最先给出信号。实际情况恰恰相反,最近半年是 MLX 生态的换血期:
今年 3 月底,Ollama 0.19 把 Apple Silicon 的后端正式切到了 MLX。官方给的数据:M5、32GB 内存跑 int4 量化的 Qwen3.5-35B-A3B,预填充 1851 tok/s,生成 134 tok/s,推理性能接近翻倍。微博
mlx-community 已经是开源模型的 Day-1 首发渠道:从去年 Qwen3 全系官方适配 MLX,到今年的 Gemma 4、Qwen3.8、DeepSeek V4 Flash、Muse-Glimmer-30B、MiniMax H3,新模型发布当天基本都有能跑的 MLX 量化版。
DeepSeek 开源 DSpark 投机解码技术才一周,社区就做出了苹果芯片原生的 mlx-dspark 版本。微博M4 Pro 上把 Gemma-4 12B 的生成速度从 18.4 tok/s 拉到 30 tok/s,提升 1.6 倍。知乎

今年 5 月,MLX 的 CUDA 后端全量测试通过——意味着你在 MLX 上攒下的代码,未来在 NVIDIA 硬件上也能跑,这条路不再只绑死 Mac。微博就连 3D 模型这种以往是 CUDA 独占的角落,都有 mlx-spatial 这样的社区项目在逐个移植。

这个密度说明:只要你玩的是「尝鲜新模型、LoRA 微调、本地 Agent」,MLX 工具链依然是 Mac 上的第一选择,Core AI 那条流水线给不了这种当天上手的折腾体验。
五、谁才需要认真研究 Core AI
也要把话说清楚:如果你是 iOS / macOS 开发者,想把 AI 功能做进 App 交付给用户,Core AI 值得现在就投入——AOT 编译吃掉了设备端编译的卡顿,混合精度由框架自动选择,连苹果自家的 Apple Intelligence 底层都在用它。小红书9 月新系统的第一波红利,是这批人吃的。
但对纯玩家来说,Core AI 眼下和你的关系是:它证明苹果在认真投入端侧推理,M 系列芯片的 AI 性能会持续升值——你的 Mac 不会白买,你的 MLX 经验也不会白费。
六、抱怨对了一半,接下来盯这三个信号
「苹果不认真搞 MLX」这个抱怨,对了一半。对的那一半:苹果的 AI 资源确实在向 Core AI 和自研模型倾斜,MLX 的官方迭代是研究团队节奏,不是产品团队节奏,早些年「很多细节没铺好」的吐槽也都真实存在。错的那一半:MLX 生态该补的课,社区和第三方工具已经在补——Ollama、LM Studio 接上了 MLX 后端,mlx-tune、Unsloth 把微调门槛打到接近零,mlx-vlm 补上了多模态。
接下来值得盯三个信号:
9 月 iOS 27 / macOS 27 正式版推送后,Core AI 的官方基准和大模型实测——现在「2.47 倍」还只是小模型的一面之词。
Core AI 的转换工具链会不会对 mlx-community 这类社区模型库开放一键转换——这决定它和玩家生态是打通还是割裂。
MLX 自身的版本节奏(目前是 0.31.x 线)和 CUDA 后端的成熟度——这决定它是「苹果的 MLX」还是「所有人的 MLX」。知乎
最后三句话总结:
玩本地大模型的:留在 mlx-lm / Ollama,不用切换,MLX 不是这次换代的输家。
做 App 的开发者:Core AI 可以开始学了,那是苹果端侧 AI 未来十年的地基。
观望买 Mac 跑 AI 的:别因为框架传言换机器,等 9 月新系统实测落地再决定。