苹果发布搭裁 M5 Max 与 M5 Ultra 芯片的新款 Mac Studio 之后,科技圈引发了一场关于“本地大模型硬件”的热烈讨论。在传统的个人电脑视角下,台式工作站与独显旗舰一直走在不同的发展轨道上,但随着本地 AI 大模型部署需求的爆发,Mac Studio 与英伟达旗下的旗舰显卡 RTX 5090 产生了一场出人意料的正面交锋。

两者的核心差异首先体现在架构设计与内存机制上。RTX 5090 作为桌面独显王者,拥有约 1.8 TB/s 的极高显存带宽,在纯粹的图形渲染、传统游戏以及小参数模型推理上具备明显优势。然而,RTX 5090 的板载显存容量被限制在 32GB。相比之下,搭载 M5 Ultra 的 Mac Studio 采用了统一内存架构,最高可配置 512GB 统一内存,带宽达到了 1.2 TB/s。在跑大语言模型时,显存或统一内存的容量往往是决定能否运行的硬指标。

这种架构差异直接导致了两者在本地大模型部署上的意外反转。运行像 GLM-5.3-Flash(320B)或 DeepSeek-V4-Flash(284B)这类百亿甚至千亿参数的巨型 MoE 模型时,模型权重本身就需要数百吉字节的内存空间。在 PC 端,单张 RTX 5090 会直接面临显存溢出问题,若想完整装下模型,需要组装包含多张 5090 显卡的高功耗多卡集群,不仅硬件成本飙升,还需要解决复杂的 PCIe 总线延迟、供电和散热问题。而一台紧凑型设计、整机功耗仅约 120W 的 Mac Studio,即可凭借超大统一内存将整套大模型完全加载到本地运行,并保持可交互的输出速度。
在跑分测试与生态表现方面,双方各有胜负。从流出的基准测试来看,在苹果 Metal API 的测试环境下,M5 Ultra 的跑分突破了 36 万,甚至在特定图形基准上略微超过了 RTX 5090 在 OpenCL 下的表现。但在通用性更强的 Vulkan 测试中,RTX 5090 依然凭借强大的算力保持领先。这表明英伟达在跨平台通用负载、3D 游戏以及成熟的 CUDA 生态中依然占据主导地位,而苹果则依靠 Metal 优化、MLX 框架以及在 GPU 核心中引入的神经加速器,在自家生态内实现了“以小博大”。
对于实际体验而言,如果只是运行 7B 或 13B 这样的小参数模型,RTX 5090 的生成速度依然非常迅捷;但当模型规模扩大到 70B 以上,或者涉及长上下文处理、多并发 Agent 任务时,Mac Studio 凭借大容量统一内存和稳定的预填充能力,展现出了极高的实用价值。它能够在不依赖云端网络、保护私有数据隐私的前提下,持续进行本地大模型推理。
从性价比角度来看,放在普通家用或日常办公市场中,高配 Mac Studio 的售价确实昂贵;但若将其作为一台能够离线运行超大参数模型的桌面级 AI 工作站,其整机成本与部署门槛反而远低于多卡 PC 方案或专业级显卡。
对于绝大多数普通用户和日常轻度 AI 使用者来说,云端 AI 订阅服务依然是更具性价比的选择,无需盲目跟风硬件。但对于需要高频处理私有资料、进行本地 Coding Agent 开发或深入研究大模型的专业用户而言,这一代 Mac Studio 确实打破了以往显卡堆料的单一赛道,提供了一种省心、安静且高效的本地 AI 解决方案。