48小时之内,本地AI圈子连着出了两件大事。
8月24日晚上,雷军在玄戒芯片技术沟通会上端出了小米AICube原型机——一台Mac mini大小的桌面主机,塞进三颗自研芯片,本地同时部署120B和3B两个大模型。知乎

紧接着8月25日晚,苹果官网毫无预热地上新了:Mac mini首发2nm的M6芯片,Mac Studio升到M5 Ultra,产品页上直接挂着Ollama和LM Studio,把“设备端跑大模型”写成了核心卖点。知乎知乎

评论区已经开始对垒了,小红书有人已经发帖问,给你13000元,你会选小米还是苹果?小红书
但把两边参数和评论区都翻了一遍之后,我的结论是:这两台机器压根不是一个量级的事。与其急着站队,不如先把账算清楚——你想跑多大的模型,能跑它的机器现在最低多少钱。
先澄清一个被传得最离谱的数字
不少媒体标题写“小米端侧AI实测295 Tokens/秒”,很多人直接把它当成了AICube跑120B的速度。
查一下出处:这个数字来自雷军微博,说的是另一台设备——玄戒O100原型机。那是一台手机形态的演示机,砍掉了影像模组、主板重做、加了10W主动风冷,跑的是小米自家的MiMo端侧小模型,实测每秒295个Token。新浪微博至于AICube里的120B,官方至今没公布任何推理速度。

B站评论区已经有人踩过这个坑,有人说120b吞吐高的话我是真想买,立刻被提醒吞吐高的是3b。哔哩哔哩3B小模型和120B大模型的速度完全不是一个概念,别把演示机的成绩单记错到主机头上。
顺带一提,发布会文案里那句“精密镂空超过33874个蜂窝散热口”被网友玩成了梗,神评说小爱智能音箱打孔一万个,领先市面上的音箱超过20%。哔哩哔哩不过也有明白人:英伟达的Spark小主机散热表现一般,发热正是这类AI小主机的大坑,小米晒孔数,其实是在晒150W持续性能释放的散热方案。知乎
这笔账的核心:内存决定你能跑多大的模型
本地跑大模型,最硬的指标只有一个:内存容量。模型参数量乘以每个参数占的字节数就是权重体积,Q4量化大约0.5到0.6字节一个参数,再给上下文缓存和系统占用留出余量,就是真实门槛。按这个算法,各档位的经验值大概是:
7B~14B(Q4):4~10GB,16GB机器绰绰有余
27B~35B(Q4):15~21GB,16GB很勉强,24GB起步才舒服,Qwen3.8-27B这类热门模型就在这一档
70B~80B(Q4):38~45GB,64GB才算从容
120B(Q4):62~70GB,80GB统一内存刚刚踩在门槛上
不量化(BF16):一个参数约2字节,160GB内存对应的上限大约是80B模型
所以AICube的“80GB统一内存+部署120B”是严格配套的——80GB就是120B Q4的入门线。知乎上一个26万阅读量的回答把话说得更直白,内存决定能放多大的模型,只说最高支持160G内存,无量化情况下一般能部署80B的模型。知乎
现在的价位表:能买到的和还买不到的
把当下真能买到、或马上能买到的选项整理成一张表。知乎知乎
档位 | 机型 | 统一内存 | 内存带宽 | 参考价 |
|---|---|---|---|---|
入门 | Mac mini M6 | 16GB起,可选24/32GB | 170GB/s | 5999元起 |
主流 | Mac mini M5 Pro | 24GB起,可选48/64GB | 307GB/s | 13999元起 |
进阶 | Mac Studio M5 Max | 36GB起,可选至128GB | 460~614GB/s | 19999元起 |
旗舰 | Mac Studio M5 Ultra | 96GB起,最高512GB | 1.2TB/s | 46999元起 |
英伟达 | DGX Spark | 128GB | 未公布 | 约3.5万元(美亚4299美元) |
小米 | AICube原型机 | 80GB,最高支持160GB | O100近存计算1.22TB/s | 未公布,暂无量产计划 |
表里有三个值得琢磨的点。
第一,苹果M5 Ultra的1.2TB/s内存带宽,和小米O100的1.22TB/s近存计算带宽,基本是同一个量级。知乎两家押的是同一件事:统一内存。本地推理的瓶颈早就不在算力,而是内存容量先决定“能不能跑”,内存带宽再决定“跑多快”。独显算力猛但显存太贵——有知乎作者算过,5万元的满血32G版RTX 5090都部署不了120B模型。知乎想上96GB显存的RTX PRO 6000,整机要到10万元。知乎
第二,苹果这次把DeepSeek、Kimi、GLM、Qwen直接写进了官网,M5 Pro版Mac mini还支持用雷雳5把多台机器组成集群跑更大的模型。知乎大厂已经把“本地跑大模型”当成正式的消费场景在经营了,这个信号比任何参数都重要。
第三,这一代新Mac集体涨价了:内存芯片供应紧张、价格飙升,起售价比上代涨了100到200美元。知乎“本地AI硬件越来越便宜”这个预期,至少今年可能不成立。

按预算,你应该看哪一档
6000元档:Mac mini M6。说实话,16GB标配是给7B~14B小模型和轻量智能体准备的,要是冲着“买回来跑Qwen3.8-27B”去,大概率会失望——刨掉系统占用,16GB塞27B Q4没什么余量。真想跑27B,至少看24GB以上的配置。
1.4万~2万元档:Mac mini M5 Pro。13999元起是24GB版本,加钱选48/64GB之后,就是32B~35B MoE模型的甜点区间,70B Q4也能勉强塞下。目前“中产本地AI”最集中的就是这一档。
2万~2.5万元档:Mac Studio M5 Max,把内存升到128GB,70B从容,120B Q4也能装下。但614GB/s的带宽决定了它的输出速度属于“能用,别指望飞快”。
3.5万元档:DGX Spark,128GB,CUDA生态是它的护城河。实测社区的反馈是预填充极强、解码输出偏慢。知乎也有人用双机跑更大的MoE模型。知乎但两台就是六七万的预算了。知乎
4.7万元以上:Mac Studio M5 Ultra,这是目前唯一能稳稳吃下120B以上模型的零售渠道,512GB版本预计10月下旬才推。知乎B站评论区的参考很真实,有人说要想运行120b,Mac Studio来到了4.5万,光内存焊满也3万起步了。哔哩哔哩
想等AICube的也完全可以理解,社区盲猜2万价位。哔哩哔哩如果小米真把80~160GB统一内存的主机打成“价格屠夫”价,整个2万~4.5万档都会被重洗。但也要清醒:它目前是技术验证阶段,暂无量产计划。知乎O100和D100明年才量产。新浪微博软件生态会不会死绑MiMo也还是未知数——评论区已经为这事吵起来了。
接下来值得盯的三件事
明天(8月27日)上午9点,新Mac开启预购,9月22日发售。知乎在内存涨价的背景下,刚需用户早点下手未必吃亏。
AICube的量产时间和定价。今年内没有下文的话,能参考的只有发布会上的原型机表现。
内存价格走势。统一内存容量就是本地AI的“显存”,这是今年这笔账里最大的变量。
最后说一句:这两天两台机器,表面是小米打苹果,实际是同一个信号——本地跑大模型,正在从极客的DIY玩具变成大厂亲自下场的消费电子品类。以后聊本地AI,先别聊芯片,先聊两个问题:你要跑多大的模型,你的预算是多少。
评论区说说你的答案。