这个周末,迷你主机圈连着出了两件大事,而且指向同一个方向。
8 月 24 日小米玄戒芯片技术沟通会,真正让迷你主机群炸锅的不是跑分 522 万的玄戒 O3 手机芯片,而是一台叫 AI Cube 的小主机:玄戒 O3、O100、D100 三颗自研芯片塞进一个航空铝机身,150W 持续性能释放,80GB 统一内存,本地跑 120B 参数大模型,旁边还挂着个 3B 小模型做「快慢系统」切换。知乎官方口径很明确:工程样机,暂无量产计划,也没公布价格。知乎

24 小时后,苹果突然更新了 Mac mini 和 Mac Studio。M6 版 Mac mini 6999 元起,官方话术是「AI 性能最高提升 4 倍」。知乎

两家公司,同一个 24 小时,给出了两条完全相反的路:小米往垂直走,把所有算力塞进一台机器;苹果继续往水平走,把入门门票递给你(虽然这张门票已经从 M4 时代的 4499 元涨到了 6999 元),让你买一台,再买一台。知乎
微博评论区有人一句话问到了点子上:三台新 Mac 算力串并联,是不是就是一台小米 AI Cube 了?微博听着像玩笑,但这其实就是现在想在家跑大模型的人,面前最真实的选择题:买一台大的,还是先堆几台小的?今天把这笔账算清楚。
为什么这道题突然重要了
两个背景数字。
第一,模型体积膨胀了。7 月底开源的 DeepSeek V4 Flash 是 284B 参数的 MoE,FP4 权重 157GB 往上——一台 128GB 统一内存的机器,装都装不下。知乎再叠加 DeepSeek API 峰谷调价把一批重度用户推向本地部署,大内存机型直接被买涨价:站内之前算过账,能跑 284B 的 AMD 395 迷你主机,半个月从 1.5 万涨到 2.6 万。
第二,内存变贵了。DDR5 年内涨了 300% 以上,16GB 单条卖到 1500 元。本地 AI 这条路,内存就是最大的单项支出,「买多大、怎么买」从随便选变成了要先算账的事。
单机能走到哪:容量决定跑不跑得动,带宽决定跑多快
先看一张对照表,全部来自本周社区实测和官方口径:
方案 | 统一内存 | 大致能跑什么 | 现状 |
|---|---|---|---|
Mac mini M6 入门款 | 16GB | 7B 级小模型、养虾办公 | 6999 元,8 月 27 日预购 |
主流 32GB 小主机 | 32GB | 14B 流畅,32B 加知识库吃力 | 现货 |
395 迷你主机 | 64–128GB | 70B 级甜点位 | 现货,9999–26999 元 |
小米 AI Cube 工程版 | 80GB | 120B + 3B 双模型 | 无量产计划、无价格 |
NVIDIA DGX Spark | 128GB | 70B–100B 级 | 美区官方 4299 美元 |
两个判断:
其一,内存容量决定「跑不跑得动」,内存带宽决定「跑多快」,这两样都不跟价格成正比。知乎有条高赞说法很直白:5 万块的满血 32G 版 RTX 5090,也部署不了 120B 模型。选本地 AI 机器,第一眼看的是真实可用内存,不是 TOPS,也不是跑分。
其二,AI Cube 有个细节值得抠:官方和多家媒体口径都是 80GB 统一内存,部分自媒体传的「160GB」,我没查到官方依据,先按谣传处理。带宽口径倒是很清楚——玄戒 O100 本身就是高带宽 AI 加速芯片,官方标称 1.22TB/s。知乎O100 原型机跑 3B 小模型,实测输出速度可达 295 tokens/s。知乎注意,这个数和下面要说的「74 tokens/s」不是一个量纲,模型规模完全不同。
堆叠这条路有人蹚过了,水比想象的深
「买一台再买一台」不是嘴炮,DGX Spark 用户已经把双机并算的路蹚出来了。两台 DGX Spark 用 200GbE 光纤直连,张量并行跑 DeepSeek V4 Flash 完整 284B 权重,单流 74 tokens/s,200K 上下文。知乎但这个 74 tokens/s 的成本,值得看仔细。
一位折腾了整整 4 周、连撞 6 道墙:镜像内置核数不支持 GB10 的 sm_121 架构、跨境拉镜像被限速、vLLM 版本改接口、网卡绑定错位……最后是北大和 DeepSeek 合作研究团队专门为 GB10 做的 vLLM 镜像把他救活的。知乎他自己总结:先读他的踩坑记录再动手,「至少能省你 3 周」。
另一位用上了现成方案,一天跑通:200GbE 直连传文件 490MB/s,冷启动 8–10 分钟,输出和官方 FP8 基准基本一致,prefill 低 4–5%。知乎

两篇复盘有三个共同提醒:
双机要两台完全一样的机器,网络直连,别指望家里路由器;
软件坑的时间成本按周算,硬件到手只是开始;
vLLM 默认无鉴权,一旦绑到局域网,任何设备都能白嫖你的推理服务——之前 923 个公网裸奔的「虾塘」刚被点名,堆叠等于多开一扇门,就要多守一扇门。
Mac 这边说句实话:Mac mini「买一台再买一台」的主力场景,是 OpenClaw 养虾这类小模型长任务多开,真要把三台 Mac 并起来切一个大模型,目前没有成熟的开箱方案。「三台串并联等于 AI Cube」这个说法,现阶段还停留在段子和愿望层面。
每 GB 内存的成本账
本地 AI,买机器本质上就是买内存。按本周公开价算一笔粗账(美元按近期汇率折算,仅供参考):
方案 | 价格 | 统一内存 | 每 GB 成本 |
|---|---|---|---|
Mac mini M6 入门 | 6999 元 | 16GB | 约 437 元 |
395 迷你主机 128G 档 | 12999–19999 元 | 128GB | 约 102–156 元 |
DGX Spark 官方 | 4299 美元 | 128GB | 约 240 元 |
DGX Spark OEM 版 | 约 3300 美元 | 128GB | 约 186 元 |
小米 AI Cube | 未公布 | 80GB | 有知乎用户猜 14999 元,约合 187 元,听听就好 |
结论不意外:最便宜的统一内存,还是国产 395 迷你主机这边;Mac 的溢价是 macOS、功耗和养虾生态;DGX Spark 的溢价是 CUDA 生态。AI Cube 如果真落到知乎用户猜的那个价,每 GB 成本不算离谱。知乎但所有讨论都建立在「量产」两个字上,两款原型机均处于技术验证阶段,小米至今没给时间表。知乎

谁该走哪条路
养虾、跑 32B 以内、7×24 常开:别碰集群。一台 32–64G 小主机就够,预算紧的甚至可以看看咸鱼 200–600 元的二手工控 allinone,之前算过,电费比你想的便宜。
70B–120B 档:买一台大的,别堆叠。能等就等 9 月 4 日的 192GB 统一内存新品(评论区都叫它「马甲」,名字别当真,看价格和供货就行);等不了就买 128G 现货,认下这波内存涨价溢价。
284B 级 MoE 是刚需:双机张量并行,或者干脆等更大内存的机器。两句话:机器必须同款,网络必须直连。
一看命令行就头疼:认真考虑云端。站内早算过这笔账,轻度用户本地部署真不如月付会员。本地部署只在三种情况下成立:重度使用、隐私刚需,或者你就享受折腾本身。
接下来两周,值得盯的信号
8 月 27 日 9 点 Mac mini M6 预购:重点看大内存配置的价格阶梯,它决定「买一台再买一台」这条路的真实成本;
9 月 4 日 192GB 统一内存新品:看定价和供货,决定 395 这轮要不要继续等;
AI Cube 的量产时间和价格:工程版 80GB 是官方口径,160GB 是谣传,别急着上头;
RTX Spark 上市机型:GTC 台北官宣「1 PFLOP AI 性能、最高 128GB 显存」,搭载机型最低 1.4 万起步,只会更贵;
DeepSeek API 价格走势:云端要是再降回去,本地部署的账就得重算。买硬件前,先看自己上个月的调用账单。
这 48 小时里的两张牌,本质都在赌同一件事:每家都会有一台 AI 主机。但对真掏钱的人来说,变量从来不是芯片,是内存——DDR5 涨了 300%,每一条路线的定价都在被它往上顶。现在要买,先把三件事算清楚:买多少 GB、每 GB 多少钱、折腾成本另付多少。能等的,不妨等一等,9 月会很热闹。