昨晚小米玄戒芯片技术沟通会之后,本地大模型圈子久违地炸了一次。雷军亲自发博介绍两台原型机。B站AI日报一条切片视频一天6.7万播放、一千多条评论。哔哩哔哩小红书上“小米把120B大模型塞进小主机”的帖子评论区盖到385楼。小红书知乎相关问题浏览量冲上24万。
炸的原因很简单:这台叫 Xiaomi AI Cube 的迷你主机,官方口径是“支持本地部署120B参数大模型”,80GB统一内存,玄戒O3+O100+D100三颗自研芯片,150W持续性能释放,航天铝一体成型机身。微博微博

但热闹看完,我发现流传的信息里有三组数字被搅在了一起。如果你是真在考虑“要不要等这台机器”的本地模型玩家,先把这三个数字拆开,账才有的算。
一、先把数字归位:295 tok/s 不是 AI Cube 的速度
刷屏最狠的是“295 tokens/秒”(官方口径峰值330)。知乎但这个速度属于玄戒O100原型机——一台取消影像模组、加了10W主动风冷的阔折叠手机形态演示机,跑的是内置的3B级MiMo端侧模型。雷军微博里写得清楚,是“内置Xiaomi MiMo端侧模型,实测可达每秒295 Tokens”。微博

而AI Cube宣称的120B模型,官方没有公布任何生成速度。这不是小差别:3B模型和120B模型,推理难度差的是数量级。
更关键的一层:O100那颗芯片的1.22TB/s带宽(号称主流旗舰手机的16倍),对应的是它自己堆叠的那一小块近存内存。小红书知乎有拆机向分析指出,这种晶圆级垂直堆叠的容量一层最多16GB,整机大概率32GB封顶——装得下3B模型,装不下120B。知乎所以120B必须住在AI Cube那80GB统一内存里,而这块内存的带宽,小米没公布。
本地大模型推理有个很硬的物理规律:生成速度≈内存带宽÷要搬运的权重字节数。算力再高,带宽不够,token就是吐不快。这台机器“能不能跑”已经不是问题,“跑多快”完全悬在那个没公布的带宽数字上。
二、第一笔账:速度能到什么水平?拿GB10的实测数据推一下
小米没给数据,但我们可以拿同赛道的现成机器做锚点。NVIDIA DGX Spark(GB10,128GB统一内存,带宽约273GB/s)卖了快一年,实测数据遍地都是。知乎
有人在一台到四台DGX Spark上把Qwen3.8-27B跑了11种配置:BF16精度只有4.5 tok/s,FP8提到7.9,NVFP4量化也才9.7——连理论上限的64%都没吃满。微博双机互联跑DeepSeek V4 Flash(284B总参数、13B激活的MoE)能到74 tok/s,那是沾了“激活参数小”的光。知乎哔哩哔哩

按同样的物理规律,给AI Cube的120B做个粗算(假设Q4量化、权重约60-70GB):
AI Cube统一内存带宽假设 | 120B Q4理论生成速度 |
|---|---|
273GB/s(GB10水平) | 约4 tok/s |
500GB/s | 约7-8 tok/s |
800GB/s | 约11-12 tok/s |
也就是说,即便带宽做到相当激进的水平,120B的聊天体验大概率是“能用、不卡成幻灯片”,而不是很多人被295 tok/s刷屏后脑补出来的“本地起飞”。反过来,如果它真把带宽做上去了,那这台机器确实值得等——这正是现在要盯的第一个信号。
三、第二笔账:80GB装120B,余量比你想象的小
再看内存账。120B模型Q4量化后权重大概60-70GB,塞进80GB统一内存,剩下的10-20GB要留给KV缓存、系统和上下文。长对话、大上下文一开,余量会非常紧张。
横向比一圈同价位的“现货”:
机型 | 统一内存 | 带宽 | 大致价格 |
|---|---|---|---|
小米AI Cube(工程版) | 80GB | 未公布 | 未公布 |
NVIDIA DGX Spark | 128GB | 约273GB/s | 涨价后国内3万+,奔着4万 |
AMD AI Max 395主机 | 最高128GB | 约256GB/s | 从1.5万涨到2-2.6万 |
Mac Studio M3 Ultra | 最高512GB | 约819GB/s | 官网可查,贵但余量大 |
内存只是一半,另一半是生态。DGX Spark的护城河从来不是参数,是CUDA+vLLM+Ollama整套工具链开箱即用,双机、四机、八机集群都有人蹚通了完整部署。知乎而玄戒这套平台,llama.cpp能不能跑、量化格式支持哪些、社区工具链多久能跟上,目前全是未知数。小红书评论区已经有用户在问“支不支持FP4”——这个问题放到一年前的GB10上,答案都是折腾了很久才有的。小红书
微博也有冷静的声音:DGX Spark、技嘉AI TOP Atom、华硕Ascent GX10这一类大内存迷你主机“都卖了快一年了”,AI Cube不是开创新品类,而是杀进一个已经被验证、也被实测数据照过一遍红利的赛道。微博好处是有作业可抄,坏处是用户的期待值已经被GB10们的实测锚定了——光喊“能跑”不好使了。
四、第三笔账:等小米的成本,正被内存涨价悄悄抬高
第三笔账最容易被忽略:等待本身是有成本的,而且成本在涨。
DGX Spark今年2月已经官宣涨价,FE版从3999美元上调到4699美元,涨幅17.5%,国内从3万起步直奔4万。微博
AMD AI Max 395主机也从媒体评测时的1.5万上下,涨到了2万甚至2.6万。知乎
整个行业都在为内存买单。这种情况下“等小米”,赌的是两件事。一是小米“价格屠夫”的传统艺能,黑虾那篇分析直接用了这个标题,大家对它的定价预期是明显低于DGX Spark的。知乎二是量产时内存价格别再涨。前者是小米的历史战绩,后者谁也说了不算——工程版到量产,中间隔着的时间正好是内存最贵的周期。
结论:谁别等,谁可以等
把三笔账算完,给不同情况的人一个直接的建议:
现在就要部署干活的,别等。工程版没有价格、没有发售时间,量产节奏不明。知乎跑32B以下模型为主、预算2万上下,AI Max 395主机性价比目前最能打;必须吃CUDA生态、以后想组集群,DGX Spark虽贵但现货即战力;要跑100B+还要留长上下文余量,现阶段唯一余量充足的现货还是大内存版Mac Studio。
可以等的,是这三类:不急用、本来就在小米生态里、预算卡在2万内想买“第一台本地大模型主机”的人。但等的时候别光等,盯三个信号:①官方公布统一内存带宽数字;②真机120B模型的实测tok/s(尤其是首字延迟和长对话稳定性);③最终定价和DGX Spark的差价。这三个数字出来之前,所有的“卧槽”都只是工程机情绪。
最后提醒一句:现场体验过的博主说得很实在——“原型机就是原型机,形态和体验仅供参考”。微博120B本地跑,方向是真的,细节还全在雾里。想入坑的,先收藏这篇,等第一个信号落地我们再来对答案。