8月24日的小米玄戒芯片技术沟通会上,雷军揭晓了一个"隐藏彩蛋":Xiaomi AI Cube原型机,一台搭载O3、O100和D100三颗芯片、完成大模型本地计算的桌面AI高算力终端。微博消息一出,微博热搜、B站评论区直接炸锅,有人喊"无限Token自由",有人问"跟DGX Spark谁强",也有人冷笑"120B是MoE吧?又开始文字游戏了"。80GB统一内存、120B+3B双大模型、150W持续释放——这串数字对在家里跑模型的人意味着什么,该等还是该现在动手?我把36氪、知乎、微博、B站的公开信息和实测数据全过了一遍,只算该算的账。
先把信息分成三堆
热闹归热闹,先做减法。目前关于AICube的公开信息,可以分成三堆。
已确认的:这台机器采用航天铝一体成型机身,80GB统一内存,机身内部将玄戒O3、O100、D100三芯整合,可同时部署120B与3B双模型并支持快慢系统切换——小模型接毫秒级高频指令,大模型管深度推理。36氪目前是原型机,O100和D100两颗AI算力芯片要到明年才上机。36氪
实验室数字:玄戒O100内存带宽1.22TB/s;O100配合MiMo实验室最高330 Tokens/s;沟通会现场O100原型机演示约295 Tokens/s。
完全空白的:售价、操作系统、上市时间;这个"120B"到底是哪个模型、dense还是MoE、激活参数多少;能不能跑Qwen、DeepSeek这些开源模型;以及最重要的——120B模型在这台机器上到底跑多少tok/s。
后面所有判断都建立在这个分堆上:确认的拿来算账,实验室数字拿来参考方向,空白的列入观察清单。

80GB统一内存:这才是120B的"入场券"
先算一笔显存账,这是本地部署的生死线。一个120B参数的模型,4-bit量化后权重大约60GB出头,再算上KV cache和运行时开销,80GB内存刚好是"紧但够得着"的档位;要是8-bit,120GB起步,直接出局。
这就是独立显卡路线的死穴。要知道5万元的显卡,满血版32G的RTX5090,都部署不了120B模型——不是算力不够,是32GB显存连权重都塞不下。知乎这也是为什么8月14日刚开源的Qwen3.8-27B能在社区炸成这样:27B稠密模型4-bit量化只要16GB出头,一张24GB显卡就能全速跑。知乎知乎上有人叫它"第一个能在本地部署的,能正儿八经工作交付的本地模型"。知乎27B和120B之间隔着的,不是性能,是显存这道物理墙。

统一内存路线就是来拆这堵墙的:内存即显存,容量管够,代价是带宽通常不如独立显存。目前这条路线上的参照物:英伟达DGX Spark,128GB LPDDR5x统一内存,首发价为3,999美元,约合人民币2.9万元。知乎Mac Studio想跑到能装下120B的内存配置,B站评论区的估算是"来到了4.5万"。AICube的80GB卡在中间:比所有消费级独显高一个数量级,比DGX Spark少48GB,但对4-bit的120B来说,够用。
真正的看点不是33874个散热孔,是O100的1.22TB/s
B站热度最高的评论(88赞)在吐槽:"宣传文案上出现’精密镂空了超过33874个蜂窝散热口’,有一种荒诞的好笑。"底下跟帖更损:“刚看完O100的先进封装,明明有很多能吹的,吹外壳打了多少孔干嘛。”
吐槽得对。对本地推理来说,决定体验的永远是一道小学数学题:生成速度 ≈ 内存带宽 ÷ 每个token要读的权重字节数。统一内存设备跑大模型慢,从来不是因为算力不够,而是带宽喂不饱。DGX Spark被诟病的核心就是LPDDR5x的带宽,苹果靠M系列超大杯统一内存硬堆带宽才站稳脚跟。
所以小米这次真正硬核的是玄戒O100:6nm逻辑工艺不算先进,但封装思路激进——Wafer on Wafer晶圆级3D堆叠,两层AI专用DRAM晶圆和一层NPU晶圆垂直键合(Hybrid Bonding,和下一代HBM同款路线),258万个物理键合节点,直接将O100的内存带宽推到了惊人的1.22TB/s,达到目前主流旗舰手机LPDDR5X的16倍。36氪什么概念?这已经摸到独立旗舰显存的带宽区间(RTX 5090的GDDR7公开规格约1.8TB/s)。如果AICube量产时真能让120B模型吃到这个带宽,"统一内存跑大模型慢"这个老印象,可能要被改写。

但速度数字有个"小字注释"
这里要泼一盆冷水。目前所有公开的速度数字——现场演示的295 Tokens/s、实验室的330 Tokens/s——仔细看玄戒O100原型机的演示屏,右下角跑的是Model: 5B级别的小模型。也就是说,小米至今没公布过120B模型在AICube上的任何一个速度数字。玄戒O100原型机与AI Cube首秀时给出的端侧AI性能实测为295 Tokens/秒,但对应模型规格并未展开。知乎微博评论戳中了这一点:“主要他光说最高支持200B的大模型,没说速度和性能,我是真又馋又急啊。”
给个参照系。现在开源社区跑27B稠密模型的真实成绩:单卡3090跑Qwen3.8-27B Q4,230K上下文下decode速度 = 40 tokens / s。知乎3090Ti调优后输出速度从20-30tps优化到50-60tps,和在线的DeepSeek v4 flash输出速度相差无几。知乎社区还有4090挂DFlash2草稿模型的玩法,贴文称110K上下文,解码还能到90 tokens/s以上。知乎
而16GB显存的5070Ti只能把27B压到3-bit:我这台聊天80、agent loop 113,差41%。知乎如果AICube的120B能跑出3090跑27B的水平(40+ tok/s),那就是教科书级的胜利;如果是个位数tok/s,那它更像一个高级离线知识库。这个答案,只能等量产后的实测。
第三个问题:生态,生态,还是生态
硬件之外,本地部署老玩家最警惕的是软件生态。知乎问题下的评论很冷静:"就连AMD小主机运行大模型都受限于生态,小米这个新丁没法看好。"B站的高赞评论给了条件:"良心价和高自由度,不死绑定mimo的话真要吹一波。"还有人直接问:“双大模型什么意思,限定自家的吗?”
这些担心不是多余的。DGX Spark和Mac之所以是本地部署的"安全选择",是因为它们跑CUDA和Metal,llama.cpp、Ollama、vLLM、MLX整个开源工具链即插即用,今天跑Qwen、明天换DeepSeek、后天试GLM,自由切换。而AICube的三颗玄戒芯片是全新硬件,如果工具链不开放、只适配MiMo自家模型,那"本地部署"的意义就少了一半——你买的不是自由,是一个绑定账号的离线盒子。
雷军说玄戒"至少做十年,至少投入500亿以上",决心不缺。36氪但生态开放度这件事,只能等官方回应和开发者社区的实测。
该等还是该现在动手?分三种人
现在就想用起来的:AICube今年跟你没关系。它是原型机,O100和D100明年量产,售价、系统全无消息。你手里一万到两万的预算,最现实的路径还是24GB显卡+Qwen3.8-27B 4-bit——50-60 tok/s的输出速度,挂Coding Agent、做本地知识库都够用,这是当下被全网实测验证过的甜点组合。
已经有Mac统一内存或DGX Spark的:AICube对你只是观察对象。你手上的设备生态成熟,没必要为一个原型机改变计划,盯着实测报告看就行。
想要120B级别、又不想花四五万买Mac Studio大内存版的:AICube是你最该等的东西。社区对它的期待很明确——“小米出应该会比DGX Spark便宜”。如果小米真把120B级本地终端打进消费级价格带,配合O100的带宽优势,它有机会成为"年轻人的第一台AI工作站"。但等,要有等地等。

观察清单:五个信号出现前,别掏钱
售价和上市时间:目前唯一的时间锚点是"O100、D100明年量产",价格完全空白。小米是著名的价格屠夫,这一次屠不屠,等官宣。
120B实测tok/s:谁来测、什么量化、什么上下文长度下的数字。低于30 tok/s要谨慎,达到40+就是惊喜。
120B模型的真身:dense还是MoE、激活参数多少。社区那句"又开始文字游戏了"不是空穴来风,这个信息直接决定能力上限。
生态开放度:是否适配llama.cpp/Ollama/vLLM,能不能跑Qwen、DeepSeek等开源模型。这一条决定它是"本地部署设备"还是"MiMo专用盒"。
真实功耗和噪音:150W是官方持续释放数字,放书房还是放客厅,等首批用户的体感反馈。
写在最后
AICube是一个"方向正确"的原型机:它对准的正是本地部署用户最真实的痛点——把大参数模型以合理的功耗和价格搬回家。80GB统一内存+1.22TB/s带宽的O100,技术路线上确实戳中了统一内存阵营的两个要害。但价格、120B实测速度、生态开放度这三道题,小米一道都还没答。
对本地部署玩家来说,这不是"买不买"的问题,是"盯紧哪几个信号"的问题。现在想用的,27B开源生态已经是成熟答案;愿意等的,把上面五个信号存进收藏夹——任何一个落地,都值得回来重看这篇文章。