当前位置:
AIGC文章详情

小米AI Cube“120B本地跑”一夜刷屏:295 tok/s是另一台机器的速度,等不等先看这三笔账

源自36位全网作者

08-26 05:45

昨晚小米玄戒芯片技术沟通会之后,本地大模型圈子久违地炸了一次。雷军亲自发博介绍两台原型机。B站AI日报一条切片视频一天6.7万播放、一千多条评论。哔哩哔哩小红书上“小米把120B大模型塞进小主机”的帖子评论区盖到385楼。小红书知乎相关问题浏览量冲上24万。

炸的原因很简单:这台叫 Xiaomi AI Cube 的迷你主机,官方口径是“支持本地部署120B参数大模型”,80GB统一内存,玄戒O3+O100+D100三颗自研芯片,150W持续性能释放,航天铝一体成型机身。微博微博

小米AI Cube“120B本地跑”一夜刷屏:295 tok/s是另一台机器的速度,等不等先看这三笔账

但热闹看完,我发现流传的信息里有三组数字被搅在了一起。如果你是真在考虑“要不要等这台机器”的本地模型玩家,先把这三个数字拆开,账才有的算。

一、先把数字归位:295 tok/s 不是 AI Cube 的速度

刷屏最狠的是“295 tokens/秒”(官方口径峰值330)。知乎但这个速度属于玄戒O100原型机——一台取消影像模组、加了10W主动风冷的阔折叠手机形态演示机,跑的是内置的3B级MiMo端侧模型。雷军微博里写得清楚,是“内置Xiaomi MiMo端侧模型,实测可达每秒295 Tokens”。微博

小米AI Cube“120B本地跑”一夜刷屏:295 tok/s是另一台机器的速度,等不等先看这三笔账

而AI Cube宣称的120B模型,官方没有公布任何生成速度。这不是小差别:3B模型和120B模型,推理难度差的是数量级。

更关键的一层:O100那颗芯片的1.22TB/s带宽(号称主流旗舰手机的16倍),对应的是它自己堆叠的那一小块近存内存。小红书知乎有拆机向分析指出,这种晶圆级垂直堆叠的容量一层最多16GB,整机大概率32GB封顶——装得下3B模型,装不下120B。知乎所以120B必须住在AI Cube那80GB统一内存里,而这块内存的带宽,小米没公布。

本地大模型推理有个很硬的物理规律:生成速度≈内存带宽÷要搬运的权重字节数。算力再高,带宽不够,token就是吐不快。这台机器“能不能跑”已经不是问题,“跑多快”完全悬在那个没公布的带宽数字上。

二、第一笔账:速度能到什么水平?拿GB10的实测数据推一下

小米没给数据,但我们可以拿同赛道的现成机器做锚点。NVIDIA DGX Spark(GB10,128GB统一内存,带宽约273GB/s)卖了快一年,实测数据遍地都是。知乎

有人在一台到四台DGX Spark上把Qwen3.8-27B跑了11种配置:BF16精度只有4.5 tok/s,FP8提到7.9,NVFP4量化也才9.7——连理论上限的64%都没吃满。微博双机互联跑DeepSeek V4 Flash(284B总参数、13B激活的MoE)能到74 tok/s,那是沾了“激活参数小”的光。知乎哔哩哔哩

小米AI Cube“120B本地跑”一夜刷屏:295 tok/s是另一台机器的速度,等不等先看这三笔账

按同样的物理规律,给AI Cube的120B做个粗算(假设Q4量化、权重约60-70GB):

AI Cube统一内存带宽假设

120B Q4理论生成速度

273GB/s(GB10水平)

约4 tok/s

500GB/s

约7-8 tok/s

800GB/s

约11-12 tok/s

也就是说,即便带宽做到相当激进的水平,120B的聊天体验大概率是“能用、不卡成幻灯片”,而不是很多人被295 tok/s刷屏后脑补出来的“本地起飞”。反过来,如果它真把带宽做上去了,那这台机器确实值得等——这正是现在要盯的第一个信号。

三、第二笔账:80GB装120B,余量比你想象的小

再看内存账。120B模型Q4量化后权重大概60-70GB,塞进80GB统一内存,剩下的10-20GB要留给KV缓存、系统和上下文。长对话、大上下文一开,余量会非常紧张。

横向比一圈同价位的“现货”:

机型

统一内存

带宽

大致价格

小米AI Cube(工程版)

80GB

未公布

未公布

NVIDIA DGX Spark

128GB

约273GB/s

涨价后国内3万+,奔着4万

AMD AI Max 395主机

最高128GB

约256GB/s

从1.5万涨到2-2.6万

Mac Studio M3 Ultra

最高512GB

约819GB/s

官网可查,贵但余量大

内存只是一半,另一半是生态。DGX Spark的护城河从来不是参数,是CUDA+vLLM+Ollama整套工具链开箱即用,双机、四机、八机集群都有人蹚通了完整部署。知乎而玄戒这套平台,llama.cpp能不能跑、量化格式支持哪些、社区工具链多久能跟上,目前全是未知数。小红书评论区已经有用户在问“支不支持FP4”——这个问题放到一年前的GB10上,答案都是折腾了很久才有的。小红书

微博也有冷静的声音:DGX Spark、技嘉AI TOP Atom、华硕Ascent GX10这一类大内存迷你主机“都卖了快一年了”,AI Cube不是开创新品类,而是杀进一个已经被验证、也被实测数据照过一遍红利的赛道。微博好处是有作业可抄,坏处是用户的期待值已经被GB10们的实测锚定了——光喊“能跑”不好使了。

四、第三笔账:等小米的成本,正被内存涨价悄悄抬高

第三笔账最容易被忽略:等待本身是有成本的,而且成本在涨。

  • DGX Spark今年2月已经官宣涨价,FE版从3999美元上调到4699美元,涨幅17.5%,国内从3万起步直奔4万。微博

  • 8月22日彭博报道,因为内存芯片成本飙升,英伟达AI服务器明年年初可能还要普涨超过15%。微博

  • AMD AI Max 395主机也从媒体评测时的1.5万上下,涨到了2万甚至2.6万。知乎

整个行业都在为内存买单。这种情况下“等小米”,赌的是两件事。一是小米“价格屠夫”的传统艺能,黑虾那篇分析直接用了这个标题,大家对它的定价预期是明显低于DGX Spark的。知乎二是量产时内存价格别再涨。前者是小米的历史战绩,后者谁也说了不算——工程版到量产,中间隔着的时间正好是内存最贵的周期。

结论:谁别等,谁可以等

把三笔账算完,给不同情况的人一个直接的建议:

现在就要部署干活的,别等。工程版没有价格、没有发售时间,量产节奏不明。知乎跑32B以下模型为主、预算2万上下,AI Max 395主机性价比目前最能打;必须吃CUDA生态、以后想组集群,DGX Spark虽贵但现货即战力;要跑100B+还要留长上下文余量,现阶段唯一余量充足的现货还是大内存版Mac Studio。

可以等的,是这三类:不急用、本来就在小米生态里、预算卡在2万内想买“第一台本地大模型主机”的人。但等的时候别光等,盯三个信号:①官方公布统一内存带宽数字;②真机120B模型的实测tok/s(尤其是首字延迟和长对话稳定性);③最终定价和DGX Spark的差价。这三个数字出来之前,所有的“卧槽”都只是工程机情绪。

最后提醒一句:现场体验过的博主说得很实在——“原型机就是原型机,形态和体验仅供参考”。微博120B本地跑,方向是真的,细节还全在雾里。想入坑的,先收藏这篇,等第一个信号落地我们再来对答案。

内容由AI生成

精选参考来源

1. 见证历史!小米玄戒三芯合体引爆芯片界大地震!黄仁勋看到 AI Cube 眩晕瘫坐,DGX Spark 或将无人问津!| AI日报0824

2. 卧槽!小米今天真的把120B大模型塞进一个小

3. 【小米 AI Cube 工程版迷你主机官宣:玄戒 O3+O100+D100 三芯阵容,150W 持续性能释放】小米在玄戒芯片技术沟通会上正式推出 AI Cube Prototype 迷你主机,搭载玄戒 O3、O100 和 D100 三颗芯片,支持大模型本地部署和 120B 参数模型运行。150W 持续性能释放与航天铝外壳设计彰显硬核实力。#小米AI主机#

4. 小米玄戒芯片技术沟通会还发布了两款原型机。玄戒O100 原型机:为端侧大模型而生的高速 AI 演示终端。采用玄戒O3 与 O100 双芯协同计算,将传统手机影像模块取消、主板全部推翻重制,加入主动风冷散热系统,最高可支持 10 瓦功率的超强散热能力。内置 Xiaomi MiMo 端侧模型,实测可达每秒 295 Tokens 超高推理速度。小米 AI Cube 原型机:外观采用航空铝一体成型机身,33874 个 CNC 精密镂空散热孔,可 150 瓦持续高性能释放;机身内部,将玄戒O3、O100 与 D100 全面融于一身,配备 80GB 超大容量统一内存,部署 120B 大参数量模型与 3B 端侧模型,可进行快慢系统切换。不论前端开发还是复杂编程任务,都可在这台个人 AI 超级计算终端快速、精准执行。玄戒O3 将搭载在小米18 Fold上发布,其他两款芯片将于2027年商用。

5. 小米玄戒 O100 官宣行业首颗 6nm3D 晶圆级堆栈 AI 芯片,有哪些技术亮点?

6. 怎么看小米发布的 Xiaomi AI Cube Prototype 和全新玄戒算力芯片?

7. AMD AI Max 395 与 DGX Spark真的差不多吗?

8. 有人在 1–4 台 DGX Spark 上把 Qwen3.8-27B 跑了 11 种配置,其中一个结论是BF16→FP8 只把 C1 从 4.5 提到 7.9 tok/s,而 NVFP4 在官方 vLLM 上只跑到 9.7,尽管模型体积小得多,原因可能是 BF16 和 FP8 都能吃到理论带宽上限的 90% 左右,但 NVFP4(约 18 GB,理论上限约 15.2 tok/s)实测只有 64%,说明瓶颈已经从显存带宽转移到了 vLLM 在 SM 12.1 上的 NVFP4 kernel 效率。然后投机解码和软件栈对加硬件的价值更大,正如我的GX10用SGlang+Dspark可以跑到单流接近40toks。

9. Deepseek V4 Flash 74 t/s !实测DGX SPARK双机部署:撞墙 6件 + anemll 1:1 复刻

10. B.AI 白嫖大模型教程:DeepSeek-V4-Flash、腾讯混元 Hy3、小米 MiMo-V2.5 限时免费,Chat 与 API 一站式体验

11. 有点期待Xiaomi AI Cube了

12. 没有见识就是这样,什么都“开创新品类”NVIDIA DGX Spark , Gigabyte ai top atom, ASUS Ascent GX10 这些都卖了快一年了。

13. 【4万元!NVIDIA迷你工作站DGX Spark官方大涨价】NVIDIA官方宣布,由于内存供应紧张,迷你AI工作站或者说个人桌面超级计算机DGX Spark,本周起正式涨价,FE官方公版从3999美元上调到4699美元,涨幅达17.5%。国内售价3万元起步,贵的在3.4万元左右。这么一涨就奔着4万元去了……

14. #英伟达AI服务器被曝涨价#下一轮推高AI算力成本的,可能不再是GPU,而是GPU旁边的内存。8月22日,彭博社援引知情人士报道称,部分英伟达大型客户已被告知:由于内存芯片成本飙升,搭载英伟达AI芯片的服务器价格,明年初可能普遍上涨超过15%。据报道,受影响的系统包括采用Vera Rubin和Grace Blackwell芯片的服务器,实际涨幅将根据芯片代际与内存配置而变化。为大型数据中心运营商生产服务器的代工企业,也已开始向客户传达涨价信息。但先划清事实边界:这不是英伟达正式发布的统一涨价通知。路透社表示无法立即独立核实,英伟达也尚未回应。因此,目前能够确认的是“媒体援引知情人士报道”,不能写成所有英伟达芯片或服务器已经全面涨价15%。不过,内存成本上升并非空穴来风。TrendForce预计,2026年第三季度传统DRAM合约价环比上涨13%至18%,NAND闪存上涨10%至15%;AI服务器持续吸收高带宽内存、服务器DRAM和企业级存储产能,使供应商拥有更强的定价权。今年2月,英伟达已经以全球内存供应受限为由,将DGX Spark建议零售价从3999美元上调至4699美元,涨幅约17.5%。这至少说明,内存短缺已经真实影响部分AI硬件的官方定价。为什么一块“配套内存”会如此重要?现代AI系统不仅要进行大量计算,还要不断在芯片之间高速搬运模型参数和上下文数据。GPU再快,如果内存容量和带宽跟不上,也只能等待数据。随着模型和上下文继续扩大,每台服务器需要的高带宽内存、系统内存和存储容量都在上升。内存已经不再是附属零件,而正在成为决定整套AI服务器性能、交付时间和价格的关键资源。AI基础设施正在从“GPU短缺”进入“整机供应链短缺”。未来算力竞争比拼的,不只是能拿到多少加速芯片,还包括谁能提前锁定内存、网络、电力、冷却和服务器交付能力。大型云厂商可以通过长期合同分摊成本,资金有限的创业公司和研究机构则可能面临更高门槛。但服务器涨价也不必然意味着AI调用价格会同比上涨。模型效率、芯片利用率和市场竞争,仍可能抵消部分硬件成本。如果这轮超过15%的涨价最终得到证实,你认为它意味着AI需求依然强劲,还是意味着算力扩张已经开始遭遇成本极限?#热搜AI创作激励大赛## 英伟达##AI服务器##内存涨价##AI算力##人工智能#

15. 价格屠夫小米,杀入大模型本地硬件,小米 AI Cube到底是什么?

16. #小米玄戒#三款芯片发布的同时,也在现场展示了各种 demo 机型以及体验。4WHAT 第一时间体验到基于玄戒 O3 和 O100 打造的原型机。以及在此基础之上加入玄戒 D100,也就是玄戒三芯齐备的小米 AI Cube 个人 AI 超级计算终端。首先必须强调的是,原型机就是原型机,各个设备的形态以及体验都仅供参考,我们还是期待一下首发搭载玄戒 O3 的小米 18 Fold 折叠屏手机,再来做进一步的实机测试以及体验。再就是现场原型机给没有给我们“跑个分”或“打局王者”的机会。只有纯粹的端侧 AI 演示环节,例如在不插卡且没连 Wi-Fi 的情况下,以极快的速度响应。简单点说,就是小爱同学以后在没网的情况下,也能秒回消息。而小米 AI Cube 个人 AI 超级计算终端,也是跟原型机类似的展示环节。例如 2048 这样的游戏,仅需3到5分钟就能给出。简单点的3D游戏,最多5到7分钟就能完成。当然这一切的前提是你能像视频里一样,给出清晰明确的指令。

0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章