38.7对34.3只差一口气,17秒对50秒差出三倍:本地AI整机五条路线这周打成一团,掏钱前先把四笔账算完

源自230位全网作者

08:48

这个国庆假期,"本地AI整机"这个圈子集体炸锅了。

先给你看这几天的时间线:9月29日,有UP主把还没开售的Framework Desktop 192GB版和DGX Spark、三张RTX 5090摆在一起算"每GB内存多少钱",算出一条7050美元的盈亏线。10月1日凌晨,Framework 192GB版正式开启预售。同一天,硬件比价账号甩出"4张RTX 5090对决DGX Spark",结论是同样128GB,光显卡钱就是整机的4倍多。10月2日,海外博主Alex Ziskind放出M5 Ultra Mac Studio(256GB统一内存)对决两台DGX Spark(各128GB)的实测原片,24小时内B站冒出至少三个中文解说版本。还是10月2日,国内UP主"梅加雨"的双Spark部署DeepSeek v4.1视频收获110赞27评论,评论区直接变成大型"为啥我的双机只有40 token"排查现场。哔哩哔哩哔哩哔哩

再加上8月底雷军那条524条评论的小米AICube原型机微博,评论区的估价大战到现在还没完全冷下来——"本地大模型专用整机"这条赛道的路线之争,从来没有像这个星期这么热闹过。微博

这篇不聊"本地部署是什么",默认你已经知道Ollama、量化、显存这些词。我们只聊一件事:如果你正打算在这个假期掏两万到六万块买一台"AI专用机",五条路线怎么选,四笔账怎么算。

一、本周最火对决:两个数字"不能比",但都很重要

Alex Ziskind这条实测,最值得玩味的是两个数字。

第一个数字:生成速度38.7对34.3。这是两边"写得多快"的成绩,原片自己的说法是——“This is the closest these two are gonna get for the rest of the video”(这是全片两者最接近的一刻)。也就是说,纯吐字速度上,256GB的Mac Studio和两台组集群的DGX Spark基本打平。哔哩哔哩

第二个数字:17秒对50秒。测试场景是约32k token的输入加300 token的输出,模拟"把一个大代码库丢进去问问题"。双DGX Spark 17秒跑完,M5 Ultra用了50秒,差出接近三倍。

原片给的结论很直白:“So big inputs favor the Spark. Big output favors the Mac.”——大输入Spark占优,大输出Mac占优。还有一句更狠的:“Really, the Mac is a machine for one person, maybe two.”——Mac是一个人的机器,最多两个人。哔哩哔哩

B站UP主"锋奈徳"做图解版时特意标注了口径:这组17秒对50秒来自约32k输入、300输出的演示,不能当作纯预填充时间,也不能当通用跑分看。这个提醒是对的,单条实测说明不了所有场景。哔哩哔哩

但方向性的东西值得划重点:本地AI整机的分水岭,已经从"写得多快"变成"读得多快"。两年前大家跑本地模型是聊天,输出几百字,生成速度就是全部体验;现在大家跑的是Agent任务、整库代码问答、百页文档总结——全是"大输入、小输出"的活。这正好踩在统一内存大Mac的短板上,也正好是Spark靠张量并行最能打的地方。

所以别再拿"xx t/s"当唯一指标买机器了,先想想你每天喂给模型的东西有多长。

38.7对34.3只差一口气,17秒对50秒差出三倍:本地AI整机五条路线这周打成一团,掏钱前先把四笔账算完

二、四笔账:买任何一条路线前,都得过一遍

第一笔:容量账——装得下是0和1的问题

大模型本地跑,第一道坎不是快慢,是"装不装得下"。这里有个现成的案例:DeepSeek V4 Flash的Q8版本,媒体口径约162GB。这个数字意味着什么?三张RTX 5090加起来96GB显存,装不下;一台128GB的DGX Spark,理论上装得下但要给KV缓存留余量;256GB的M5 Ultra Mac Studio和192GB的Framework Desktop新版,才是从容的。哔哩哔哩

注意"一整块"和"拼起来"的区别:Mac和Spark的统一内存是一整块,模型多大都能整只吞下;多张显卡的显存是切开的,跨卡切分既有工程门槛也有速度损耗。容量账上,统一内存路线天然占便宜。

第二笔:带宽账——装得下不等于跑得快

这笔账最容易被"192GB!256GB!"的大数字糊弄过去。

DGX Spark和Framework Desktop 192GB版的内存带宽都是273GB/s;RTX 5090单卡是1792GB/s,6.56倍。吐字速度的上限基本由带宽决定——有UP主按70B八位量化稠密模型估算,273GB/s的机器每秒上限约3.9个token,三张5090约76.8个token,差一个数量级。

那多卡拼带宽行不行?难。NVIDIA规格页上RTX 5090的NVLink一栏写的是"No",卡和卡之间只能走PCIe。PCIe 5.0满速x16单向约64GB/s——从隔壁卡上拿数据,比读自己显存慢约28倍。这就是为什么"4张5090"不等于"4倍速度",也是为什么Framework新版容量加了50%、带宽只比现款多6.6%时,那期比价视频给出的判断是:它替代的是"装不下",不是多卡的速度。哔哩哔哩

第三笔:每GB价格账——同样128GB,差价4.26倍

这是本周两条"硬件AI日报"视频算得最细的部分,我把关键数字搬过来(均为9月到10月初口径,美元):

  • DGX Spark:今年2月从3999涨到4699美元,128GB统一内存,合每GB约36.7美元;

  • RTX 5090:首发价1999美元/张,但9月比价网站的最低全新挂牌已到4999.99美元,比首发价高150%;4张凑128GB,合每GB约156美元——光显卡就是Spark的4.26倍,主板电源机箱还没算。哔哩哔哩

  • Framework Desktop 192GB:官方还没标价,媒体猜价从4500美元到8000美元不等,两个数差1.78倍。那位UP主反推的盈亏线是:低于约7050美元,每GB才比Spark便宜;

  • 国内渠道:小红书上DGX Spark(128G+4T)的现货报价在3万元人民币出头,还有渠道商在传"厂家封仓",价格波动不小。小红书小红书

一句话总结这笔账:在9月的显卡行情下,"自己拼多卡更省钱"这个直觉已经不成立了。

38.7对34.3只差一口气,17秒对50秒差出三倍:本地AI整机五条路线这周打成一团,掏钱前先把四笔账算完

第四笔:人数与场景账——这台机器给几个人用

Alex Ziskind原片的第三个章节专门对比了八用户总吞吐和首字等待:单人用,Mac很够;小团队并发,Spark集群和GPU阵列的吞吐才拉得开。哔哩哔哩

还有一笔很多人漏算的账:电。单张RTX 5090标称575W,四张就是2300W,是DGX Spark整机电源240W的9.6倍——这还没算CPU和散热。办公室电路扛不扛得住、家里电表转不转得动、夏天空调费谁出,都是真实成本。Spark和Mac这类整机塞在书架上就能用,四卡塔式机得有专门的地方伺候。哔哩哔哩

三、五条路线,各适合谁

路线一:Mac大内存派(M5 Ultra Mac Studio,96/256/512GB)。适合一个人用、输出型任务为主、要求开箱即用不折腾的。生态是真好——B站上M5 Max 64GB跑Qwen3.8-27B的体验视频能有46条评论,玩客笔记拿老款M2 Ultra 64GB配oMLX框架,单人单请求70 TPS、四路并发冲到240 TPS,老设备也没掉队。短板前面说了:大输入场景的完整请求时间明显吃亏,而且内存是焊死的,买的时候一步到位,256GB和512GB的差价就是"装得下162GB模型"和"装不下"的区别。哔哩哔哩哔哩哔哩

路线二:DGX Spark派(单台或双机集群)。适合要跑128GB级单个大模型、输入型任务多、对功耗噪音敏感的。单机3万元人民币出头的渠道价,在五条路线里是"容量/价格比"最省心的。但双机集群别想得太美:那条110赞的DeepSeek v4.1部署视频,UP主说"双机速度经过优化已经很可用,我99%的活都丢给它了",评论区马上有人回"为啥我双机就只有40的散文(token)"、“我部署的4.0才50几的单流decode”。同一套硬件,优化水平不同,体验能差出一截——这条路对你动手能力有要求。哔哩哔哩

38.7对34.3只差一口气,17秒对50秒差出三倍:本地AI整机五条路线这周打成一团,掏钱前先把四笔账算完

路线三:自组多卡派(双3090、4090D 48G魔改、双2080Ti 22G魔改等)。适合预算敏感、愿意折腾、主要跑27B-48GB级模型的。知乎上一个14.5万浏览的"预算5万配家用AI服务器"问题下,高赞回答给了很实在的口径:27B想在本地当生产力而不是玩具,精度要q6起步、显存要48GB、速度要60 token/s以上,否则Agent多轮任务分分钟爆上下文。方案上,双2080Ti 22G魔改约5000元是穷玩之选,双3090约2万但有矿卡风险,4090D 48G魔改单卡2.6万。这条路的容量每GB最便宜,但你要自己扛调试、驱动、散热和翻车风险,而且前面说过,多卡带宽拼不过单块统一内存。知乎

路线四:新统一内存迷你主机派(Framework Desktop 192GB、各类Ryzen AI Max机器)。本周刚开预售,是标准的"观望中的变量"。192GB统一内存+273GB/s带宽,纸面上"容量比Spark大、价格可能更低",但带宽决定了它的吐字速度上限和Spark一个量级。买不买,就看最终定价落在7050美元盈亏线的哪一边——落在下面,它就是容量党的新甜点;落在上面,不如直接买Spark。哔哩哔哩

路线五:等等党(小米AICube及同类)。雷军8月底晒的原型机:玄戒O3+O100+D100三芯片,120B+3B双模型快慢切换,航天铝机身镂空33874个蜂窝散热孔。评论区最热闹的其实是估价:“6999起步”“12999以上”“至少3万”,各种猜测都有,还有一条221赞的"本地部署就是不要钱的无限token"和一条138赞的反驳"你要这么说的话,其实各家的大模型对你也没太大用处"。按数码闲聊站的说法,O100这代芯片"明年终量产后大规模运用",他晒的原型机现场跑端侧模型,屏幕上3B小模型TTFT 0.54秒、生成速度280.6 token/s——小模型的成绩不代表120B的表现,但这个端侧起点已经相当能打。等它的风险很明确:这个假期你没机器玩,而且首发价、软件生态、模型适配全是未知数;等的价值也明确:小米定价从来不讲武德,如果真落在万元级,上面四条路线的账全得重算。微博微博

38.7对34.3只差一口气,17秒对50秒差出三倍:本地AI整机五条路线这周打成一团,掏钱前先把四笔账算完

四、下单前的三盆冷水

第一盆:"有这么钱,干嘛不直接用云端?"这话难听但在理。知乎上有个"个人玩AI部署开源模型,性价比最高的是不是租GPU云服务器"的回答把账算得很清楚:偶尔玩、项目制、模型需求经常变的,租——市面上3090 24GB约699元/月、4090 24GB约999元/月,用几百块的月租先试错,比一次性砸几万块买硬件理性得多;只有每天高负载、准备连续跑一两年的,买才划算。判断标准就一条:你的GPU利用率有多高。知乎

第二盆:实测数字因人而异,别拿别人的成绩当自己的预期。本周评论区最常见的冲突就是"UP主双机很可用,我双机只有40 token"。推理框架、量化档位、上下文配置、张量并行方案,每一项都能让同一台机器的成绩差出一大截。看任何实测,先看口径,再想自己的动手能力配不配得上这个口径。

第三盆:这轮所有价格都在动。5090现货比首发价高150%还在涨,Spark官方已经涨过一轮价,Framework定价没出,国内渠道"封仓"传闻和低价现货齐飞,小米AICube连影子价都没有。本文所有账目都是2026年9月底到10月初的口径,你下单那天的价格,以当天为准。

五、最后:先看自己的活,再看机器

Alex Ziskind在实测结尾说了句大实话:“Look at your own work. How big are your prompts? How long are your answers?”——看看你自己的活:你的提示词有多长,你要的回答有多长。哔哩哔哩

落到操作就三个问题:

  1. 你要跑的最大模型和精度是多少?——定容量下限(比如DeepSeek V4 Flash Q8就要奔着162GB以上去);

  2. 你的日常任务是大输入还是大输出?——大输入(Agent、代码库、长文档)优先看Spark系和GPU阵列,大输出(写作、对话)Mac不亏;

  3. 这台机器给几个人用?——一个人,别为并发付钱;一个团队,别买"一个人的机器"。

三个问题答完,五条路线基本就剩一两条了。

如果你还不着急下单,接下来值得盯的信号有四个:Framework 192GB的实际预售价对7050美元盈亏线的位置;RTX 5090现货价会不会从150%的溢价上回落;小米AICube的量产时间表和定价;以及双Spark社区的优化方案(TensorFold、sglang这些)能不能把单流速度稳定推过100 token——最后这个,直接决定"双机集群"这条路的性价比成色。哔哩哔哩

机器永远买不完,账要算在自己头上。

内容由AI生成

精选参考来源

1. 光显卡贵4.26倍!4张RTX 5090对DGX Spark:比价网站$4,999.99一张、每GB $156.25对$36.71,不划算!|硬件AI日报

2. 双dgx spark部署deepseek v4.1

3. 我们设计了一款小米AICube原型机,桌面AI高算力终端,搭载O3、O100和D100三颗芯片,完成大模型本地计算。部署了120B和3B双大模型,支持快慢系统切换,计算速度非常快。外观采用航天铝一体成型设计,通过CNC精密镂空了超过33874个蜂窝散热孔。三款芯片已完成全部设计和验证。玄戒O3在小米18F...全文

4. 【中英字幕】M5Ultravs双DGXSpark:被忽略的那个数字

5. M5 Ultra vs 双 DGX Spark:50秒与17秒,别只看生成速度

6. 192GB对96GB!Framework 192GB每GB账:DGX Spark合$36.7、3张5090合$62.5,低于约$7,050才划算!|硬件AI日报

7. DGX Spark 大量现货(价格很美丽3xxxx!!!)

8. DGX Spark GB10厂家封仓?现在还有低价现货

9. M5maxMacStudio64GB统一内存QWEN3.8-27b使用体验

10. 【实测】MacStudio彻底榨干!Qwen3.827B四并发狂飙240TPS?oMLX本地极限部署

11. 想在家部署AI服务器,希望可以跑中等大小模型(32b),预算5万左右,想知道怎么配置硬件?

12. 小米阔折叠的超前瞻,玄戒O3+玄戒O100原型机,加了风扇,可以感受一下这个阔形态比例。另外O1001.4μmHybridBonding,1.22TB/s带宽,现场跑本地大模型速度已起飞,听说明年量产后会大规模多产品线运用

13. 对个人而言,玩ai部署开源模型,性价比最高的是不是租GPU云服务器?

14. dgxsparkTP4sglangdeepseekv4.1flash

0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章