“三万块小金砖”的机主,刚补了一堂刷机老规矩:内核要回退、假砖先grub、交换机没货——先对版本表,再分四条路线,最后算三本账

源自422位全网作者

01:55

先把这事的坐标说清楚

9月11日,林亦LYi那条《什么叫去酒吧蹭Token??》把"两台DGX Spark本地部署"玩出了圈:没几天冲到54万播放、1.8万赞、近7000收藏。而"这玩意儿我都觉得复杂,普通用户能玩的转?",也成了这类AI迷你主机丢给玩机圈的第一个问题。哔哩哔哩小红书

真正动手买的人,撞上的却是另一幅画面。9月13日,B站UP主"银灵的收藏库"发了条只有一分多钟的视频:《新内核让DGX Spark四机环网TP4性能腰斩——记得从7.0回退6.17内核》,底下三条评论句句是刷机老规矩的口吻——“生产业务就是能跑就别动,尤其不要瞎升级”“我第一时间禁用了更新”,还有人贴出英伟达开发者论坛的回归反馈帖,帖子标题写的就是kernel 7.0.0-1019-nvidia导致NCCL问题。哔哩哔哩

也就是说,这轮刷机的主角已经不是手机,而是GB10这一批"AI迷你主机":英伟达官方的DGX Spark(机圈外号"小金砖"),和一堆同芯片机型(华硕GX10等,闲鱼和渠道价已经打到7899元档)。老刷机党的全套方法论——版本表、路线表、砖与假砖、成本账——一台不少地在这台两三万块的"小超算"上重演。而这次冲进来的人,很多已经十年没碰过刷机了。

“三万块小金砖”的机主,刚补了一堂刷机老规矩:内核要回退、假砖先grub、交换机没货——先对版本表,再分四条路线,最后算三本账

第一张表:9月这台"小金砖"上有几道版本闸

版本闸

状态

一句话结论

DGX OS内核

7.0.0-1019与NCCL冲突,四机TP4性能腰斩

已跑稳的直接回退6.17,禁用自动更新

NVIDIA Sync/集群助手

6月推送,9月中旬被机主集中复盘

支持最多3台Spark零交换机直连,NCCL 2.30u1带环形拓扑

NVIDIA Pair

9月初开源

官方终于下场做家庭异构组网路由,解决"2台以上文档空白"

Windows ARM

部分硬件驱动缺位

卖家原话:只能等RTX Spark正式发布

模型权重

DeepSeek-V4主干0731→0831上多模态;V4.1约552B主干+196B Engram≈748B

权重500GB上下,128GB单台装不下,4台是入场门槛

两个细节值得展开:

一是"能跑就别动"第一次在3万块的设备上变成钱。回退6.17的帖子下,机主晒的是"第一时间禁用了更新";而9月1日小红书那条《DGX Spark刷机救砖》里,机主给四台机器推官方更新,光升级就耗了一整天,中途一台变砖、一台网络拉胯。评论区反而比正文冷静:“我昨天也是同样问题,进grub修复就行”“能进BIOS怎么能称为砖”“重装一下系统就好了”——外加一句扎心的"你买之前都不做功课的呀"。小红书

“三万块小金砖”的机主,刚补了一堂刷机老规矩:内核要回退、假砖先grub、交换机没货——先对版本表,再分四条路线,最后算三本账

二是官方文档的边界。做8台集群、凑出1TB显存的UP主"程序员分享人生"说过一句大实话:当你需要超过2台DGX Spark的算力时,官方文档一片空白,只能自己来。现在3台直连有了Sync集群助手兜底——6月的这轮软件更新里,零交换机组网支持最多3台DGXSpark直连。但3台以上,依旧靠社区方案。哔哩哔哩哔哩哔哩

第二张表:从1台到8台,现在实际在跑的是四条路线

路线一:单台,当"体验票"。 单台128GB能跑什么,知乎UP主黎子yy用一台真机给出了完整实测记录:Nemotron跑到约77 tok/s,Gemma4只有2.8 tok/s。B站也有"跑27B只有8 token"的吐槽。它适合跑编程Agent、量化小模型和微调练习——guoyong zhou用本地"小金砖"生成440条数据集,前后花了四个半小时,平均每分钟1.63条。指望单台当生产力,大概率失望。知乎哔哩哔哩知乎

路线二:两台起步,直连环网。 这是目前社区公认的"甜点":救砖帖评论区里有机主报数"已经弄好了,接近80 tokens/s,但是这玩意儿确实不适合新手"。旁边还有一句旁观视角的承认:“两台79 tokens/s很强了”。"困梦的杂物间"9月2日实测TP2对TP4:解码速度提升约45%(80→120Token/s)、预填充和首字延迟提升两三成。模型配方抄现成的:DeepSeek-V4-Flash、GLM5.3-Flash、Qwen3.8-Flash,MiaAI_Lab和tech2wild都有recipe。小红书哔哩哔哩

路线三:四台,绕不开交换机或环网。 小米的屈恒5月就晒过自己的周末工程:4台Spark加一台MikroTik CRS812,跑MiMo-V2.5(310B参数/1M上下文),24并发稳在200 tok/s。但那是5月,到了9月,TP4实测视频的评论区里,一条热评说,就算要买,这个交换机现在全新的根本就没货。于是"路紫大佬"的无交换机TP4环形总线方案(GitHub上挂着的那份LuZ方案)成了平替。顺带一提,9月13日那条"性能腰斩"视频翻车翻的就是这条环网路线:环网对NCCL最敏感,所以内核7.0第一刀砍的就是它。微博哔哩哔哩哔哩哔哩

“三万块小金砖”的机主,刚补了一堂刷机老规矩:内核要回退、假砖先grub、交换机没货——先对版本表,再分四条路线,最后算三本账

路线四:8台及以上和异构,DIY深水区。 MagicBear用8台华硕GX10凑出1024GB分布式统一内存,跑748B的DeepSeek-V4.1-Flash,这条实测冲到了1.2万播放。Azure则更早试过"Mac Studio M3 Ultra+两台Spark"走10GbE异构跑512GB级模型。金猪升级包点破了这类方案的本质:这轮国产Flash模型是"超大规模+超低激活",对内存容量的需求远大于内存带宽的需求,GB10这种Super UMA正好对口。只是单台128GB不够,所以才有了一排一排的小集群。哔哩哔哩微博

最后看砖:刷机党的老三样,一台都没少

说回那条救砖帖。刷机党看到这段应该眼熟:这就是当年刷官方新ROM变砖、论坛教你线刷救砖的复刻版,只是对象从手机变成了集群。区别在于新玩家不熟悉老规矩:升级前先关自动更新;出问题先分清"假砖"还是"真砖",能进BIOS的,先试grub修复,别急着喊砖。模型下载也别硬啃Hugging Face——评论区实测"换了魔搭,至少速度快了很多",走对镜像站这一步,能省掉帖子里那一整天。小红书

“三万块小金砖”的机主,刚补了一堂刷机老规矩:内核要回退、假砖先grub、交换机没货——先对版本表,再分四条路线,最后算三本账

三本账:动手前该算的,刷机党早就在算

第一本,钱。 这台设备上市后的行情和手机完全反着来:不降反涨。知乎那条12万播放的提问下,机主何表报的数是"DGXSPARK还是3W+,涨是涨了点,但是按比例很低",顺带补了一刀"6000PRO从7万涨到18万了"。guoyong zhou写《DGXSpark涨了20%,我为什么一点也不后悔?》,海上钢琴师干脆叫它"又一个理财产品"。参照系也给出来了:同一个机主晒的9月报价——RTX Pro5000 72G约6.5万、Mac Studio M5 Ultra 256G约8.5万、两台Spark约7万。另一头是7899元的"GB10迷你主机"渠道池——带专票、报UP主名可减500,商家也承认"商品价格波动较大"。同一个芯,7899到7万,中间隔着官方互联软件、保修和翻车时的底气。知乎微博哔哩哔哩

第二本,时间。 这是老刷机党最熟悉、新玩家最容易低估的一项:升级排队一天、一台"变砖"进grub、环网方案"快被TP4折磨死了,当然主要是最近工作太忙了,到家11点了"。TP4实测视频280条评论里,一条热评说,本来以为是技术,后来发现是金钱。对多数人来说,更准的说法是:是时间。哔哩哔哩

第三本,带宽。 物理墙就一道:四台的算力核心并肩一张5090,还是快不了——瓶颈在内存带宽。黎子yy的实测把它写得很直白:Spark的内存带宽273GB/s是硬瓶颈。下面这张四款迷你主机的横比表里,苹果M4 Max的带宽是它的两倍——这就是差距。机主的对策是把8192上下文改到2560,并发和KV翻倍也"没有任何影响"。与其叫"算力堆叠",不如叫"容量换门票":先用N多台的128GB凑出模型能装下的容量,再接受它不快。哔哩哔哩知乎

“三万块小金砖”的机主,刚补了一堂刷机老规矩:内核要回退、假砖先grub、交换机没货——先对版本表,再分四条路线,最后算三本账

谁上车、谁等、信号看哪里

  • 已经在用的:内核锁6.17、禁用自动更新;模型下载早换魔搭(ModelScope),别硬啃HF;砖先别喊砖,能进BIOS先试grub。

  • 准备入坑的:想清楚是路线一还是路线二。两台起步有官方环网兜底,单台是玩具,四台先问交换机有没有货。

  • 纯观望的:盯四个信号。英伟达论坛那条kernel 7.0回归帖什么时候修复。Windows ARM的坑还大着——部分硬件驱动缺位,卖家的判断是"预计只能等RTX Spark正式发布"。下一代来不来,评论区已经在吵,明年可能没有下一代了,60系显卡都遥遥无期了。最后一个是DeepSeek-V4.1的官方分片方案:“主干模型以官方精度常驻四台Spark,196B Engram保持FP8并分片”,这套跑法什么时候写进正式文档。哔哩哔哩哔哩哔哩知乎

刷机的乐趣这二十年没变过:查版本、分路线、算成本。变的是设备从999块的山寨机变成3万块的"小金砖",以及当年翻砖了论坛里捞人,现在捞人的还是论坛——只不过帖子标题从"救砖教程"换成了"回退内核"。

内容由AI生成

精选参考来源

1. 什么叫去酒吧蹭Token??

2. DGX Spark 刷机救砖…但是这个网络速度,救命

3. 新内核让DGX Spark四机环网TP4性能腰斩——记得从7.0回退6.17内核

4. 疯狂!8台DGXSpark组成1TB显存集群,NVIDIA都不敢公开的秘密

5. 省下一台交换机!英伟达DGXSpark支持三机直连组网,NCCL环形拓扑升级速览

6. DGX Spark实测:双模型部署全记录

7. dgspark跑27b只有8token?跑本地化还得用服务器!

8. 2.10 入手DGXSpark,先别急着微调大模型,我给你算算账

9. 【实测】DGXspark TP2对比TP4部署DeepSeek

10. 周末组了套小集群:4台DGXSpark+一台MikroTik CRS812

11. 8台华硕GX10跑7480亿参数DeepSeekV4.1!本地实测对比RTX PRO6000

12. 国产Flash模型与Super UMA设备分析

13. 我朋友买了两台NVIDIA DGX SPARK 4TB个人超级计算机,这玩意能干什么很酷的事情么?

14. 本地AI设备报价对比

15. 你的DGX SPARK 安装Windows ARM版了吗?

16. 500GB的DeepSeek-V4.1-Flash,四台DGXSpark真的没法跑吗?

17. NVIDIA DGX Spark评测:首款PC太酷了(正文设备图来源)

0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章