官方"三台直连"落地了,第四台 Spark 还要不要抢交换机:环网星型实测、拆口陷阱和一份可抄的 PFC 作业
如果你 8 月问过"四台 DGX Spark 怎么拼",答案大概率是:整一台 MikroTik CRS812。9 月 15 日,这个问题被官方改写了——NVIDIA Sync 在 6 月那次软件更新里悄悄加了"集群助手":零交换机组网,最多 3 台 Spark 直连,NCCL 2.30u1 直接给了三机环形拓扑支持。哔哩哔哩
也就是说:三台以内的纠结结束了,四台才刚开始。而恰好是把 CRS812 群聊、二手挂单和"算力刚需"话术全带起来的那一段。
这篇就说给你:手里有 2-4 台 Spark、在二手市场搜过 CRS812、懂 TP 和 NCCL 但没摸过 400G 交换机的人。不算"Spark 值不值得买",也不教 ROS 入门,只算三笔账:第三台到第四台之间发生了什么、环网和星型的差距到底在哪、以及那台交换机的钱怎么花才不冤。
一、第四台是分水岭:先算内存,才轮到网络
MiaAI-Lab 把 DeepSeek-V4.1-Flash 塞进 Spark 集群的那组数据,是最好的路标:整个 checkpoint 约 476GiB,其中约 189GiB 的 Engram n-gram 表放 NVMe,剩下约 305GiB 权重分进统一内存。 Spark 实际可用的统一内存约 121.7GiB——所以两台每台要背 145GiB,装不下;三台每台 101GiB 左右,勉强(评论区原话:“3 台只有 200k 的可靠上下文”,且只有 4bit 量化方案);四台每台约 77GiB,才叫坐得下。小红书
TP=4 还刚好把这个模型的整除问题解了:64 个 attention heads、8 个 group,TP=3 除不尽要做 padding,白白多算;TP=4 就是 16 和 2。小红书

性能对得上:项目公开数据显示 3 台单流约 37.9 tok/s、4 路并发总吞吐约 78.6 tok/s;后面有人实际跑了 4 台,单流到了 60 tok/s,4 路并发总吞吐到了 138.1 tok/s——机器只多三分之一,提升不止三分之一。 9 月 21 日最新的实测里,4 台跑 GLM-5.3-Int4-Int8Mix,在保持 256K 超长上下文的同时做到接近实时的交互体验,配新版 DSpark 草稿模型(k=7)生成约 52 token/s、首字 858ms。小红书小红书

但注意:第四台的增益来自内存和并行结构,跟交换机一分钱关系没有。三台可以三角形手拉手,到四台就只剩两条路——要么四机环网,要么上交换机做星型。网络问题从这一刻才开始花钱。
二、环网 vs CRS812 星型:吞吐打平,抖动差一个数量级
9 月 4 日,有玩家把两条路各测了一轮:同镜像、同权重、同测法,四台 Spark 拼 320B 推理集群,200G 内网先环网后 CRS812 星型,连续两天对拍。结果:
预填充吞吐打平:128K 冷启动都是约 2077 tok/s,四档差距 ±2% 以内。小红书
解码稳定性差一个量级:短文本抖动 213ms → 31ms,2K 短对话输出快 71%。小红书
作者自己的定调很克制(“我的测试也许片面”),但读法其实清楚:如果你的负载是长文档解析、RAG 批处理这种吃预填充的活,环网不亏;如果拿集群当 Agent 后端、多轮对话、高频小请求,星型抹平的就是体感本身——他测完直接把交换机方案转正了。 值不值?这笔账跟"交互多还是批处理多"挂钩,不跟参数表挂钩。小红书
三、带宽真相:Spark 的瓶颈排不到交换机
评论区早就有人点破:100G 就够了,因为 PCIe 是 gen5x4,最高也就不到 120Gbps,200G 也用不到。 更狠的是 8 月初那位玩家的双轨方案:把 CRS812 的 400G 口拆成 4×100G,一个口喂 4 台 Spark,双 rail 凑出 8 节点 TP=8 跑 GLM-5.2 753B——实测累计 1.66TB/1.49TB 流量下,PFC pause 和 NAK 计数全程为 0。 拆出来的 100G 都没跑满,原始 200G 口更是没到过上限。小红书小红书
首测作者(7 月 31 日)同样实测过:把两根 qsfp56-200G 单根线换成 2×100G DAC 后,协商速率掉档、收发从 100Gbps 变成 50Gbps。 但 vLLM 推理时 RDMA+TCP 四台合计上限他才摸到 150G、平均每台 45G,所以他的结论是"100G 在多数时候都是够用的"。小红书

不过三个坑要记着:一是拆口换线是协商速率的游戏,买错 DAC 类型连 100G 都谈不出来;二是"在一台机器上插两根线,每个端口就降到 100"——双线上联碰上拆口逻辑,速率直接腰斩(实测贴评论区的"鬼故事");三是留个活口:首测作者自己说了,将来 NCCL 利用率上来,这套"够用了"可能过期。
四、真要上 812,先把三件事做完
1)抄作业:主机侧无损网络的配置模板已经有人开源了。 trust dscp、DSCP 24 → priority 3、PFC priority 3 打开、NCCL_IB_TRAFFIC_CLASS=24(打 DSCP 24 命中 lossless 队列)、NCCL_IB_HCA 显式声明双轨。DCQCN 则被这位作者主动全关:ROCE_CC_PRIO_MASK 置 0——交换机没配 ECN 标记,单边开 DCQCN 等于给自己加不确定变量,纯 PFC 保无损就够。 这是 CRS812 组网帖子里少见的一份"可以直接抄"的参数,比多数人拿大模型现场问强得多。小红书

2)算成本:货比机器难。 华为、中兴、浪潮的 400G 价格吓死人,千元档能拿到 400G 的只有拉脱维亚这家——这是 MikroTik 在 AI 圈当"穷人版 Cisco"的基本盘。 但现实是:国内渠道一度没货,8 月底有老板写到自己飞过去从代理手里拿走最后一台 812;这两周站内挂出的二手 CRS812/CRS804 明显变密,全新原包装都有,卖家的话术已经跟上"算力机房刚需"。 行货保修、序列号、L6 授权的事我们上篇"三笔账"里算过,不再重复;这里只补一句:越是行情往上走的时候,越先查货源再谈价。小红书小红书
3)它是台 RouterOS 设备,按 ROS 的规矩来。 1U 金属壳 + 暴力扇,"这个交换机噪音不大吗?"是实测贴下真有人问的问题,办公室党先想好上架位置。 也有玩家拿 3D 打印支架配风冷,群里的说法是跑起来大部分 70 度左右、不加也没影响——Spark 本来就靠机身散热。 四核 2GHz + 4GB 内存做纯二层大材小用,但别忘了这个 9 月 RouterOS 是什么舆论环境:WebFig 和 SSH 的补丁还在追,官方排查建议里就有"暂无法升级时将 SSH、WWW 限入可信网段"这一条——刚上手的集群别顺手把它暴露到公网,也别在跑稳定性观察期内追新固件。这一条,是给每个从 AI 圈子闯进 ROS 的人准备的。小红书小红书知乎

五、三种人和一个观察清单
三台以内、刚上车: 直接吃官方 Sync 三角互联,交换机的钱省下来。但记住官方支持的边界是"直连 3 台、配合交换机最多 4 台",别把它当成"组 8 台也不用买交换机"的许可证。哔哩哔哩
四台、做交互/Agent/团队共用: CRS812 星型是实测高一档的方案,还能留双轨和 8-12 台的扩展余量;换到手的是约 71% 的短对话提速和 213ms→31ms 的抖动收敛,实测玩家那句"值不值得花1.5万左右上交换机",在交互负载下有了答案。小红书
四台、只做批处理、预算紧: 先环网,吞吐打平那部分白捡,等价格冷静了再转正。
继续盯四个信号:NVIDIA Sync 什么时候放开 4 台以上的官方组网;NCCL 利用率会不会真把 100G 吃穿;CRS812 二手价格这条曲线(这波是不是又一场"等等党"的胜利);以及 MiaAI-Lab 9 月 21 日整理的转向——机器越多的人,越不把所有机器并起来跑一个模型,而是让 GLM-5.3 做调度、Qwen3.8 做 worker,机器更多再加 DeepSeek-V4 跑安全扫描。 分工路线一旦成主流,网络需求就从"一条 400G"变成"多段互相隔离的流量"——到那时,RouterOS 真正的主场才刚开场。小红书