3张卡是残废、4张卡白买?GLM-5.3-Flash开源这几天,多卡切分的旧规矩全被重新验算了一遍

源自38位全网作者

05:37

两条流传最广的"多卡常识",一条都对得不彻底

8月26日,智谱GLM-5.3-Flash(320B总参/18B激活的MoE,MIT协议首日开源)和阿里Qwen3.8-Flash-Next同日发布。知乎发布前,智谱用匿名ID"ox-alpha"压测,6天内冲上OpenRouter最热模型(23.2T token,2.3倍于第二名),且全部流量跑在中国AI芯片上。知乎这四天里社区里冒出来的追问不是"能不能跑",而是一堆多卡拆法问题:我手里3张3090,vLLM到底能不能用?llama.cpp层切分是不是"只能凑合跑"?4张卡是不是反而不如3张?

3张卡是残废、4张卡白买?GLM-5.3-Flash开源这几天,多卡切分的旧规矩全被重新验算了一遍

社区里同时流传着两句话:“3卡跑不了vLLM,只能跑llama.cpp”,以及"3卡通信损失还能接受,4卡就不行了,除非有高速互联"。大方向都对,但魔鬼全在细节里——而这两个周末恰恰出现了足够多的实测数据,把这两句话重新验算了一遍。

规则一:vLLM没有封杀3卡,封杀你的是"整除"

很多人以为vLLM硬性规定张量并行(TP)只能1/2/4/8卡。实际约束只有一条:Attention Head数量和KV Head数量必须能被TP size整除。问题在于,主流模型的头数几乎都是2的幂——64、32这种数字除以3除不尽,`–tensor-parallel-size 3`直接抛ValueError,6卡同理。知乎于是"整除约束"在实践中退化成了"2的幂专属"。

换句话说:不是框架歧视3卡,是模型设计者的习惯歧视3卡。哪天遇到头数能被3整除的模型,vLLM跑3卡毫无障碍。对入门阶段还在挑卡的人来说,这条规则决定了你买卡前该看的第一个参数不是显存,是你想跑的模型有多少个head。

规则二:llama.cpp能吃3卡,不是因为"通信损失小",是因为它换了切法

llama.cpp默认走Layer Split:按层切,第1-20层在卡A,21-40层在卡B,串行流水。层与层之间只传一次激活值,通信量小到可以忽略——所以3卡、5卡、7卡都行,没有任何整除要求。知乎

这里要纠正流传最广的误解:“4卡通信量会上悬崖”。错。按层切分时,4卡和3卡的通信量几乎一样低,仍然只在层边界传激活值;6卡、8卡也一样没问题,唯一瓶颈是显存够不够分。知乎真正的悬崖从来不在卡数上,而在你选的切分方式上——TP是每层同步两次All-Reduce,layer split是整层交接一次,两者根本不在一个量级。

规则三:TP的代价被量化了——2卡理想2倍,实测1.4倍

纯.NET推理引擎TensorSharp恰好把两条路线都实现了,成了最直接的对照实验。它官方基准里有一组很扎心的数字:张量并行下,理想情况2卡该有2倍吞吐,实际只有1.4倍左右——消失的0.6倍就是All-Reduce通信和同步开销。它甚至支持跨机TP走普通TCP,没有CUDA P2P时自动回退主机内存中转:工程上能跑,性能要靠NVLink级别的互联来救。知乎

这也解释了为什么教程界早就把TP划给了"NVLink单机多卡":每层两次高频通信,PCIe机器上根本吃不消。知乎这正好接上上一篇"算力涨7.2倍、互联只涨3倍"的账:互联墙不是未来问题,是你今天插第二张卡时就已经付的税。所以"除非高速互联"这个判断是对的,只是门槛来得比民间说法早——不是4卡才需要,2卡TP就已经明显受益(或受损)。

MoE和线性注意力改写了什么:这三天最硬的三组实测

第一个案例:3张RTX PRO 6000(96GB)跑744B参数的GLM-5.2 MoE,layer split加上把92%专家权重offload到内存,prefill 2048 tokens跑出918.9 tok/s,反超llama.cpp的763.1 tok/s。知乎"3卡、PCIe时代"的老常识认为这不该跑得动——但层切分下卡数本来就不是变量。代价也写得诚实:同样这台机器开CPU MoE offload后,pp2048从915.9掉到94.7 tok/s,"能跑"和"跑得快"是两个预算。知乎

第二个案例:GLM-5.3-Flash在TensorSharp上(2×RTX PRO 6000、层切分、同机同权重背靠背对llama.cpp)decode跑出73.5 vs 36.6 tok/s,整整2倍;prefill互有胜负基本持平。知乎

这组数字自洽:GLM-5.3-Flash的45层主干里34层用KDA线性注意力、11层用NoPE MLA+稀疏注意力,KV缓存较GLM-5.3降了约4.4倍——decode是KV带宽瓶颈,prefill是算力瓶颈,所以decode翻倍、prefill持平完全符合预期。知乎

3张卡是残废、4张卡白买?GLM-5.3-Flash开源这几天,多卡切分的旧规矩全被重新验算了一遍

第三个案例,也是给旧规则判死刑的:Qwen3.8-Flash-Next是125B MoE(512专家、激活约6B)加Gated DeltaNet递归层的新架构,原生262K上下文,对现有GGUF引擎"几乎处处是非标件"。知乎llama.cpp的`-sm row`直接拒绝加载这个架构,`-sm layer`也只换来约10%的prefill提升;TensorSharp的TP在该架构上实际就是层切分,明确写着"容量特性,不是速度特性",2×A100-80GB上73.4GiB拆成24.2+26.2GB,单双卡贪心输出SHA-256相同。

顺带一提参考机的价格:RTX PRO 6000 Blackwell官方商城价已从早期8565美元涨到16000美元,涨幅87%,官方商城还标注了缺货。知乎3张就是三十多万人民币的卡钱——所以真正的受众反而是垃圾佬们那种混搭机:两张2080Ti 22G、两张3080 20G加一张V100 32G,共5张卡116GB显存,8月30日刚拿来首测qwen3.8-flash-next。B站混搭机没有NVLink、卡数随便凑、显存大小不一,恰恰是这套新规则的主战场。

3张卡是残废、4张卡白买?GLM-5.3-Flash开源这几天,多卡切分的旧规矩全被重新验算了一遍

不同人群怎么办:一张决策表

手里是3/5/7张卡的DIY玩家:别折腾vLLM TP了,直接llama.cpp/TensorSharp层切分,卡数无整除要求,混牌混容量都行;显存不够先想专家offload,但心里要清楚那是换容量的钱,不是换速度的钱。

在凑4/8卡、目标是服务吞吐的:TP能给你速度,但2卡1.4×的实测先看清——没有NVLink/P2P就别指望多卡线性加速;MoE模型优先考虑DP(每个副本独立、几乎无通信)或EP,TP留给你必须切开单卡放不下的大头时再上。

准备为GLM-5.3-Flash/Qwen3.8-Flash-Next买卡的:先看渠道差价——同为96GB,官方商城挂16000美元还缺货,第三方渠道同卡有一万一千多美元的报价,一张差四千多美元。再看引擎:这两个都是"线性+稀疏注意力混合"架构,llama.cpp部分切分模式直接拒载,新架构跟进速度本身就该列入选卡预算——能三天接进主干的引擎,和只会打补丁的引擎,不是一回事。

3张卡是残废、4张卡白买?GLM-5.3-Flash开源这几天,多卡切分的旧规矩全被重新验算了一遍

接下来值得盯的信号:旗舰GLM-5.3本体权重仍在安全评估流程中,落地那天的GGUF适配成本大概率接近零。知乎以及各家推理引擎对KDA/GDN这类递归状态的并行布局,什么时候从"per-sequence整包状态"进化到分页——那才是混搭多卡机器吞吐翻倍的下一个节点。

需要说明一条边界:文中TensorSharp与llama.cpp的对比数字全部出自张善友项目的自测基准(同机同权重背靠背),作者本身是该引擎的推广者,暂无独立第三方复现;但"头数整除限制卡数"“layer split对卡数免疫”"TP加速非线性"这三条规则性结论,在vLLM官方参数校验逻辑和Megatron式TP的通信模型里都能独立成立,不依赖那组跑分。

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章