9月8日B站那条《AMD/NV本地双卡加速 MiniMax H3 效率双倍提升》下面,46条评论里最高频的问题不是怎么装,而是能不能再配张2080ti和4090一起跑加速。 UP主的回答相当含蓄:可以,但可能2080拖后腿。哔哩哔哩
四天之后,知乎"LLM Training Lab"的作者用真机把这条思路的最坏情况量了出来:RTX 3070 + RTX 4090,两台机器各一张,全局batch不变,30步训练墙钟从1.599秒变成14.152秒,加了一张GPU不是没快,是慢了约8.85倍。知乎

一周之内,三个流传的数字:双卡推理演示的约1.9倍、两个进程抢一张卡的8倍、跨机DDP的0.113。它们都没说谎——量的是三笔不同的账,而评论区里大量玩家正拿着第一笔账,去算第三笔的命。
账本一:推理切分,是唯一基本能摸到翻倍的场景
MiniMax H3的双卡方案把注意力的序列/头拆给两张卡,用一轮all-to-all交换换回原本一张卡才能做的完整计算。同一台机器、PCIe直连、推理不需要每步同步梯度——通信少且规律,所以同型号双卡能做到接近线性。评论区UP对"速度翻倍"的口径自己也降了档:还是有一些额外开销的,最好将近1.9x这样。哔哩哔哩
但置顶实现有两条边界要记牢。第一,repo目前只做了NV双卡或AMD双卡,UP原话:两张卡不能一起,理论上也能一起,但这里实现是nv或者amd双卡,多卡还没实现。 一张4090配一张9070XT的混搭想白嫖,暂时没门。第二,这个把56头拆成两个28的均分法是对这类模型的针对性切分,评论区已经在问"其他DiT模型无法使用?"答案是别的模型走另一条路:SD那种多模块模型直接分卡放置更省事。哔哩哔哩
账本二:训练DDP,每步45.6MB的梯度是台跑步机
训练的通信结构和推理完全两样。同系列第13篇给了公式:all-reduce通信量 = 参数字节 × 2(w-1)/w,w是卡数。 两张卡,就是每步每张卡都要把45.6MB(11.41M参数fp32)的梯度搬运一轮,30步一步不停。知乎

单卡3070算30步用了1.599秒;双机跨网线跑,14.152秒。差的这12秒就是"每步都站在网线上等梯度"的时间——作者按有效带宽0.1GB/s量级估算每步通信约456ms,和backward段399ms的差值对得上。作者本人也反复声明:跨机配置未重复测量、未采集通信profiler,不能推广到同型号双卡或更快互联。知乎
这条账本里最值得抄走的反而是方法论。同一批逐步日志,取哪段样本、用哪个统计量、batch口径对不对齐,speedup会在0.108~0.126一族数之间漂移;那个把耗时比乘了batch比例得到的0.214,是人为构造的假指标。作者开出的可信数字最低配置:全局batch实际值、rank与显卡绑定、预热步数、正式记录范围、统计量、重复次数——口径错了,数字再精确也没有含义。

账本三:你以为是"两张卡",可能两张卡都不是
同一篇文章里还有个更惨的历史对照:两个进程塞在同一张3070上,单进程约58.2ms/步,双进程约464.2ms/步——慢约8倍。 这不是多卡,是同一张卡上两个进程互相掐脖子,混着通信后端一起测,谁也别拿它吓唬谁。知乎
而真正让"老卡混搭"变雷区的是同步点。Lab14给rank1每步注入20ms固定延迟,上中位代表值比基线高约42ms,最近秩P95高约81ms。 慢卡带来的损失不止它自己慢的那点,每个DDP同步点,快卡都在原地等。B站评论区那条用户直觉——“两者性能相差不能超过一倍?”——其实就是straggler问题的民间版经验法则。知乎

说回来:你抽屉里的2080Ti到底有什么用
把三本账叠在一起,分人群下结论,一点都不玄学:
你的配置 | 值得做 | 不值得期待 |
|---|---|---|
4090单卡装得下目标模型 | 啥也别接,单卡最干净 | 2080Ti"帮忙加速"基本是亏的 |
单卡显存装不下 | 接上老卡分模块放置,跑更大/更高精度模型 | 双倍速度——显存决定能不能跑,算力只决定多快 |
两张同型号卡+同机PCIe | 推理切分,摸得到约1.9倍 | 跨厂商混搭,repo没实现 |
两台旧机器拉网线 | 学测量方法(Lab11~14) | 训练提速,0.113就是前车之鉴 |

这也解释了8月26日那条1.85万播放、1472收藏的《八张卡怎么才能像一张卡》:它开头那句被评论区追着夸的话——切开不是为了快,是为了能跑,33B参数权重就六十多GB,一张卡根本塞不进。 先分清你的瓶颈是"装不下"还是"算得慢",再决定接不接这张旧卡。哔哩哔哩
接下来盯什么
MiniMax H3那套repo的更新:混厂商双卡、更多卡数的实现会不会补上(现在连4卡都只是评论区"56/4=14每卡放14个头"的口头方案);
9月22日那篇vLLM多GPU通信扫盲贴把AllReduce/AllGather/AllToAll和NCCL、NVLink分成了"原语—库—硬件"四层,源码口径是v0.29.0。 下次再看到"多卡一接就快/就慢"的帖子,先检查它有没有串层;知乎
Lab系列作者预告下一轮按相同口径增加重复次数与通信trace——4/8卡的效率曲线出来,这轮多卡效率账才算补上右半边。
先算自己的账:你要的是"跑得动",还是"跑得快"。这是两种显卡,两本账,别拿一张2080Ti,同时回答两个问题。