9月4日深夜,一条消息刷屏了信息流:据报道,DeepSeek计划在内蒙古建设大规模数据中心,部署至少16万颗华为昇腾950DT用于运行自己的AI模型。微博 报道里特意留了一句关键限定:训练工作依旧使用英伟达的GPU,受消息影响英伟达股价上涨1.1%。微博 更微妙的是市场反应——英伟达不跌反涨,股民给它总结了一句话:唯一还在创新高的AI芯片公司。微博
全网都在聊"去英伟达化",但48小时前挂在英伟达官方技术博客上的那份文件,和这块屏幕前玩家的关系要大得多:9月2日,一篇《用投机解码做AI模型协同设计》正式上线——芯片霸主第一次以官方姿态给大模型推理发"选型表",而表里压阵的核心方案几乎全出自华人团队。36氪 如果你是用N卡本地跑大模型的人——手里是16G的5060Ti、两张3090还是24G的4090——这份指南回答了一个很实际的问题:不换卡,你这台机器还能再快多少?
一张官方选型表,六个方案,一场"中文含金量"
先讲明白投机解码在干嘛。大模型吐字是词语接龙:每吐一个字,几百GB参数要在显存里完整跑一圈,大部分算力其实在等内存搬数据。投机解码的做法是找个轻量小模型先猜7个字,主模型一次性验证——权重反正都要搬一遍,验证7个字和写1个字耗时差不多。猜对的收下,猜错的重来,因为大模型只接受它本来就会写的字,所以最终输出连个标点都不用变,这就是"无损"的真实含义。36氪
英伟达把目前最主流的6种推理加速方案一字排开,连训练成本和适用场景都摊开了讲。36氪 最左是外置草稿模型,从头训要烧1T到10T个token,英伟达给它安排的归宿是自己花200亿美元收编的Groq芯片(LPU);最右是无需训练的n-gram查表,白嫖但只适合大段复制的呆板场景。中间四行,才是演进主线——
EAGLE-3:北大团队主导,三年连发三代,把"逐字往下猜"的串行路线做到物理上限,但在新表里已被挤到参考位,理由极短:接受长度被后浪超越了。
MTP(多Token预测):思路Meta在2024年首创,真正把它锤成大模型标配的是DeepSeek-V3,英伟达给出全场最高评价——GPU上大模型的最佳选择;但它必须在预训练阶段就和主模型绑在一起练,属于厂商的菜,你在本地补不了。
DFlash:拿下6倍无损加速的主角,放弃"一个字接一个字猜"的串行打法,借鉴扩散模型一次前向生成7个Token的预测序列;三位作者都是华人,指导老师刘知健是UCSD助理教授、同时兼任英伟达研究院研究科学家。
DSpark:DeepSeek与北大混编的24人团队操刀,在并行底座上外挂极轻的串行筛选——接受长度比EAGLE-3高近30%、比DFlash高18%,在DeepSeek-V4的线上生产环境里比MTP快60%到85%。36氪
表底下还藏着最"霸道"的推导:注意力机制占解码大头时,草稿长度必须贴着GPU矩阵分块的物理边界走——G=8,草稿刚好猜15个;G=32,只能猜3个。36氪 把硬件的常数方程写进模型设计图纸,芯片厂商里英伟达是第一个。
"最优解全是华人写的"很快出圈,环球时报那篇《英伟达想抄中国作业,我们欢迎》被搬上B站,一个月播放量突破8万。哔哩哔哩 但谈资归谈资,"6倍"能不能搬回你家主机,得对账。
官方的6倍,社区的实测2倍
6倍是测试台上的天花板,不是你能直接领走的数字。知乎做AI Infra的博主kaiyuan在vLLM上跑过DFlash/DSpark对照实测(8月23日最后更新):吞吐上DSpark相对不开投机解码约2.45到2.55倍,DFlash约1.96到2.09倍,互换成同参配置后DSpark仍领先约两成。知乎 同一位实测者还提醒了精度侧的冷水:各配置MMLU差异多在1个百分点内,而不开投机解码的Baseline自己两次评测就能波动5.2个百分点——这个细节下文还要用。
B站混合推理玩家的实测更接地气。"爱跳绳的乃龙"用双路EPYC 7642、16通道DDR4内存配两张3090跑DeepSeek-V4-Flash原版(mxfp4格式MoE),开DSpark后decode最高45t/s,上下文能开到268K。哔哩哔哩
评论区更像一份民间配置图鉴:单张RTX Pro 6000混合推理能跑115t/s,4×3080 20G把上下文开到700K;一位4090 48G配W3-3345的玩家,3层进显存、其余塞8通道内存,草稿解码开到3档也只有约20t/s,被跟帖点破真凶——内存通道少了,带宽低。哔哩哔哩 还有条被反复引用的经验值:每个token输出约占0.5GB/s的PCIe带宽,PCIe 3.0×16的机器上限大概32t/s。
昨天凌晨小红书上又有新笔记在晒:同一个vLLM,27B文本模型从37拉到220 tokens/s,作者把这套"不换显卡"的折腾思路继续搬去伺候本地视频模型。小红书 vLLM官方账号7月25日就把"DSpark,当下最强投机解码"做进了小课堂,dllm-plugin和speculators库的入口都挂在简介里。哔哩哔哩
对完账,结论分三句:纯显卡部署,1.5-2.5倍是现实的提走区间;本地单用户聊天恰恰是最大受益场景——batch=1正好落在"算力等数据"的瓶颈区;混合推理的天花板轮不到投机解码说话,内存通道和PCIe才是裁判。对照评论区晒出的官方API成绩——快的时候100、慢的时候40——本地这台45t/s的3090已经不丢人。
你的卡值不值得开:分四档
24-32G(5080/4090/5090):最大受益者。14B-32B量化模型整卡放得下时,草稿模型的额外开销咬得住,主流推理引擎现在就直接支持部署DFlash和DSpark,今晚就能开。知乎 唯一纪律是显存吃满的先砍上下文或降一档精度——实测者原话:一张卡也行,推测解码额外会占用些。哔哩哔哩
16G级(5060Ti/4060Ti 16G):模型本体已经塞满,硬开大概率反向。这类卡的正确姿势是混合推理,但动手前先数清楚内存通道——"从37到220"和"只有20t/s"的差距就是这么来的。
30系/多卡魔改党:别急着出二手,上面45t/s和700K上下文的成绩单就是3080/3090考的——老卡的第二春恰恰在这条软件路线上。20系玩家自嘲"彻底没戏了",问题出在mxfp4这类新格式的支持窗口,不是投机解码本身。哔哩哔哩 顺带一提:这是和DLSS 5"50系独占"完全不同的一条线,跑模型提速这扇门,英伟达没关。
模型侧:MTP这种"出厂自带"的方案你补不了课,能补的是草稿端。但选型信号已经很清楚——DeepSeek V4-Flash这类原生带投机解码设计的新模型才贴着官方最优解;下一批值得盯的,是Qwen、GLM们会不会标配MTP头。
避坑三件事
“无损"不等于"免费”:猜错的草稿,算力是真金白银烧掉的,接受率一低就可能白忙,社区测评早就把分歧摆上了标题。哔哩哔哩 开与不开,拿你自己的输入分布测一轮才算数。
显存账先算再开:草稿模型权重、验证阶段的额外KV,抢的是同一块显存。
测速讲方法:同batch、同输入、重复两轮再下结论——Baseline自己都能在数学题上波动5个点,拿单次跑分喊"降智"或"翻倍"都是耍流氓。
接下来盯什么
英伟达会不会在指南里补一页消费级显卡的推荐配置;vLLM的dllm-plugin和speculators库迭代多快;还有DeepSeek把推理搬上昇腾这件事的落地进度——据报道,华为当前产能把今年昇腾950DT的产量限制在数十万颗级别,这张16万颗的订单可能需要超过一年才能完成。微博 英伟达拿下的是训练和"方法论的正名",昇腾拿到的是推理集群,谁定标准要看更长的时间轴。
比较扎心的是这张选型表透出的风向:堆参数的时代翻篇了,接下来拼的是谁更懂脚下那块硅片的物理极限。所以下一次有人喊你换卡,先问一句——你现在这张卡的算力,真的用干榨净了吗?