满血DeepSeek V4.1双3090跑到22t/s:500GB权重进内存、每token只激活16B,先算清这三个数再决定加内存还是换卡

源自174位全网作者

00:25

9月10日,DeepSeek V4.1-Flash发布并同步开源:552B总参数的MoE、支持原生多模态,权重直接上了HuggingFace。官方同时宣布,9月14日中午12点起,所有发往deepseek-v4-pro的请求将路由到V4.1-Flash并按Flash低价计费。 消息出来后,本地推理圈第一反应高度一致——知乎那篇CED架构解读的原话是"参数从284B翻倍到552B,本地推理圈一片哀嚎,消费级显卡基本跑不动了,只能在云上玩"。知乎知乎

但就在同一天到第二天,B站的实测视频把这句话打成了半句废话:双3090能跑,6张8G矿卡能跑,8台迷你AI盒子也能跑。哀嚎派和Day0实测派吵起来的这件事,恰恰是这周最值得N卡用户算清楚的一笔账:决定你跑不跑得起满血V4.1的,可能根本不是你那张显卡,而是你机箱里另外三个地方的东西。

先把三个数掰开

第一个数:500GB,权重的体积。 首日用H100部署的UP主说得很直白:这是个"500GB的模型",放在8×80G的H100上刚好能进。 552B参数加上196B的Engram记忆参数(合计约748B),按当前放出的精度,权重文件就是这个量级。这直接杀死了一个常见误解——“我显存不够,所以跑不动”。在这种规模的MoE面前,16G、24G还是32G显存的差距,远不如你主板上有多少条内存槽重要。哔哩哔哩

第二个数:16B,每个token真正被唤醒的量。 V4.1-Flash用了新的CED架构(20层因果编码器喂20层解码器),预填充阶段每token只激活8B参数,解码阶段激活16B。 模型很胖,干活只醒一小块——这就是为什么两张2020年的3090还有资格上桌:GPU只需要处理被激活的那一小撮专家加注意力计算,剩下几百GB的"闲置字典"放内存里就行。跑通Day0方案的sglang+lk_moe(v1.5.2)明确标注支持sm80+,也就是20系往上都有份。知乎哔哩哔哩

第三个数:890B,每个token的全局KV账本。 CSA2加FP4 KV缓存把全局KV压到每token约890字节,只有上一代V4-Flash的四分之一。 顺着这个数算一笔乘法:哪怕你挂满1M上下文,全局KV也就850MB上下,比一张4A高清贴图大不了多少。上一代让无数人爆显存的"上下文越长越吃卡",在这代架构里基本被拆掉了。知乎

满血DeepSeek V4.1双3090跑到22t/s:500GB权重进内存、每token只激活16B,先算清这三个数再决定加内存还是换卡

三个数合在一起,本地部署的成本重心就挪位置了:入口是内存容量和内存带宽,其次是给Engram留一块像样的NVMe,最后才轮到显卡。这不是推测,是这两天所有跑通者的配置单共同指向的结论。196B的Engram记忆参数不需要整卡常驻,官方口径就是"用稀疏查找去访问",权重住内存,账本放SSD,显卡只干真正被唤醒的那一小块。知乎

满血DeepSeek V4.1双3090跑到22t/s:500GB权重进内存、每token只激活16B,先算清这三个数再决定加内存还是换卡

两天跨平台实测样本,拼出来的分布长这样

把B站、知乎两天内放出的实测拼成一张表,单个用户刷到其中一两条视频时容易得出错误结论,全放在一起才有分布感:

配置样本

权重/内存占用

实测速度

状态

双路EPYC+1TB DDR4+双3090(sglang+lk_moe)

1TB内存整版加载

常规decode 22t/s,开推测解码30t/s+

已跑通,1.5万播放

6张170HX 8G矿卡+512G内存

内存实占约230G,显存余量30G

约25t/s,UP主自述仍在优化

跑通原版

8×H100 80G(vLLM官方镜像+推测解码参数)

500GB权重进显存集群

部署级方案,Day0可用

已放出完整参数

8台华硕GX10(128GB统一内存×8,共1TB)

分布式统一内存跑748B总参数

与RTX PRO 6000同场对比实测

已发布

上代参照:单4080+AMX至强+196G内存

V4-Flash全精度

预填充1100/解码36t/s,1M上下文

8月底已验证

读这张表,有三个反直觉的点值得圈出来。

其一,决定22t/s还是30t/s的,不是两张3090,而是那颗双路EPYC和背后的1TB DDR4。评论区问得最扎心的一条是"这内存不得500g(占用)"——矿卡玩家的512G内存实占230G、约25token/s还在继续优化,说明量化和分页策略下门槛能压,但要舒服,服务器级内存就是硬通货。 第二,速度区间意外地收敛:48G显存的矿卡集群、48G显存的老旗舰双卡、1TB统一内存的迷你盒子,全都落在22到30t/s这条带里。想靠买一张5090把本地速度拉开代差,这代架构不给你这个机会。第三,上一代已经证明过消费级卡的路走得通:4080+至强跑V4-Flash能到36t/s,前提是196G内存起步、CPU带AMX指令集、显存至少20G(极限16G)——这三条门槛到V4.1只会更高不会更低。哔哩哔哩

接下来是你自己的三本账

账一:守卡加内存。 你手里如果有30系/40系/20系22G这类卡,正确的升级顺序不是显卡:先查CPU(AMD EPYC/带AMX的至强,普通桌面U缺内存带宽),再上内存(512G起步,1TB舒服),NVMe给Engram留独立一块。要提醒的是,这一轮加内存不是捡漏窗口——B站9月11日的硬件日报还在播"华硕显卡再次涨价",小红书装机店的原话是"显卡缺货还涨价,别再等了",存储和内存整体在涨价通道里。 这台"服务器"值不值,取决于你是不是高频离线跑敏感数据;只是偶尔玩玩,它大概率变成下一台吃灰矿机。哔哩哔哩小红书

账二:9月14日之后的API账。 V4.1-Flash把缓存命中价压到0.003美元/百万token,架构解读里那句HN调侃成立:“比把token传过去的网络成本还便宜”。 输入缓存命中比上一代便宜7倍多,输出直接砍了三分之二。 实测党已经把账单晒出来了:用新版DeepSeek桌面客户端跑5轮285步的长任务,81.4M token全程缓存命中率99.5%,吞吐289 tok/s——换句话说,Agent场景越"复读"上下文,这代API越接近白送。GX10实测视频评论区里有条话替很多人说破了:“实话说,今天,这些本地模型,就是鸡肋。这些机器的钱,你一个月5个200美元账户,能用大概4年”。 对绝大多数没有服务器平台、不需要断网运行的N卡用户,14号v4-pro静默切换到Flash低价后,"继续用满血API"才是这轮的默认正确答案。本地只输给钱包不输体验的场景,才值得折腾账一。知乎知乎哔哩哔哩

满血DeepSeek V4.1双3090跑到22t/s:500GB权重进内存、每token只激活16B,先算清这三个数再决定加内存还是换卡

账三:为了"跑更大模型"去换新卡的人,最该先停手。这周社区里最贵的错觉,就是"等5080/5090显存大了再玩本地"。先看站内货架的现价:七彩虹RTX 5090D 10399元、耕升RTX 5080 12179元、华硕ROG 5080 15014元——而这个月你大概率还抢不到官方价。V4.1-Flash的架构设计目标恰恰是把"模型变大"和"单卡变贵"解耦:16B激活让16G显存都能进牌桌(极限门槛,上代4080玩家实测20G更稳),500GB权重逼的是内存而不是显存。换句话说,为本地大模型去买溢价新N卡,这轮基本等于花一万多买了个不在瓶颈上的零件。

满血DeepSeek V4.1双3090跑到22t/s:500GB权重进内存、每token只激活16B,先算清这三个数再决定加内存还是换卡

想Day0上车的,记住这四个坑

方案已经公开:sglang+lk_moe v1.5.2(sm80+即可)、vLLM的deepseekv41-flash镜像(8×H100那套参数已完整放出)、ktransformers的kt-prod分支三条路线。坑在于:一是别拿单条视频的t/s当天花板,矿卡UP主自己都标注"目前大概25token左右,还在持续优化",Day0一周内的数字大概率还会变;二是"满血"和"官方精度"不完全是一回事,各家跑的分页/量化策略不同,评论区"200K长上下文速度如何"这类问题目前还没人给出统一答案;三是AMX/大带宽是硬门槛,桌面平台强行照抄配置单的结果通常是能启动、不能日常;四是V4.1-Pro还没上线,14号的路由只是"Pro的价格Flash的命",真需要顶配能力的人,这轮本地无解。

值得继续盯的信号就三个:低比特量化版会不会把500GB的权重档位压进300GB以内(那意味着256G内存的准服务器门槛塌一半);V4.1-Pro的实际规格;以及内存价格这条涨价通道什么时候见顶。前两个决定你等不等,第三个决定你现在动手贵不贵。

至于老黄们喊的"显存为王",V4.1-Flash给了这个圈子一个很实在的反例:这代模型用890B的账本,把消费级显卡从门票名单上暂时划掉了。你的3090还能再战一轮,但账要按上面三个数算,不是按显卡广告算。

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章