V4.1 Flash发布72小时:890B的KV是漂亮口径,42%的AllReduce才是难受的那笔——8卡集群的三本账

源自31位全网作者

06:58

9月10日 DeepSeek 发布 V4.1 Flash 的那天,讨论区打的是跑分仗:官方说 Terminal-Bench 2.1 拿了 90.6、超过 Opus 5 的 89.1,B 站"斩杀线"榜单里它却只有 40 分、被 GLM 的 45 分压在国产第二。但真正的技术流量在 9 月 11 日夜里才涌过来:知乎上三篇硬核文章前后脚发出来——有人把 V4.1 Flash 挂进 SGLang 抓了完整的 GPU Kernel Trace,有人推演 CED 结构下的部署切点,还有人逐条盘了 vLLM 和 SGLang 当天还在动的适配 PR。三篇文章指向同一个结论:这场发布对自托管玩家的真正信息量不在"聪明与否",而在部署的账本被改写了。知乎哔哩哔哩

这篇不掺和跑分仗,只把三本账摊开:口径账、时间账、切点账。适合手上有一台 8 卡机、正在纠结"KV 降到 1/4 了我能不能挤进去"的人。

第一本账:890 B/token 是 FP4 口径,你的机器未必按这个口径跑

先把官方数字钉清楚:V4.1 Flash 是 552B 总参的 MoE,40 层骨架对半切成 Encoder/Decoder,输入阶段激活 8B、输出阶段 16B——总参比上一代 V4 Flash 的 284B 翻倍,输入侧参与计算的参数反而更少。全局 KV Cache 压到每 token 约 890 字节,官方说约为上代的 1/4;HBM 需求降到 1/4、SSD 持久化需求降到 1/8。权重已按 MIT 协议放上 Hugging Face,1M 上下文、最大 384K 输出、并发上限从 500 提到 2500,还原生带图像理解。知乎

V4.1 Flash发布72小时:890B的KV是漂亮口径,42%的AllReduce才是难受的那笔——8卡集群的三本账

漂亮归漂亮,自部署的人先要面对一个口径陷阱。890 B 这个数是全局 KV 按 FP4(E2M1)存的口径,靠量化感知训练换出来的。而写部署切点那篇分析的人提醒得很直接:V4.1 Flash 权重是 FP4/FP8 混合,如果你按常见的 W4A8 配方部署,KV 就得按 FP8 算——同一份缓存,账面直接翻倍到约 1792 B/token。"两侧口径不统一,所有倍数都是假的。"换句话说,官方"1/4"是架构层的事实,但不自动等于你机器上的事实:你用什么精度配方,决定你吃不吃得到这 1/4。知乎

V4.1 Flash发布72小时:890B的KV是漂亮口径,42%的AllReduce才是难受的那笔——8卡集群的三本账

更要紧的是另一半。上一代大家喊"显存装不下",这一代框架侧的分析直接翻了篇:自托管的主要约束已经从 KV 变成权重——510GB 级别的 FP8 权重摆在那,自部署门槛被写到 8 卡 H200/B300 一档的节点,KV 反而不再是瓶颈。这是"KV 骤降"叙事里最容易被忽略的小字:缓存省下来的空间,立刻被更大的总参重量(552B vs 284B)吃回去了。旧卡党想靠"KV 只要 1/4"上车 552B 的全参部署,第一本账就不成立。知乎

第二本账:TP8 实测,Prefill 里最大的单项开销是 AllReduce 的 42%

9 月 11 日深夜发出的 SGLang Trace 系列(作者 ACEEE,8×RTX 6000D / SM120,TP8+EP8,16384 token 输入),第一次把 V4.1 Flash 的执行时间线完整摊开。值得记住的是模块占比而不是绝对毫秒:

  • Prefill(C8 并发):K018 AllReduce 占累计 kernel 时间 42.11%,dense FP8 GEMM 占 23.63%。也就是说跨卡通信吃掉了近一半的计算时间。知乎

  • Decode:FP8 GEMM 回升为主项(C8 38.10%、C32 28.70%),AllReduce 稳定在 20.5% 上下;专家 GEMM 随批次从 9.95% 涨到 16.54%——EP8 下每卡管 48 个专家、384 个专家全量铺开,批次一大,专家路由的负载就压上来了。知乎

V4.1 Flash发布72小时:890B的KV是漂亮口径,42%的AllReduce才是难受的那笔——8卡集群的三本账

要按证据强度说话:这是单一采样配置(前缀缓存关闭、dense GEMM 走 Triton、通信走 NCCL)的一个窗口,不是普适常数。但方向足够扎心——KV 压到 890B 之后,八卡张量并行里最贵的单项变成了卡间通信。上一周 CUDA Graph 讨论还集中在 launch 开销找回几个百分点,这一代的账本里,通信已经是大头。Engram 那条"GPU 直接读主存 FP8 表 + 各卡取分片后 AllReduce"的路径也在时间线上留了痕迹:主存查表的省显存收益,是拿通信和内核数换来的。

对集群的人,这本账的实操含义是两条:换卡之前先换互联(NVLink 域内的 TP 宽度、AllReduce 融合 kernel),以及——别急着按官方跑分规划你的集群吞吐,框架还在动:SGLang 那边 Blackwell 适配 PR #38879 一天就把 B300 TP4/EP4 的 BS64 稳定解码从 6534 tok/s 提到 13771 tok/s,翻了一倍还多,今天的数字过几天就是旧的。知乎

第三本账:最好的切点不在 P/D 边界,在第 20 层那 640 字节

前两本账还是"成本搬家",第三本账直接动架构假设。9 月 12 日凌晨那篇 CED 部署分析提出的问题是:默认那套"Prefill 一个池、Decode 一个池",在 V4.1 Flash 上还是最优解吗?

V4.1 Flash 的 CED 结构(Causal Encoder-Decoder)把 40 层从中间切开,Decoder 的全局 KV 不是 Decoder 自己注意出来的,而是 Encoder 末层隐状态(H_L/2)的一个纯投影。这个结构事实翻译成部署语言,就是跨界传输有三种载荷可选:H_L/2 本体 5120 B/token、全量源层 KV 1792 B/token、投影后 KV 640 B/token——最大和最划算差 8 倍。选第三个的原因很具体:Decoder 侧只有一个真正的 KV 源层(L20 Full 模式,其余层跨层复用),所以"投影成 KV"每 token 只做一次;而 Encoder 侧三个源层(L2/L8/L14)那 1152 B/token 只要 Encoder 还在线就根本不用过网;滑动窗口注意力(窗口 128)那份 2.62 MB/会话的小 KV 干脆不持久化,用时重放最近 128 个 token 重建(官方叫 SWA Bounded Replay)。合起来:跨界只剩 640B,其他一切留在原地或本地生成。知乎

但作者把最容易误读的地方也标红了:EG 分离不是 PD 换了个名字。PD 是时间上的阶段切片——P 算完就退出;EG 是模型结构上的层界,而且因为 DSpark(半自回归草稿+置信度调度验证)的输出期验证需要跨 E/G 两侧条件,出 token 阶段两侧依然配对工作,每轮 verify 都有一次跨机往返。账面收益是单机 KV 预算从 148GB 涨到 300–307GB、可驻留会话量级上界约为全参 PD 的 3.2x/10.8x——注意是"驻留上界",没扣分页碎片、CUDA Graph、缓冲和排队,不是"能服务这么多并发"。还有一条硬约束:D 侧必须能把新 token 送过 L0–L19,不存在只装 L20–39 的"纯解码节点"。这直接否决了很多人第一反应的部署形态。知乎

三本账之后:谁现在动手,谁再等等

API 用户(不需要集群):这轮降价是真金白银。闲时价缓存命中输入 0.02 元/百万 token(约等于白送)、未命中 1 元、输出 4 元,高峰(工作日 9–12、14–18)双倍。有开发者按一天 1000 万输入 + 50 万输出、80% 命中的 Agent 负载测算:V4 Pro 闲时要 16.95 元,Flash 只要 4.16 元。知乎

V4.1 Flash发布72小时:890B的KV是漂亮口径,42%的AllReduce才是难受的那笔——8卡集群的三本账

坑在默认思考模式:实测一次简单问答,912 个补全 token 里 879 个是 reasoning token——max_tokens 给小了拿到空回复,高频调用记得显式关思考。知乎

V4.1 Flash发布72小时:890B的KV是漂亮口径,42%的AllReduce才是难受的那笔——8卡集群的三本账

另外 9/14 那次"V4 Pro 强制路由"风波 48 小时里反复了三次、最终以继续提供 V4 Pro 收场,社区情绪的教训是:计费口径变动比模型名更值得盯知乎

有 8 卡 H200/B300 级机器的:可以上车但要接受在分支上跑——vLLM 走 deepseekv41-flash-0909 预览镜像(需 0.30.0+,主 PR #56214 的 dsv41-feat 特性分支尚未合入主线),SGLang 走 dev-dsv41;AMD 这边 MI350X 八卡节点已验证通过(AITER 后端)。融合 kernel(QK-Norm+RoPE+KV 插入三合一、KV-only 插入让 H100 上 2048 token 插入快 4.14~5.93 倍)收益已经落在 PR 里,值得盯的就是主线合并节奏。知乎

旧卡/中小集群的:三本账合起来就一句话——KV 省下的钱买不回权重的地。510GB 级别的 FP8 权重是入场券,"8G 跑 8B"那套旧规矩在这代模型上对全参部署依然不成立。真想吃这代架构红利,短期内更现实的路径是租用已经跑通 EG/优化配方的推理服务,或者等量化 GGUF 在 HF 热榜上发酵之后的实测帖(Qwen3.8 GGUF 的路径已经演示过一遍了),别拿自家旧卡去赌首发。

最后照例把不确定项摆出来,免得这篇被当成新口径去传:40 分 vs 90.6 分是两套评测体系,都真实,谁代表你的负载谁才算数;GPQA 上 V4.1 Flash(90.9)仍低于 GPT-5.6 Sol(94.1)和 Opus 5(93.4),302.AI 的结论是"Pro 级能力、Flash 级价格初步坐实,极限复杂任务仍有瑕疵"。Trace 是单配置采样,CED 切点推演是第三方从论文出发的工程分析而非官方参考实现——9/14 之后 V4 Pro 的最终计费怎么收、EG 会不会出官方部署配方、SGLang 作者会不会补多配置对照的 Trace,这三个信号出来之前,账本先记着,钱别急着花。知乎

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章