DeepSeek V4.1 Flash 开源第一夜:本地玩家先别算升级账,"显存杀手"是数据中心的账,你撞的第一堵墙是权重

源自472位全网作者

07:13

9 月 10 日晚上,DeepSeek 把 V4.1 Flash 端上桌:发布、开源权重、API 降价,App 端还把"快速/专家/识图"三个入口合并成统一智能模式,四件事挤在同一晚。微博

第二天,技术社区最出圈的词是"显存杀手"——KV 缓存暴降 437 倍,1M 上下文的缓存账约等于一张截图。知乎于是本地板块肉眼可见地躁动起来:16G、24G 档的玩家开始认真问"我是不是也快跑得起百万上下文了",群里开始传"加内存等量化"。先泼一盆温水:这盆躁动里,两笔账被混成一笔了。

第一笔账:890 字节是"上下文账",不是"入场券"

把 V4.1 Flash 拆开看,它有两个体积完全不同的成本。一个是跑多长上下文花多少。官方的每 token 全局 KV Cache 数据:DeepSeek-V1 为 389,120 字节,V3.2 降到 48,068 字节,V4-Flash 降到 3,514 字节,V4.1-Flash 进一步降到 890 字节。知乎照这个单价,1M 上下文的常驻全局 KV 不到 1GB,上下文从 4K 拉长 256 倍,解码 FLOPs 只涨约四分之一。知乎这是真革命——它砍掉的是长上下文时代"KV 吃显存、吃 HBM、吃 SSD"的三座大山,官方口径是与上一代相比 HBM 需求降到 1/4、SSD 需求降到 1/8。知乎

另一个成本是把模型请进门要花多少。V4.1 Flash 是 552B 参数的 MoE 模型,还外挂了一个 196B 的 Engram 条件记忆模块。知乎官方讲得很清楚:prefill 每 token 只激活 8B 参数,decode 也只激活 16B,激活的是计算量,不是进门时往显存和内存里搬的权重总量。知乎记住这个换算:激活 8B ≠ 只要 8B 的显存,这句话这两天被误读得最多。

对比你自己机器的经验值:Qwen3.8-27B Q4 量化 16GB 上下,是这一波本地玩家的主力盘。而上一代 V4 Flash 才 284B 主干,就已经需要 4 张二手 3060 加 UD-Q4 量化压进 48GB 显存,才跑出 100 tok/s。哔哩哔哩单卡 3090 配 192GB 内存跑 Q8,也只有约 10 tok/s。哔哩哔哩24GB 显存党的整活实测也就 15.4 tok/s。哔哩哔哩主干直接翻倍、再挂一个 196B Engram 的 V4.1 Flash,第一夜的本地门槛只会更高,不会更低。KV 那 890 字节确实诱人,但它是你跨过权重墙之后才配拿到的奖励。

第二笔账:开源后 12 小时,全网只有两单"能跑"

高时效事件的价值在于快,风险也在于快。发布后十几个小时,真正意义上的本地实跑目前只有两单,都走 CPU+GPU 混合推理:一位 UP 主用双路 EPYC 6642 + 2TB DDR4 + 两张 3090,靠 sglang v1.5.2 的 lk_moe 分支(支持 sm80+)报到 30 tok/s+,自述还在持续优化。哔哩哔哩另一位垃圾佬用 6 张 8G 矿卡 170HX + 512GB 内存跑通原版权重,报约 25 tok/s,内存占用 230GB。哔哩哔哩

这两个数字按发帖人自述收录,未经第三方复测。官方跑分这边也一样:第三方口径目前只有 OpenDesign Arena 给过一个"世界第二"。知乎海外博主的 API 实测报出思考模式编码得分 81.25%、速度约 221 TPS。哔哩哔哩成规模的第三方基准还没排上来,结论强度先按"厂商自测+零星复测"打折。但方向感已经很清楚了:第一夜能跑 V4.1 Flash 的"本地",本质是退役服务器加半吨内存的机房余料,不是你的主机箱llama.cpp 没动,官方 GGUF 没出,Unsloth 那批往常几小时就交作业的量化仓库也还没动静——上一代 V4 Flash 的 GGUF 生态是发布数周后才逐步铺开的,CED+CSA2 这套新架构等框架适配是硬周期。

唯一的确定性利好藏在架构里:主 KV 原生就是 FP4 存储,每 16 个通道配一个缩放系数。知乎训练阶段还引入了量化感知训练(QAT)。AI科技评论理论上这个模型对后续激进度量化的耐受度会比常规模型好,等量化版的玩家,画质损失可能比想象中小。这是推断,不是实测,记在观察项里。

第三笔账:真正该算的,是 9 月 14 日中午 12 点

对大多数还没跨过权重墙的本地玩家,V4.1 Flash 第一周的正确用法还是在云上,而这次云端给了两个必须处理的动作。

其一,价格结构变了,周末党赚最多。对照上一代,V4.1 Flash 的缓存命中输入从 0.05 元降到 0.02 元/百万 token,降幅 60%;未命中输入从 1.5 元降到 1 元,输出从 4.5 元降到 4 元。知乎

高峰只在工作日 9:00–12:00 和 14:00–18:00,其余时间含整个周末都是谷时价,谷时正好减半。知乎

KV 压到 890 字节之后,Agent 类"反复读长上下文"的缓存命中成本,是被直接打穿的。

其二,你熟悉的"满血 DeepSeek"还有 3 天。9 月 14 日中午 12 点起,旧的 V4 Pro 接口下线,所有请求自动路由到 V4.1 Flash 并按新价格收费。知乎规格上它还是 1M 上下文、384K 最大输出、2500 并发,旧名字 deepseek-v4-pro 的调用全部由它接管。微博

但"全面超越 Pro"是性能、费用、速度、总用时的综合口径,纯知识推理并没有全面赢:HLE 36.8 对 Pro 的 42.7,GPQA Diamond 也低 1.5 分。知乎社区已经用脚投票:小红书那条"deepseek 啥意思?v4pro 也是 4.1f 的模型?“底下,85 条评论在互相提醒"4.1 写文好拉,大家珍惜这几天”。小红书重度依赖 Pro 写作和长文风格的,这两天该做两件事:把吃重的提示词在 V4.1 的 low/high/max 三档思考上重测一遍;把有独家输出的提示词资产和调用代码导出备份——路由切换不会有第二次提醒。

顺带一个容易被略过的细节:官方模型卡里,同一个 V4.1 Flash 换个 Agent 框架,DeepSWE v1.1 分数从 mini-SWE 的 74.2 一路分布到 OpenCode 的 65.5。知乎换框架的差距约等于换一档模型,纠结要不要为它折腾本地之前,先看看你接云端用的什么框架——这部分收益是免费的。

按档位给结论

  • 8–16G 显存 / 32G 内存档:这轮跟 V4.1 Flash 没关系,别动。你的生态位还是 27B 级量化盘,升级任何硬件都解决不了 552B 的进门费。

  • 16–24G 显存 + 96–128G 内存档:观望,不加钱。等 GGUF/llama.cpp 支持和第一批第三方量化实测定了生死再说,按 V4 Flash 的节奏保守估计以"周"为单位。这期间用云端的谷时价过渡,成本大概率低于你为焦虑多买的那条内存。

  • 128G+ 统一内存 / 双路服务器党:你们才是"890 字节"的真正受益者——权重墙你本来就翻过了,KV 不再是瓶颈之后,1M 上下文从纸面规格变成日常可用,瓶颈正式移交内存带宽。sglang 的 lk_moe 分支就是给这个档位准备的,第一夜 30 tok/s、还在优化中。

  • 写作重度用户(不分档位):本周核心动作不是本地部署,是赶在 9 月 14 日 12:00 路由切换前,把 Pro 的用法迁移测完。

接下来盯什么

三个继续观察的信号:Unsloth / GGUF 仓库有没有 V4.1 Flash 的量化版落地;llama.cpp 的 CED 架构支持 PR 排期;以及 V4.1 Pro 的上线时间表——它回来那天,"Flash 暂代 Pro"这出戏才算落幕,今天下的不少结论要重算。

至于"要不要为了 V4.1 升级硬件":第一夜的答案很朴素——它改写了数据中心的成本账,但还没改你主机箱的账。先收藏这篇,等量化版落地和第三方复测。

你现在的机器卡在哪一档?评论区报个配置,看看这轮到底有没有你的上车机会。

内容由AI生成

精选参考来源

1. #DeepSeek 快速专家识图合并#9月10日DeepSeek正式将快速、专家、识图三大模式合并为统一智能模式

2. 深度解读 DeepSeek V4.1 Flash 全新架构,如何成为显存杀手

3. DeepSeek V4.1 Flash 发布:552B 新架构、原生多模态,API 价格同步下调

4. DeepSeek V4.1 Flash 精讲:把 KV 缓存压缩推向极限的五大创新

5. DeepSeek V4 Flash本地部署实测:4×RTX 3060跑到100 tok/s

6. 消费级本地部署 DeepSeekV4-Flash 0731 Q8 无损量化

7. DeepSeek V4 Flash 跑进 24GB 显存:Reddit r/LocalLLaMA 实测 15.4 tok/s|284B MoE 家用实战

8. DeepSeek V4.1 FLash 本地部署测试30t/s+,sglang+lk_moe,支持sm80+, epyc6642*2,1tddr4,3090*2

9. Deepseek v4.1 Flash 本地部署。6张矿卡170Hx 8G

10. [中配]DeepSeek V4.1 Flash实测:开启思考模式后编码得分达81.25%,速度约221TPS

11. DeepSeek V4.1 Flash 上线

12. DeepSeek V4.1Flash正式上线了,且将临时接替V4Pro。9月14日12:00之后,到V4.1Pro上线之前,原来调用V4Pro的API请求,会直接路由到V4.1Flash,而且按Flash的价格计费。

13. deepseek啥意思?v4pro也是4.1f的模型?

0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章