这波竞赛的起点:9 月 10 号开源,9 月 14 号强推
9月10日,DeepSeek 在 Hugging Face 上发布了 V4.1 Flash 开源模型,采用 MIT 许可证,权重商用不设门槛。两周多过去,本地圈最热的不是跑分,是一场“本地部署竞赛”:B站那条《DeepSeek V4.1 Flash 30万成本跑起来了!》一天多冲到一万二播放,评论区吵翻了天,热评里最扎心的一句:30万,这是普通人的玩具?!云端这边也没闲着:官方公告写得直白,V4.1 Flash 已全面超越 V4 Pro,9月14日起 deepseek-v4-pro 的请求全部路由到 V4.1 Flash 并按其价格计费。手里攥着 16G 显卡、跑着 27B、在纠结要不要跟进这波的人,这篇就是写给你们的。掏钱之前,三笔账都得换把新算盘。微信公众号哔哩哔哩知乎
第一笔账,容量:墙从“显存装不下”挪到了“内存装不下”
官方口径是总参数 552B,输入侧激活 8B、输出侧激活 16B——MoE 玩家都熟,不算新东西。FP8 精度下,模型权重文件就有 510 GB 的样子。再加两张巨大的 Engram 查找表,总规模超过 200GB——社区有人干脆把账算成“552B 主干 + 196B Engram”,七千多亿参数,每次推理只点亮 16B。微信公众号知乎知乎

坏消息是统一内存设备逃不开同一个池子:四台 Spark 合计 512GB,按标准 vLLM 方式把 Engram 表放进主机内存,仍然无法安全运行完整模型。知乎
社区解法简单粗暴:Engram 放 NVMe 硬盘,每台只留约四分之一(47.2GiB),推理时按 n-gram 哈希取行;第一版把读取放在模型 forward 里,破坏 CUDA Graph,decode 卡在 20 tok/s,挪到 prepare_inputs 阶段并行读取后才起飞——这一项改动,就把早期约20 tok/s的decode推进到了约40 tok/s。知乎
更值得警惕的是底层 kernel 的地雷:面向大型 Blackwell 服务器 GPU 的设计,在只有 48 个 SM 的 GB10 上连环翻车,TileLang 的 FP8 激活量化 kernel 在 SM121 上存在竞态——短输入一切正常,长 prompt 一次性 prefill 可能默默输出无关内容。记住这颗雷,后面“能不能稳”的判断全靠它。知乎
第二笔账,速度:94t/s 是真的,但那是数数的速度
四机 Spark 集群最终形态的分任务实测:计数任务 90—94、表格 88、数学 81、代码 64—78、JSON 60,而你最可能拿它干的活——普通散文、叙事和摘要约31—35 tok/s。原因是推测解码的草稿接受率:代码、表格一次能接住 5—6 个草稿 token,自然语言只有约 2 个。所以宣传页上的 94 和你要的 31,是同一台机器——别用错对标数字。知乎
并发才是这套集群的真正卖点:六个任务同跑、平均每个仍有约 35.7 tok/s,整个系统还完成了540个混合请求的压力测试,结果是0错误、0挂起、0输出检查失败。知乎
便宜档也跑通了:社区 MiaAI-Lab 的双机 EXL3 量化方案把权重压进两台 DGX Spark,模型总体积 196 GiB,单流 prose 约 50 tok/s,上下文 60 万——双机方案总价约 7,000 美元,约合人民币 5 万元。但作者也写得很清楚:这是 60 万上下文的方案,不是满血 1M,每台内存余量只剩约 4 GiB,官方文档建议打开 memguard 防 OOM。微信公众号
矿卡党交出的成绩更夸张:6×CMP-170HX + 256GB 内存,PP流水线并行跑 DeepSeek-V4.1-Flash 原版模型,6卡支持 4M上下文Cache,prefill 6000 t/s,decode 峰值 316 token/s;开 dskpark 16并发。注意“16并发”四个字——评论区立刻有人冷静发问:“单流速度还是聚合速度?”这 316 是流水线全开的聚合口径,不是你单开对话框的手感。哔哩哔哩
电费账也有人替算了:Spark 阵营晒出来的实测:4*dgx 唯一神、全设备功耗不到 1000w。矿卡阵营自己承认“电费和线上api价格差不多,刚需本地部署的可入”。哔哩哔哩哔哩哔哩

第三笔账,能力:官方图和你的体感,不在同一个榜上
官方放出的 benchmark 确实能打:从官方公布的测试结果来看,V4.1 Flash 在多项 Agentic Benchmark 上已经超过包括 DeepSeek V4 Pro 在内的一众旗舰模型。微信公众号

但同一批官方图里也有刺眼的:Terminal-Bench 3.0 这一组,V4.1 Flash 只有 30.0,Claude Opus 5 是 43.3;换到 Artificial Analysis 的综合口径,它是 36.8,低于 V4 Pro 的 42.7。体感更是两极:编程圈 728 赞的高票回答,结论是编程任务 V4.1Flash 整体较 V4Pro、V4FlashVision 等版本更优。做数据分析的长文则直接开喷:DeepSeekV4.1FLASH是当前深度求索发布体验最差、最不严谨的版本。这代模型明显偏科:拿它写代码、跑终端的人给高分,拿它当全能文档助理的人摔杯子。更微妙的是,今天 X 上已经有人爆料 deepseekv4.1pro 似乎正在按账号分批次进行灰度测试。Pro 在路上,只是还没开源——冲着“用 4.1 换掉所有 Pro 的活”去攒机的,先掂量这个定位差。知乎知乎哔哩哔哩
坑:你的 DS4 还不认识 4.1,12.6 万和 30 万也不是一回事
Mac 党最容易误伤。Redis 作者 antirez 的 DS4(DwarfStar)靠不对称 2-bit/8-bit 混合量化把 V4 家族塞进 96GB 以上的 Mac,两台 128GB 还能 RDMA。但装之前看清 README:截至目前 DS4 公开列出的适配对象仍是 V4 家族,而不是直接宣称已经完成 V4.1 Flash 适配。现在群里传的“Mac 吃上 4.1”,多数吃的是 V4,不是 V4.1。知乎
价格口径同理要拆开。Spark 党评论区最高赞的原话是“四台小垃圾12.6,一张6000p就能买四台小垃圾了,办公桌上可以停比亚迪,但是停一台奥迪还是离谱了”。四台机器本体约 12.6 万,200G 网络、NVMe 和调试人力才把整机账推到“30万”;同样是四台,评论区里有人晒“4dgx就可以了,实测prefill 4000token/s,decode 80-100token/s”,也有人说四张 H20 足矣、Engram 不占显存。预算差的是带宽和网络,不只是那四台盒子。哔哩哔哩
结论:三种人能上车,三种人先别动,外加三个观察信号
能上车的:数据不出楼、需要 24 小时任务池的人——540 请求 0 挂起那种底线,对合规场景就是生产力;把部署本身当爱好的人,GB10 上修 kernel 这段路,就是这一代玩家的“寒武纪考古”;以及手里已有两台以上 Spark、接受“双机 50、四机散文 31”这个速度现实的人。
先别动的:16G 单卡党——V4.1 塞不进你的机器,而且你的 27B 口粮这轮没被淘汰;想靠本地化省 token 的人——官方 API 端输入 $0.30 / 百万 tokens,与上一代基本持平。评论区已经有人直接表态“我选火山方舟的49块钱plan”,这本身就是对 30 万方案的一张反对票。以及在等满血 Pro 的人——今天那条灰度爆料就是给你看的,这周先捂紧钱包。微信公众号哔哩哔哩
三个信号:V4.1 Pro 开源是否跟进,跟进的话双机、四机、矿卡三档定位全部重排;6×170HX 矿卡路线的六卡版仓库何时开源、卡价能不能实测出稳定货源;以及最实在的一条——接下来几周会不会冒出更多“长 prompt 默默输出无关内容”的返工报告。“能装、能跑、能稳”三道门,目前被大量复现的基本只有第一道,机器没跑满一个月之前,别把“点亮”当“买定离手”。