DeepSeek V4 Flash本地部署实测盘点:单卡11 tok/s、八卡21 tok/s,最后大家都回了27B

源自10位全网作者

12:47

DeepSeek V4 Flash 的 0731 正式版上线快两周了,API 侧输入 1 元、输出 2 元、命中缓存输入 0.2 元每百万 Tokens 的定价,把开发者圈聊得火热。知乎但本地部署圈关心的,是另一个更落地的问题:这个规格几乎默认属于云端的 MoE 怪物,我家里的老机器到底能不能跑?

V4 Flash 是效率型号:284B 总参数、13B 激活参数、100 万 token 上下文。知乎连 Redis 之父 antirez 都下场了,专门给它写了个纯 C 推理引擎 ds4,外科手术式 2-bit 量化只压路由专家,96G 权重全塞进内存,128G 的 MacBook Pro 实测每秒生成 39 个 token。哔哩哔哩于是很多人坐不住了:Mac 都能跑,我的 2080Ti 呢?

DeepSeek V4 Flash本地部署实测盘点:单卡11 tok/s、八卡21 tok/s,最后大家都回了27B

答案是:能跑,但圈子里实测了一圈之后,结论出奇地一致——别硬上。

我把这三个月全网能找到的 V4 Flash 本地实测数据捋了一遍,放一起看非常有意思:单张 2080Ti 22G 魔改卡加 256G 内存,走 FastLLM 的 CPU+GPU 混合推理跑混合量化,实测速度稳定在 11~12 Tokens/s。哔哩哔哩八张 2080Ti 22G 魔改卡加 llama.cpp,原版基线 Coding 21.49 t/s、Writing 21.35 t/s,稳定在 21.5 t/s 附近。哔哩哔哩而对照组是:两张卡加桥接器和小主机一共 4500 元,跑 27B/31B 稠密模型单并发 100 tok/s。哔哩哔哩

DeepSeek V4 Flash本地部署实测盘点:单卡11 tok/s、八卡21 tok/s,最后大家都回了27B

八卡为什么只有 21 tok/s?测试者自己拆得很清楚:整机没有 NVLink 互联,llama.cpp 只能按层切分,任一时刻只有一张卡在满负荷计算,其余七张干等,IPMI 实测待机 326W,推理瞬时也只有 778W,八卡从没同时拉满过。哔哩哔哩他们甚至试了 DSpark 投机解码想提速,结果 Writing 场景接受率只有 0.205,速度反而掉 40%,显存装不下时开投机解码基本是负优化,这已经成了圈里共识。另一台 4 卡老机器更直接:在一台 2023 年组的、成本不到 2 万元人民币的 4×RTX 2080 Ti(22G魔改版)老机器上跑通 284B,FP4 全驻留 decode 平均只有 3.49 tok/s,换来的是 65,536 token 长上下文的验证——容量全用来装下模型,速度一点没剩。知乎

DeepSeek V4 Flash本地部署实测盘点:单卡11 tok/s、八卡21 tok/s,最后大家都回了27B

最反常识的点在于:13B 激活的 MoE,理论上不是很轻吗?但 MoE 省的是计算量,不省内存带宽。每个 token 都要把被激活的专家权重从显存或内存里搬一遍,2080Ti 这种老卡的瓶颈恰恰是带宽而不是算力;再叠加长上下文的 KV cache 和慢到让人难受的 prefill,284B 在消费级老硬件上,“能跑”和“好用”之间隔了一整条鸿沟。八卡实测的上下文只有 8K,评论区一排“8K 上下文”的苦笑,最高赞的留言是:听我一句劝,买 api,睡眠香了,身体好了,家人同事关系和谐了。哔哩哔哩

再算一笔账,这是劝退的最后一根稻草。八卡方案就算按多并发聚合 100~200 t/s 乐观估算,百万输出 token 的电费大约 0.54~1.1 元,看着比 API 输出价 2 元便宜,但这是没算八卡折旧、整机平台和空调功耗的“裸电费”,单用户体感还是 21 tok/s。测试者自己的结论也只有一句:能跑,但毫无性价比。

所以这波热度真正沉淀下来的共识,反而跟 V4 Flash 本身没关系:2026 年消费级本地部署的甜点,还是 27B 上下的稠密模型。用圈子里的话说,“27B 才是我们 28 佬永远的家”。现在一条 4500 元上下的双卡路线已经被社区蹚得很熟:两张 2080Ti 22G 魔改卡跑 27B 稠密,FP8 权重就能到 80 tok/s。哔哩哔哩社区甚至给 20 系老卡做了专用 vLLM 加速工程(vLLM-2080Ti-Definitive),补上 MTP 和 FP8 KV cache,把老卡的剩余价值榨到底。哔哩哔哩与此同时,二手市场上几乎全新的魔改 22G 卡还在不断流出,成色“嘎嘎新”,全是机房出身。知乎

DeepSeek V4 Flash本地部署实测盘点:单卡11 tok/s、八卡21 tok/s,最后大家都回了27B

给不同情况的人分个流:

  1. 只有一张 11G/16G 卡、内存不大:别碰 V4 Flash 全量,直接跑 27B 级别的 Q4/FP8,或者干脆用 API——现在这个价格,轻度使用买 API 真的比自己配机划算,评论里那句“4500 都够买几年顶级模型订阅了”不是抬杠。

  2. 手里有双卡位、能搞到便宜内存:双 2080Ti 22G 魔改加定制 vLLM 跑 27B 稠密,是当前性价比天花板;但评论里也有人提醒,卡也涨价,双槽主板也涨价,矿卡出身还有翻车风险,别追高。哔哩哔哩

  3. 非要本地跑 V4 Flash 这类超大 MoE:方向是大内存而不是多显卡——antirez 的 ds4 路线(96G 以上内存全驻留)和 FastLLM 混合推理都证明了可行性,代价是 11~39 tok/s 的速度,适合离线、隐私优先、不在乎等待的场景。

  4. 等一等党:社区传言 Qwen3.8 27B 近期就来(截至发稿还没放出权重),如果 27B 甜点位的下一代值得等,现在这个节点囤卡可以缓一缓。

最后提醒一句:V4 Flash 这波真正的冲击,是把“超大 MoE 本地跑”的门槛从“不可能”变成了“能跑但不划算”——半年前 671B 时代大家还在挑战 2 tok/s,现在讨论的已经是“怎么跑得更体面”。接下来值得持续盯三件事:Qwen3.8 27B 的开源落地、老卡魔改的行情走势、以及社区 vLLM 针对 20 系卡的加速工程更新。想入坑的,先把上面这笔账算明白再下单。

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章