DeepSeek V4 把 API 打到全网最低价,按理说本地部署该降温了。结果 8 月的社区恰恰相反:V4 上线后的第三周,本地部署阵营比任何时候都热闹。先把事件线捋一遍,再算账,最后给三条决策线——这大概是最近"本地大模型"圈子里最纠结的一个问题。
先看时间线。7 月底 DeepSeek V4 正式上线,社区第一波反应全是围着价格转的:微博流传的竞技场跑分显示,V4 Flash 的智能水平排进测试模型前 13,任务成本排名最低,热帖一句话总结——“比它聪明的没它便宜,比它便宜的没有”。几天后又有微博帖子称,V4 Flash 以单日 8 万亿 Token 的吞吐量登顶全球大模型调用榜首,这个数字目前没看到官方确认,但热度是实打实的。同期国产模型挤成一团:Kimi K3 因火爆暂停新用户注册,微博话题"AI模型差价能有50倍"挂了好几天。8 月 13 日,V4 Pro 0813 版本发布,微博援引 DeepSeek 报告称其 Terminal-Bench 2.1 成绩从 72.1% 跳到 87.9%。
API 便宜成这样,本地部署是不是该散场了?
恰恰相反,第二幕从"晒跑分"变成了"晒部署"。8 月 11 日,小红书一篇"128G显存成功本地部署 deepseek v4 flash"的笔记拿到 448 赞、115 条评论、246 个收藏。小红书收藏快赶上一半点赞,说明大家是真在存下来照着配。8 月 24 日,B 站 UP 主"鲲鹏Talk"直接上了硬菜:4 张二手 CMP 170HX 矿卡(每张 8GB 显存)装进 4U 服务器,对 DeepSeek-V4-Flash-0731 连续压测 5.7 小时,23 个测试点、15268 条 GPU 采样数据,从 5 万 Token 一路测到 104 万 Token 的长上下文,日常稳定在 80 tok/s。哔哩哔哩最扎眼的是视频标题的后半句:“对比官方API多久回本”。同一周,社区里还躺着一堆平行样本:DGX Spark 测 Qwen3.8-27B 已经测到第七轮,有人把 Qwen3.8-27B 换成 FP8 量化提速到 71 t/s,IBM Technology 出了期对比 llama.cpp 与 vLLM 本地引擎的视频。哔哩哔哩连 9 月显卡推荐视频都把"本地部署大模型"单列成一个选购场景。

其实争论早就埋好了。7 月 23 日,也就是 V4 发布前一周,小红书有篇"本地部署大模型到底有意义吗",评论区盖了 487 层。小红书V4 的白菜价只是往这把火里又浇了一桶油。
所以真正的问题不是"部署不部署",而是:当省钱逻辑已经失效,本地部署到底在买什么?
先说省钱逻辑为什么塌了。矿卡压测视频把"多久回本"写进标题,这四个字等于承认:本地部署已经是一种投资行为。投资就要先垫硬件——4 张矿卡加一台 4U 服务器,或者一台 128G 显存级别的机器——再搭上电费、调试时间和折腾成本。

而 API 那头是"比它聪明的没它便宜"。对只是想用 V4 智能的普通用户,这笔账根本不用算:按量付费几乎必然比自己搭便宜。前几周 DeepSeek 调整过部分 API 价格,当时确实逼出一波迁本地的讨论,但 V4 Flash 这种"全网地板价"一出,"本地部署=省钱"这个说法对大多数人已经不成立了。
那为什么还在部署?因为另一本账浮出来了,我管它叫主权账。
第一笔:数据不出本机。合同文本、客户资料、内部代码,这些东西过任何云端 API 都有合规和心理成本。V4 权重可获取、能本地跑,128G 显存帖和矿卡压测都已经验证过,这条对特定职业不是"划算不划算",是"能不能"的问题。
第二笔:不限量、不排队、断网可用。API 再便宜也有限流、有服务条款、有宕机窗口;本地跑,吞吐上限只取决于你愿意堆多少电。
第三笔:长上下文和高频批量场景。矿卡团队为什么专门测 104 万 Token?因为这种用法走 API,账单是随量放大的,而本地是一次性投入、边际成本趋近电费。调用量越大,本地这端越可能反超。那篇 128G 显存帖的博主就是现成的例子:一个月花了学校将近 500 美元的 token 额度,被提醒省着点用,转头在 128GB 显存的 M3 笔记本上本地跑 V4 Flash,自述效果跟前沿模型没有明显区别,而且不需要管任何额度调用,“这下实现token自由了”。小红书

第四笔最容易被忽略,但它是社区声量的主力:折腾本身就是收益。那 44 条评论里有相当一部分在聊矿卡供电和散热,对硬件党来说,压测数据本身就是晒单。
基于这些,给三条决策线,对号入座:
第一条线:只是想要 V4 的智能,数据不敏感——直接用官方 API,别部署。部署对你就是纯成本,V4 Flash 的价格已经把"自建省钱"这条路基本焊死了。
第二条线:数据不能出本机、要在离线环境用、或者有长上下文高频调用——值得部署,但接受这是一次硬件投资。先看显存门槛再动手,别被"白菜价"三个字带偏。

第三条线:纯粹想折腾——部署,但请把账记成学费和玩具,不要拿"多久回本"折磨自己,矿卡压测那期视频就是给这条线的人看的参考样本。
几个避坑提醒顺手放这儿:矿卡集群是工程项目不是即插即用,供电散热主板都要算进去;量化是目前提速的主流手段,Qwen3.8-27B 那个 71 t/s 就是 FP8 的功劳;个人单机用 llama.cpp 系更灵活,要起服务跑并发再考虑 vLLM。哔哩哔哩
最后留几个值得持续盯的信号:一是 V4 Flash 的 API 定价能不能一直稳在地板,哪天它涨价,本地这笔账就得翻出来重算;二是 V4 Pro 的权重会不会放出来本地跑;三是显存和显卡的价格走势,最近这波涨得不太讲道理;四是 llama.cpp 和 vLLM 对 V4 系列的新版本支持速度,这直接决定本地体验的下限。
便宜到极致的 API 没有杀死本地部署,只是把它筛选了一遍:留下来的,要么有数据主权刚需,要么有长账本场景,要么就是单纯享受折腾。想清楚自己在哪一条线上,这题就不难。