DeepSeek 已经把 V4-Flash 用 MIT 协议开源,开发者可以自托管,边际成本趋近电费。尬聊大师涨价也随之而来,有人跑了一天任务,钱包直接少了 100 块。無生免费渠道也开始接连下架,OpenCode 的 DeepSeek-V4-Flash 免费入口已经没了。GPT工具人本地部署圈这一周有点热闹:有人晒 8 卡整机,有人研究内存条,有人在群里问白嫖渠道还能不能回来。
今天把一个问题聊透:想在自己电脑上跑 V4-Flash,到底要什么配置? 我把全网这周的实测和论文翻完了,先说结论——能走的路有三条,但对应的是完全不同的三类人。
先澄清一个最容易踩的误区。V4-Flash 是 MoE 模型:284B 总参数,每个 token 只激活 13B,每层 256 个专家只激活 6 个。北京日报这意味着激活参数决定算力速度,总参数决定你要多少内存。FP4 精度下专家池约 140GB。机器之心所以"只激活 13B"不等于"16G 显存能跑"——权重总得有个地方放下。这是 MoE 本地部署和以前玩 Qwen 那种稠密模型最不一样的地方。
路线一:单卡+大内存(FreeToken 路线)
周五,UC Berkeley、MIT 等机构的联合团队开源了边缘推理系统 FreeToken,作者名单里有 Ion Stoica、Matei Zaharia、韩松,阵容相当硬。思路一句话:显存不够,内存来凑。RTX 5090(32G 显存)配约 192GB 系统内存,就能跑 V4-Flash。机器之心

论文数据是首 token 延迟比传统 offload 低 42%–58%,Agent 多轮场景的后续 TTFT 降 65%–80%,是"交互级实用速度",不是每秒两三个 token 的煎熬。机器之心Windows、Linux 都有带 GUI 的桌面 App,命令行一行就能装。

注意两点:一是 2026 年内存涨价还没停,192GB DDR5 的预算要按实时价算;二是这条路线面向个人交互场景,要多人并发的别想。
路线二:多卡堆显存(8×3090 路线)
知乎上有人实测了 8 张二手 RTX 3090:192G 总显存,模型做成 GGUF/MXFP4 约 155GB,llama.cpp 起 OpenAI 兼容接口。Black J

单次实测首字时延 680ms、生成约 39 tokens/s。Black J整机预算 6.5–6.9 万,GPU 占六成。

这条路的正确打开方式是团队:数据不出内网、算力自己调度、夜里挂批处理任务。而且作者自己泼了冷水——整机满载 3kW 往上,24 小时跑月电费千元级,要 16A 独立回路,开放式机架噪音巨大,二手卡还得预留返修备件钱。Black J个人轻度用户买它纯属给自己找事。
路线三:不买硬件,继续用 API
说句实话,对大多数人这条路最现实。V4-Flash 官方定价本来就是全球最低档:输出 2 元/百万 tokens,而 Claude Opus 级别的模型动辄 20–30 美元/百万 tokens。智科小探涨完价绝对值也不算离谱。
真正烦人的是两件事:峰谷定价已预告——高峰时段(9–12 点、14–18 点)翻倍。智科小探OpenCode 这类免费渠道因扛不住成本接连下架。GPT工具人
应对也简单:批量任务挪到夜间低谷跑,提前多注册几个备用渠道,把本地部署当最后退路而不是第一选择。
到底值不值得为它买硬件?
帮你把决策逻辑捋成三句话:
同时满足这三条才考虑买:已经有(或本来就打算买)32G 显存的卡、有真实的高频 Agent/编程需求、在意数据不出本机或需要全天候可控算力;
纯聊天、偶尔写代码的,API 一定更省。别被"Token 自由"带热血上头——那篇 6 万块 8 卡实测的作者自己都说,Token 自由不是没有成本,只是成本结构回到了自己手里。Black J
想蹲后续的,盯三个信号:V4-Pro 正式版什么时候发、峰谷定价的生效日期、FreeToken 会不会支持更多模型(论文结尾他们自己都在等传说中的 Qwen3.8-A3B)。机器之心
最后补一个避坑提醒:这周上线的多模态 Vision-Exp 目前只有 API。文兰公子图片会被强制缩放到 800×800,社区已经有人吐槽"细节多一点的图直接抓瞎"。尸王想本地跑多模态的先别折腾,等权重放出来再说。