8 月 17 日,DeepSeek 的新定价正式生效。在 B 站播放量最高的那条 Qwen3.8-27B 本地部署教程下面,点赞第一的评论有 188 个赞:“有没有人和我一样,是看到 DeepSeek 涨价后才来看本地部署的?”
这波人为什么跑出来,不难理解。云端这边,DeepSeek 首次引入峰谷分时计价,工作日高峰时段价格翻倍,旗舰 V4-Pro 高峰时段的输出价格升至 27 元/百万 tokens,较调价前上调约 350%。36氪有媒体采访的用户,涨价当日单日模型成本从不到 20 元涨到了近 200 元。本地那边,Qwen3.8-27B 在 2026 年 8 月 14 日开源。知乎这是个 27B 参数的 Dense 模型,被社区称为"单张消费级显卡能跑的最强模型",实测帖里给出的许可证是 Apache 2.0,个人随便用。云在变贵、模型变好用,两件事一碰,往本地部署跑的人就排起了队。

但这模型到家到底需要什么条件?这两周知乎、B 站、小红书的实测帖已经卷翻了,结论却五花八门:有人说 8G 显存就能跑,有人在小红书发帖灵魂拷问"拿 2 万块换本地 AI,你愿意么?"。我把全网实测帖翻了一遍,把这次的硬件真相浓缩成几条,看完再掏钱。
先记两条规则,能过滤掉八成噪音
第一条,显存(或统一内存)容量决定"能不能跑"。Qwen3.8-27B 的 BF16 原始权重约 54GB,量化到 8-bit 约 30GB,4-bit 约 17~19GB,压到 3-bit 约 13GB。装不下,要么跑不了,要么只能把权重卸到内存、硬盘里,速度掉到折磨级别。
第二条,带宽决定"跑多快"。英伟达 DGX Spark 有 128GB 内存,比 RTX PRO 6000 的 96GB 还大,但带宽只有 273GB/s,约为后者 1792GB/s 的六分之一,跑这种大 Dense 模型速度就是起不来。容量决定能不能跑,带宽决定跑多快,"内存大=跑得爽"对稠密模型只成立一半。小红书
分档实测:你的卡在哪一档
8G 显存(RTX 2070 / 3060 / 部分矿卡):能跑,但只能叫"跑起来"。有人拿服役 8 年的 2070 极限实测,层卸载、KV 量化、推测解码全上:IQ2 量化写写小说还行,思维链容易断;IQ4_XS 能跑 Agent 任务,但速度只有约 1 token/秒。当玩具可以,干活别想。
16G 显存(4060Ti / 5060Ti / 5070Ti / 4080):社区公认的入场券。Q3 / IQ3_S 量化能装下,实测 40 tok/s 上下,双 5060Ti 甚至能拉起 182K 上下文。社区里被反复引用的结论是:16G 以上显存,才可以流畅胜任绝大多数本地 Agent 工作。
24G 显存(3090 / 4090):舒适区。有人单卡 3090 实测,上下文可以开 230k,显存占用 98%,非常极限了。知乎Q4_K_M 单卡直跑供 Coding Agent 调用,是目前社区公认的"甜点"。
32G(5090)及以上:富余档。1792GB/s 的带宽喂 27B 正好,还能兼顾打游戏;要多 Agent 并发就上两张。96G 的 RTX PRO 6000 属于生产级配置,价格也对普通人不友好。
Mac 阵营:统一内存能用相对低的价格买到更大容量,但带宽普遍只有顶级显卡的一半甚至更低,社区建议 24GB 统一内存起步跑 IQ3_S;M3 Ultra 256GB 级别的机器,已经有人拿来做更大模型的对比实测了。

然后是最要钱的环节:这笔钱到底该怎么花
先给一个反直觉的结论:如果目的只是省模型调用费,租云显卡是算不过账的。社区口径 5090 租金约 3 元/小时,按 40 tok/s 的实测水平跑 27B,一小时约产出 15 万 output tokens,折合每百万 tokens 约 20 元。而 Qwen3.8-Flash 的官方 API 刚上线,每百万 Tokens 输入 1 元,输出 3 元,比 DeepSeek 同档的谷时价格还低 33%。36氪同样的活儿,调用成本比租卡便宜一个数量级。租卡的真正价值是:不用一次掏几万买卡,还能先验证自己是不是真需要。

本地这条路,只有需求命中这几条才值得走:数据不出本机、不限流、离线环境、想要无审查版本,或者折腾本身就是目的。如果用量不大、任务简单,1 元/3 元的 API 就是最省钱的路线。实测党里也有清醒的声音:"本地部署只能干干简单的破限推理、破限小说……没有破限需求的,放弃是最好的选择。"这话难听,但值得听。
三个坑,都是真人踩出来的
极端量化(IQ2 / IQ4_XS 这类)下不要无脑开思考模式,容易触发 token 溢出、无限循环。哔哩哔哩
8 月 26 日千问又开源了 Qwen3.8-Flash-Next,主模型参数量为 125B,每 token 只激活 6B。36氪它基准成绩多处超过 27B,但内存门槛极高,家用电脑基本装不下,"用固态硬盘跑模型"的方案有人实测,评价在"黑科技"和"纯折磨"之间分裂——别为它冲动买硬件。
与 27B 同期发布的 2.4T 旗舰 Qwen3.8 用的是自定义商业许可,超大规模商用要另谈条款。36氪27B 则保留 Apache 2.0——"模型越大,免费午餐越少"的趋势已经出现,后续追更值得留意。

继续观察的信号:Qwen4 正式家族的发布(Flash-Next 只是先导预览版)、16G 卡社区魔改版的更新节奏(榜单迭代很快)、DeepSeek 峰谷计价的后续调整。
最后一句建议:手里已有 16G 卡的,直接试 Q3 量化版,多半能白嫖到位;没卡、正在二手 3090 和新 5090 之间犹豫的,先去租几个小时云显卡,确认需求真实存在,再掏这笔钱。