玩本地大模型的这帮人,这周是真热闹。两条新闻前后脚只差几天,把"本地部署"从小众爱好直接推到了算账的桌面上。
8 月 14 日,阿里通义千问正式开源 Qwen3.8-27B,270 亿参数稠密多模态模型,原生 262K 上下文,Apache 2.0 协议,社区给它的定位很直接——16GB 显存单卡就能部署。知乎
8 月 17 日,DeepSeek 新一轮定价正式生效,这次涨得不少。微博东方财富的报道标题毫不客气:DeepSeek 不再白菜价,API 最高涨 11 倍。东方财富
一边是云上变贵,一边是本地开源模型强得有点离谱。原本安心调 API 的重度用户开始动摇:这工作负载,要不要搬回家?今天把这笔账认真算一遍。
DeepSeek 这波涨得有多狠
先看疼的程度。DeepSeek 新定价方案相当复杂,按模型、输入输出、时段各有不同,以至于"到底涨了多少"本身就是一道计算题。知乎一个值得注意的细节:这次 Pro 的涨幅约为 Flash 的 3 倍,且高峰时段涨得最多。知乎

知乎用户靳伟拿自己某个月的真实用量套了新价格:他日常主力是 deepseek-v4-flash,flash 和 Pro 的用量比大约 9:1,算下来涨幅在 2.06 倍到 4.11 倍之间,混合约 3 倍。知乎他的结论很直白:涨价之后,账单已经大大超出 99 元/月的编程包月套餐,性价比优势荡然无存。
这不是个例。相关问题下有人表示涨了 3 倍,打算把不重要的负载迁移出去。知乎也有人开始怀念,V4-flash 正式版加低价的那段日子真是快乐。
第三方工具侧的反应更直接:opencode 的 go 套餐里,V4-Flash 模型的调用次数从 6 万直接掉到 3 千多。知乎
当然也要说句公道话:涨完之后,DeepSeek 对国外顶级模型依然保持明显价格优势。知乎国内也已经有新模型补上它腾出来的低价生态位,价格接近涨价前的 Flash。知乎所以这不是"云不能用了",而是"重度用户的无限量廉价 token 时代结束了"。
Qwen3.8-27B 为什么偏偏是这个时候被盯上
时间点太巧。涨价阵痛最猛的这一周,正好是 Qwen3.8-27B 开源后的第一周。这个模型身上几个特性,几乎条条对着本地部署的痛点:
27B 稠密参数,Q4_K_M 量化后约 17GB,16GB 显存卡咬咬牙能进,要注意给 KV cache 留空间,24GB 显存就很从容;
原生多模态,能看图、能圈目标返回边界框;
官方跑分超过前代 Qwen3.6-27B 和闭源的 Qwen3.7-Plus,社区资料里它在多项智能体基准上追平甚至超过闭源旗舰;
Apache 2.0 协议,商用无压力。

圈内的评价相当统一:当前消费级显卡能部署的最强模型就是 Qwen3.8-27B,毫无争议。知乎
视觉能力也不是凑数的。社区实测里,模型能在照片里准确框出多个目标并返回坐标,连测试圈经典的鹈鹕照片都稳稳拿下。知乎

把这一周知乎、B 站社区实测里讨论最多的速度数据归拢一下(量化方案和环境各不相同,横向对比仅供参考):
硬件 | 量化 | 实测速度 | 备注 |
|---|---|---|---|
RTX 4090 24G | Q4 | 流畅跑通 | 最有代表性的配置 |
AMD 7900 XTX 24G | Q4 | 约 62 tok/s | workbuddy 实测 |
16G 显存卡 | Q3 | 约 40 tok/s | B 站 UP 主实测 |
M5 Max 128G(Mac) | Q4_K_M | 可用 | 开发者实测 |
Ryzen AI Max+ 395 128G | Ollama | 已跑通 | 统一内存路线 |
RTX 5090 32G | Q4/Q8 | 并行多任务 | 本地 Agent 工作站方向 |
其中"16G 显存能不能跑 27B"是玩家讨论最多的话题,Q3 量化下实测约 40 tok/s,社区的反应是"居然也有这么强"。哔哩哔哩AMD 阵营也没缺席,7900 XTX 上输出速度约 62 tok/s。知乎4090 单卡跑通全参数 27B 的视频,开源当天就冲上了热门。哔哩哔哩
再补一个反常识实测:有 UP 主用 i7-14700KF 加 RTX 5070 Ti 16G 的家用机测了 4 个人同时和本地模型对话(用的是 Qwen3.6-35B-A3B 这款 MoE),单人约 44 tok/s,4 人同时每人只剩约 17 tok/s,而总吞吐始终恒定在 44 左右。哔哩哔哩本地大模型的并发上限是内存带宽——能用多人,但只能排队分速。指望部署一次服务全办公室的,可以冷静一下。
算账:本地部署真省钱,但只对一种人成立
先说结论:手里已经有 16GB 以上显存显卡、日常 token 消耗重的,现在就迁是划算的;需要专门买卡的,大多数人回不了本。
算给你看。涨价后的重度用户,账单大概到了"大大超出 99 元/月编程套餐"的水平。知乎按 API 月支出 150—300 元估,重度 agent/coding 场景下 token 是流水一样烧的,这个估算不激进。
本地这边的成本:已有显卡的话,硬件是沉没成本,只剩电费。跑 27B 推理时主流高性能卡整机功耗大约 300—450W,按每天重度生成 8 小时、电价 0.6 元/度算,月电费约 43—65 元;中度使用每天两三小时,大约 15—20 元。对比 150—300 元/月的 API 账单,省的是真金白银,而且用得越狠省得越多。
但没卡的话,账就变了性质:一张 16G—24G 显存的主力卡,投入大约 3500—5500 元;就算每月能省 200 元 API 费,回本周期也要 18—25 个月。显卡有残值、还能打游戏跑绘图,但如果"省 token"是唯一动机,轻度用户真回不了本。
还有一笔容易被忽略的账:包月套餐。涨价之后,包月制的存在感反而更强了——GLM Coding Plan 99 元/月,Qwen Token Plan 139 元/月版按 7 天限额 1 万积分滚动计。知乎中轻度使用的话,最划算的既不是硬扛 API 也不是本地部署,而是换个包月。
必须改的 3 个设置,不然"很强但很难伺候"
这是本周翻车最集中的地方。Qwen3.8-27B 能力没得说,开箱体验却是另一回事,B 站的泼冷水视频标题就是社区心态的写照:很强,很难伺候,很难用。哔哩哔哩
第一,把推理强度调低或关掉。模型默认使用 xhigh 推理强度,对消费级硬件是灾难。知乎
开发者 Simon Willison 实测让它画一张"鹈鹕骑自行车"的 SVG,它先思考了 22276 个 token,整整跑了 21 分钟;关掉推理后,同一任务只要 137 秒。知乎国内实测也发现,深度思考一开,200K 上下文都不够它想的。日常用建议把 reasoning_effort 设成 low 或直接关闭,高强度推理留给真正的硬问题——评测者的建议很直接:第一次用先把推理调到 low 甚至关掉,模型本身很出色,但默认设置不适合拿来起步。

第二,把上下文拉大。LM Studio 默认 8192 的上下文,会被思考过程瞬间吃光,拉到完整的 262144 才算正常。知乎
第三,按显存选量化。16GB 显存用 Q3 或 Q4_K_M,注意给 KV cache 留空间;24GB 以上建议 Q6,质量更稳。社区还有实测:给 llama-server 加两个参数,Qwen3.8-27B 的速度能再提 30%。知乎8GB 以下显存基本没有无损玩法,只能当尝鲜。
4 种人,4 个结论
日常重度 agent/coding,手里有 16G+ 显存卡:迁。把上面 3 个设置改好,在 API 大幅调价的当下,27B 就是目前最有性价比的端侧 Agent 模型,电费账怎么算都划算;有敏感数据需求的更是双重坚定。知乎
重度使用,但没合适的卡:先算回本周期。每月 API 支出不到 200 元的,别为这事专门买卡,包月套餐和补位低价 API 都先看看。
轻度使用:别折腾本地部署,换包月。99—139 元/月的套餐覆盖大部分日常需求,别为了"免费"两个字去受部署的苦。
这些场景继续留在云上:要顶级模型能力的任务、多人并发、超长上下文加深推理的组合。本地部署解决的是"重负载、单用户、要隐私",不是万能替代。
值得继续盯的信号
DeepSeek 新一轮灰度测试已经开始,社区流传新版本能力超过上次灰测,甚至可能藏着更大的版本。知乎如果新版本落地并调整定价策略,本地迁移的紧迫性会跟着变;
Qwen3.8-27B 的生态正在快速补全:量化版本、llama.cpp 优化、Agent 框架适配陆续到位,速度纪录还会被刷新;
低价 API 生态位正被新模型填补,云端价格大概率还有一轮博弈。
最后一句:这不是"云 vs 本地"的站队题,而是重度用户第一次被迫认真计算"一个 token 到底值多少钱"。算完这一遍,每个人的答案都不一样——但这笔账本身,值得每个本地大模型玩家都算一次。