这周 AI 编程圈如果你只关注了一件事,多半是这个:DeepSeek V4 Pro 官方 API 涨价,部分档位涨了十倍不止,有人开发一天,周额度直接归零。哔哩哔哩哔哩哔哩第二天,被大家当"避难所"用的 OpenCode 也跟着深夜提价。哔哩哔哩云端 token 这个原本几毛钱随便用的东西,突然变成了要认真算账的对象。
而从 8 月 14 日晚上开始,一条新出路冒了出来:阿里开源 Qwen3.8 系列,先是 2.4 万亿参数的 Max 底座,14 号晚上又放出了面向本地部署的 27B——稠密架构、原生多模态、262K 上下文、Apache 2.0 协议,官方说法是"全球 AI 社区呼声最高的模型尺寸"。小红书四天时间,全网进入部署狂欢:发布当天冲上 Hacker News 首页,r/LocalLLaMA 被刷屏,知乎、微博、B 站的实测帖按小时更新,出现频率最高的四个字是"token 自由"——本地跑起来,token 不要钱,再也不用看价格表。微博
听起来很美。但这几天我把散落在各平台的实测数据收拢、对了一遍之后,还是想先泼一点冷水:这份自由是有账本的,而大多数教程没写账本。
跑分炸裂,但跑分不等于能干
先看官方发布时的基准数据,确实吓人:SWE-bench Pro 跑出 61.7,同表超过 Claude Opus 4.6 Max;在部分 Agent 基准上也是压着打。知乎在 Artificial Analysis 的智能指数上,27B 进入了与顶级闭源模型相同的分数区间。难怪有知乎用户说,第一反应是"这分数假的吧"。

不过社区里也有更冷静的说法:在它覆盖的那组能力测试里,27B 确实进入了第一梯队的分数区间,但这推不出"27B≈闭源旗舰";而且目前流传的分数多来自官方 model card,第三方独立验证还在路上。知乎微博
这两天被引用最多的一份实测,来自一位 5070 Ti 16GB 显存的用户:29 道经典 bug 修复题,有的干净利落地修好,有的掉进 debug 螺旋烧完全部步数,还有一道直接放弃——但它知道不行时不乱改。"写一个完整俄罗斯方块"的任务 3 次全部成功,每次 35 秒左右;数学题纯推理只对一半,给它一个 Python 执行工具后全对。知乎
结论其实很直白:这是一个"接上工具链就好好干活"的模型,不是让你看了跑分就能躺平的模型。连 B 站泼冷水视频的标题都很直给——很强!很难伺候!很难用!哔哩哔哩
全网硬件账:4 档,各有各的活法
每篇实测帖只有自己的那一台机器,我把目前能核实到的数据归拢成了四档:
你的硬件 | 能不能玩 | 实测要点 |
|---|---|---|
24GB 显存(4090 档) | 甜点区,最成熟 | Q4_K_XL 量化 + llama.cpp"真能干活";双 4090 跑 vLLM 有 128K 上下文实测 |
16GB 显存(5070 Ti 档) | 能玩,须 3-bit 量化 | 能力折损可见;往 CPU 卸载一层,速度直接掉六成 |
Mac(32GB 内存起) | 运行时决定生死 | Ollama 只有 6 tok/s,换 MTPLX 到 18—21 tok/s,M5 Max 官方标称 58.7 |
没卡 / 低配 | 别硬上 | 已有第三方 API 上架;云端 vLLM+A800 可"平替 deepseek-flash" |
有两个常见误区要澄清。第一,“最低 8GB 显存就能跑"是极限量化的宣传话术——稠密模型必须把 270 亿参数全部塞进显存,想靠 CPU 卸载补救,生成速度一层就能掉六成。知乎第二,别只按模型本体算显存:4-bit 量化后的权重大约 16GB,但加上 KV cache,真实占用要到 20—24GB,RTX 4090 这一档才跑得舒服——这也解释了为什么 5070 Ti 用户只能退到 3-bit。微博至于速度,别拿别人的数字当自己的:同一个模型,运行时、量化、上下文长度、散热不同,结果天差地别,有微博用户实测只剩 10 tok/s,也有人直言"显存完全不够,连玩具都算不上”。微博

三笔隐藏成本,教程不会教你
第一笔:思考消耗。 这是本周被吐槽最多的问题:Reddit 热帖标题直接就是"拒绝停止思考"。知乎国内有双 3080 用户实测,开了深度思考后 200K 上下文"根本不够",改一行 CSS 它能脑补几千 token 的内心戏。哔哩哔哩本地 token 确实不要钱,但你的等待时间要钱,上下文也要钱。对策已经有了:官方新增了 reasoning_effort 开关,简单任务可以直接关掉思考。微博社区也出了 Cold-Fusion 这类思考压缩版——代价是你得持续追版本。
第二笔:能力折价。 3-bit 量化是 16GB 显存的入场券,代价是实测可见的能力降级;你换来的是"能干活的 Opus 替身",不是顶级能力本身。社区给它的定位很准:本地 Agent 的中坚,不是云端旗舰的万能平替。
第三笔:调参时间。 运行时选错,速度差三倍只是起步,量化版本、上下文上限、KV cache 参数,个个都是取舍。知乎有微博用户写得特别好——悲报:ds4 涨得好贵;喜报:折腾了一天,在实验室服务器部署 qwen3.8 27b 成功了,现在有花不完的 token 了。微博这个"折腾了一天",就是每个心动的人该提前预算的成本。

所以,到底该不该部署?
问自己三个问题:
有没有现成硬件? 24GB 显存档的显卡,或 32GB 内存以上的 Mac。如果要新买卡,先算这张卡的价格能抵几个月涨价后的云端订阅——多数情况下算不平。
是不是高频且在意隐私? 天天写代码、又不想代码出本机,本地是双重收益;一周用三次,云端涨价后的价格往往还是比电费加你的时间便宜。
能不能接受"能干但不是顶级"? 能接受,27B 就够;项目每一步都要顶级能力,本地暂时还接不住。
三个答案都是肯定,那就部署,路线已经很成熟:N 卡走 llama.cpp/vLLM + 4-bit 量化,Mac 直接上 MTPLX。知乎更关键的是,这些运行时的端点普遍兼容 OpenAI/Anthropic 协议,你平时用的 Claude Code、Cline、DeepSeek Harness 可以直接指过去,使用习惯零成本。知乎另外值得一提:27B 用的是 Apache 2.0 协议,想把它嵌进自己的产品里,法律摩擦也比那些自定义条款的模型小得多。

有任何一个答案是否定的,不部署也不丢人。云端加低价档 API,或者等下一轮模型发布再观望,成本都比硬上低。知乎
值得继续盯的信号:思考压缩版的迭代速度(直接决定体验下限)、更多运行时何时跟上 MTP 加速、DeepSeek 们的价格会不会再调。本地部署从"玩具"变"正经选项"的窗口,正在以超出所有人预期的速度打开。