DeepSeek涨价后,全网都在本地部署Qwen3.8-27B:想跟的,先看完4档硬件账和3笔隐藏成本

源自18位全网作者

03:53

这周 AI 编程圈如果你只关注了一件事,多半是这个:DeepSeek V4 Pro 官方 API 涨价,部分档位涨了十倍不止,有人开发一天,周额度直接归零。哔哩哔哩哔哩哔哩第二天,被大家当"避难所"用的 OpenCode 也跟着深夜提价。哔哩哔哩云端 token 这个原本几毛钱随便用的东西,突然变成了要认真算账的对象。

而从 8 月 14 日晚上开始,一条新出路冒了出来:阿里开源 Qwen3.8 系列,先是 2.4 万亿参数的 Max 底座,14 号晚上又放出了面向本地部署的 27B——稠密架构、原生多模态、262K 上下文、Apache 2.0 协议,官方说法是"全球 AI 社区呼声最高的模型尺寸"。小红书四天时间,全网进入部署狂欢:发布当天冲上 Hacker News 首页,r/LocalLLaMA 被刷屏,知乎、微博、B 站的实测帖按小时更新,出现频率最高的四个字是"token 自由"——本地跑起来,token 不要钱,再也不用看价格表。微博

听起来很美。但这几天我把散落在各平台的实测数据收拢、对了一遍之后,还是想先泼一点冷水:这份自由是有账本的,而大多数教程没写账本。

跑分炸裂,但跑分不等于能干

先看官方发布时的基准数据,确实吓人:SWE-bench Pro 跑出 61.7,同表超过 Claude Opus 4.6 Max;在部分 Agent 基准上也是压着打。知乎在 Artificial Analysis 的智能指数上,27B 进入了与顶级闭源模型相同的分数区间。难怪有知乎用户说,第一反应是"这分数假的吧"。

DeepSeek涨价后,全网都在本地部署Qwen3.8-27B:想跟的,先看完4档硬件账和3笔隐藏成本

不过社区里也有更冷静的说法:在它覆盖的那组能力测试里,27B 确实进入了第一梯队的分数区间,但这推不出"27B≈闭源旗舰";而且目前流传的分数多来自官方 model card,第三方独立验证还在路上。知乎微博

这两天被引用最多的一份实测,来自一位 5070 Ti 16GB 显存的用户:29 道经典 bug 修复题,有的干净利落地修好,有的掉进 debug 螺旋烧完全部步数,还有一道直接放弃——但它知道不行时不乱改。"写一个完整俄罗斯方块"的任务 3 次全部成功,每次 35 秒左右;数学题纯推理只对一半,给它一个 Python 执行工具后全对。知乎

结论其实很直白:这是一个"接上工具链就好好干活"的模型,不是让你看了跑分就能躺平的模型。连 B 站泼冷水视频的标题都很直给——很强!很难伺候!很难用!哔哩哔哩

全网硬件账:4 档,各有各的活法

每篇实测帖只有自己的那一台机器,我把目前能核实到的数据归拢成了四档:

你的硬件

能不能玩

实测要点

24GB 显存(4090 档)

甜点区,最成熟

Q4_K_XL 量化 + llama.cpp"真能干活";双 4090 跑 vLLM 有 128K 上下文实测

16GB 显存(5070 Ti 档)

能玩,须 3-bit 量化

能力折损可见;往 CPU 卸载一层,速度直接掉六成

Mac(32GB 内存起)

运行时决定生死

Ollama 只有 6 tok/s,换 MTPLX 到 18—21 tok/s,M5 Max 官方标称 58.7

没卡 / 低配

别硬上

已有第三方 API 上架;云端 vLLM+A800 可"平替 deepseek-flash"

有两个常见误区要澄清。第一,“最低 8GB 显存就能跑"是极限量化的宣传话术——稠密模型必须把 270 亿参数全部塞进显存,想靠 CPU 卸载补救,生成速度一层就能掉六成。知乎第二,别只按模型本体算显存:4-bit 量化后的权重大约 16GB,但加上 KV cache,真实占用要到 20—24GB,RTX 4090 这一档才跑得舒服——这也解释了为什么 5070 Ti 用户只能退到 3-bit。微博至于速度,别拿别人的数字当自己的:同一个模型,运行时、量化、上下文长度、散热不同,结果天差地别,有微博用户实测只剩 10 tok/s,也有人直言"显存完全不够,连玩具都算不上”。微博

DeepSeek涨价后,全网都在本地部署Qwen3.8-27B:想跟的,先看完4档硬件账和3笔隐藏成本

三笔隐藏成本,教程不会教你

第一笔:思考消耗。 这是本周被吐槽最多的问题:Reddit 热帖标题直接就是"拒绝停止思考"。知乎国内有双 3080 用户实测,开了深度思考后 200K 上下文"根本不够",改一行 CSS 它能脑补几千 token 的内心戏。哔哩哔哩本地 token 确实不要钱,但你的等待时间要钱,上下文也要钱。对策已经有了:官方新增了 reasoning_effort 开关,简单任务可以直接关掉思考。微博社区也出了 Cold-Fusion 这类思考压缩版——代价是你得持续追版本。

第二笔:能力折价。 3-bit 量化是 16GB 显存的入场券,代价是实测可见的能力降级;你换来的是"能干活的 Opus 替身",不是顶级能力本身。社区给它的定位很准:本地 Agent 的中坚,不是云端旗舰的万能平替。

第三笔:调参时间。 运行时选错,速度差三倍只是起步,量化版本、上下文上限、KV cache 参数,个个都是取舍。知乎有微博用户写得特别好——悲报:ds4 涨得好贵;喜报:折腾了一天,在实验室服务器部署 qwen3.8 27b 成功了,现在有花不完的 token 了。微博这个"折腾了一天",就是每个心动的人该提前预算的成本。

DeepSeek涨价后,全网都在本地部署Qwen3.8-27B:想跟的,先看完4档硬件账和3笔隐藏成本

所以,到底该不该部署?

问自己三个问题:

  1. 有没有现成硬件? 24GB 显存档的显卡,或 32GB 内存以上的 Mac。如果要新买卡,先算这张卡的价格能抵几个月涨价后的云端订阅——多数情况下算不平。

  2. 是不是高频且在意隐私? 天天写代码、又不想代码出本机,本地是双重收益;一周用三次,云端涨价后的价格往往还是比电费加你的时间便宜。

  3. 能不能接受"能干但不是顶级"? 能接受,27B 就够;项目每一步都要顶级能力,本地暂时还接不住。

三个答案都是肯定,那就部署,路线已经很成熟:N 卡走 llama.cpp/vLLM + 4-bit 量化,Mac 直接上 MTPLX。知乎更关键的是,这些运行时的端点普遍兼容 OpenAI/Anthropic 协议,你平时用的 Claude Code、Cline、DeepSeek Harness 可以直接指过去,使用习惯零成本。知乎另外值得一提:27B 用的是 Apache 2.0 协议,想把它嵌进自己的产品里,法律摩擦也比那些自定义条款的模型小得多。

DeepSeek涨价后,全网都在本地部署Qwen3.8-27B:想跟的,先看完4档硬件账和3笔隐藏成本

有任何一个答案是否定的,不部署也不丢人。云端加低价档 API,或者等下一轮模型发布再观望,成本都比硬上低。知乎

值得继续盯的信号:思考压缩版的迭代速度(直接决定体验下限)、更多运行时何时跟上 MTP 加速、DeepSeek 们的价格会不会再调。本地部署从"玩具"变"正经选项"的窗口,正在以超出所有人预期的速度打开。

内容由AI生成

精选参考来源

1. AI白菜价终结?DeepSeek凌晨偷偷涨价11倍 | 国产AI变天

2. 再见了D小弟——DS涨价后,我开发一天,周额度0%

3. 【突发】快跑! OpenCode深夜涨价,价格对标官方api,DS涨价避难所变绞肉机,用户的未来将何去何从?我们怎么办?只有天知道。

4. 开源!Qwen3.8-27B如约而至

5. #how i ai# 阿里这周把 Qwen3.8 的权重陆续开源了,两个型号,但完全是两种开放。先是 8 月 13 日放出 Qwen3.8-2.4T-A95B,也就是 Qwen3.8-Max 的底座。2.4 万亿总参数、每 token 激活 95B,MoE 架构,原生 262K 上下文、可外推到 1M。这是 Qwen 第一次把 Max 级别的权重开放下载,意义不小。但说实话,这个开放打了不少折扣:用的是自定义许可,不是 Apache 2.0;权重是纯文本的,没有 API 版那种视觉能力和 1M 上下文,推理还强制开启 thinking;硬件门槛也高,BF16 大约要 4.89TB 显存,得靠一堆 H100 级别显卡才跑得动。社区里有人直接说很失望。所以它是个理论上开放的旗舰。真正对开发者有意义的,是隔一天(8 月 14 日)开源的 Qwen3.8-27B。这是个 270 亿参数的稠密(Dense)原生多模态模型,能看图和视频,Apache 2.0 协议,262K 原生上下文、YaRN 可扩到 1M。4-bit 量化后权重大约 16GB,一张高端消费级显卡、甚至 32GB 内存的 MacBook 就能跑。发布当天直接冲上 Hacker News 首页第一、上千赞。性能上它比上一代 Qwen3.6-27B 涨了一大截,整体超过了参数更大的 Qwen3.7-Plus,而且在部分 agent 基准上超过了 Claude Opus 4.6 Max——比如 CoWorkBench 70.7 对 68.2、LiveCodeBench v6 90.3 对 88.8、OSWorld-Verified(电脑操作)84.3。一个 27B 的本地模型能在 GUI agent 这类任务上压过闭源旗舰,这本身就挺反常的。几个值得留意的细节:27B 是 Dense 架构不是 MoE,每个参数都参与计算,本地推理反而更省事,不用处理稀疏路由那套。新增了 reasoning_effort 开关,简单任务可以关掉思考,延迟更低。官方给出的分数目前都是自家 model card 的数据,第三方独立验证还得等一两周。实际跑起来别只盯着 16GB:加上 KV cache,4-bit 量化真实显存大概要 20–24GB,RTX 4090 那档才舒服。关于 2.4T 那个自定义许可「禁用美欧英韩」的传言是假的,协议里没有地域限制,只是对大模型商用的收入阈值有要求。整体看,阿里这次是两条线一起打:2.4T 给有基础设施、要天花板的人,27B 给更广大、想在本地私有部署里跑得动的人。而 27B 用 Apache 2.0 而不是会撤回的定制条款,对想直接塞进产品、用自有数据微调的公司来说,法律摩擦小很多。

6. Qwen-3.8 27B开源权重发布,有什么值得关注的地方?

7. 怎么看Qwen 3.8 27B在人工智能指数得分追平GPT 5.6 luna,单卡小模型生产力来了吗?

8. Qwen3.8-27B实测 (5070Ti 16GB VRAM)

9. 泼冷水!Qwen3.8 27B三宗罪:很强!很难伺候!很难用!

10. 今天试了一下qwen3.8 27b,连玩具都算不上,显存完全不够35b a3b来的话就太好了,3.6终于可以升级了

11. Qwen 3.8/3.6-27B 社区实测:当开源大模型开始把闭源打得满地找牙,本地党们在讨论什么?

12. 测一下qwen3.8 27b,不开深度思考的情况下吊打deepseek-v4-flash,注意看简介

13. 老机器 Qwen3.8-27B 每秒 20+ token:MTPLX 四档上下文实测

14. 悲报:ds4涨的好贵喜报:折腾了一天在实验室服务器部署qwen3.8 27b成功了 现在有花不完的token了

15. 超强端侧大模型!一张 4090,把 Qwen3.8-27B 跑到真能干活:能力实测、快速部署与最佳参数分享

16. Qwen3.8-27B vLLM 部署——Unlimited Tokens

17. Qwen3.8-27B 开源后,我用双 RTX 4090 跑通了:vLLM 0.27.1、128K 上下文与 MTP 实测

18. Qwen3.8-27B 开源了!Mac mini 直接跑

0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章