这几天,本地部署党像过年一样。以 Apache 2.0 协议开源的 Qwen3.8-27B,两天内下载量突破百万,成了眼下讨论度最高的开源模型。知乎海外开发者连外号都起好了:Reddit 上有人叫它“游戏规则改变者”,更多人用“Opus at Home”来形容它——闭源旗舰级的能力,跑在自己家里,讨论焦点直接变成“我的 3090 能不能跑”。微博官方规格也很明确地瞄着本地场景:原生多模态稠密模型,量化后在消费级显卡上即可流畅运行,原生 262K 上下文,用 YaRN 技术可以轻松扩展到 1M tokens。微博
先把时间线捋一遍。8 月 3 日,2.4 万亿参数的 MoE 旗舰 Qwen3.8-Max 发布,API 定价每百万 tokens 输入 12 元、输出 36 元;8 月 12 日深夜权重开源,这是千问历史上第一次把 Max 级旗舰放出来给所有人下载。知乎两天后 27B 稠密版跟进,官方以宽松的 Apache 2.0 协议开放模型权重,所有人都可免费下载、部署及商用。微博

能力账:分数亮眼,但先认清“尺子”
先说分数,不用谦虚:在测试真实 GitHub issue 修复的 SWE-bench Pro 上拿到 61.7 分,超越 Claude Opus 4.6 Max 的 53.4。知乎OSWorld 电脑操作 84.3 对 72.7,AndroidWorld 手机操作 81.9 对 62.0,CoWorkBench 办公任务 70.7 对 68.2,LiveCodeBench 代码生成 90.3,核心 Coding 和 Agent 项目对 Opus 优势明显。微博Artificial Analysis 给出 52 分的综合分,和 GPT-5.6 Luna 持平,只比 DeepSeek V4 Pro、GLM-5.2 低一分。哔哩哔哩

但两盆冷水也必须浇。第一,官方那张成绩表是用 Claude Code harness 跑的,Qwen 修正了有问题的任务后在精修过的题目集上重跑,截至 2026 年 8 月中旬,没有任何独立实验室复现过官方那张表的质量分数。知乎第二,在 WildClawBench 的 60 项真实任务集上,它总分 48% 排第 15,仍落后于更大的托管模型——真实任务动辄跑几个小时、反复调用工具,27B 的优势没有跑分表上那么绝对,“超 Opus”不等于“取代 Opus”。微博
硬件账:先看你的显卡在哪一档
这部分最值得收藏。综合社区最近一周的实测,可以拍出一张分档表:
显存档位 | 可行方案 | 实测参考 |
|---|---|---|
16GB(5070Ti 等) | 只能上 3-bit 量化 | Q4 权重单独就能吃满显存;3-bit UD 版仍能干活 |
24GB(3090/4090) | Q4_K_M(约 17GB)+ 200K 上下文 | 甜点区,优化后 50-60tps,3090 实测 40~47 Tokens/s |
32GB+ / 双卡 | 更高量化或多卡并行 | 余量越大,上下文越宽裕 |
Mac 统一内存 | MLX 4-bit | M3 Ultra 512G 的 Q4 版约 30+ Tokens/s |
RTX 5090 | 高端单卡 | 稳定 60 Tokens/s 左右,峰值 100+ |
三个判断,逐条说。判断一:24GB 是当前甜点区。有人花 1-2 天在 Windows+LM Studio+3090Ti 上做优化,输出速度从 20-30tps 提到 50-60tps,体感基本实用,和在线 API 的吐字速度相差无几;上下文窗口 200K 是安全边界,再大就有爆显存的风险。知乎判断二:16GB 不是不能玩,但必须接受 3-bit。在 5070Ti 上,Q4_K_M 权重单独就把显存吃满,量化不是“3-bit 还是 4-bit”的取舍,而是“3-bit 还是没有”;好在 3-bit UD 版本干活不含糊,2048 核心逻辑连生成五次,19 条隐藏断言全部通过。知乎判断三:Mac 和高端卡的具体速度见上表,补充一个细节:Mac M3 Ultra 512G 跑 FP8 甚至只有 20 Tokens/s 左右;换到 RTX 5090,速度可以稳定在 60 Tokens/s 左右,最高还能冲到 100+ Tokens/s。哔哩哔哩
体验账:这周大家踩的三个坑
坑一:它太爱思考了。 默认推理强度是最高档 xhigh,能力强但慢得离谱。Simon Willison 实测生成一张 SVG 花了 21 分钟、22276 个推理 Token,输出才 3223 个,关掉深度思考后 137 秒搞定。微博有玩家在 3090Ti 上数过:固定 prompt 下,312 个输出 token 里有 286 个是思考 token(~92%),可见的回答只有约 26 个。知乎
Reddit 上还有一篇高赞帖子,标题叫 《Qwen 3.5/3.8 27B refuses to stop thinking》(拒绝停止思考)。知乎Mac 端有个更直观的例子:在 Mac Mini M4 32G 上跑 MLX 4-bit 版本,只能跑到 5~6 tokens/s,让它写一个计算器,它思考了 51 分钟——不过效果很惊艳,光影和声音细节做得非常好,唯一的小问题是,不能计算。微博

一线开发者的吐槽更直接:“大哥,我只是让你改个 CSS,你用不着把整个计算机科学史推导一遍……”。知乎解法其实就藏在前面那个案例里:关掉深度思考后 137 秒搞定——对不需要深度推理的任务,把推理强度降下来,省时是立竿见影的。
坑二:“能跑”不等于“能干活”。 到处都能看到“8GB 显存就能跑”的说法——那是极限量化下的“能跑”,属于能开机不等于能干活。真要干活,尤其是 coding 场景,上下文是硬约束:有人拿几张 5090 试了下,coding 场景至少要两张 5090,单张即使跑完量化,也只能剩约 100k 上下文。知乎所以目标如果是 AI 编程,请按“模型+上下文”一起准备显存,别只盯着模型体量。好消息是这代架构对长文本比较友好:64 层里 48 层用 Gated DeltaNet,只有 16 层保留 Attention,DeltaNet 用固定循环状态,KV Cache 不随上下文暴涨,长文本显存压力小。微博
坑三:别被聊天速度吓退。 这代模型有 MTP 多 token 预测,代码、工具调用 JSON 这类结构化输出更容易被“猜中”,接上 agent 反而更快:同一台机器,聊天 80 tok/s,agent loop 能到 113 tok/s,差 41%。知乎用聊天速度判断“能不能干活”,会系统性低估它。
部署账:按段位挑工具
第一次碰本地大模型:Ollama 或 LM Studio,图形界面导入 GGUF 就能跑,4-bit 量化是起步主流选择;
想接 agent 干活:vLLM 或 llama.cpp 起 OpenAI 兼容接口,再接 OpenCode 等 agent 外壳,配合投机解码和各种 GGUF 量化,吐字速度直接飙到 70+ tok/s。知乎
追求极限吞吐:Inco AI 团队开源了面向 Qwen3.8-27B 的投机解码草稿模型 DFlash2,在单张 H200、SGLang、并发 1 的条件下,输出吞吐达到自回归解码的 2.7–3.4 倍。知乎
下载源:国内直连 ModelScope(魔搭)最顺。Qwen 至今累计开源 460 余个模型,全球下载总量超 30 亿次,衍生模型数超 30 万个,量化和衍生版本相当齐全。微博

谁不用硬上本地
说句实话:没有显卡,或者只有 16GB 以下的卡,又不想折腾量化和环境,API 路线更舒服。这个月的行业背景是集体涨价:智谱年内三次上调 API 价格,Kimi K3 定价较上代翻 3-4 倍,腾讯云年内两轮调价,混元 API 单轮最高涨了 463%,DeepSeek 8 月中旬正式执行新价——而千问按兵不动。知乎在这个背景下,“买显卡本地跑”和“付费用 API”本质是一道经济账:目的只是把模型用起来,API 省时间;本地更适合数据不能出域、有离线环境,或者就是享受折腾的人。
三个值得继续盯的信号
官方分数的独立复现:目前成绩多由官方 harness 跑出,第三方用同一套环境复现的结果更值得参考;
生态降本的速度:一旦过了可用线,卡在可用线上的模型,逻辑就变成了降本,也许再过半年,同样水平的模型要的硬件资源只要现在的一半。知乎
端侧新路线:达摩院的 RISC-V 旗舰 CPU 玄铁 C950 近日成功原生运行 Qwen3.8-27B,这是 RISC-V 架构芯片首次在不依赖 GPU、无需模拟层的情况下直接运行 270 亿参数级别的 AI 模型。微博
最后收个尾:Qwen3.8-27B 真正的意义不是“27B 追上闭源旗舰”,而是闭源级 Agent 能力第一次被压缩到消费级硬件能跑的尺寸,追赶是暂时的,下放是结构性的。微博手里有 24GB 显卡的,这是近两年最值得认真折腾的一个本地模型;没有的,先用 API,等硬件价格和模型降本一起给你答案。