这两天要是你在关注本地大模型,时间线大概率被一波测速刷屏了。Qwen3.8-27B 这个 270 亿参数的稠密模型 8 月中旬开源之后,本地圈发酵了两周,在这个周末彻底爆发:B 站、知乎全是逐帧调优的实战帖,小红书全是晒自己机器跑分的,8G、16G、24G、Mac,各档位吵成一团。
点火的是云端的两个消息。8 月中旬,DeepSeek 实施「峰谷分时计费」新规,经第三方核算,工作日高峰时段的输出价格最高涨至旧版的 4.7 倍;OpenAI、谷歌、Anthropic 也相继上调价格或收紧免费额度。知乎 而 8 月 26 日晚,阿里反手发布 Qwen3.8-Flash,把 API 定价压到每百万 Token 输入 1 元、输出 3 元。云端一边涨价一边降价,本地又多了一个「消费级显卡真能干活」的新模型,难怪很多人开始认真算这笔账:到底要不要转本地?

一位小红书用户的心态很有代表性:「最近ds涨价了,不过刚好有了qwen3.8 27B这样的开源新宠,于是狠狠部署了」。小红书 但测速数字互相打架:有人说 24G 是舒适区,有人说 16G 已经够用,还有人说不超过每秒 20 个 token 都是折磨。我把这两天跨平台的 20 多份实测和高热度讨论汇总了一遍,给你一份能对号入座的参照。
为什么是这颗 27B 成了本地的「当红炸子鸡」
在 Qwen3.8 系列的开源阵容里,最适合消费级硬件的就是这颗稠密模型。它不走超大 MoE 路线,而是用 27B 稠密参数,在代码执行、专业办公、科研推理和多模态工具调用四个维度上,实现了对更大体量模型的反超。跑分也能对上:Terminal Bench 2.1(Terminus)得分 73.0,QwenSWE Bench 79.0。知乎 说白了,这是一颗能干 Agent 活的模型,不是聊天玩具。
更关键的是它对本地部署友好的几个设计:
原生多模态:能看图、看视频、读长文档。它 8 月 14 日发布,被称为目前最强的本地视觉模型之一,Apache 2.0 许可证可商用,而之前这个级别的视觉能力至少要 32B 起步。知乎
混合注意力省显存:每 4 层才安排 1 次全注意力,剩下 48 层用 Gated DeltaNet 处理局部依赖,直接收益就是降低 KV Cache 峰值。知乎 对本地玩家来说,这意味着同样显存能开更大的上下文。
内置 MTP 多 token 预测,速度有调优空间。
推理强度可控:reasoning_effort 参数可以在一颗模型里切换轻问答和硬推理。
跨源实测对照表:你的显存能推到哪一档
下面这张表来自这两天 B 站、知乎、小红书各平台的实测帖和评论区高赞反馈。不同版本、不同参数下数字会有波动,看量级,别看小数点。
显存档位 | 代表硬件 | 可行方案 | 社区实测参考 |
|---|---|---|---|
8GB | RTX 4060 / 3070 级别 | 超低比特量化,上下文压得很小 | 能跑,以轻量对话为主 |
12GB | RTX 4070 SUPER / 3060 12G | Q3 量化 + KV 量化 | 评论区实测 32 t/s @ 40K 上下文,但「干不了一点活」 |
16GB | 4060 Ti 16G 级别 | IQ4 / APEX 系列量化 | UP 主 qwased 全流程教程,16G 更推荐 apex 版;另有思考 token 减 80% 的微调版 |
24GB | 3090 / 4090 / 5090 / 7900XTX | Q4_K_M 到 Q5 | 7900XTX 调优到 52 t/s;4090 Q4 实测约 48 t/s |
双卡及老卡 | 双 3090、4 卡 2080Ti | Q6 到 Q8 | 双 3090 跑 Q8 40+ t/s;4 卡 2080Ti Q6 开 262K 上下文 |
Mac 统一内存 | M3 Ultra / M4 Max | MLX Q4_K_M 等 | M3 Ultra 约 14 t/s;M4 Max 128G 跑更大 MoE 32 t/s |

表里有几个判断值得展开说。
24GB 是绝对的甜点位。 Q4 量化后权重约 17.1GB,24G 显存「跑起来很舒服」,RTX 4090 上实测约 48 tok/s,日常使用流畅。知乎 A 卡也不怂:一位 7900 XTX 用户把 Q4_K_M 一路调到 52 t/s,还跑了个 23.3M tokens 输入的超长开发任务,全程不崩不降智。知乎 评论区有人问 24G 显存推荐什么配置,UP 主 qwased 只回了两个字:Q5。
16GB 的世界,全在选量化包。 B 站 UP 主 qwased 那份 246 收藏的部署教程,用的是 llama.cpp 配 unsloth / APEX 量化包,他有个很具体的坑位结论:unsloth 的 IQ 系列对 KV 量化非常敏感,做「鹈鹕骑自行车」测试能明显看出来,KV 量化一高鹈鹕就缺胳膊少腿,16G 显存用 apex 更稳。哔哩哔哩 另外还有人放出「冷聚变」微调版,宣称思考 token 减少 80%,给 16GB 显存又多了一个选项。哔哩哔哩

Mac 党的优势是不用纠结显存,劣势是速度看内存带宽。 Mac Studio M3 Ultra 跑 27B Q4_K_M 约占 17GB 内存,速度 14 tokens/s。哔哩哔哩 不快,但有人专门论证过这个速度已经让本地代码分析、工具调用和后台 Agent 跨过了「值得实测」的门槛。M4 Max 128GB 统一内存就更夸张,直接塞下 72GB 的 Qwen3.8-Flash 量化版,实测 32 t/s。小红书
表外还有一条路:MoE 卸载。 24G 显存 + 128G 内存,有人塞下了接近 94GB 的 Qwen3.8-Flash-Next 量化版,生成速度能做到 40 token/s。知乎 原理不复杂:把需要高速计算的层留在 GPU,大量 MoE Expert 权重放进系统内存,「模型总文件可以远大于显存,只要每次真正参与计算的参数足够少,消费级显卡依然有机会跑出实用速度」。但这招不是免费午餐:内存只有 32G 时把模型硬塞进固态硬盘跑,实测只有 4.8 tokens/s,纯属折磨。哔哩哔哩
三道门槛:能跑、好用、值得跑
很多教程只负责「跑起来」,但本地部署的真实体验分三道门槛:
第一道:能跑(不 OOM)。 显存预算 = 模型权重 + KV 缓存 + 运行缓冲,一样都不能爆。27B 的 Q4 权重要 17.1GB,24G 卡装完只剩几个 G 给上下文和缓冲,这就是为什么各种教程里上下文总要「收着点用」。
第二道:好用(速度 + 上下文)。 日常对话,15-20 t/s 是「不烦躁」的门槛;要挂 Agent 调工具,速度和上下文都得要。评论区有位 4070 SUPER 用户实测「4070s q3量化,最高40k上下文不掉速32tps」,然后自嘲「干不了一点活」。哔哩哔哩 速度够、上下文开不大,模型连材料都读不完,这就是「能跑」和「好用」的差距。
第三道:值得跑(量化后不降智)。 这一关最反直觉——量化不是精度越高越好。有测试发现,Q8 量化在某些模型上会引入「思考噪声」,反而比 Q4 表现差。知乎 有人在 Mac 上把同一颗 27B 的 8bit 和 4bit(oQ4e)拉出来对打,自带准确性测试跑完,两者各赢 5 项,基本打平。哔哩哔哩 Luke’s Dev Lab 的 Q8 到 Q1 七档全横评,更是用 Kanban、Blender、Godot 三个场景逐档测出翻车点在哪。哔哩哔哩 结论:别迷信 Q8,也别嫌弃 Q3,拿你自己的任务当裁判。
避坑清单:这 5 个地方都有人替你踩过了
默认推理强度太高,模型会「想太多」。 有技术博主让它画一个圆的 SVG,模型花了两万多个推理 token 思考「怎么做一个有艺术感的圆」。知乎 把 reasoning_effort 调到中或低,体验立刻好转;而且有实测发现思考等级设成 medium 后,速度几乎不降(35 对 36 tok/s),长任务质量反而明显提升。
–no-kv-offload 别乱开。 名字听着像加速,实际是把 KV 缓存强行塞进显存、挤压计算缓冲,速度直接崩。不是所有听起来合理的参数都有效,得实测。
调优之前,先把 llama.cpp 升到最新。 同样的 MTP 参数,老版本 b10336 的草拟接受率只有 42.5%,新版本 b10590 直接跳到 81.3%,「这个提升不是调参调出来的,是等上游更新等出来的」。知乎 Flash-Next 的支持也是 8 月 27 日才通过 PR #27742 合入 llama.cpp 官方 master 的,想跑先升级。
Ollama 变笨,先查对话模板。 有人把模型塞进 Ollama 发现效果很差,回答短、接不到重点,折腾半天才发现是对话模板没正确加载。模型跑起来「不像聊天模型」,先查 template。
想跑 MoE,先看内存。 93GB 的模型放硬盘只有 4.8 t/s,放进 128G DDR5 内存里能做到 40 t/s。MoE 卸载之前,先问一句自己的内存还剩多少。
算账时间:谁该跑本地,谁直接用云端
先说清楚,这笔账的背景已经变了。一边是云端集体涨价,DeepSeek 高峰时段输出价最高涨了 4.7 倍;另一边是 Qwen3.8-Flash 卖 1 元/百万输入 tokens,「是 Claude Opus 4.6 价格的 3%,是 DeepSeek-V4-Flash 闲时价格的三分之二、忙时价格的三分之一」。知乎 「本地一定省钱」的朴素逻辑,已经过时了。

分三类人说:
没有 24G 级别显卡的,不必为「token 自由」硬买硬件。 开源模型的 API 价格已经被打得很低,纯省钱角度本地不占优。有 UP 主算过 Mac Studio 的账:按每月 200 美元订阅计算,128GB 机型约 26 个月回本,若只用 20 美元档订阅,得 21 年。哔哩哔哩 本地的核心价值在隐私、离线、数据控制和 24 小时挂机,不在省那点调用费。
手里已经有 24G 显卡的,这颗模型值得认真跑。 Q4_K_M + 新版 llama.cpp + MTP,就是能干活的速度;Apache 2.0 可商用,挂一天也不按 token 收费。有本地玩家说得很实在:「个人部署一大好处是可以24小时挂着,哪怕只有30左右速度也能跑很多了」。哔哩哔哩
想为它升级硬件的,记住两件事。 第一,MoE 路线正在把硬件焦虑从显卡插槽扩散到内存插槽,24G 显存 + 大容量 DDR5 成了当下的流行配方,而「最近显存价格刚让大家心疼完」,别再被连带收割一波。知乎 第二,双 3090、4 卡 2080Ti 这类老卡多卡路线,老玩家玩得很欢,但多卡并行的调优门槛明显更高,新手别盲目跟。
接下来值得盯的几个信号
llama.cpp / vLLM / SGLang 的版本更新。 MTP 接受率还在一路往上走,新版本就是免费的速度。
unsloth、APEX、冷聚变这类量化和微调包。 迭代很快,16G 档位的选择题每隔几天就要重做一次。
FreeToken 这类新引擎。 专为 MoE 在 GPU 显存和系统内存之间协同推理而生,已经出现 8GB 内存笔记本跑 35B 模型的实测案例,低配机器可以蹲一下。
官方的 1M 上下文。 官方计划在云托管服务中为这颗模型提供默认 1M 上下文长度。知乎 一旦落地,本地「长上下文免费」这张牌也会被重新定价。
峰谷分时计费的扩散。 如果有更多厂商跟进按时段收费,本地部署的性价比曲线会重新抬头。
最后聊五毛钱的:你手里是什么卡在跑 Qwen3.8-27B,Q 几量化,每秒多少 token?评论区正好凑一份新的实测汇总。