这两天,LLM 推理圈两条方向完全相反的消息撞在了一起。
一边是云端肉眼可见地变便宜。OpenAI 在 Hot Chips 上公布了首款自研推理芯片 Jalapeño 的首批实测,单位功耗峰值吞吐是英伟达商用系统的 1.5~1.9 倍,端到端延迟降低 1.7~3.6 倍。知乎英伟达这边也没闲着,推理加速器 Groq 3 LPX 官宣投产,官方口径下每 Token 推理成本直接降 35 倍。知乎杰富瑞的报告说得更直白:企业 AI 推理成本已经跌到 2026 年以来的最低点,价格战和中国开源模型是两大推手。知乎

另一边,是本地部署阵营为一个模型吵翻了天。Qwen3.8-27B 开源两周,Hugging Face 下载量突破 260 万。知乎社区分成两派:一派发视频说“Qwen3.8-27B 劝退,对普通用户没意义”。哔哩哔哩评论区立刻反驳——那是你显存不够、量化压得太狠;还有一派已经用一张 2000 元的二手 2080Ti,把这个模型跑出了 57 token/s。知乎
问题就很实际了:云端越来越便宜,本地部署还值不值?值的话,显卡钱该怎么花?我把这周知乎、B站、小红书上的实测翻了一遍,这笔账能算清楚。
这个模型为什么值得单独算一笔账
Qwen3.8-27B 火,不只是因为强——Artificial Analysis 榜单 52 分,和 DeepSeek-V4-Pro 的 53 分基本持平,大幅领先上一代 Qwen3.6-27B 的 38 分。知乎更关键的是它踩中了两个架构红利,把本地部署的硬件门槛整体拉低了一档:
混合注意力架构:64 层里只有 16 层是全注意力,其余是 Gated DeltaNet 线性注意力。直接结果是 KV 缓存每 token 只占约 34KB,不到同规模纯全注意力模型的四分之一。200K 上下文在这里只要 3.5~6.6GB 显存,而不是以前的 26GB。知乎
训练时内置 MTP(多 token 预测)头:模型每往前走一步会额外“猜”出后面几个 token,再批量验证。社区实测在编码场景接近翻倍提速——这是“本地模型写代码突然可用”背后的主要原因。

再叠加成熟的 Q4_K_M 量化方案,模型文件约 17.1GB,社区评测保留满血版九成五以上能力。知乎消费级显卡第一次在 27B 稠密模型上拿到了“能干活”的速度。另外它是原生多模态,能看图看视频,262K 原生上下文,Apache 2.0 协议,商用也没有授权顾虑。知乎
成本账:云端没你想的便宜,本地没你想的贵
先看云端。Qwen3.8-27B 官方 API 输入价约 0.5 美元/百万 token(官方定价页口径),输入看着跟不要钱一样。知乎但注意:这是个思考模型,评测里的平均输出长度有 47K token,比上一代的 29K 明显变长——大头都藏在输出 token 和深度思考里,单次深度调用的真实账单并不轻。知乎有 B 站 UP 主拿同定位的 DeepSeek-V4-Flash 实测过:每天 2000 次重度调用,API 账单约 126 元/天。哔哩哔哩

本地则相反:电费几乎可以忽略(同一位 UP 主实测约 4 元/天),大头是硬件。社区实测的主流硬件档位整理如下:
硬件 | 投入(社区口径) | Qwen3.8-27B Q4 量化实测 | 适合谁 |
|---|---|---|---|
2080Ti 22G 改装卡(二手) | 约 2000 元 | 57 t/s,可开 200K 上下文 | 折腾党入门甜点位 |
5060Ti 16G(新卡) | 以当期行情为准 | Q4 可用,显存不局促 | 免折腾党 |
4090 24G | 以当期行情为准 | 约 80 t/s(开 DFlash2 加速) | 单卡高配 |
5090 32G | 以当期行情为准 | 70~100 t/s,可开 3 并发 | 全都要党 |
CMP 170HX 矿卡 × 4 | 整机约 4.4 万元 | 解码约 80 t/s,回本周期约 12 个月 | 高频重度、能接受故障风险 |
判断其实很清晰:
每天几十次调用,写写文案查查资料:直接用 API。一个月账单几十块钱,买显卡这辈子都回不了本。
让 Agent 7×24 干活、单次请求动辄几万 token 思考链,或者有数据不能出域的场景(合同、会议记录、内部资料):本地部署开始划算。
两类只有本地能满足的需求:跑破限/无审查版(没有任何云 API 提供),以及完整的数据主权。
另外提个醒:矿卡那套“12 个月回本”的账,有人指出有水分——官方 API 的缓存命中率很高,真实计费更便宜。哔哩哔哩而且矿卡价格已经从原来的一千多元被炒起来,掉卡故障时有发生。现在入矿卡,性价比远不如半个月前。
三条避坑规则,都是别人踩过的
1. 显存决定量化,量化决定体验。 Q4_K_M(约 17.1GB)是 27B 的体验线。拿 IQ1、Q1 级极端量化硬塞进 12G 显存,等于主动降智。哔哩哔哩大部分“劝退帖”就栽在这:体验差不是模型不行,是预算给的量化档位不行。社区共识大概是 Q3 起步、Q4 稳定。

2. 显存溢出到内存是无声的。 没有任何报错,只是变慢,速度能掉几倍。判据一条:看 nvidia-smi,空闲显存不足 100MB 就是超订了。有知乎用户 262K 上下文加载成功后速度从 57 t/s 掉到 13 t/s,就是这个坑。知乎最后把 KV 缓存压到 q4_0 量化,才全部塞回显存。
3. 框架给的“上限”别全信。 Ollama 的显存估算器对混合注意力架构会系统性高估 KV 开销,只肯给 64K 上下文;换 llama.cpp 直接复用同一个模型文件,满血 262K 就能加载。知乎限制分物理限制和软件限制,遇到上限先查清楚是哪一种,再决定加不加钱。
两个值得继续盯的信号
一个是今晚 23 点,Qwen3.8-Flash-Next 开源权重。哔哩哔哩这是 Qwen4 架构首次露面的模型,走 MoE 路线、激活参数只有 6B 左右(总参数各渠道口径不一,以官方模型卡为准)。MoE 意味着激活参数决定速度——如果百亿级总参的能力能在消费级硬件上稳定跑起来,本地部署的甜点位还会再往上挪一档。手里没卡的,值得等今晚的实测出来再动手。
另一个是云端价格战还没打完。Jalapeño、Groq 3 LPX 会陆续商用部署,API 单价大概率还要降。知乎本地这笔账是按今天的价格算的,观望党不亏。
顺带一提硬件侧:苹果 8 月底刚更新了搭载新一代 M 系列芯片的 Mac mini 和 Mac Studio。微博Mac 的统一内存是本地推理的另一条路线,社区已经在 M4 Pro 机型上实测跑 Qwen3.8-27B 的 4bit 量化:峰值内存 17GB,解码速度约 15 token/s——速度拼不过 N 卡,但胜在低功耗、安静、内存上限高。小红书手里已经有 Mac 的,不必急着为跑模型单独买 N 卡。

最后一句话收拢:轻度用云,重度用本地;买显卡先看显存,再看预算。Qwen3.8-27B 的红利窗口确实在眼下,但云端降价也是真的——先把自己的用量算清楚,再决定进哪边的账本。