当前位置:
AIGC文章详情

Qwen3.8-27B 发布刚过一周:两天下载破百万,但 600 元二手卡到 5090 速度差 14 倍,先对表再部署

源自121位全网作者

11:06

这周的本地模型圈子,就一个字:炸。

阿里发布刚过一周的 Qwen3.8-27B,上线 48 小时冲上 Hugging Face 趋势榜第一,当天在 Hacker News 登顶,LM Studio 上线 38 分钟下载破万,Ollama 单渠道 5 天 36 万下载。知乎开源两天总下载量破百万,社区直接给它起了个外号——“本地 Opus 4.6”。小红书还流传起一张"斩杀线"图:在参数量×智能的坐标里,27B 据说是本地模型第一次真正够用的那个点。知乎

但先泼盆冷水:这个模型,你该操心的不是"强不强",而是"你的机器跑不跑得动、跑得快不快"。

它火的原因,是第一次把"逼近旗舰"的能力塞进了家用显卡的显存里。但同一个模型,在不同硬件上的速度差能到 14 倍。这篇把最近知乎、B站、小红书、微博的实测数据汇总到一起,给你一个判断:你在哪个档位,值不值得现在部署。

Qwen3.8-27B 发布刚过一周:两天下载破百万,但 600 元二手卡到 5090 速度差 14 倍,先对表再部署

先说这个 27B 凭什么

参数先摆一下:270 亿参数、稠密模型、Apache 2.0 协议,商用也不要钱。官方跑分很凶——SWE-bench Pro 61.7(官方口径对标 Claude Opus 4.6 Max 的 53.4),不过官方跑分惯例先打对折听。知乎

第三方 Artificial Analysis 的 Intelligence Index 给出 52 分,性能已经逼近 Claude Opus 4.6 Max。小红书Agentic Index 51 分、排第 7,比前代 Qwen3.6-27B 的 28 分高出一大截,但前面还站着 Claude Opus 5、GLM-5.3、Grok 4.6 三个 59 分的。知乎

准确的说法是:本地模型第一次挤进了第一梯队的门槛,离"干翻闭源旗舰"还差一截。

Qwen3.8-27B 发布刚过一周:两天下载破百万,但 600 元二手卡到 5090 速度差 14 倍,先对表再部署

它能在消费级硬件上跑起来,靠的是三个设计:

第一,混合注意力。64 层里只有 16 层用全注意力,剩下 48 层换成 Gated DeltaNet 线性注意力。别人记流水账,它只记余额,KV cache 大约只有同尺寸传统模型的四分之一——27B 的身板扛 262K 上下文,靠的就是这个。

第二,内置 MTP(多 token 预测)。相当于自带一个打草稿的,先猜几个再验证,速度白捡一截。这个开关有多重要,后面速度表里见。

第三,原生多模态。能看懂图片和视频,官方口径连小时级长视频都能理解。注意是"看懂"不是"生成",想让它画图的可以散了。

全网实测速度表:从 600 块二手卡到 5090

这是本文的核心。单个博主只能测自己手里那台机器,我把最近知乎、B站、小红书、微博上能找到的实测锚点全汇总了:

硬件

量化/配置

实测速度

来源

RTX 5090 32G

4bit + MTP

90~121 tok/s(同版本开 MTP 前 66)

社区实测(知乎汇总)

Apple M5 Max

4bit + MTP

50~60 tok/s

社区实测(知乎汇总)

双 RTX 3090 张量并行

Q8 + MTP + 128K 上下文

40+ tok/s

B站实测

海光 DCU gfx936 64G

W8A8 量化

33.3 tok/s(优化前 14.3)

知乎部署实录

Apple M5 Max 128G

Ollama 4bit

约 25 tok/s

知乎作者自测

Apple M4 Max

MLX 4bit

约 23 tok/s

社区实测(知乎汇总)

NVIDIA DGX Spark

Q5_K_M + MTP=3

19.5 tok/s

知乎五轮实测

NVIDIA M40 24G(600 元二手)

Q4_K_M + 16K 上下文

约 8.5 tok/s

小红书实测

Mac Mini M4 32G

MLX 4bit

5.6 tok/s(首 token 1.41s)

微博实测

Qwen3.8-27B 发布刚过一周:两天下载破百万,但 600 元二手卡到 5090 速度差 14 倍,先对表再部署

从表里能读出三个不太有人明说的结论:

  1. MTP 开没开,速度差接近一倍。 5090 同一个版本,开 MTP 从 66 冲到 121。代价是多吃显存、压缩可用上下文。所以看到谁晒了个很高的速度,先问一句:开 MTP 没?

  2. MTP 不是越大越好。 DGX Spark 上五轮实测,MTP=3 时 19.5 tok/s、接受率 54.3%,是最优点;拉到 8 反而只比不开快四分之一。知乎预测得越远,草稿被整段拒绝的概率越高,预测加验证的开销反噬收益。

  3. 要快,MoE 是另一条路。 同一台 DGX Spark,Qwen3.6-35B-A3B(MoE,每 token 只激活约 3B 参数)能跑 63.7 tok/s,是 27B 稠密模型的 3.3 倍。知乎你要的是"快问快答"还是"极限质量",答案不一样。

对号入座:你该不该部署

16GB 显存 / 入门档 Mac:能跑,但约等于行为艺术。 一位小红书用户拿几年前 600 块的二手 M40(24G)实测,Q4 量化、上下文只敢开 16K,速度 8.5 tok/s,他原话是"用是可以用,就是这个速度约等于行为艺术"。小红书16G 档只会更惨,聊天尝鲜可以,别指望干正事。

24GB 显存(3090/4090 档):及格线。 社区共识是"部署及格线 24GB"——官方说 17GB 能跑,那是模型文件本身的大小,没算系统占用和上下文缓存。小红书Q4 量化下显存所剩不多,上下文 16~32K 比较稳。这个档位的真实体验:写代码够用,长任务要有耐心。

32GB 显存(5090):目前消费级的体验天花板。 开 MTP 后 90~121 tok/s,这个速度已经和云端 API 的体感差不多,是"真·token 自由"的档位。知乎

Mac 大内存党:优势在长上下文,短板在带宽。 M4 Max 约 23 tok/s,M5 Max 开 MTP 50~60。统一内存的好处是上下文随便开,跑满 262K 都不慌。但一个关键点:如果你拿它接 Claude Code 这类 agent,决定流畅度的不是生成速度,是"读档"速度——agent 每轮干活前都要把前面的对话和工具结果重读一遍,上下文越厚等待越长。知乎这种场景下,内存带宽比 tok/s 数字更值钱。

部署路线本身不用纠结:图省事用 Ollama 或 LM Studio,想接自己的工具链用 llama.cpp,团队要并发吞吐才考虑 vLLM/SGLang。小红书上下文第一次统一从 32K 起步,稳了再往上加,不然你会怀疑是自己电脑坏了。

避坑清单:发布刚过一周,没人着重讲的事

  1. 默认推理档疯狂过度思考。 国外开发者 Simon Willison 实测:让它画一张鹈鹕骑自行车的 SVG,它在 xhigh 档想了 21 分钟、烧掉两万多推理 token;同一个提示词关掉推理,两分多钟完事。知乎国内还有更极端的:一位微博用户拿 Mac Mini(M4 32G)不调档位硬跑,它花了 51 分钟才写出来一个计算器——生成速度本来就只有 5.6 tok/s,大头时间全耗在"想"上。微博日常用,把 reasoning_effort 调到 medium 或 low。

Qwen3.8-27B 发布刚过一周:两天下载破百万,但 600 元二手卡到 5090 速度差 14 倍,先对表再部署

  1. token 消耗约是上代 3.6 的三倍。 并排实测答案质量 10 局赢 9 局,但有个任务想了 7 分钟烧 3.1 万 token,3.6 一分半钟 7000 token 就交卷了。知乎本地跑烧的是自家电力无所谓,打算按量调 API 的,这笔账要重新算。

  2. 1M 上下文目前是 PPT 数字。 那是 YaRN 外推的理论值,精度没校准,实测大家跑到的上限都是原生 262K。

  3. 知识截止实际在 2024 年左右。 自报 2026 年,一追问 2024 年之后的具体事就露馅,不知道自己不知道,用的时候留个心眼。

  4. agent 多轮长任务有输出截断的反馈, 等官方修复。

算笔账:token 自由到底划算吗

粗算一下电费:按整机 400W 功耗、20 tok/s 的生成速度,100 万 token 大约耗 5.5 度电,居民电价 0.6 元/度算,约 3 块 3;5090 这种高速档(按 700W、120 tok/s 估)能压到 1 块钱/百万 token 以内。对比旗舰级 API 的按量定价,重度用户跑上几个月,电费对订阅费基本是碾压性的。

但反过来,如果你一天就用几千 token,现有一张卡都没有——为了它专门买张 3090 甚至 5090,回本周期按年算,不如继续用云端免费额度。

所以现在最值得部署的是三类人:被 token 焦虑折磨的重度编程/agent 用户;代码不能出内网的隐私敏感场景;以及手里已经有 24G+ 显存显卡或大内存 Mac 的——你的硬件已经付过钱了,边际成本只有电费。

接下来值得盯的信号

  • MTP 生态:给 27B 当"抢答搭档"的 DFlash2 草稿模型已经上了 HuggingFace,GSM8K 上实测无损提速 5 倍。哔哩哔哩这类组合会越来越多,速度表还会刷新;

  • llama.cpp 刚发了 v0.2.0 里程碑版本,框架层优化还在快速迭代;

  • 1M 上下文(YaRN)的第一批真实实测;

  • agent 输出截断问题的官方修复进度。

一句话总结:Qwen3.8-27B 让本地模型第一次摸到了"能用"的门槛,但值不值得部署,看的不是模型,是你手里那台机器在速度表的哪一行。

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章