Qwen3.8-27B开源满10天了。这几天只要你在看本地部署相关内容,大概率被它刷过屏:Hugging Face两天下载破100万、冲上趋势榜第一,Hacker News主帖1400多分、近800条评论;国内社区给它起了个外号,叫"模型斩杀线"——一个27B的稠密模型,第一次让"个人本地跑"摸到了前沿闭源模型的能力区间。知乎小红书

而对零刻用户来说,这10天评论区问得最多的问题已经变了:从"这台机器值不值得买",变成了"我这台机器,能不能跑27B"。
B站那条零刻SEi13 AI评测视频底下,两条相邻的评论把这事说得特别透。哔哩哔哩上面那条:"如果能使用Qwen 3.8 27B,那性价比爆炸。"下面紧跟着泼冷水:“27B dense模型不行的,即使DGX Spark其实也不可用。”
这就是今天想聊的信息差:Qwen3.8-27B在很多硬件上都"能跑",但"能跑"和"能用"之间,隔着一条带宽的沟。我把这10天全网陆续出来的实测都翻了一遍,替大家把账算清楚。
先记两个数:容量是门票,带宽定快慢
Qwen3.8-27B用Q4_K_M量化后,文件大小约17GB,这是门票——内存或显存凑不出这个数,就不用往下想了。

但真正决定你每天用着爽不爽的,是内存带宽。知乎一位在零刻395机型上做完整部署测试的用户,把规律总结成一句话:解码速度≈带宽÷模型大小。
用这个公式算一圈,很多争论就有答案了:
零刻GTR9 Pro的锐龙AI MAX+ 395,统一内存带宽在256GB/s级别,除以17GB,理论解码15 tok/s上下——逐字阅读完全够用;
普通DDR5双通道迷你主机,带宽约90GB/s,算下来只有5 tok/s上下(这是推算,暂时没找到SER系列的专项实测)——机器没卡死,但人快卡死了;
SEi13 AI那张NPU卡,24GB独立内存、153.6GB/s带宽,纸面上算得出9 tok/s,但评论区实测口径更直接:稠密27B别想,它的主场是MoE和小模型。
所以结论先摆在这儿:给本地大模型选机器,别看TOPS,别看核心数,就看内存容量和内存带宽这两个数。知乎
这10天的实测地图:从2300元到老旗舰,都测到哪了
最让人意外的是2080Ti。 知乎用户"闲人太忙"用两张22GB魔改2080Ti(单张目前2300元左右)加NVLink跑,prefill约600 tok/s,开MTP后输出最高50+ tok/s。知乎更关键的是他拿零刻玩家熟悉的OpenClaw(小龙虾)智能体框架做了三个实战开发项目,其中一个项目上下文跑到7.4万token,一次成型没返工。他的原话:显卡又涨了一波,但2300元一张的魔改卡,入门还是合适的。

最有参考价值的是零刻395这台机器。 知乎用户"枫淡月"在搭载锐龙AI MAX+ 395的零刻迷你主机上写了一份完整部署报告,过程有反转,值得细看:
用ROCm后端跑分,数字非常漂亮,首token只要0.38秒;
但一换到真实客户端(WorkBuddy、TraeWork)就全部翻车,一个12k的表格分析都完成不了就中断;
Vulkan后端反过来:跑分有每请求约4秒的固定开销,但实战稳定;
最后他给的推荐组合是:llama.cpp + Vulkan后端 + Q4量化 + MTP max6 + 256K上下文;
还有个隐蔽的坑:KV cache压到q4是负优化,MTP草稿接受率从50%崩到29%,越优化越慢,KV q8_0才是甜点。
打算在395机器上部署的,这份报告能省一星期弯路,建议直接收藏。

最轻量的是5060Ti 16GB。 Q4量化塞得下,小红书有人直接喊出"token自由"。轻办公、问答场景够用,但16GB显存留给长上下文Agent的空间很紧张,重度使用要慎重。知乎
战场之外的生态也在动。 昇腾950PR单卡bf16解码测出67.1 tok/s,海光DCU、双V100老服务器都有人部署成功。知乎但注意,热度之下也有冷静的反对声:评论区有观点认为稠密27B"即使DGX Spark也不可用"——"可用"的标准,社区现在还没吵完,别被跑分截图带节奏。哔哩哔哩
映射到零刻的产品线,结论有点扎心
GTR9 Pro(395+128GB):全零刻唯一真正舒服的选项。 双万兆网口、126 TOPS算力,媒体评测早就说过它能部署32B、70B级别的稠密模型,27B更不在话下。问题是价格:去年上市时国补顶配做到过11999元,评论区还记得"去年395 128G不到1.5万",这轮内存涨价潮把它又往上顶了一截,现在行情明显更贵,而且一天一个价。小红书真要买,建议盯大促和补贴窗口,别在涨价高点入手。

SEi13 AI / SEi14 AI(NPU卡24GB):别为27B买它。 153.6GB/s的带宽、加上目前"只支持定制模型、玩不了通用GGUF"的软件生态(评论区吐槽最集中的一点),它适合的是MoE模型、小模型、低功耗常开这类场景。那张NPU卡单卖要七八千,这个钱加上去,选择其实很多。
SER9 / SER9 MAX(32GB DDR5):塞得进,用不爽。 17GB的Q4模型能装下,但按带宽定律估算就5 tok/s上下,尝鲜可以,当生产力工具就算了。
EQ系列办公机:想都别想。 内存和功耗都不是干这个活的。
三条路,按预算对号入座
第一,预算能到2万上下,铁了心要本地AI。 GTR9 Pro 128GB是零刻家族里唯一解,但务必等价格;部署时直接用上面那份实测报告的参数组合,别自己瞎调。

第二,预算一万以内,就想体验27B。 别买迷你主机,两条更划算的路:一是DIY路线,2080Ti魔改卡或5060Ti装台式机,成本低见效快;二是干脆用API,Qwen3.8-27B的API输入价已经低至0.5美元/百万token,只要不是天天高频跑,这笔钱比买硬件耐用得多。知乎
第三,已经拿着零刻的NPU机型或者DDR5小机器。 别硬上27B。你在等的不是新机器,是Qwen3.8家族出MoE版本或者更小的尺寸——那才是低带宽硬件的菜。
接下来值得盯的四个信号
llama.cpp的ROCm后端会不会修好客户端兼容性——跑分快、实战翻车这个问题不解决,AMD生态的部署体验就总有根刺;
Qwen3.8家族会不会补齐其他尺寸——27B这个稠密尺寸很"鸡贼",恰好卡在消费级硬件的甜蜜点边缘,再来个MoE版本,一大批中低端机器就活了;
395机型下半年的价格走势和补贴窗口——现在追高不划算;
NPU卡厂商什么时候开放通用GGUF支持——那一天来了,SEi系列的账才值得重新算。
最后聊一句:你现在用什么硬件跑Qwen3.8-27B?实测多少速度?评论区报个数,咱们把这张实测地图补全。