Qwen3.8-27B开源今晚:本周四个开源模型都瞄准你的16GB显存,先装哪个、等什么、避什么坑

源自7位全网作者

09:04

预告里,今晚(8月14日)23:00,Qwen3.8-27B开源。哔哩哔哩这是本周第三个重磅开源。

先把这周的时间线捋一遍:8月10日,Meta放出Muse Glimmer 30B,Apache 2.0协议,从闭源旗舰Muse Spark蒸馏来的稠密多模态模型;随后NVIDIA发布Nemotron 3.5 Lightning,30B MoE只激活3B;8月13日,阿里直接开出2.4T参数的Qwen3.8-2.4T-A95B,Qwen-Max级别第一次开放权重;今晚压轴,Qwen3.8-27B。

开源周常有,但这周有个细节值得琢磨:除了2.4T那个门面,真正和你有关的模型,全挤在27B-35B这个区间。这不是巧合。

为什么全挤在27-35B

本地部署有一笔很朴素的账:4bit量化下,1个参数大约占0.5字节权重。知乎于是:

  • 27B ≈ 14-15GB权重,16GB显存刚好能装

  • 30B ≈ 16-17GB权重,24GB显卡的甜点

  • 35B ≈ 18-19GB,24GB显存从容带

而本地部署玩家的消费级显卡存量,恰好集中在16GB(4060 Ti 16G、4080)和24GB(3090、4090、5090)这两档。知乎「本地能部署什么大模型」的显存分档回答能拿到94万浏览,B站「英伟达哪些显卡能跑AI」这周在两个平台同时火——大家问的都是同一个问题:我这张卡,够得着哪个档。

Qwen3.8-27B开源今晚:本周四个开源模型都瞄准你的16GB显存,先装哪个、等什么、避什么坑

厂商显然也算过这笔账。旗舰是拿来立形象的:Kimi K3满血版要64张高端卡才能跑,Qwen3.8-2.4T官方recipe里NVFP4精度要8张B300,BF16要24张——都不是个人会去想的配置。真正落到个人电脑上的,是从旗舰技术蒸馏下来的27-30B稠密版。

所以这周本质上是「16-24GB显存甜点区」的第一次集中交锋,抢的正是本地部署里盘子最大的那批人。

本周四个模型,一张表看清

模型

参数/架构

量化后显存

许可

定位

Muse Glimmer 30B

29.6B稠密(含1.8B视觉编码器)

4bit约16-20GB(官方17GB版损失约1%)

Apache 2.0

本地agent/多模态

Qwen3.8-27B

27B(对应上代稠密版)

社区预估4bit≈16GB

待定(旗舰版为Qwen自定义协议)

agent/多模态/可关思考,今晚开源

Nemotron 3.5 Lightning

30B MoE,激活3B

官方主打DGX Spark

NVIDIA开源

高吞吐低延迟(官方称670 tok/s)

MiniMax H3

视频模型轻量版

8GB起

开源

本地视频生成

Qwen3.8-27B开源今晚:本周四个开源模型都瞄准你的16GB显存,先装哪个、等什么、避什么坑

表里有几个点单独说:

Muse Glimmer是本周唯一被社区大规模验证过的。 发布当天Hacker News主帖1050分、583条评论,Ollama、unsloth、mlx-community这些量化/推理生态24小时内全跟上,HuggingFace一天冒出96个衍生仓库。知乎RTX 3090实测Q4占显存约15.9GB,长上下文场景的显存开销比Qwen3.6-27B低一个数量级;Artificial Analysis给了智能指数35,同尺寸132个模型里排第2。

Qwen3.8-27B是今晚唯一没被验证的。 目前所有信息都是预告和预期:预告关键词是agent执行、多模态、可关思考;社区流传最广的预期是4bit量化后16GB显存能装下,「单张4060 Ti 16G就能本地部署」——但这是B站UP主按量化公式推的,不是实测。

参考坐标是上一代:知乎有人把Qwen3.6-27B-FP8在单张RTX 4090 48GB上压到26.5 tok/s(非MTP),开MTP推测解码后短文本68.6 tok/s,262K上下文能跑通。知乎今晚的27B如果架构思路接近,这个速度区间就是合理预期,Q4量化还会更快。

按你的显卡,装什么、等什么

16GB显存(4060 Ti 16G / 4070 Ti Super / 4080): 你正卡在27B的门槛线上,建议直接等今晚。Muse Glimmer官方17GB版你装不下,硬上更低的量化档意义不大。如果今晚Qwen3.8-27B的Q4真落在16GB以内,它是本周跟你这张卡贴合度最高的模型——但注意上下文余量,权重装满后,剩下的显存才是KV cache的。

24GB显存(3090 / 4090 / 5090): 本周最大赢家。Muse Glimmer的Q4(约16GB)现在就能装,还有余量留给DFlash投机解码和长上下文,官方宣称17GB量化版能跑233 tok/s,就算打个对折,agent交互也完全够用。知乎今晚27B落地后,你还可以FP8和Q4各试一遍。急用先装Muse Glimmer,看重中文生态和编码就等今晚。

Mac统一内存(64GB以上): MLX已经有muse-glimmer:30b-mlx,按Muse Glimmer的经验,今晚27B放出后mlx-community通常24小时内覆盖。小红书有个样本:被学校邮件提醒一个月token账单快500美元的学生,用128GB统一内存的机器部署DeepSeek V4 Flash,实测25-30 tok/s,长上下文开满后速度会掉但能稳。

Qwen3.8-27B开源今晚:本周四个开源模型都瞄准你的16GB显存,先装哪个、等什么、避什么坑

8-12GB: 说实话别硬凑这周的新模型。MiniMax H3那个8G显存档是给视频生成用的,而且注意:本地轻量版的出片质量跟官方完整版差距明显,有实测直言「本地部署纯属娱乐」。对话类需求,7B-14B小模型够用。

不想折腾只要用的: API不丢人。阿里云百炼Qwen3.8-Max目前标准价输入12元、输出36元每百万token,小红书评论区那句「还不如接官方api,一天蹬满也就10块钱」有人认同。但另一条回复也有意思:「API的钱花出去就花出去了,而我去年前年买的二手硬件今年还能以比买时更高的价格卖出去」——本地部署的硬件是资产,API支出是费用,这笔账看你用多少、用多久。小红书

三个坑,本周都有实锤

坑一:首日跑分别全信。 Muse Glimmer官方挑的项目(工具调用、agent基准)确实领先,但SWE-Bench Verified和TerminalBench两项编码任务输给Qwen3.6-27B,HN上还有人报告更难的TerminalBench Hard子集也落后。知乎B站甚至有UP主直接做了个评测引擎自己验,标题就是「别再信大模型跑分了」。哔哩哔哩今晚27B出来同理:先用你自己的日常任务跑两个,再看跑分。

坑二:许可不等于开源。 本周唯一真宽松的是Muse Glimmer的Apache 2.0。Qwen3.8换了自定义协议:要求UI显著展示模型名称。连续12个月总收入超5000万美元另有附加条件。知乎Llama系列一直背着限制性条款。个人玩无所谓,商用嵌入产品前先看条款。今晚27B跟不跟同一个自定义协议,是今晚的观察点之一。

坑三:本地版不等于官方完整版。 MiniMax H3是最典型的课:8G显存能跑的是轻量base版,跟官方完整版跑2K是两回事。今晚的27B也一样要盯:放出来的是不是完整权重、多模态组件是否随包附带。

今晚的行动清单

  1. 23:00(预告时间) 先看三件事:权重是否完整、许可条款、量化版跟进速度。参照Muse Glimmer,Ollama、unsloth、bartowski、mlx-community通常24小时内全部跟齐。

  2. 落地第一天 拿GGUF的Q4版本,用你常用的任务测——编码、长文总结、工具调用,别急着下结论。

  3. 未来两周盯三个信号: 第三方对27B的独立评测(尤其编码项)、MTP/投机解码生态跟进情况,以及上一代Qwen3.6-27B相关硬件的行情——新模型如果够强,老模型的讨论热度和二手3090的价格通常先有反应。

最后一句。对真正在本地跑模型的人来说,这周的新闻不是「哪个模型跑分更高」,而是厂商终于把火力集中到了你手里这张显卡上。旗舰2.4T是门面,27B才是日子。别急着买新卡,先把手里这张卡跑过这个开源周再说。

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章