这两天本地AI圈最揪心的一件事,不是哪个模型又屠榜了,而是一个"失踪案":传闻中的 Qwen3.8-35B-A3B,8月16日刚被曝出相关信息。哔哩哔哩转头就有开发者发现,它在 ModelScope 的 ms-swift 注册表里的条目不见了。哔哩哔哩
阿里官方至今没吭声。于是一批人开始慌了——他们等这个模型,已经等了快一个月。
一群人在等它,不是没原因的
如果你手里是张 8G、16G 显存的卡,这波 Qwen3.8-27B 的热闹其实跟你关系不大。

27B 是个 Dense(稠密)模型,意味着每生成一个 token 都要动用全部 270 亿参数。社区实测的数据很直白:同样一台机器、同为 IQ3_XS 量化,Qwen3.8-27B 大概 30 token/s,而上一代 MoE 模型 Qwen3.6-35B-A3B 能跑到 100 token/s 左右,快了三倍还多。微博
这就是 MoE 的结构性优势:总参数可以很大,但每个 token 只激活一小部分。DeepSeek V4-Flash 那种 85GB 的模型文件,靠专家卸载(inactive 的专家放内存,只把激活的搬进显存),24G 显卡实际只占 17GB 显存,还能跑 35 token/s。知乎极端点的,8G 显卡配大内存,跑 35B 级 MoE 的量化版,接上 Agent 框架日常干活也有人跑通了,20 token/s。哔哩哔哩
所以低显存用户的算盘打得很响:Qwen3.8-35B-A3B 如果继承 3.8 这一代的能力,又保留 A3B(激活约3B)的身材,那就是"新一代小模型之神"回归——单张消费级显卡全速跑,不用跟雷霆思考、上下文爆炸搏斗。
微博上从 8 月初就有人喊话:35B-A3B 能不能也来一个,普通消费级单显卡也能跑,27B 的 dense 是真跑不了啊。微博27B 开源之后这种声音更大,有人试完直说"显存完全不够,35B-A3B 来的话 3.6 终于可以升级了"。微博知乎上也有人泼冷水式地期待:这才是真正能在本地部署的模型——如果它真的存在的话。知乎
这桩"失踪案",目前证据是这样的
把时间线捋一遍:
8月上旬:Qwen3.8-Max 发布前后,社区就开始在路线图里找 35B-A3B 的影子;
8月14日:Qwen3.8-27B 正式开源,12 小时冲进 Hugging Face 历史最受欢迎模型 TOP4,两天下载破百万。36氪但低显存用户发现这热闹参与不了,等待声量反而更大了;
8月16日:有 AI 资讯视频爆出"Qwen-3.8-35B-A3B 相关信息出现",一条 3 万播放;同一天 B 站已经有人传相关模型文件的消息;
8月19日-20日:有开发者发现,ModelScope 的 ms-swift 注册表里,Qwen3.8-35B-A3B 的条目被移除了。

注意两件事。第一,"条目被移除"目前只是社区观察,阿里没有任何官方确认或否认,这个模型到底存不存在、是不是这次序列的一员,都没有实锤。第二,社区有句自嘲流传很广:qwen github 前瞻上的模型,就没一个出来过。哔哩哔哩预告归预告,落地归落地,这在千问的历史上是有前科的。
所以现在的真实状态是:信号存在,但没有一个能一锤定音。
等待期间,手里的卡其实不用闲着
这是我最想说的一段:等一个不确定的模型,最亏的姿势是把手里确定的路也搁置了。按显存档位,现在能跑的东西比很多人想的多。

8G 显存:Dense 的 27B 可以直接放弃,Q2 硬塞进去也会被思考量和上下文吃干抹净。但 MoE 路线是通的——Qwen3.6-35B-A3B 的 IQ2/IQ3 量化,配合专家卸载,8G 卡 + 32G 内存的组合已经有人日常接 Agent 在用,20 token/s 上下。哔哩哔哩日常聊天、写代码、查资料够用。
16G 显存:两条路都有人跑通了。硬扛派:27B 的 UD-Q3_K_XL 量化能塞进 16G,开 MTP 推测解码后有人跑到 60-70 token/s,干 PPT、写前端这种任务效果不错。哔哩哔哩代价要心里有数:这代雷霆思考严重,社区实测思考占上下文的比重能到 90% 以上,有人一个简单任务等了半小时,思考没结束上下文先满了。哔哩哔哩哔哩哔哩安稳派:3.6-35B-A3B 的 Q4 量化全量进卡,速度是 27B 的两三倍,没有思考爆炸问题,知识类、写作类任务更稳。
24G 显存:其实没什么可等的。27B 的 Q4/Q5 量化就是官方和社区公认的甜点位,开 MTP 后体验完整,35B-A3B 就算来了,对你是锦上添花不是雪中送炭。
另外两个坑,是这周全网实测里反复出现的,顺手提一句:同名不同命——三家发布的同名 Q4_K_M 文件,体积能差出 2.2GB,挑量化版要比字节数,别比名字;Mac 用户注意系统不会把全部统一内存交给 GPU,16G 的 M2 Pro 实测 Metal 上限只有 12.7GB,挑档位前先看清这一行。知乎
到底值不值得等?三类人三个答案
先说一个社区里被顶得很高的判断,供参考:“稠密智商高,稀疏知识多”——历代 Qwen 里,27B 稠密版的任务能力一直压同代 35B-A3B 一头,MoE 版赢在速度和知识覆盖。哔哩哔哩所以 35B-A3B 就算来,也不是"全面碾压 27B",而是低显存用户的最优解。

按这个逻辑:
你的主力需求是聊天、写作、知识库:3.6-35B-A3B 现在就能满足,等 3.8 版的边际收益有限,建议先用起来,新版来了直接换文件,成本就是下一次下载。
你想要 coding/Agent 能力,卡只有 16G 以内:27B 硬扛路线先用着(记得开 MTP、控制思考强度),同时保持关注——这类任务确实是 3.8 基座更强,值得留一个"到时候切过去"的选项。
还没买硬件、想为它配机器的:千万别。为一个没有官方确认的模型掏钱,是等待党成本最高的错误,何况眼下内存、显卡还在涨价行情里,连矿卡都被炒起来了。微博
最后给一组具体的观察信号,出现任何一条,说明 35B-A3B 大概率要来:Hugging Face 官方模型页上线、ModelScope 出现官方(而非注册表占位)条目、Unsloth/Ollama 跟进量化和适配、官方 changelog 提及。如果两周内一条都不出现,就当它不存在,把手里的方案用好。
开源模型的等待党,本来就是成本最低的一批人——不花钱、不排队,等的只是一个下载链接。但也别为了一个没落地的链接,把手里已经能跑的日子暂停了。毕竟本地部署最大的好处从来不是追新,而是:装进硬盘里的,才是自己的。