先说结论:如果你这个月一直盯着千问,大概率已经晕了。8月3日 Qwen3.8-Max 正式版,8月12日深夜突然开放 2.4 万亿参数的 A95B 权重,8月14日开源 27B,8月下旬放出替你操作屏幕的 UI-Agent,今晚(8月26日)23:00 还要开源 Flash-Next——而就在昨天,一个叫 paloma 的神秘模型现身竞技场,被猜是下一代 Qwen 本尊。
24 天,4 个正式模型加 1 个疑似下一代。有开发者调侃:发版速度已经超过了我下载模型的速度。
我把微博、魔搭、知乎和官方博客的信息拼成了一条完整时间线,这篇只回答一个问题:这条产品线现在是怎么分工的,你该追哪个、等哪个、跳过哪个。
先把时间线摆出来
8月3日,Qwen3.8-Max 正式发布:2.4T 总参数的 MoE,单次激活 95B,API 支持 100 万上下文。微博 8月6日它在 Artificial Analysis 开分,智能水平全球第五,和第一梯队守门员 Opus 4.8 打平。微博 同一天的榜单里,它的 Agentic 能力得分拿下全球第一。微博
8月12日深夜,魔搭社区官宣开放 Qwen3.8-2.4T-A95B 模型权重,总参数 2.4T、每 Token 激活 95B、原生 262,144 上下文、可扩展到约 101 万,这是 Qwen-Max 级别的模型首次开源权重。微博 要注意的是,开放版权重和云端的 Qwen3.8-Max 并不完全一样,两者不能画等号。微博
8月14日,官方如约开源 Qwen3.8-27B,所有开发者、科研机构和企业均可自由下载、部署和使用。微博 8月下旬,Qwen-UI-Agent 上线,一个替你操作屏幕的模型,手机端成功率亮眼但桌面端还很早期,之前已经单独聊过,这里不展开。8月25日,神秘模型 paloma 现身 Arena 竞技场,目前看能力对标 Opus 5,社区普遍怀疑它就是下一代 Qwen 的先行版,官方尚未确认。微博 而今晚 23:00,Flash-Next 就要开源。

三个主力,各干各的活
看懂这条产品线,关键是别把它们当「同一个模型的不同版本」,而是三个不同岗位。
Qwen3.8-Max 是 API 旗舰。 2.4T 的体量注定不是给个人本地跑的,它服务的是「最强能力直接调用」的场景。Artificial Analysis 那张榜上,它智能指数全球第五,但 Agentic 能力全球第一——让它自主干活、跑长链路任务,是目前它最突出的长板。对普通用户来说,Max 的存在感主要在 API 和应用层,你大概率已经在某些产品里用过它了。
Qwen3.8-27B 是开源中坚。 这是给本地部署和二次开发准备的:Apache 2.0 许可,商用没有附加条件;原生 262K 上下文,官方文档明确可以通过 YaRN 外推到 100 万。魔搭 海外社区给它找了一句很传神的宣传语:能在你笔记本上免费运行的 Opus 4.6 Max。微博

成绩也对得起这句话:多项测试中它超过了半年前的 Claude Opus 4.6 Max。知乎 开源短短 10 天,其 Hugging Face 下载量便突破 260 万。知乎
端侧生态也跟得很快,8月15日联发科宣布已在天玑汽车座舱平台 C-X1 及天玑旗舰移动芯片上完成 Day-0 支持。微博 也要提前提醒一句:27B 能力提升的另一面是输出变长了,相关评测里平均输出长度达到 47K tokens,Token 成本明显比上一代高。知乎 用 API 的话注意预算,本地跑的话准备好耐心。
Qwen3.8-Flash-Next 是端侧小钢炮,也是今晚的主角。官方口径很明确:魔搭社区显示,阿里千问 Qwen3.8-Flash-Next 模型将于北京时间 8月26日 23:00 开源。微博 它是基于下一代 Qwen4 架构构建的多模态 MoE 模型,引入 GDN 混合架构以及 Qwen 稀疏注意力机制(QSA)等全新架构变更。微博 社区流传的参数说法是总参数约 176B、单次激活约 6B,官方尚未确认;也有人怀疑它其实就是之前传的 35B-A3B。微博 这些都要等今晚权重落地才有答案。

最容易被搞混的:两张完全不同的许可证
这是全月信息噪音最大的地方,必须单独说清楚。
路透的报道说得很直白:这个级别的模型仍可以免费下载、自己部署,普通开发者不用交钱;但如果大公司拿它做成收费 AI 服务、赚到很多钱,阿里要求对方签商业协议,并把一部分收入分给阿里。微博 对应到实际操作:8月12日开放的 2.4T-A95B 在魔搭上挂的是自定义的「qwen3.8-max」许可证,而 27B 是干净的 Apache 2.0。魔搭 所以「Qwen 开源了旗舰」和「旗舰可以随便商用」是两回事。个人和小团队基本不受影响,但如果你想把它包进商业产品,先读许可证,别想当然。
今晚的 Flash-Next,值不值得等
我的判断是:看你的硬件,分两种人。
如果你有一台大内存设备,值得等。门槛其实没想象中高:27B 的 4-bit 量化版在约 17GB 内存/显存的设备上就能跑,包括 RTX 5080/4090 和 24GB 统一内存的 Mac。微博 端侧工程优化也在真实推进:新发布的 DFlash 2 是目前公开方案里对 Qwen3.8-27B 加速效果最好的投机解码方案之一,官方单并发测试中五项基准平均加速约 3.2 倍。知乎 甚至有人已经可以在 M5 Max 的 MacBook Pro 上以 70 tok/s 的速度运行 Qwen3.8-27B。微博 Flash-Next 激活参数更小,只会更友好——128G 统一内存够不够跑全量、它和 35B-A3B 到底是什么关系,是今晚最值得蹲的两个悬念。
如果你没有本地硬件、只用 API,可以只关注不急着上手。它的定位是「Qwen4 架构首秀」,更大的意义是给下一代探路,首批权重大概率还有打磨空间。

该追谁、该等谁、该跳过谁
最后给一份可以直接抄的分层清单:
写代码、跑 Agent 的重度用户:API 直接用 Max,Agentic 全球第一不是虚的;
想本地部署的:27B 是当前最稳的选择,Apache 2.0、生态最全、实测最多,但记得它的输出变长了,成本和耐心都要算进去;
大内存设备玩家:今晚 23:00 的 Flash-Next 值得蹲,它是 Qwen4 架构的第一块试金石;
只用过千问 App 的普通用户:这条发版线对你影响不大,等它们进产品就行;
商用集成:先分清许可证,27B 随便用,旗舰权重先读条款。
接下来值得继续盯的三个信号:paloma 会不会被官方认领,大概率就是下一代 Qwen 的预告;Flash-Next 开源后的首批实测,尤其端侧速度和内存占用;以及 Qwen Cloud 上 27B 托管版什么时候上线——官方文档里写了,它会带默认 1M 上下文和内置工具。魔搭 顺带一提生态的基本盘:过去 6 个月,千问开源模型全球累计下载量超过 30 亿次,家族模型超过 460 个,衍生模型 30 多万个。微博 发版狂飙的背后,是整套开源飞轮已经转起来了。
这个月的千问,值得追的不是某一个模型,而是这条节奏线本身。