先说结论:这可能是开源大模型历史上第一次,"下载权重"和"能用上"被拆成了两件完全不同的事。
这周千问的动作很密。8月13日,阿里宣布开源Qwen3.8-Max,2.4万亿参数,这是国产大模型里第一次开放Max级别的旗舰权重——之前阿里只开源到72B这个档,旗舰一直是闭源的。微博紧接着14日又开源了Qwen3.8-27B(这篇站内已经聊过不少,今天不重复)。17日HuggingFace的报告又给添了把火:Qwen开放权重模型过去半年全球下载量突破30亿次,排第一,作为对比,Google是4.18亿,Meta是2.27亿。极客公园

热闹归热闹,作为一个手里最多也就一两张消费级显卡的普通人,你得先看清楚一件事:这次开源的旗舰,跟你家电脑基本没关系。
先算一笔显存账:1.2TB起步,50张4090才够门槛
Qwen3.8-Max是MoE架构,总参数2.4万亿,每个token大约激活950亿参数。注意,"激活参数"只影响推理时的计算量,权重文件本身是2.4T全量存在显存里的。这笔账很好算:
BF16精度:2.4万亿 × 2字节 ≈ 4.8TB显存
FP8精度:≈ 2.4TB
4bit量化(也是目前云厂商实际在用的档位):≈ 1.2TB,这还没算262K上下文的KV cache和激活开销
1.2TB是什么概念?一张RTX 4090是24GB显存,纯放权重就需要50张。DigitalOcean是第一个把它托管上线的云厂商,用的方案是NVIDIA HGX B300整机加NVFP4量化权重——注意,是整机级别的服务器,不是一台PC。
对比一下前两天刷屏的Qwen3.8-27B:Q4量化版21GB显存上下就能跑,单卡4090甚至A卡7900XTX都有人实测跑通。知乎一个是甜点,一个是数据中心,这就是27B和Max开源的本质区别。
所以先给准备"下载权重本地跑"的朋友泼盆冷水:别下,下了也跑不动,硬盘和心态都会崩。

那这次开源到底开了什么?先分清两个版本
这是最容易被标题带偏的地方。很多报道写的是"Qwen3.8-Max开源",但严格来说,目前开放权重的是从旗舰衍生出来的纯文本版本,名字叫Qwen3.8-2.4T-A95B:MoE、2.4T总参、每token激活约95B、262K上下文,主打编程、工具调用和长周期Agent任务,但不支持图片和视频输入。知乎
完整版Qwen3.8-Max(支持文本、图像、视频多模态输入的那个)目前仍然只走阿里云官方API。DigitalOcean在上线说明里也特意强调了这点:他们引用benchmark时排除了所有多模态测试成绩,因为那些数据对不上这个纯文本版本。
一句话记住:想玩多模态,走官方API;想拿权重做文章,目前只有纯文本版。

旗舰用不起但用得上:三条路,各有各的账
第一条:阿里云官方API,门槛最低。 Qwen3.8-Max已经上百炼平台,并入了Token Plan订阅计划,个人版39元/月起,分Lite、Standard、Pro三档,夜间时段还有额外折扣。知乎新用户赶上的话有限时加量10倍的token额度。另外提醒一个细节:工具调用(Function Calling、联网搜索、代码执行)是含在基础token计费里的,不单独收钱。还有个容易踩的坑:8月5日Preview版已经下线了,API里的model字段要改成qwen3.8-max,老代码不检查会直接报错。

顺带一个羊毛:阿里云刚推了夜间错峰活动,每晚22点到次日8点,Qoder、Meoo、TokenPlan用户跑Qwen3.8-Max自动5折,Qwen3.7-Max直接2折,不用报名不用兑换码。新用户注册Qoder CN送800次3.8-Max调用,59元/月个人版再送2000次。知乎官方的slogan很直白:"白天舍不得跑的大活,夜里跑。"对跑长任务的Agent党来说,这个时间差是真金白银。

第二条:海外云厂商托管,按量计费。 DigitalOcean的无服务器推理已经上线,价格是每百万输入token 2美元、输出6美元——作为参照,Claude Fable 5同口径是10美元和50美元。知乎接口兼容OpenAI格式,改个Base URL和模型ID就能迁。但有两个实操细节值得注意:一是这个模型回答前会先推理,reasoning_effort分low、high、xhigh三档,推理token既计输出费用又占上下文,做信息提取、分类这类任务老老实实设low,不然512的输出预算能被思考过程直接吃光;二是它支持MCP和标准Function Calling,但平台侧的Computer Use、Bash这些服务端工具暂时不支持。
第三条:自己下载权重部署,只建议企业考虑。 权重在HuggingFace和ModelScope都能拿到,适合数据出域有硬约束、或者要深度微调的场景。但前面算过了,1.2TB显存起步意味着这是多机多卡的数据中心工程,TCO要按项目算,个人用户到这里可以关页面了。另外商用前务必确认许可证条款,目前官方页面的具体授权细则我还没看到权威说明,别想当然。
能力到底什么水平?强在Agent,弱在纯修代码
按阿里云公布的benchmark(DigitalOcean转引时只保留了第三方评测,剔除了Qwen自家judge模型打分的内部榜,这个处理方式值得肯定):
强项很突出——IFBench指令遵循82.8分,在对比的所有模型里排第一,包括Claude Opus 4.8、Fable 5和GPT-5.6 Sol;Terminal-Bench 2.1拿了86.6,比Opus 4.8和Fable 5的84.6都高;PaperBench 93.0也领先。知乎官方把宣传重点放在"持续数天的自主运行"上:连续用工具、按反馈自我修正、几百轮交互保持策略一致。
短板也说清楚:SWE-bench Pro上67.7,Fable 5是80.0,差距明显;HLE的纯文本推理也不占优。另外目前开放权重版还没有独立的第三方benchmark,现有的分数都是从旗舰Max的纯文本结果借来的,参考可以,别当验收标准。
还有一个容易混淆的细节:官方随这次开源放出的基准对比图,主角是27B版本——拿来和Qwen3.6-27B、Qwen3.7-Plus这些同级模型对比,展示的是这一代开放权重的能力涨幅,跟上面Max的benchmark不是同一组数据,别对照着看。

所以定位很清楚:它是给长周期Agent、工具链编排、大文档大代码库推理准备的,不是给"让它帮我修个bug"准备的。
放进大盘看:这次开源是生意,不只是情怀
前阵子知乎上还有个热帖,标题是"如何看待Qwen千问现在成为国产顶尖大模型中,唯一一款不开源的厂商?"——说的就是旗舰一直闭源这件事。这次Max权重开放,算是正面回应了。知乎
而数据层面,开源早就不只是赚吆喝。HuggingFace报告显示Qwen的衍生模型已经超过15万个。极客公园同一周,Stripe花70亿美元收购了OpenRouter——一家50个人、没训练过一个模型的公司,干的活就是把各家模型接在一起赚差价。微博而它平台上最赚钱的货,就是DeepSeek、通义千问这些免费开源的中国模型。开源免费,渠道收费,这套商业模式已经跑通了。
最后,不同人怎么办
纯体验党、27B已经够玩的:2.4T权重跟你没关系,别折腾。想尝旗舰能力,官方39元/月的个人档或者Qwen App足够,等社区把蒸馏版做出来再说。
个人开发者、小团队:别碰自部署。用官方API或托管服务,长任务记得把reasoning_effort设成low,批量任务挪到晚上10点后跑,5折。先拿一个真实的长周期任务试水,别信demo。
企业用户:数据合规是硬需求再评估自部署,先看许可证、再算TCO、最后谈微调。
接下来值得盯的信号:开放权重版的第三方独立benchmark什么时候出;许可证细则落地;以及阿里新一期财报里AI资本开支的方向——这决定了这套开源打法会不会持续加码。
旗舰开源却人人跑不动,听起来像个悖论,其实是个信号:大模型的开源竞争,已经从"谁的权重能塞进你的显卡",变成了"谁的生态能让你按量买到旗舰"。对普通用户来说,这反而是好事——你不用买50张4090,也能用上一线旗舰的能力,只是方式从"拥有"变成了"订阅"。