8月26日晚上,开源圈连着落下两颗炸弹。
阿里千问开源了 Qwen3.8-Flash-Next——基于下一代 Qwen4 架构的先导预览版,API 定价压到每百万 tokens 输入1元、输出3元,比 DeepSeek-V4-Flash 空闲时段还便宜三分之一。几乎同一时间,智谱开源了 GLM-5.3-Flash,就是此前在匿名测评里爆火的那个 Ox-Alpha(网友戏称"牛来"模型),价格直接打到 GLM-5.3 的十分之一,限时折扣期内只有二十分之一,相当于 Claude Opus 4.8 的四十分之一。智东西
海外开发者社区当场炸锅。据知乎专栏作者统计,这两条消息在 Hacker News 上合计逼近1500分,是中国开源阵营动静最大的一天。知乎千问的推特评论区里,有人直接留言"这太强了"“我们不需要 OpenAI”。智东西
再往后一天,还有一个更重的背景板:据 The Information 报道,英伟达以129亿美元达成收购全球最大开源社区 Hugging Face 的协议。36氪
三件事放在一起,信号其实很清楚:开源大模型进入了"性价比卷到极致、规则同步改写"的阶段。价格是真崩了,但"免费"两个字,已经不是过去那个意思了。
一夜之间到底开源了什么
先说千问。Qwen3.8-Flash-Next 主模型125B参数,外加51B的 N-gram Embedding,但每个 token 只激活6B参数——这是它能把成本和价格同时打下来的关键。原生支持256K上下文,通过 YaRN 可以扩到100万;训练开销只有上一代 Qwen3.7-Plus 的约九分之一。智东西
在千问团队自己放出的基准测试里,它在智能体、编程、通用和多模态的绝大多数项目上超过了 DeepSeek-V4-Flash 正式版和 Claude-Opus-4.6——注意,这是厂商自测榜单,含金量先打个问号,等第三方复测。智东西

权重已经上了 Hugging Face 和魔搭社区。API 将以 qwen3.8-flash 的名字上线千问 AI 平台,接口同时兼容 OpenAI 和 Anthropic 协议,意味着可以直接替换进 Claude Code、Codex 这类编程工具。
再说智谱。GLM-5.3-Flash 是320B总参、激活18B的 MoE。知乎也是 GLM-5 系列第一个原生多模态模型。智谱自研的 Z.ai CodeBench 体感评估里,它的编程表现与 Claude Opus 4.8 相当——同样是自家尺子,参考即可。真正实在的是价格和许可证:价格降到上一代的十分之一,许可证继续用标准 MIT,几乎没有任何商业限制。
同一天微信还开源了 WeMM-Embedding 多模态向量模型。一天三发,密度罕见。
对普通用户来说,最直观的变化是成本。按这次公布的数字,qwen3.8-flash 输入1元/输出3元(每百万 tokens),倒推回去,比 DeepSeek-V4-Flash 空闲档便宜约三分之一;而 GLM-5.3-Flash 限时折扣期只有 Opus 4.8 的四十分之一。过去一年"用闭源旗舰心疼额度"的日子,正在被开源阵营集体改写。
但"免费"的规矩,正在悄悄改写
价格战打得越凶,另一件事越值得看:模型公司开始把商业边界写进许可证。
今年4月以来,几家头部厂商的做法已经明显分道。把关键条款捋一遍:
DeepSeek V4-Pro、GLM-5.3-Flash:标准 MIT,随便商用。但 DeepSeek 在8月13日开放新版权重的同一天,把 API 改成了峰谷定价,高峰时段输出价格从每百万 tokens 6元涨到27元。
Qwen3.8-27B:Apache 2.0,宽松商用,小模型继续放开做生态。
Kimi K3:允许下载、微调、商用,但如果你做的是 MaaS 生意(直接向第三方提供推理、微调服务),且公司或关联方任意连续12个月合计收入超过2000万美元,就得和月之暗面另签协议;企业内部使用明确豁免。硅星人Pro
MiniMax M3:年收入2000万美元以内的商业产品,标注"Built with MiniMax M3"加一次性通知即可,超过才需要另签授权。
Qwen3.8-Max:在 MaaS 之外还单独圈了一类"AI 工作助手"(编程和办公生产力产品,官方拿自家 Qoder 和 QwenWork 举例),被许可方加关联方总收入超过5000万美元需另行授权;翻译、电商这类垂直应用被明确排除在外。
这次新发布的 Qwen3.8-Flash-Next:换成 Qwen Community License 1.0,对 MaaS 和 AI 工作助手不再设营收门槛——只要经营这两类业务,商业使用前就需要另行取得许可。
看出门道了吗?这些条款针对的从来不是个人开发者。按硅基流动递交港交所的招股书,这家中国排名第一的独立 token 供应商2025年总营收约770万美元,连任何一条门槛都够不到。闸门真正挡的是火山引擎、阿里云、百度智能云这种体量的平台——路透社8月26日报道,月之暗面正在分别和微软、亚马逊、Google 洽谈 K3 的收入分成,希望 K3 进入 Azure、AWS 和 Google Cloud,寻求的分成比例最高可达相关服务收入的30%,不过谈判还处于早期,各方都没确认条款。
这个剧本其实不新鲜。2018年以来,MongoDB、Elastic、HashiCorp 都因为云厂商免费托管自己的开源项目而改过许可证,AI 模型只是把载体从代码换成了权重。更贴切的类比是虚幻引擎:游戏随便做、免费用,收入超过门槛才开始分成。权重可以免费拿,不意味着你把生意做大以后什么都不用谈。
开源模型赚钱,其实有三条路
把最近的动作串起来,会发现所谓"开源不赚钱"是个误解,各家只是选了不同的旋钮:
第一条,许可证设卡。Kimi 和 Qwen 走这条路,盯住的都是 MaaS 这一层——推理正在变成一门越来越大的生意,Together、Fireworks、硅基流动这类第三方推理平台的核心商品,就是替别人跑开放模型。谁来部署、谁拿推理收入,直接关系模型公司的商业空间,所以条款精准卡在"拿我的权重对外卖服务"这件事上。
第二条,API 涨价。DeepSeek 权重照样 MIT 全开,但原厂服务不再廉价。据流出的投资者交流纪要,梁文锋的说法是按十个月回本定价,“第三方做不到这个成本”。硅星人Pro8月那次涨价,高峰输出价一夜涨了350%,客观上倒是给第三方部署留出了更大的利润空间——这条逻辑还成不成立,可以再观察一阵。

第三条,卖服务收钱。智谱的财报已经给出了形状:2025年总收入7.24亿元,本地化部署占73.7%;2026年一季度 API 涨价83%,调用量反而增长400%,MaaS 平台 ARR 做到17亿元。硅星人ProMIT 负责把生态铺到最大,私有化部署和云服务直接承担收入。
一句话总结:权重越来越像免费的路基,钱收在"谁来替你跑、跑得多稳"那一层。
不同类型的使用者,现在该怎么选
这次变化对不同人的影响完全不一样,分开说:
个人轻度用户(聊天、写作、翻译、跑跑小工具):基本无感,甚至是纯受益。价格战打得越狠你越划算,qwen3.8-flash 和限时折扣期的 GLM-5.3-Flash 值得上手试试。唯一提醒:Flash-Next 是 Qwen4 架构的预览版,千问自己都说了是放出来让社区检验的,生产环境先别押注。
编程工具党(拿模型接 Claude Code、Codex 写代码的):千问 API 兼容 Anthropic 协议,切换成本很低,1元输入/3元输出跑日常编码任务性价比突出;如果是商业化项目,GLM-5.3-Flash 的 MIT 许可用起来最没有心理负担。
企业内部使用(知识库、内部工具、私有化部署):各家的条款都明确豁免或不管内部使用,照常用,这轮变化和你关系不大。
想做 MaaS、API 转售、模型服务的:这轮闸门就是冲你来的。K3 看2000万美元、Qwen3.8-Max 看5000万美元,而 Flash-Next 预览版干脆不设门槛。就算现在营收够不到线,也请把"做大之后要回到谈判桌"写进商业计划。
本地部署党:社区已经在动手了。微博上有实测,Mac mini M4 32G 跑 Qwen3.8-27B 的 MLX 4bit 量化,速度5-6 tokens/s。微博也有人在 RTX Pro 6000 上跑 27B 的 Q8 全精度双 Agent 流程,生产可用。微博这次 Flash 系列每 token 只激活6B,意味着本地跑动的硬件门槛还会继续下探,值得等社区的量化和适配版本。另外记住:同代的 Qwen3.8-27B 是 Apache 2.0,商用部署最省心。
接下来值得盯的三个信号
一是 Qwen4 正式家族。这次的 Flash-Next 只是先导预览,正式版落地时能力和许可证会不会再变,是近期最大的变量。
二是 DeepSeek 的峰谷定价会不会被跟进。开源阵营一边卷价格、一边给原厂服务涨价,这两个动作同时存在,后面其他家跟不跟,决定"便宜的 API"这个红利还能吃多久。
三是 Hugging Face 的走向。据 The Information 报道,英伟达以129亿美元达成了收购协议——这家托管着超过200万个公开模型、1300万注册用户的"AI 界 GitHub"。36氪今年2月刚把 llama.cpp 的作者 Georgi Gerganov 和他的团队收编。
它最大的价值本来是对所有硬件一视同仁的中立性,现在归了卖 GPU 的巨头,社区信任会不会迁移,会直接影响开源阵营的大本营在哪。顺带一提,Stripe 也刚以约80亿美元收购了 OpenRouter,资本正在集体涌向 AI 的分发层。36氪

对普通用户来说,这大概是玩开源模型成本最低的时代:旗舰水平的能力,零头的价格。真正需要多看一眼的只有两件事——哪个 API 当下最便宜好用,以及你的用法,是不是恰好落进了许可证的"设卡区"。前者帮你省钱,后者帮你避坑。