追大模型的朋友应该都感觉到了,这周的国产大模型圈,比过年还热闹。
一个匿名模型在 OpenRouter 上霸榜了一整周,最后被智谱"认领";第二天腾讯就甩出 770B 的旗舰,还免费两周;阿里的 Qwen3.8 系列这个月更是炸弹不断。三天之内,三张"旗舰级白嫖卡"排着队拍在桌上。对普通用户来说,这是今年薅羊毛最舒服的一周。
先把这周发生了什么捋清楚,再说怎么薅、谁适合用谁。
一、霸榜一周的匿名模型,原来是智谱的"牛来"
先说最有梗的这段。
8月20日,一个名叫 OxAlpha 的模型悄悄上架 OpenRouter 和 OpenCode,没有厂商、没有参数、没有技术报告,只有一句"面向代码与智能体任务设计的推理模型",免费用。结果一周之内,它直接冲上两个平台的用量榜首,把此前霸榜的 DeepSeek V4 Flash 挤了下去。按平台页面的数据,光 OpenRouter 上 ox-alpha 就跑掉约 23 万亿 token,OpenCode 上更是高达 45 万亿,DeepSeek 的卡片上直接被标了个 -78%。知乎

然后就是全网"猜爹"环节。有人押智谱,有人押小米,还有人往谷歌身上猜,Polymarket 上押智谱的概率一度冲到 90% 以上。硬核玩家用分词器指纹、脏 token 测试找证据,偷懒的直接构造错误请求,靠报错信息反推厂商。微博中文社区给它起了个接地气的名字:“牛来”——既是蹭当时正在上映的电影《牛来》的热度,也是接了之前 Pony Alpha(小马)的梗。小马加牛,"牛马"齐活。
8月26日,智谱通过彭博社正式认领:OxAlpha 就是 GLM 系列的新模型,当晚开放权重,话题直接冲上微博热搜前 20。微博智谱官方账号的置顶只写了一句话,信息量很大:此前匿名预览的 Ox Alpha,全部跑在国产 AI 芯片上。知乎
那这模型到底什么水平?几个硬信息:
320B 总参数,每次推理只激活 18B,1M 上下文,MIT 协议开源。知乎
是 GLM-5 系列第一个原生多模态模型,写代码时能自己看界面、看渲染结果,边写边改;
Artificial Analysis 指数 57 分,与 Claude Opus 4.8 持平,官方对比里 DeepSWE 拿到 63.4,超过 Opus 4.8 的 58.0。知乎
价格是真狠:输出价限时两周五折,1.4 元/百万 token,折扣结束回到 2.8 元,而 DeepSeek Flash 空闲时段都要 4.5 元。折算下来,成本大约只有 Opus 4.8 的四十分之一。

有团队拿真实项目做过横评:一个 Unity C# 项目,GLM-5.3-Flash 耗时 46 分钟、总花费 3.02 元,完成度排进第一梯队。知乎另外智谱团队自己也说了,Ox Alpha 只是 GLM-5.3-Flash 的早期版本,正式版还会更稳。知乎
二、第二天腾讯也掀桌了:Hy4,770B,免费两周
8月28日,腾讯混元发布并开源 Hy4 preview。知乎
770B 总参数,每次只激活 49B,MoE 架构;
上下文直接拉到 1M,一整个中型代码库或者几百页文档可以一次性塞进去;
权重开源,API 同步上线腾讯云 TokenHub 和 OpenRouter;
重点:WorkBuddy 和 CodeBuddy 从 8 月 28 日起限时免费两周(大概到 9 月中旬),元宝、ima 和腾讯 AI 开放平台也能直接体验。知乎
对了,多模态版 Hy4-V 其实 8 月 14 日就已经开源,图像、文本、音频、视频、3D 五模态都支持。

腾讯这次没放标准跑分,只给了一场盲测:163 名内部专家、203 个真实工程任务,Hy4 均分 2.99/4,GLM 5.3 是 2.92,Kimi K3 是 2.94——赢了,但三家基本同一梯队。知乎
冷水也得泼两句。第一,官方明说这是 preview 早期版本,预训练和后训练都还有提升空间;第二,社区灰测的用户已经明显感觉到慢,输出速度和首字延迟都偏高,思考久、轮次多,新模型不稳定是常态,重要产出务必自己复核。
还有个值得留意的细节:Hy4 首次参与了自己的研发流程优化,提方案、跑实验、按结果迭代,端到端吞吐比基线提升了 31.8%。AI 帮着优化 AI 自己,方向挺有意思,但普通人当个谈资就好。
三、Qwen3.8:闷声放了一整月的炸弹
阿里通义这个月是连环输出:
8月初,Qwen3.8 Max 正式版上线,有之前为 Claude 付费的开发者说,现在全线换成 3.8 Max,一个月账单连 200 美元都花不到。知乎
8月14日,开源 Qwen3.8-27B,一个稠密模型,Agent 执行力被社区评为"今年最令人意外的成果"。知乎
8月26日,开源 Qwen3.8-Flash-Next,官方定位是 Qwen4 架构的早期预览:125B 主干、每 token 只激活 6B,外加 51B 的 N-gram Embedding,千问平台上 Qwen3.8-Flash 可以直接免费用。

本地部署党这周最热闹。有人把约 94GB 的 Qwen3.8-Flash-Next 塞进 RTX 3090(24GB 显存)+ 128GB DDR5 内存,128K 上下文跑出 40.4 token/s。知乎有人在 M5 Max 的 Mac 上用 llama.cpp 跑 Qwen3.8-Flash,干到 50 token/s——llama.cpp 官方在 8 月 27 日刚把这个模型的支持合进主分支。还有人在双 V100S-32GB 的老服务器上,用 4 天时间、6 篇实战记录,把 27B 从"裸跑能开"一路推到全链路可用。知乎

这意味着:旗舰级模型不再是云端专属。消费级显卡 + 大内存,或者一台高配 Mac,数据不出内网也能用上。
四、为什么突然集体送?不是做慈善
一周三个旗舰白送,看着热闹,其实逻辑很清楚。
第一,市场空档是 DeepSeek 让出来的。7 月底 DeepSeek V4 Flash 涨价之后,"便宜又能打"的位置立刻空了出来,GLM-5.3-Flash 用"Opus 四十分之一价格"的姿态卡位,直接登顶用量榜。
第二,现在争的不是跑分,是真实使用量。行业统计里,中国日均 token 调用量已经突破 500 万亿。跑分可以刷,真实任务刷不了。免费期本质上是拿白嫖换真实反馈——上一代 Hy3 从 preview 到正式版,周调用量涨了 68 倍还多。知乎这个先例就摆在眼前。
所以心态可以放平:厂商拿免费换数据、换口碑,我们拿到的是实打实的窗口期。各取所需,不薅才是亏。
五、怎么选?直接给结论

写代码、跑 Agent 为主:优先 GLM-5.3-Flash。 编码多模态是它的杀手锏,能看图改前端,价格三家里最狠。免费渠道:chat.z.ai 网页、智谱清言 App、ZCode,Cline 里也能免费用,截止时间官方未说明。知乎OpenCode 的订阅计划里它限时给双倍额度。
重度办公、长文档处理:薅 Hy4 的两周窗口。 WorkBuddy 和 CodeBuddy 免费到 9 月中旬,1M 上下文特别适合"整堆资料丢进去出报告"的场景。错过了也别慌,Hy3 的免费期延长到了 9 月 30 日。知乎
日常问答、轻度使用:千问平台就够了。 免费、零门槛,Qwen3.8 系列的日常能力口碑很稳。
本地部署、硬件党:Qwen3.8-Flash-Next 是现在的当红炸子鸡。 94GB 的模型,24GB 显存 + 128GB 内存就能跑出可用速度;显卡不够的,27B 稠密版的实战教程也已经铺了一地。
还在给 Claude、ChatGPT 交订阅的: 不用急着退订,但可以把低风险任务先迁过来试,省下来的都是真金白银。
六、三个避坑提醒
preview 就是 preview。Hy4 官方自己都说是早期版本:速度慢、轮次多、输出翻车都正常。重要产出,代码跑一遍、数据抽查、文档通读,AI 是副驾,不是自动驾驶。
免费渠道有窗口期。写明两周的还好,没写截止时间的(比如 Cline 那个免费入口),随时可能收回,别囤教程,先用上再说。
跑分传闻别当真。Hy4 这次官方没放标准跑分,网传的都是猜测。知乎GLM 的 57 分也只是 Artificial Analysis 一家的体系,参考可以,别迷信。
七、接下来值得盯什么
Hy4 正式版:按 Hy3 的节奏,preview 到正式版大约两个月,值得等;
Qwen4 正式版:Flash-Next 只是架构预览,正主还没来;
GLM-5.3-Flash 的限时折扣会不会变成长期价;
DeepSeek 的反击——榜一被一个"无名氏"端了,不可能没动作。
这波免费档过去之后,价格战大概率还会换着花样继续。觉得这篇有用,先收藏,这种全员发福利的窗口期,一年遇不上几次。