牛来真身揭晓,Hy4免费两周:本周国产旗舰大模型排队送免费档,哪个更值得薅

源自10位全网作者

10:17

追大模型的朋友应该都感觉到了,这周的国产大模型圈,比过年还热闹。

一个匿名模型在 OpenRouter 上霸榜了一整周,最后被智谱"认领";第二天腾讯就甩出 770B 的旗舰,还免费两周;阿里的 Qwen3.8 系列这个月更是炸弹不断。三天之内,三张"旗舰级白嫖卡"排着队拍在桌上。对普通用户来说,这是今年薅羊毛最舒服的一周。

先把这周发生了什么捋清楚,再说怎么薅、谁适合用谁。

一、霸榜一周的匿名模型,原来是智谱的"牛来"

先说最有梗的这段。

8月20日,一个名叫 OxAlpha 的模型悄悄上架 OpenRouter 和 OpenCode,没有厂商、没有参数、没有技术报告,只有一句"面向代码与智能体任务设计的推理模型",免费用。结果一周之内,它直接冲上两个平台的用量榜首,把此前霸榜的 DeepSeek V4 Flash 挤了下去。按平台页面的数据,光 OpenRouter 上 ox-alpha 就跑掉约 23 万亿 token,OpenCode 上更是高达 45 万亿,DeepSeek 的卡片上直接被标了个 -78%。知乎

牛来真身揭晓,Hy4免费两周:本周国产旗舰大模型排队送免费档,哪个更值得薅

然后就是全网"猜爹"环节。有人押智谱,有人押小米,还有人往谷歌身上猜,Polymarket 上押智谱的概率一度冲到 90% 以上。硬核玩家用分词器指纹、脏 token 测试找证据,偷懒的直接构造错误请求,靠报错信息反推厂商。微博中文社区给它起了个接地气的名字:“牛来”——既是蹭当时正在上映的电影《牛来》的热度,也是接了之前 Pony Alpha(小马)的梗。小马加牛,"牛马"齐活。

8月26日,智谱通过彭博社正式认领:OxAlpha 就是 GLM 系列的新模型,当晚开放权重,话题直接冲上微博热搜前 20。微博智谱官方账号的置顶只写了一句话,信息量很大:此前匿名预览的 Ox Alpha,全部跑在国产 AI 芯片上。知乎

那这模型到底什么水平?几个硬信息:

  • 320B 总参数,每次推理只激活 18B,1M 上下文,MIT 协议开源。知乎

  • 是 GLM-5 系列第一个原生多模态模型,写代码时能自己看界面、看渲染结果,边写边改;

  • Artificial Analysis 指数 57 分,与 Claude Opus 4.8 持平,官方对比里 DeepSWE 拿到 63.4,超过 Opus 4.8 的 58.0。知乎

  • 价格是真狠:输出价限时两周五折,1.4 元/百万 token,折扣结束回到 2.8 元,而 DeepSeek Flash 空闲时段都要 4.5 元。折算下来,成本大约只有 Opus 4.8 的四十分之一。

牛来真身揭晓,Hy4免费两周:本周国产旗舰大模型排队送免费档,哪个更值得薅

有团队拿真实项目做过横评:一个 Unity C# 项目,GLM-5.3-Flash 耗时 46 分钟、总花费 3.02 元,完成度排进第一梯队。知乎另外智谱团队自己也说了,Ox Alpha 只是 GLM-5.3-Flash 的早期版本,正式版还会更稳。知乎

二、第二天腾讯也掀桌了:Hy4,770B,免费两周

8月28日,腾讯混元发布并开源 Hy4 preview。知乎

  • 770B 总参数,每次只激活 49B,MoE 架构;

  • 上下文直接拉到 1M,一整个中型代码库或者几百页文档可以一次性塞进去;

  • 权重开源,API 同步上线腾讯云 TokenHub 和 OpenRouter;

  • 重点:WorkBuddy 和 CodeBuddy 从 8 月 28 日起限时免费两周(大概到 9 月中旬),元宝、ima 和腾讯 AI 开放平台也能直接体验。知乎

  • 对了,多模态版 Hy4-V 其实 8 月 14 日就已经开源,图像、文本、音频、视频、3D 五模态都支持。

牛来真身揭晓,Hy4免费两周:本周国产旗舰大模型排队送免费档,哪个更值得薅

腾讯这次没放标准跑分,只给了一场盲测:163 名内部专家、203 个真实工程任务,Hy4 均分 2.99/4,GLM 5.3 是 2.92,Kimi K3 是 2.94——赢了,但三家基本同一梯队。知乎

冷水也得泼两句。第一,官方明说这是 preview 早期版本,预训练和后训练都还有提升空间;第二,社区灰测的用户已经明显感觉到慢,输出速度和首字延迟都偏高,思考久、轮次多,新模型不稳定是常态,重要产出务必自己复核。

还有个值得留意的细节:Hy4 首次参与了自己的研发流程优化,提方案、跑实验、按结果迭代,端到端吞吐比基线提升了 31.8%。AI 帮着优化 AI 自己,方向挺有意思,但普通人当个谈资就好。

三、Qwen3.8:闷声放了一整月的炸弹

阿里通义这个月是连环输出:

  • 8月初,Qwen3.8 Max 正式版上线,有之前为 Claude 付费的开发者说,现在全线换成 3.8 Max,一个月账单连 200 美元都花不到。知乎

  • 8月14日,开源 Qwen3.8-27B,一个稠密模型,Agent 执行力被社区评为"今年最令人意外的成果"。知乎

  • 8月26日,开源 Qwen3.8-Flash-Next,官方定位是 Qwen4 架构的早期预览:125B 主干、每 token 只激活 6B,外加 51B 的 N-gram Embedding,千问平台上 Qwen3.8-Flash 可以直接免费用。

牛来真身揭晓,Hy4免费两周:本周国产旗舰大模型排队送免费档,哪个更值得薅

本地部署党这周最热闹。有人把约 94GB 的 Qwen3.8-Flash-Next 塞进 RTX 3090(24GB 显存)+ 128GB DDR5 内存,128K 上下文跑出 40.4 token/s。知乎有人在 M5 Max 的 Mac 上用 llama.cpp 跑 Qwen3.8-Flash,干到 50 token/s——llama.cpp 官方在 8 月 27 日刚把这个模型的支持合进主分支。还有人在双 V100S-32GB 的老服务器上,用 4 天时间、6 篇实战记录,把 27B 从"裸跑能开"一路推到全链路可用。知乎

牛来真身揭晓,Hy4免费两周:本周国产旗舰大模型排队送免费档,哪个更值得薅

这意味着:旗舰级模型不再是云端专属。消费级显卡 + 大内存,或者一台高配 Mac,数据不出内网也能用上。

四、为什么突然集体送?不是做慈善

一周三个旗舰白送,看着热闹,其实逻辑很清楚。

第一,市场空档是 DeepSeek 让出来的。7 月底 DeepSeek V4 Flash 涨价之后,"便宜又能打"的位置立刻空了出来,GLM-5.3-Flash 用"Opus 四十分之一价格"的姿态卡位,直接登顶用量榜。

第二,现在争的不是跑分,是真实使用量。行业统计里,中国日均 token 调用量已经突破 500 万亿。跑分可以刷,真实任务刷不了。免费期本质上是拿白嫖换真实反馈——上一代 Hy3 从 preview 到正式版,周调用量涨了 68 倍还多。知乎这个先例就摆在眼前。

所以心态可以放平:厂商拿免费换数据、换口碑,我们拿到的是实打实的窗口期。各取所需,不薅才是亏。

五、怎么选?直接给结论

牛来真身揭晓,Hy4免费两周:本周国产旗舰大模型排队送免费档,哪个更值得薅

写代码、跑 Agent 为主:优先 GLM-5.3-Flash。 编码多模态是它的杀手锏,能看图改前端,价格三家里最狠。免费渠道:chat.z.ai 网页、智谱清言 App、ZCode,Cline 里也能免费用,截止时间官方未说明。知乎OpenCode 的订阅计划里它限时给双倍额度。

重度办公、长文档处理:薅 Hy4 的两周窗口。 WorkBuddy 和 CodeBuddy 免费到 9 月中旬,1M 上下文特别适合"整堆资料丢进去出报告"的场景。错过了也别慌,Hy3 的免费期延长到了 9 月 30 日。知乎

日常问答、轻度使用:千问平台就够了。 免费、零门槛,Qwen3.8 系列的日常能力口碑很稳。

本地部署、硬件党:Qwen3.8-Flash-Next 是现在的当红炸子鸡。 94GB 的模型,24GB 显存 + 128GB 内存就能跑出可用速度;显卡不够的,27B 稠密版的实战教程也已经铺了一地。

还在给 Claude、ChatGPT 交订阅的: 不用急着退订,但可以把低风险任务先迁过来试,省下来的都是真金白银。

六、三个避坑提醒

  1. preview 就是 preview。Hy4 官方自己都说是早期版本:速度慢、轮次多、输出翻车都正常。重要产出,代码跑一遍、数据抽查、文档通读,AI 是副驾,不是自动驾驶。

  2. 免费渠道有窗口期。写明两周的还好,没写截止时间的(比如 Cline 那个免费入口),随时可能收回,别囤教程,先用上再说。

  3. 跑分传闻别当真。Hy4 这次官方没放标准跑分,网传的都是猜测。知乎GLM 的 57 分也只是 Artificial Analysis 一家的体系,参考可以,别迷信。

七、接下来值得盯什么

  • Hy4 正式版:按 Hy3 的节奏,preview 到正式版大约两个月,值得等;

  • Qwen4 正式版:Flash-Next 只是架构预览,正主还没来;

  • GLM-5.3-Flash 的限时折扣会不会变成长期价;

  • DeepSeek 的反击——榜一被一个"无名氏"端了,不可能没动作。

这波免费档过去之后,价格战大概率还会换着花样继续。觉得这篇有用,先收藏,这种全员发福利的窗口期,一年遇不上几次。

内容由AI生成

精选参考来源

1. 牛来模型,终于让我满意

2. 牛来藏不住了。前段时间有个匿名神秘模型Ox Alpha,被人戏称牛来。智谱今天官方确认,在 OpenRouter、OpenCode 上匿名测试的 Ox Alpha,就是 GLM 新一代模型,今晚开放权重。社区其实猜到个七七八八。分词器指纹、视觉编码消耗、API 报错路径,几条线索全指向智谱,就差官方点头。现在官方认领了。值得期待的,是即将开放的权重。开放意味着到时候可以本地部署,架构、硬件门槛、许可边界全部摊开。编程加长程 Agent,文本图片视频都吃,这代 GLM 能力,开发者自己跑一遍就知道了。#牛来模型确认为智谱GLM系列#

3. 【#牛来模型确认为智谱GLM系列#】8月26日消息,据彭博社报道,中国人工智能公司智谱(Z.AI)确认,近期以匿名方式上线的Ox Alpha是其GLM系列的新一代模型GLM-5.3 Flash Model,并计划于今晚开放模型权重。Ox Alpha已登上OpenRouter使用榜首,调用量超过DeepSeek的两倍。该模型面向编程及智能体任务,支持处理文本、图像和视频输入,目前可免费使用一周,后续收费标准尚未公布。

4. 「牛来」模型正式揭晓:便宜是真便宜,能力到底行不行?GLM-5.3-Flash 快速一览(附免费渠道)

5. 腾讯混元刚开源 大模型Hy4,770B免费两周,4 条路教你用上

6. 如何评价8月3日上线的阿里Qwen 3.8 Max正式版?相比其他模型表现如何?

7. Qwen3.8-27B 发布

8. 24GB 显存 + 128GB 内存,塞下Qwen3.8 Flash 94GB 大模型:MoE 把消费级显卡玩出新花样

9. 双 V100S 跑 Qwen3.8-27B总结:6 篇实战、4 天优化

0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章