开源社区最近很少这么连着热闹。8 月 28 日晚上,腾讯发布并开源了新一代大模型 Hy4 preview,总参数从上一代的 295B 干到 770B,上下文从 256K 扩到 1M。微博同一晚,GLM-5.3 的 141 个权重分片也挂上了 HuggingFace,总体量约 756GB,把 8 月 14 日那句“两周后公开权重”的承诺按期兑现了。知乎再往前倒两周,还有 2.4T 的 Qwen3.8 和“牛来”GLM-5.3-Flash——开源 heavyweight 们轮番出牌,隔两天就是一张。
知乎上“如何评价腾讯混元 8 月 28 日发布并开源新一代大语言模型 Hy4 preview”的问题下,讨论一天之内就分成了两拨:一拨在为分数兴奋,一拨在算显存劝退,还有一拨卡在免费体验的排队里。这篇不复读通稿,只把三件事说清楚:这个“第一梯队”的含金量到底怎么样,上手门槛有多高,以及谁现在就该上、谁该再等等。
770B 总参、49B 激活,这规格什么水平
先把规格钉死。Hy4 preview 是 78 层 Transformer,第一层是标准 dense FFN,剩下 77 层都是 MoE,每层 256 个路由专家加 1 个共享专家,每个 token 只激活 top-8 路由专家。知乎总参数 770B,但每个 token 只激活 49B,MoE 就是用稀疏换推理成本。上下文 1M tokens,官方定位也直白:为生产力而生。

但真正有意思的不是参数。官方公告里写,Hy4 preview 首次参与了自身研发,模型提出方案、运行实验并根据结果继续迭代,形成初步的递归自我改进闭环。知乎这个闭环已经产出了数字:它自主分析推理系统瓶颈,围绕算子融合、通信优化做了多轮迭代,端到端吞吐相比基线提升 31.8%。知乎换句话说,这个模型已经能帮工程师加速它自己的下一版——跑分回答的是“它现在多聪明”,这件事回答的是“它变聪明的速度会不会自己加快”。
“第一梯队”的含金量,拆开看
官方给了 12 项基准,其中传播最广的一条:Terminal Bench 85.4 分,追平 Claude Opus 5。知乎

但 12 项里最值得看的不是哪一项第一,而是它没有一项垫底。知乎770B/49B 的规格在第一梯队里算偏“小”的,用更小的激活参数跑出全项不落,这个效率才是工程师该盯的信号。
我个人觉得更有参考性的,是这组数据。在腾讯内部组织的 163 名内部专家、203 个工程任务的盲测中,Hy4 preview 均分 2.99/4,略优于 GLM 5.3 的 2.92 和 Kimi K3 的 2.94。知乎

拆成胜负率看:对 GLM 5.3 是 46.8% 胜、12.8% 平、40.4% 负;对 Kimi K3 是 51.2% 胜、7.9% 平、40.9% 负。知乎注意,是略胜,不是碾压——胜率没过半,两组负率都在四成以上。主场盲测该打多少折扣,各位心里可以有自己的判断。我认同的一个观点是:盲测比刷榜难作弊,这个 2.99 的含金量可以排在 Terminal Bench 前面。知乎
三盆冷水,上手前先泼
第一盆:这是 preview,不是正式版。官方自己列了已知问题:复杂任务推理时间偏长、过度自我验证。知乎说人话就是有时会想太久、自己跟自己较劲。生产环境要上,先按 preview 心态对待。
第二盆:没有视觉。目前不支持多模态,图像理解要等正式版才补。知乎带图的场景,直接绕道。
第三盆:盲测口径是腾讯主场。163 名专家、203 个任务的数据都来自官方,第三方独立复测才刚开始。知乎这不是说分数假,只是“交叉验证”这一步还欠着。
怎么上车:三类人三条路
API 接入党,定价继续走普惠路线。输入 6 元/百万 tokens,输出 18 元,缓存命中 0.3 元。知乎官方给的对标口径里,相比 GLM 5.3 和 Kimi K3,输出价格最低便宜 82%。知乎

已经接了 OpenRouter 这类聚合网关的,最稳的姿势是把它加进路由表试流量。半天就能有自己的数据——别人的 benchmark 是别人的,你的任务集才是你的 benchmark。知乎
白嫖体验党,窗口是真的。WorkBuddy/CodeBuddy 面向用户开展为期 2 周的限时免费。知乎但先给你提个醒,免费首日排队情况不太乐观。知乎评论区有人说,等了半个多小时。知乎
也有人发现,国际版不用排队。知乎有位用了三个月 WorkBuddy 的作者专门提醒,“免费”这两个字的真实价格,几乎没人讲清楚。知乎想白嫖的,趁早跑一遍自己的任务集,比收藏攻略有用。
自部署党,先看显存。权重已经在 HuggingFace、ModelScope、GitCode、CNB 四个平台开源,提供 FP8 量化版本,部署支持 vLLM 和 SGLang,官方给了现成的 recipe 和 Docker 镜像。知乎但算笔账:770B 的 FP8 权重约 770GB,加上 KV cache,单机显存得按 TB 级起步。卡不够,别硬上。
把视野拉远:这周的开源棋局
Hy4 不是孤立事件。把最近半个月的时间线排一下,节奏密得吓人:
日期 | 事件 |
|---|---|
8 月 13 日 | 阿里 Qwen3.8-2.4T 开源 |
8 月 14 日 | DeepSeek Harness 开源 |
8 月 21 日 | OpenAI 全面开源 Codex Harness,DeepSeek 涨价争议升温 |
8 月 24 日 | 开源模型 Token 调用份额首次反超闭源 |
8 月 26 日 | 智谱 GLM-5.3-Flash“牛来”开源上线 |
8 月 28 日 | 混元 Hy4 preview 开源,GLM-5.3 权重 756GB 放出 |
背景是一个更大的拐点。过去 60 天,开源模型的 Token 调用份额从 28% 暴涨至 62%,历史上首次反超闭源模型。36氪
竞争节奏也被硬生生从“半年一代”压缩到了“两周一轮”。36氪价格战更直接,Qwen3.8-Flash 刚把输入打到 0.8 元,腾讯就用 770B 旗舰跟上了。知乎
所以把社区里那句建议再重复一遍:别追价格,把“换模型”做成配置活。知乎这周的价格表已经让上周的成本测算作废,追价格只会把自己累死,把模型切换抽象成路由配置才是正道。
真正在变的,是门槛本身
这波热闹里还有一条暗线值得说。官方公告提到,自 2 月重建基础设施以来,混元大模型平均每两个月迭代一次大版本。知乎这个节奏背后,是腾讯 AI 人才和组织的持续调整。腾讯首席 AI 科学家姚顺雨领衔重整技术路线,他的前同事、前 OpenAI 研究员田永龙也已在 7 月入职腾讯。36氪社区里有人直言:腾讯这次真要吃上 AI 的席了。36氪
同时,开源的规则也在变。同晚放权重的 GLM-5.3 就是个样本:它的 License 大迈步走向营收分成,但并没有限制 hyperscaler 的规模。知乎开源不等于免费午餐,许可条款正在变成使用成本的一部分,上车前把 license 看清楚。
官方已经埋了下一手:按照这一节奏,Hy4 的下一版模型也将在近期陆续上线。知乎与其每条新闻都追,不如盯住三个信号:正式版和多模态什么时候补齐、第三方独立复测的结果、两周免费期结束后还续不续。在这种“两周一轮”的市场里,今天的第一梯队,可能就是明天的及格线。真正该攥在手里的,不是某一个模型,而是随时能换模型的能力。