770B开源还送1M上下文:腾讯Hy4的"自改进"我存疑
770B开源还送1M上下文:腾讯Hy4的"自改进"我存疑
8月28号晚上,腾讯把 Hy4 preview 甩出来的时候,我正在看一个系统的报错日志。
手机弹出一条推送。我扫了一眼参数——770B 总参数,49B 激活,1M 上下文。我放下日志,把那行报错先搁一边。因为"1M 上下文"这四个字,比我的报错值得先看。
先算账
总参数 770B,激活 49B——意思是你每次调用只点燃 49B 的脑子,剩下 721B 在睡觉[1]。这跟开便利店一个道理:你不用把所有员工都叫来站柜台,谁当班谁上。腾讯这次的聪明,是把"上几个班"压到了 49B。
价格:输入 6 块/百万 token,输出 18 块,缓存命中 0.3 块[1]。我拉了一下同行——DeepSeek V4-Flash 输出大概也这个区间,GLM-5.3 差不多。也就是说,第一梯队的价格,腾讯挤进来了,而且开源。
端到端吞吐比基线高 31.8%[1]。这个我信。训练侧把算子融合、通信优化多跑几轮,吞吐涨三成不是神话。

真正让我停住的,是那句"自改进"
但腾讯自己最想让你记住的,不是参数也不是价格,是一句话:初步形成递归自我改进闭环。
翻译一下人话:模型自己提方案、跑实验、看结果、再迭代。实验产生的代码和日志,喂回下一轮[1]。
我干了二十多年 IT,第一反应是:谁敢让生产系统自己改自己的逻辑?
我们上 ERP 的时候,一个字段要不要改,要三方签字、灰度一周、回滚预案写好。现在腾讯说——模型自己迭代自己。这不是"会写代码"。这是"会给自己动手术"。
我存疑,但不是否定
腾讯自己也说,这还是 preview,早期阶段[2]。盲测里它拿 2.99 分,赢了 GLM-5.3 的 2.92、Kimi K3 的 2.94——但 Terminal-Bench 2.1 只拿到 85.4,低于 GLM-5.3、Kimi K3、Qwen3.8 Max 和 GPT-5.6 Sol[2]。
翻译成人话:简单活干得爽,长链路复杂活还差点意思。
"自改进闭环"目前看,更像研发流程的自动化——让模型帮着调训练策略、看评估、改算子——不是一个会自己进化的活物。腾讯把"我们让模型参与了训练优化"说成了"闭环"。这话术,我见过太多次了。
这事放到便利店系统里
就是说:你让排班算法自己改排班规则。理论上能跑,真出事的时候,没人说得清它为什么改的。
自改进要成立,前提是你敢不敢让它改"会影响钱"的那部分。腾讯现在展示的,还停在"优化算子、调通信"——离"改业务决策"远着呢。一个连补货量都不敢交给它自己定的阶段,谈"递归自我改进",早了点。
所以我怎么看
Hy4 实在的地方是真实在——1M 上下文、便宜、开源,这三点对小团队是白捡。光这一条,就值得你明天去元宝或者 ima 上试试。
"递归自改进"先打个问号。等盲测跑满三个月,看它是真闭环,还是 PPT 闭环。
我把报错日志关了。今晚不纠结我的系统了,纠结腾讯的系统。
如果这篇让你重新想了一件事,点个「在看」让朋友也看到。每周一篇算账硬货 + 两篇AI快评,关注虾哥,不掉队。
你信腾讯这个"递归自改进"是真突破,还是又一句 PR 话术?选 A 信、选 B 不信,评论区说说。
#腾讯混元 #Hy4 #递归自改进 #大模型开源 #算账
来源
[1] 腾讯混元官方发布 / 新京报:Hy4 preview 参数、1M上下文、定价、吞吐+31.8%(2026-08-28) [2] 新浪科技实测:Terminal-Bench 2.1 得分 85.4,盲测 2.99 分,对比 GLM-5.3 / Kimi K3 / Qwen3.8 Max(2026-08-29) [3] 软盟资讯:Hy4 preview 内部盲测 163 专家 203 工程任务,称超 GLM-5.3 与 Kimi K3(2026-08-29)
