770B开源还送1M上下文:腾讯Hy4的"自改进"我存疑

2026-08-29 10:43:03 0点赞 0收藏 0评论

770B开源还送1M上下文:腾讯Hy4的"自改进"我存疑

8月28号晚上,腾讯把 Hy4 preview 甩出来的时候,我正在看一个系统的报错日志。

手机弹出一条推送。我扫了一眼参数——770B 总参数,49B 激活,1M 上下文。我放下日志,把那行报错先搁一边。因为"1M 上下文"这四个字,比我的报错值得先看。

先算账

总参数 770B,激活 49B——意思是你每次调用只点燃 49B 的脑子,剩下 721B 在睡觉[1]。这跟开便利店一个道理:你不用把所有员工都叫来站柜台,谁当班谁上。腾讯这次的聪明,是把"上几个班"压到了 49B。

价格:输入 6 块/百万 token,输出 18 块,缓存命中 0.3 块[1]。我拉了一下同行——DeepSeek V4-Flash 输出大概也这个区间,GLM-5.3 差不多。也就是说,第一梯队的价格,腾讯挤进来了,而且开源。

端到端吞吐比基线高 31.8%[1]。这个我信。训练侧把算子融合、通信优化多跑几轮,吞吐涨三成不是神话。

770B开源还送1M上下文:腾讯Hy4的"自改进"我存疑

真正让我停住的,是那句"自改进"

但腾讯自己最想让你记住的,不是参数也不是价格,是一句话:初步形成递归自我改进闭环。

翻译一下人话:模型自己提方案、跑实验、看结果、再迭代。实验产生的代码和日志,喂回下一轮[1]。

我干了二十多年 IT,第一反应是:谁敢让生产系统自己改自己的逻辑?

我们上 ERP 的时候,一个字段要不要改,要三方签字、灰度一周、回滚预案写好。现在腾讯说——模型自己迭代自己。这不是"会写代码"。这是"会给自己动手术"。

我存疑,但不是否定

腾讯自己也说,这还是 preview,早期阶段[2]。盲测里它拿 2.99 分,赢了 GLM-5.3 的 2.92、Kimi K3 的 2.94——但 Terminal-Bench 2.1 只拿到 85.4,低于 GLM-5.3、Kimi K3、Qwen3.8 Max 和 GPT-5.6 Sol[2]。

翻译成人话:简单活干得爽,长链路复杂活还差点意思。

"自改进闭环"目前看,更像研发流程的自动化——让模型帮着调训练策略、看评估、改算子——不是一个会自己进化的活物。腾讯把"我们让模型参与了训练优化"说成了"闭环"。这话术,我见过太多次了。

这事放到便利店系统里

就是说:你让排班算法自己改排班规则。理论上能跑,真出事的时候,没人说得清它为什么改的。

自改进要成立,前提是你敢不敢让它改"会影响钱"的那部分。腾讯现在展示的,还停在"优化算子、调通信"——离"改业务决策"远着呢。一个连补货量都不敢交给它自己定的阶段,谈"递归自我改进",早了点。

所以我怎么看

Hy4 实在的地方是真实在——1M 上下文、便宜、开源,这三点对小团队是白捡。光这一条,就值得你明天去元宝或者 ima 上试试。

"递归自改进"先打个问号。等盲测跑满三个月,看它是真闭环,还是 PPT 闭环。

我把报错日志关了。今晚不纠结我的系统了,纠结腾讯的系统。


如果这篇让你重新想了一件事,点个「在看」让朋友也看到。每周一篇算账硬货 + 两篇AI快评,关注虾哥,不掉队。

你信腾讯这个"递归自改进"是真突破,还是又一句 PR 话术?选 A 信、选 B 不信,评论区说说。

#腾讯混元 #Hy4 #递归自改进 #大模型开源 #算账

来源

[1] 腾讯混元官方发布 / 新京报:Hy4 preview 参数、1M上下文、定价、吞吐+31.8%(2026-08-28) [2] 新浪科技实测:Terminal-Bench 2.1 得分 85.4,盲测 2.99 分,对比 GLM-5.3 / Kimi K3 / Qwen3.8 Max(2026-08-29) [3] 软盟资讯:Hy4 preview 内部盲测 163 专家 203 工程任务,称超 GLM-5.3 与 Kimi K3(2026-08-29)

展开 收起
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

相关文章推荐

更多精彩文章
更多精彩文章
最新文章 热门文章
0
扫一下,分享更方便,购买更轻松