腾讯混元 Hy4 preview 发布并开源:770B 参数,为生产力而生

2026-08-29 09:40:35 0点赞 0收藏 1评论

腾讯混元发布并开源新一代大语言模型 Hy4 preview。总参数 770B、激活参数 49B,上下文长度突破 1M,官方定位:为生产力而生。在代码、办公、游戏、科研这些真实生产力任务上,腾讯称它已稳居开源模型第一梯队。

硬参数:770B-A49B,1M 上下文

Hy4 preview 是 MoE 架构,总参数 770B、激活 49B。相比 Hy3,模型尺寸、上下文长度、数据规模都做了显著扩展,预训练和后训练共同进步。开源权重第一时间上线,WorkBuddy / CodeBuddy 国内版及国际版、元宝、ima 等腾讯产品同步首发,开发者和企业可以通过腾讯云 TokenHub 和 OpenRouter 调用 API。

腾讯混元 Hy4 preview 发布并开源:770B 参数,为生产力而生

限时福利也同步安排上了:Hy4 preview 在 WorkBuddy 和 CodeBuddy 上面向用户提供两周限时免费体验,Hy3 在这两个平台上的免费使用期限也延长到 9 月 30 日。

盲测:略胜 GLM 5.3 和 Kimi K3

腾讯组织了一次规模不小的内部盲测:163 名内部专家、203 个工程任务。结果 Hy4 preview 均分 2.99/4,略优于 GLM 5.3(2.92/4.00,胜 46.8%)和 Kimi K3(2.94/4.00,胜 51.2%)。注意这是腾讯自家组织的盲测,口径和第三方基准不完全等价,但足以说明它和同期开源旗舰处在同一档。

为生产力而生:四个场景都有官方案例

腾讯这次没有堆"通用能力"的空话,四个场景都给了具体案例:

软件工程:增强长程开发任务的理解、规划、调试与验证能力,前端视觉审美和交互质量也有提升。官方案例是用原生 WebGL 生成横向互动漫画页,多章节角色画风和叙事连续性保持得很好。

办公分析:复杂办公环境理解和金融分析能力提升,重点优化数据分析、跨文件协作,能完成从信息处理到文档、表格、演示文稿的完整交付。案例是从 72 份文件里判断发票是否合规,从 3 份规章制度里找到现行生效的规则。

游戏开发:一句话需求直接生成可玩原型,熟练使用游戏引擎——通过 MCP 接入 Unreal 5,纯对话从零做出一个射击游戏 Demo,包括环境美术、玩法、关卡搭建。

科学研究:AI 研发、分子动力学模拟、凝聚态物理、基础数学等场景均有长足进步。

亮点:首次参与"训练自己的训练"

Hy4 preview 一个值得注意的新信号:它首次参与了自己研发全链路的自动优化——训练方法、数据策略、评估体系和底层算子都让它自己提出方案、跑实验、根据结果迭代,实验产生的代码、日志和反馈进入下一轮探索,形成初步的递归自我改进闭环。

在推理基础设施层面,它自主分析系统瓶颈,围绕算子融合、通信优化做了多轮优化,端到端吞吐相比基线提升 31.8%。这在开源模型里算是少见的"模型自己优化自己"的实践。

价格

定价延续混元的高性价比路线:每百万 token,输入(命中缓存)0.3 元、输入 6 元、输出 18 元。

官方也坦白了已知问题:Hy4 preview 是 Hy4 迭代的早期版本,预训练和后训练都还有提升空间,复杂任务上有长思考和过度自我验证的倾向。腾讯的意思是——像 Hy3 preview 一样,先把 preview 放出来拿真实反馈,再据此打磨 Hy4 正式版。

总结

这波开源旗舰的竞争节奏明显加快了:Ox Alpha(GLM-5.3-Flash)刚开源一周,腾讯混元 Hy4 preview 就接棒。和智谱靠"匿名裸考"出圈不同,腾讯的差异化在两点:一是场景绑定,软件工程、办公、游戏、科研四个赛道都有自家产品线兜底,Co-Design 的反馈闭环是别人没有的;二是"模型自我优化"这个新叙事,如果 Hy4 正式版能延续下去,开源模型的迭代方式可能被改写。当然,770B 的总参数摆在那,本地跑的门槛依然不低——preview 版本真正的价值,还是先把口碑和反馈圈回来。

作者声明本文无利益相关,欢迎值友理性交流,和谐讨论~

展开 收起
1评论

  • 精彩
  • 最新
  • 770B的体量摆在这,API调用延迟和成本对个人开发者友好吗,有没有实际跑过的值友聊聊体验。

    校验提示文案

    提交
提示信息

取消
确认
评论举报

相关文章推荐

更多精彩文章
更多精彩文章
最新文章 热门文章
0
扫一下,分享更方便,购买更轻松