腾讯混元 Hy4 preview 发布并开源:770B 参数,为生产力而生
腾讯混元发布并开源新一代大语言模型 Hy4 preview。总参数 770B、激活参数 49B,上下文长度突破 1M,官方定位:为生产力而生。在代码、办公、游戏、科研这些真实生产力任务上,腾讯称它已稳居开源模型第一梯队。
硬参数:770B-A49B,1M 上下文
Hy4 preview 是 MoE 架构,总参数 770B、激活 49B。相比 Hy3,模型尺寸、上下文长度、数据规模都做了显著扩展,预训练和后训练共同进步。开源权重第一时间上线,WorkBuddy / CodeBuddy 国内版及国际版、元宝、ima 等腾讯产品同步首发,开发者和企业可以通过腾讯云 TokenHub 和 OpenRouter 调用 API。

限时福利也同步安排上了:Hy4 preview 在 WorkBuddy 和 CodeBuddy 上面向用户提供两周限时免费体验,Hy3 在这两个平台上的免费使用期限也延长到 9 月 30 日。
盲测:略胜 GLM 5.3 和 Kimi K3
腾讯组织了一次规模不小的内部盲测:163 名内部专家、203 个工程任务。结果 Hy4 preview 均分 2.99/4,略优于 GLM 5.3(2.92/4.00,胜 46.8%)和 Kimi K3(2.94/4.00,胜 51.2%)。注意这是腾讯自家组织的盲测,口径和第三方基准不完全等价,但足以说明它和同期开源旗舰处在同一档。
为生产力而生:四个场景都有官方案例
腾讯这次没有堆"通用能力"的空话,四个场景都给了具体案例:
软件工程:增强长程开发任务的理解、规划、调试与验证能力,前端视觉审美和交互质量也有提升。官方案例是用原生 WebGL 生成横向互动漫画页,多章节角色画风和叙事连续性保持得很好。
办公分析:复杂办公环境理解和金融分析能力提升,重点优化数据分析、跨文件协作,能完成从信息处理到文档、表格、演示文稿的完整交付。案例是从 72 份文件里判断发票是否合规,从 3 份规章制度里找到现行生效的规则。
游戏开发:一句话需求直接生成可玩原型,熟练使用游戏引擎——通过 MCP 接入 Unreal 5,纯对话从零做出一个射击游戏 Demo,包括环境美术、玩法、关卡搭建。
科学研究:AI 研发、分子动力学模拟、凝聚态物理、基础数学等场景均有长足进步。
亮点:首次参与"训练自己的训练"
Hy4 preview 一个值得注意的新信号:它首次参与了自己研发全链路的自动优化——训练方法、数据策略、评估体系和底层算子都让它自己提出方案、跑实验、根据结果迭代,实验产生的代码、日志和反馈进入下一轮探索,形成初步的递归自我改进闭环。
在推理基础设施层面,它自主分析系统瓶颈,围绕算子融合、通信优化做了多轮优化,端到端吞吐相比基线提升 31.8%。这在开源模型里算是少见的"模型自己优化自己"的实践。
价格
定价延续混元的高性价比路线:每百万 token,输入(命中缓存)0.3 元、输入 6 元、输出 18 元。
官方也坦白了已知问题:Hy4 preview 是 Hy4 迭代的早期版本,预训练和后训练都还有提升空间,复杂任务上有长思考和过度自我验证的倾向。腾讯的意思是——像 Hy3 preview 一样,先把 preview 放出来拿真实反馈,再据此打磨 Hy4 正式版。
总结
这波开源旗舰的竞争节奏明显加快了:Ox Alpha(GLM-5.3-Flash)刚开源一周,腾讯混元 Hy4 preview 就接棒。和智谱靠"匿名裸考"出圈不同,腾讯的差异化在两点:一是场景绑定,软件工程、办公、游戏、科研四个赛道都有自家产品线兜底,Co-Design 的反馈闭环是别人没有的;二是"模型自我优化"这个新叙事,如果 Hy4 正式版能延续下去,开源模型的迭代方式可能被改写。当然,770B 的总参数摆在那,本地跑的门槛依然不低——preview 版本真正的价值,还是先把口碑和反馈圈回来。
作者声明本文无利益相关,欢迎值友理性交流,和谐讨论~

张大妈
校验提示文案
张大妈
校验提示文案