腾讯 Hy3 正式上线: Agent 压 DeepSeek V4, 但短板也明显

2026-07-08 10:40:45 0点赞 2收藏 0评论

腾讯混元 Hy3 正式版发布。

4 月的 preview 版本上线后,日均 token 消耗量涨了 20 倍,WorkBuddy 上主动选它的用户翻了 6 倍。今天这个正式版,就是这两个月被几十条产品线"拷打"出来的结果。

Hy3 的参数规格一张表就能说完:295B 总参数、21B 激活的 MoE 架构,256K 上下文,Apache 2.0 开源。输入 1 元/百万 tokens,输出 4 元,缓存命中低至 0.25 元。

横评 12 项,Agent 最强

Hy3 在 12 项评测里和 DeepSeek V4 Pro、Qwen 3.7 Max 直接对标。

图片图片

Agent 和工具编排是它的强项。ClawEval pass^3 拿了 68.5,超 DeepSeek V4 Pro 的 62.4 和 Qwen 3.7 Max 的 65.2。SkillsBench 55.3 同样领先。BrowseComp 84.2 几乎追平 GPT 5.5 的 84.4。

图片图片

代码类有进步但差距还在。SWE-bench Pro 从 preview 的 46.0 提到 57.9,和 DeepSeek V4 Pro、Qwen 3.7 Max 差 3-5 个点。

图片图片

数学推理是最大短板。MathArena Apex 上 Hy3 只有 38.7,GPT 5.5 是 85.4。当然这也不是 Hy3 一家的问题,Qwen 3.7 Max 的 44.5 同样不高。国产模型在这块和 GPT 5.5 的结构性差距还在。

腾讯的策略很明确:不比参数规模,打"智能密度"牌。21B 激活逼近 2-5 倍参数模型的水平,同时把成本压到最低。

真实产品里磨出来的

Hy3 背靠腾讯的产品矩阵,这点和大多数模型不一样。

它是直接在 WorkBuddy、CodeBuddy、元宝、ima、QQ 浏览器、微信公众号、WeGame 等几十个产品里跑出来的。优化方向不是刷榜,而是在真实任务里少出错。

几组数据:

WorkBuddy 接入后,任务解决率从 72% 到 90%,平均耗时缩短 34%。ima 的 Agent 系统稳定性 95.1%,工具编排里盲目重试、应止未止等无效操作大幅减少。公众号 AI 客服的意图识别准确率 98.94%,面对碎片化的表达也能判断。

幻觉率降幅最明显,正式版比 preview 下降了约 44%。微信读书标签标注准确率提升 14.1%。WeGame《流放之路:降临》的 AI 助手幻觉率从 4.5% 降到 2.8%。

每个数字背后都对应着真实用户的实际体验,比 benchmark 分数实在得多。

开源选了最宽松的协议

Hy3 选了 Apache 2.0,开发者可以随便下载、修改、商用,没有附加条件。

已经上架 HuggingFace 和 ModelScope,后续会登陆 OpenRouter、Hermes、Kilo、Cline、OpenClaw、OpenCode 等海外平台,基本覆盖了目前主流的开源 AI 工具链。

从 1 月底基础设施重建,到 4 月 preview,到今天正式版,混元用不到半年跑完了重构到产品迭代的链路。这个节奏说明腾讯在这件事上的投入没打算当配角。Hy3 不是最强的模型,但可能是国产大模型里最务实的那个。


展开 收起
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

相关文章推荐

更多精彩文章
更多精彩文章
最新文章 热门文章
2
扫一下,分享更方便,购买更轻松