腾讯Hy4发布当天开源、白送两周:首日有人排队4286位、生图另扣积分,上车前先把这五笔账算清

源自24位全网作者

00:20

8月28日,腾讯混元发布并开源新一代大语言模型 Hy4 preview,总参数 770B、激活参数 49B,上下文长度突破 1M。知乎 官方定位一句话:“为生产力而生”,主攻代码、办公、游戏、科研四个方向。元宝、ima 同步首发,腾讯云 TokenHub 和 OpenRouter 挂上了 API,权重上了 ModelScope、GitCode 和 HuggingFace。

更抓眼球的在价格栏:WorkBuddy/CodeBuddy 将面向用户开展为期 2 周的限时免费活动(8.28–9.10,国内版和国际版都算)。知乎 Hy3 的免费期也同步延长到了 9 月 30 日。知乎

社区的热度当天就见了底数:有博主在发布日第一次给 WorkBuddy 派活——“帮我看一下我的 C 盘,列一个清理计划”——任务还没真正执行,就提示当前模型资源紧张,前方约 4286 位用户排队。知乎 当晚 B 站搜"Hy4",第一页几乎全是发布当天的实测视频;新模型的"免费"窗口,也赶在了同一天扎堆——GLM-5.3-Flash周末狂送3亿Token 就写在当天的 AI 日报标题里。哔哩哔哩

这篇不替厂商写通稿,也不替你喊冲。它只干一件事:把官方口径、社区实测、免费规则和续费成本拼在一张桌子上,你对照自己的用法决定上不上车。

第一笔账:它到底赢在哪——赢是赢了,但不是碾压

腾讯Hy4发布当天开源、白送两周:首日有人排队4286位、生图另扣积分,上车前先把这五笔账算清

官方这次没放标准跑分,放的是自家组织的工程盲测:163 名内部专家、203 个真实工程任务,Hy4 preview 均分 2.99/4,GLM 5.3 是 2.92,Kimi K3 是 2.94。知乎 三个数字摆出来,结论应该很清醒:略优于两款国产旗舰,三家基本坐在同一张桌子上,而不是"吊打"。

两个细节值得注意。第一,这是"工程任务盲测",考的是"能不能真把活干完",跟 MMLU 那类标准考卷不是一回事,拿去横向对比别的榜单没意义。第二,官方至今没公布任何公开基准分——所以这两天凡是截图告诉你"Hy4 跑分 XX 登顶"的,都先当传闻处理。

还有个彩蛋比跑分更值得记住:官方称 Hy4 preview 在自身研发全链路中首次参与了训练方法、数据策略、评估体系和底层算子的自动优化,模型提出方案、运行实验并根据结果继续迭代,形成初步的递归自我改进闭环。知乎

它甚至自己动手优化了推理系统:自主分析瓶颈,围绕算子融合、通信优化开展多轮优化,端到端吞吐相较基线提升 31.8%。知乎 方向是新的,幅度还是早期数字:当趋势看,不当结论用。

第二笔账:24小时实测里,强在哪、翻车在哪

发布不到一天,WorkBuddy 里的实测已经刷屏,正反两边都得看。

正面信号比较一致的是"交付物质量"。有科技媒体拿亚马逊、微软、谷歌、阿里、腾讯五家最新财报做同题测试,Hy4 生成的 PPT 排版明显比上一代 Hy3 成熟:关键字标色、企业用背景色分区,还自动提示了微软是年报而非季报、数字按季均估算。知乎 和 DeepSeek V4 Pro 放在一起,属于"能坐一张桌子"的水平。

腾讯Hy4发布当天开源、白送两周:首日有人排队4286位、生图另扣积分,上车前先把这五笔账算清

另一批实测集中在"一句话生成交互内容":3D 航发拆解演示、能玩的马里奥式小游戏(有分数、关卡、音效、复活机制)、带导出备份功能的记账小工具、化学实验模拟动画——试剂瓶和烧杯在桌面有倒影,操作面板多了搅拌、离子视角等选项。知乎 这类"从想法到可玩原型"的能力,是这代混元和前几代体感差距最大的地方。

腾讯Hy4发布当天开源、白送两周:首日有人排队4286位、生图另扣积分,上车前先把这五笔账算清

但翻车帖同样真实:有 UP 主首发实测就撞上死循环。哔哩哔哩 微博有用户抱怨 CoT(思维链)太长、“既费时又费token”。微博 还有一个把 Hy4 和 GLM-5.3-Flash、Qwen 新款放在一起测数据分析的视频,标题直接下了个"全军覆没"的判词——这跟官方主打的"办公分析、财务稽核"恰好顶着来。哔哩哔哩

证据只能说到这:这些都是发布 24 小时内的个例,样本小、任务私有,既不能定它"不行",也别拿官方案例当"什么都能干"。它更像个能力明显变强、但还要你复核的实习生。

第三笔账:免费两周,实际给的是什么

这是最容易算漏的一笔。免费入口打开后,先看见的是三个限制,不是一个无底洞。

第一,排队:首日高峰有用户第一次发任务就弹出"当前模型资源紧张",前面排着四千多人。免费是把双刃剑,大家都第一时间来,体验取决于你几点上工。第二,每天赠送额度、用完照扣积分——官方给的是"每日免费额度",不是"两周无限畅用"。第三,Hy4 和 Hy3 目前都不具备多模态:你让它生成图片、视频,系统会切到其他多模态模型,还是可能产生积分消耗。知乎 一句话:“免费用 Hy4"和"不花一分积分”,是两件事——做图做视频的同事尤其注意最后这条。

第四笔账:9月10日之后,这活值多少钱

腾讯Hy4发布当天开源、白送两周:首日有人排队4286位、生图另扣积分,上车前先把这五笔账算清

两周免费到期后走 API 的话,官方定价:输入 6 元/百万 tokens,输出 18 元/百万 tokens,缓存命中 0.3 元/百万 tokens。知乎 首发实测的媒体口径里,它的缓存价格直接看齐了这个以便宜著称的对手。微博 对经常把整包文档、整个代码库往里塞的用户来说,缓存这一条比标价更能决定真实账单。

对照你自己:轻度办公用户这两周大概率一分不花;重度长上下文用户,建议这两天顺手记一下自己的日消耗 token 数,乘出来再决定 9 月要不要续。

第五笔账:谁现在上车,谁再等等

文档、PPT、财报类办公用户,现在就是窗口期。别拿别人的案例过瘾,直接丢自己的真实文件进去跑一轮——两周足够你拿到一张属于自己工作流的成绩单。

写代码、玩 Agent 的用户:CodeBuddy 同步限免两周,重点测它宣传的长程任务能力,理解、规划、调试、验证一条龙,能不能把一件半天的活真跑完。

腾讯Hy4发布当天开源、白送两周:首日有人排队4286位、生图另扣积分,上车前先把这五笔账算清

以数据分析为生的人:先别把身家押上去。官方主打跨文件分析,社区却有个例翻车,这类"最后一公里"的验证成本该你自己出——正式版出来之前,多一道人工抽查。

想"开源=本地白嫖"的人:劝退。个人用户我不建议折腾,770B 的体量,本地跑不动。知乎 别为这两个字掏硬件钱;权重开源真正利好的,是二次开发和数据不能出内网的团队。

接下来盯什么

三个信号。一是正式版。官方节奏是自 2 月重建基础设施以来,混元大模型平均每两个月迭代一次大版本。知乎 它走的是"preview 先行、正式版跟进"的路线。上一代 Hy3 从 preview 到正式版,周调用量涨了 68 倍还多,Hy4 正式版大概率在几个月内接上。知乎

二是 Hy4-V 多模态版本:同代的 Hy4-V(多模态版)8月14日已经开源了,官方称在 12 项国际多模态基准上刷了 SOTA,你要等的是"能看图能生成"的混元,看它。知乎 三是 9 月 10 日的限免截止,别卡着最后两天才想起来试。

新模型白送两周,最划算的姿势从来不是把全家桶换一遍,而是把你手上最痛的三件事扔进去:赢了你升级主力,输了你什么也没损失——顺便,它还真缺你的反馈来养正式版。

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章