这一周如果你刷到过AI工具的消息,大概率见过这个场面:腾讯混元Hy4 preview,8月28日在腾讯的AI办公工作台WorkBuddy首发接入,上线首日任务队列就排上了;三天后,腾讯混元官方发文致歉,宣布对推理集群紧急扩容,还补了一句"受限于高端算力总量与高峰并发集中,仍不排除个别时段会继续出现排队情况"。36氪微博微博评论区里有人晒出自己的排队号:618。微博还有人说,到9月2日"排队都上千号了",流传的截图里甚至有人排到5000开外,顺带抱怨"免费但报错、生成慢"。

36氪对这事的评价是"如此盛况空前,对腾讯AI来说确实比较少见"——过去很长时间里,"腾讯做AI慢"几乎是圈内共识,这次是用户罕见地为腾讯的模型排起长队。36氪华泰证券的观点更直接:WorkBuddy访问量已在国内登顶。微博
但热闹归热闹,限免带来的流量里,永远混着看好奇心和真需求。这波值不值得你也去排一次队?我把官方公告、券商观点、知乎实测和正反两面的评论区翻了一遍,先说清楚三件事,再决定怎么花这个免费窗口。
一、能力这次是真的,但热度自带"限免滤镜"
先看事实。Hy4 preview是一款纯语言模型,总参数从上一代Hy3的295B涨到770B,每次推理实际激活49B,上下文从256K直接拉到超过100万Token。官方公布的跑分里,提升集中在"干活"这一侧:Terminal-Bench 2.1(在终端里完成真实任务)从70.8分涨到85.4分;DeepSWE(读懂整个代码仓库、定位并修复问题)从28.0分跳到64.3分;SWE-bench Pro拿到65.7分,进入GLM-5.3、Kimi K3和GPT-5.6Sol所在的竞争区间。36氪
腾讯还请163名内部专家、用203项真实工程任务做了盲测,Hy4平均2.99分,略高于Kimi K3的2.94和GLM-5.3的2.92。36氪

要提醒的是:这些都是官方披露,不能直接等于你的实际体验。但第三方实测提供了旁证。一位知乎用户把一篇352页的UCL博士论文丢给Hy4 preview,它没有只看摘要,而是通读全文,先写了约1.6万字的中文读书报告,再把报告压缩成23页、版式各不相同但视觉风格统一的PPT,全程调用了14个子Agent分工,中间没有断档。知乎
另一个测试是让它修一个有25个源码文件、73条用户反馈、14个已确认缺陷的老网盘仓库:它先把14个问题归纳成10个底层原因,再动手改,最终修改9个生产文件、主动补上约330行回归测试,实测者打出92分(满分100)。知乎
评论区的另一半声音也没错。也有泼冷水的评论,意思主要是这波热度靠免费撑起来,浑元本身感觉没那么好。微博底下有人回:"毕竟是免费期,大家伙都使劲蹬呢。"两句话拼起来才是完整判断:限免确实放大了热度,但从跑分、盲测到第三方实测,这次不是"放流量"级别的水准升级;真正的折扣在体验侧——平时2分钟能出结果的任务,高峰期经常要5分钟以上,排队号几百上千是常态。36氪能力和体验,要分开打分。
二、限免期最值的用法:交给它"三类活",别拿它聊天
Hy4加WorkBuddy这套组合的强项是"长流程任务"——那种你布置完就可以走开、过几个小时回来收菜的活。结合实测和用户反馈,这三类活最值得在限免期排队:
第一类:长文档变成品。整本论文、几十页的年报、一堆积压的会议纪要,让它读完后直接出读书报告、PPT、对比表格。100万Token上下文的意义在这里:352页的PDF不用拆成十段分批喂,它也不会"读了后面忘了前面"。
第二类:多约束的乱活。像那个老代码仓库,问题分散在25个文件里,要先归因再修;或者复杂表格清洗、多文件交叉核对、把一堆散乱素材整理成能交付的东西。判断标准很简单:你自己做要头疼两个小时以上的,才配得上排队20分钟。
第三类:能异步收菜的任务。WorkBuddy有三个视窗——对话、任务进度、产物分屏可见,还支持小程序远控:电脑上跑着的任务、生成的产物、完整对话历史都会同步到手机,人不在电脑前也能随时看进度、补要求。知乎白天把任务丢进去排着队,下班路上用手机收结果,这是消化"排队"的正确姿势:把等待异步化,排队就不算纯损耗。
反过来,这几件事别浪费排队号:快问快答、润色一段文案、聊天式头脑风暴。评论区一位用户总结得很实在:复杂任务用hy4(有时会过度思考),简单任务用hy3,再配合GLM5.3 Flash,做出的项目大都能达到满意效果。微博Hy3的限免期已延长到9月30日,正好当轻量备胎;WorkBuddy里本来就有多个模型可切换,没必要在一棵树上排死。
已经买了高级会员的用户还有一条经验值得抄:有会员反馈模型有点啰嗦、要想办法约束。布置任务时把页数、字数、输出格式、交付标准写死,越具体,它越不容易过度思考。
还有一个限制要提前知道:按官方公告说明,Hy4 preview目前不支持多模态输入——它不能直接"看"图。前面那位知乎实测者的做法是,模型自己用Node写了一个光栅器、调用视觉工具辅助读图,才完成了3D场景任务。知乎普通用户没有这套折腾能力,所以"发张图让它照着改"这类需求,暂时还是交给多模态模型更省事。
三、成本账:免费窗口怎么算,窗口关了之后多少钱
先把时间窗口摆清楚(以产品页实时显示为准):
Hy4 preview:在WorkBuddy首发限免,官方公告显示限免到9月10日,且限免期内设有每日免费额度;
Hy3:限免期延长到9月30日,官方明确说是为了分流需求;
新用户注册workbuddy.cn送免费积分;另外据微博科技资讯号报道,9月初WorkBuddy上线了开学福利,师生可免费申领积分;
一个背景信息:9月2日WorkBuddy刚宣布开放平台上线,首批引入超百家伙伴,生态还在快速变化期。微博

如果限免期结束后你还想继续用长任务,价格是这么算的:Hy4 preview输入6元/百万Token、输出18元/百万Token,不是市场最低,但关键在缓存命中价只要0.3元/百万Token——是普通输入价的二十分之一。36氪Agent类任务恰好是"反复读同一批文档、同一份代码"的重灾区,多轮长任务里缓存命中占比很高,这一项能把整体费用明显压下来。粗略结论:让它一次性干完一个长活,比拿它反复干几十个小活划算得多。

最后是时间成本,限免期最容易被低估的一项。排5分钟队让它写一段百字周报,是亏的;排20分钟队让它把352页论文变成23页能直接讲的PPT,是赚的。同一个排队号,放在不同任务上,价值完全不同。
谁该冲,谁该等
该冲的:手上有长文档消化、复杂成品产出、仓库级代码修复需求的上班族和独立开发者。限免期是试错成本最低的窗口,记得异步派活+小程序收菜,别守着屏幕干等。
该等的:只想问答、润色、做轻量办公的人。Hy3限免到9月底,加上千问办公这类替代品已经够用,不必为"国产最强模型"的好奇心去挤上千号的队。
本地部署玩家单独说一句:Hy4开源后没几天,社区已经传出权重压缩86%的轻量版(1.5TB压到214GB,有知乎帖子称单张4090就能跑)。知乎如果后续验证属实,这对不想排队、在意数据隐私的人是比限免更大的事,值得单独跟进。
接下来值得盯的三个信号:一看官方说的"动态调配资源"能不能真把队列压下去,毕竟公告自己都承认个别时段还会排队;二看9月10日限免结束后的定价和会员政策,开放平台上线后第三方接入的价格体系也可能变化;三看竞对动作——8月一个月里,DeepSeek先在13号甩出V4-Pro正式版,智谱14号发布GLM-5.3,阿里千问也端出了新旗舰Qwen3.8-Max。知乎9月的价格战大概率不会远,等等党未必输。
一句话收尾:腾讯这次是真"站上船"了,但你不一定非要在最挤的时候上。把限免期花在它最能干的重活上,才是这波热闹里对你最划算的参与方式。