当前位置:
AIGC文章详情

一周之内,从钟钊告别到Hy4灰测:腾讯的多模态生成线不是关停,是并进了主线

源自50位全网作者

02:20

8月21日,有用户发现腾讯元宝App的模型列表里冒出了Hy4,标注"专家级模型",位置排在Hy3和DeepSeek上面。微博腾讯官方还没官宣,大概率是小范围灰测,但上周财报刚说过"大参数的Hy4近期上线",这节奏算是接上了。

单看这条消息,只是一次正常的模型上新。可把它和过去十天腾讯的一连串动作拼在一起,很多关注多模态的朋友都在问同一个问题:HunyuanVideo的负责人都发告别朋友圈了,多模态部门也并掉了,腾讯这是不是要放弃视频生成?

我的判断先放在前面:不是关停,是把生成线并进了基础模型主线。这个判断背后,其实是今年AI行业一场真正的路线之争。

先把这十天的时间线捋清楚

信息比较散,我按时间排了一遍:

  • 8月11日,腾讯混元3D团队发布并开源WorldClaw,一句自然指令生成完整可编辑的3D游戏世界。知乎

  • 8月12日,腾讯Q2财报:明确"参数规模更大的Hy4计划近期上线,提升性能和多模态能力"。微博单季资本开支528亿元、同比增176%。微博

  • 8月14日,混元多模态基础模型负责人钟钊发朋友圈,称"即将发布的版本或将是我在HunyuanVideo与HunyuanImage项目中的最终版本"。36氪他负责的是混元两条生成线。

  • 8月18日前后,原xAI多模态理解负责人蔺旭东入职腾讯混元,负责多模态内容生成算法。微博

  • 8月19日,媒体梳理出混元多模态团队这轮调整的全貌:原多模态理解负责人胡瀚离职创业,前OpenAI研究员田永龙7月加入负责视觉语言模型,腾讯撤销大语言模型部和多模态模型部、合并成立"基础模型部",由姚顺雨负责。知乎

  • 8月21日,Hy4出现在元宝灰测。微博

十天之内,开源上新、财报预告、告别、换人、部门合并、旗舰灰测,全发生在同一条线上。也难怪大家会多想。

为什么很多人读成了"生成线要停"

这个解读不是凭空来的,三个信号确实扎眼。

第一是钟钊的告别。他手里是HunyuanVideo和HunyuanImage两张牌:HunyuanVideo 2024年12月首发时以130亿参数是当时全球最大的开源视频生成模型,去年11月的1.5版把参数压到83亿、支持5到10秒720p;HunyuanImage一路迭代到3.0版,800亿参数、主打工业级开源生图。36氪这两条线的掌舵人说出"最终版本"四个字,换谁都会心里一沉——B站上还有一堆UP主的工作流是搭在这些开源模型上的。哔哩哔哩

第二是组织架构。独立的"多模态模型部"没了,并入姚顺雨领导的基础模型部。在一些人看来,这等于多模态失去了独立编制。

第三是舆论定调。36氪那篇报道的标题很直白——“靠拢梁文锋,远离李飞飞”,知乎上讨论度最高的解读也是"腾讯要弱化视频生成、3D和World Model,转向多模态理解和Agent"。知乎

但有三件事,指向的是"并线"而不是"停线"

第一件事:新来的蔺旭东,管的恰恰是生成。据媒体报道,他在混元的职位是多模态内容生成算法负责人。他的履历也很有意思:清华本科、哥大博士,做过视频到文本的Vx2Text,在DeepMind参与过Gemini的多模态预训练和后训练,去年底才加入xAI负责多模态理解。知乎一个做过Gemini和Grok多模态的人进来接手生成算法,你要说是为了关停这条线,逻辑上说不通。更合理的解释是:腾讯想要的是"懂理解的生成"。

一周之内,从钟钊告别到Hy4灰测:腾讯的多模态生成线不是关停,是并进了主线

第二件事:生成线的发布没停。就在这轮人事消息的前几天,8月11日,混元刚开源了WorldClaw——输入一句话,Planning Agent自动拆解需求、规划地形、布置建筑,直接生成可编辑的完整3D游戏世界,资产还能拆开单独复用、接入游戏引擎。知乎再加上之前的HyWorld世界模型线还在更新,说腾讯放弃生成,跟它自己的发布节奏对不上。

一周之内,从钟钊告别到Hy4灰测:腾讯的多模态生成线不是关停,是并进了主线

第三件事:财报对Hy4的定位写得很清楚,“提升性能和多模态能力”。微博也就是说,多模态没有从混元的旗舰模型里消失,而是从"独立部门单独做"变成了"主线模型必须会"。

这里要多说一句边界:蔺旭东的具体职责来自媒体报道,腾讯官方没有正式公布;钟钊也只是朋友圈发言,人事变动没有官方确认;Hy4目前也只是灰测曝光。所以下面的判断,是基于公开信息的推断,不是官方口径。

背后真正的分歧:视频生成到底是不是AGI主线

把这轮调整只看成人事换血,就看浅了。它背后是今年AI圈一条真实的路线分歧。

一边是梁文锋的说法。据36氪引述,他在被投资人问到多模态时回答,只做AGI主线——GPT、CoT、Agent,3D、视频生成、世界模型"跟智能的主线没有太大关系"。36氪DeepSeek OCR就是这套思路的技术样本:把长文本渲染成图像,用视觉编码器压缩成视觉token再交给语言模型——视觉在这里不是独立的智能方向,而是给语言模型服务的压缩工具。

另一边是李飞飞的空间智能:让AI感知、生成、推理三维世界,世界模型是通往AGI的重要一支。腾讯之前的HyWorld系列,从全景图重建3D场景到RGB-D漫游,基本就是照着这个设想做的,技术报告标题里直接写着"重建、生成、模拟3D世界"。36氪刚开源的WorldClaw也属于这条线,把四季场景、地形、资产做成可编辑的开放世界。微博

一周之内,从钟钊告别到Hy4灰测:腾讯的多模态生成线不是关停,是并进了主线

而接管腾讯大模型的姚顺雨,站的是前一边。他6月在腾讯云AI产业应用大会上说过,AI下半场的竞争壁垒不在模型参数量,而在Context(上下文)。36氪他给混元做的第一款旗舰Hy3,主打的也是推理、Agent和长上下文,接入WorkBuddy后任务解决率从72%提到90%。把多模态部门并进基础模型部、让做过Gemini多模态的人来做生成算法,逻辑是一致的:把视觉能力拆成模型能理解、能推理的表征,喂给主线模型,服务于Agent场景——比如GUI Agent要"看懂屏幕再操作",瓶颈恰好就在多模态理解。

所以这轮调整的信号不是"腾讯不做多模态了",而是"腾讯不做独立的多模态了"。生成不再是一个独立产品线,而是主线模型的一种能力。有知乎答主总结得很到位:这是让generation重新并入intelligence。知乎顺便说一句,这不是腾讯一家的动作。把多模态能力收进旗舰主线模型,是包括OpenAI在内的大厂普遍做法;国内这边,各家新旗舰也都在卷原生多模态。独立的多模态生成部门,正在整个行业里退潮。

对普通用户和创作者意味着什么

分三种情况说:

如果你是HunyuanVideo、HunyuanImage或者混元3D的开源用户,短期不用慌。已发布的模型、权重、社区工作流都在,WorldClaw刚开源,B站上搭好的ComfyUI流程该跑还能跑。但要留意的是,长期看这类"独立开源模型"的更新节奏大概率会放缓——团队的重心和算力正在往Hy主线倾斜,这个从财报528亿的资本开支流向就能看出来。微博如果你的生产流程重度依赖混元开源线,可以开始留意备选方案了,不是现在必须切,而是别把鸡蛋越放越深。

如果你是元宝、微信小微这类腾讯系AI产品的用户,这轮调整对你其实是利好。多模态能力并进主线模型,意味着Hy4开始,“看图、听声音、理解界面"这类能力会跟着旗舰模型一起升级,而不是等某个单独的生成模型慢慢更新。Hy4灰测已经标了"专家级模型”,如果灰测扩到你,值得拿真实的看图、读文档任务去试试。

如果你是纯看热闹的AI爱好者,这轮调整给了一个挺好的观察样本:一家大厂怎么在"生成"和"理解"之间重新下注。比起讨论谁对谁错,更值得看的是结果——36氪那篇文章自己也说了,这不足以证明李飞飞错了,只能说明姚顺雨选择了梁文锋那边。

接下来值得盯的四个信号

与其猜,不如盯结果。这几个点近期就会有答案:

  1. Hy4正式发布时的能力清单。重点看多模态部分怎么写:是"理解和生成一体",还是只提理解。这直接验证"并线"判断。

  2. HunyuanVideo、HunyuanImage开源仓库的更新频率。如果未来一两个季度明显放缓,说明资源确实在转移。

  3. 钟钊的下一站,以及混元生成线的正式接任安排。目前都还是媒体报道和朋友圈信息,等官方确认。

  4. HyWorld、WorldClaw这条世界模型线还更不更新。它是腾讯在李飞飞路线上走得最远的资产,这条线的冷暖,就是路线之争最直接的晴雨表。

一句话收尾:腾讯的多模态生成线没有熄火,它只是从独立赛道并进了主线高速。至于这条路通不通,Hy4会给出第一个答案。

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章