虎牙VAM 1.0最狠的不是"会说",是"会听":一个被全网忽略的能力

2026-07-25 09:34:23 0点赞 0收藏 0评论

虎牙VAM 1.0最狠的不是"会说",是"会听"——一个被全网忽略的能力

别的公司做数字人,在实验室里调参。

虎牙做数字人,在直播间里被弹幕骂了十几年。

这两条路出来的东西,完全不一样。

图片图片

7月18日,WAIC 2026腾讯AI应用创新论坛上,虎牙发布实时多模态数字人VAM 1.0。基于DiT架构,一张照片扔进去,生成一个能说话、能唱歌跳舞、能7×24小时不下播的AI数字人。首帧延迟1.3秒,片段延迟0.77秒,36.4帧每秒,连续跑24小时不崩、不走样、不撕裂。

但这些参数不是重点。

重点藏在CEO黄俊洪一句话里:"大多数模型只学过怎么说,没学过怎么听。虎牙泡在直播间十几年,观众不会等你说完再发弹幕。场景,倒逼出了技术。"

"听"这件事,难在哪

你跟一个AI数字人说话,它什么反应?

图片图片

大多数数字人的反应是:没有反应。你在说话的时候,它要么愣着不动,要么已经开始念下一段台词。它不看你,不点头,不眨眼,不知道你在说话。它只等着你说完,转头开始输出。

这不叫交互,叫轮流发言。

VAM 1.0做了一件别的模型没做的事:它原生覆盖了三种状态——静默、聆听、说话。你在说话的时候,它会点头、注视、微微前倾。你停下来,它自然接话。你打断它,它立刻停,不是跳到预设回复,而是真正接上你新的语义往下聊。

弹幕和语音双通道并行驱动。你发文字它读得到,你开麦说话它听得到,两条线并行不冲突。

图片图片

这个能力听起来简单,做起来极难。难在哪?在于模型训练的时候,大多数团队根本没有"聆听态"这个概念。训练数据全是"输入→输出"的配对,没有"输入→等待→反馈→输出"的动态过程。模型从来没学过"别人在说话的时候我该怎么表现"。

虎牙凭什么能做?它的训练数据不是标注集,是十几年直播间里日均数亿条弹幕、千万级并发的语音连麦。主播打哈欠时的嘴角弧度、观众刷"666"时的语速峰值、连麦卡顿时的微表情滞留——这些东西喂进模型,VAM学到的不是"表演",是"共情"。

这就是场景驱动的优势。实验室里模拟不出来的真实交互压力,直播间里每天都在发生。

三堵墙,和虎牙怎么翻的

图片图片

数字人行业有三道公认的硬墙,几乎所有团队都在同样的地方碰壁。

第一堵,时间墙。跑久了会崩。面部特征漂移,五官走形,肤色偏移,严重的时候画面直接撕裂。原因叫累积误差——每一帧基于前一帧生成,误差像滚雪球越滚越大。多数方案跑不到几十分钟就废了。

VAM 1.0怎么翻的?三阶段训练。第一阶段用多参考图加运动帧锚定人物形象,训练时故意喂各种画面劣化场景,让模型提前学会在恶劣条件下稳住。第二阶段用偏好优化算法平衡嘴型、表情、动作三个经常打架的目标。第三阶段把推理步骤从20步压到4步,并引入自纠错机制——模型拿自己之前生成的画面当输入继续跑,边生成边纠偏,不让误差累积。

结果:24小时不崩。

图片图片

第二堵,交互墙。就是前面说的"只会说不会听"。VAM用全双工模式拆了这堵墙——你随时插话它都能接住,0.77秒内完成语境切换。支持10个AI角色同场狼人杀博弈,各自有独立立场和发言风格,不是念剧本,是实时推理。

第三堵,部署墙。实验室能跑,线上高并发撑不住。虎牙从底层算子到注意力计算到VAE解码全部压了一遍,最终在8块H200 GPU上把延迟压到0.77秒。观众发完弹幕,几乎感受不到等待。

三堵墙全翻了,才敢说"每一帧都在线生成"。不是预渲染,不是录播,是实打实的实时。

观众把它当树洞了

技术参数说完了,说个更有意思的。

VAM落地后的测试数据:接入VAM的直播间,用户平均停留时长提升4.2倍,私信咨询量增长380%。其中超过61%的私信内容跟游戏无关。

图片图片

是"今天失恋了""考研压力好大""我妈又催婚"。

观众把AI数字人当树洞了。

这个数据比任何技术指标都值得关注。它说明一件事:当数字人的交互能力跨过某个阈值,用户对它的态度会从"这是工具"变成"这是伙伴"。不是它长得像人,是它"听得懂你在说什么"。

虎牙自己也很清楚这个边界。黄俊洪说VAM不追求"像人",专注"懂人"。深夜三点刷副本的孤独需要一句"我陪你等复活",不是"亲,点击下单"。

带货场景的数据更直白:游戏道具带货转化率比人工主播高出217%。零人力成本,零情绪波动,零下班念头。深夜场、冷门垂类这种"播不起人"的时段,数字人直接填上。

但边界也说得明白:标准化问答、重复性讲解、长时间弹幕回复,数字人能接。高客单带货需要的信任建立,强个人IP属性的深度互动,还得真人兜底。

图片图片

从方桃子到VAM:AI角色的进化链

之前聊过AI短剧《被裁掉的女孩》里的虚拟角色方桃子。她的运营逻辑是"破屏运营"——角色走出剧情框架,在社交平台上做三明治、买花、健身,变成可陪伴的虚拟偶像。

方桃子解决的是"AI角色怎么活下来"的问题。播完不凉,靠运营续命。

VAM 1.0解决的是"AI角色怎么真正活着"的问题。不是靠运营团队发日常碎片维持陪伴感,是数字人本身就能实时听你说话、实时回应你、24小时不下线。

从"破屏运营"到"实时互动",这是两个量级的跃迁。前者还需要人在背后操作,后者已经能自己站在直播间里接弹幕了。

沙利文报告说中国数字人赛道年复合增长率52%,约为全球增速的1.5到2倍。市场很热,但落地很冷——多数数字人还停留在照本宣科的阶段,能拍三分钟视频,撑不住三小时直播。

VAM 1.0能不能真正撬动这个行业,还得看后续迭代。但至少它把标尺从"像不像人"换成了"能不能听懂人"。

这个方向,对了。

展开 收起
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

相关文章推荐

更多精彩文章
更多精彩文章
最新文章 热门文章
0
扫一下,分享更方便,购买更轻松