Tavus新AI通过视频图灵测试:一分钟通话,48%的人把它认成了真人
一分钟的视频通话,54个人里有26个坚信,屏幕对面坐着一个真人。而屏幕对面,一个人都没有。
这是AI公司Tavus做的实验。它刚发布了实时视频交互模型Griffin,号称历史上第一个通过「实时视频图灵测试」的模型。上一代在同样流程的测试里,41个人中只有1个把它错认成真人,比例2.4%。一年多时间,2.4%变成了48%。
这类消息乍一看是科技公司在秀肌肉。但你要是曾经把「开个视频」当成确认对方身份的最后一道手续,特别是家里有老人、担心他们被骗的,这个数就值得当回事。多少年来,防骗建议里的最后一招,一直是拿不准就视频一下,看看脸。
Griffin厉害在哪?不是画面多逼真,换脸视频做得逼真的,现在一抓一大把。它厉害在会看眼色。你话说一半停下来组织语言,它不抢答;你讲了件难过的事,屏幕那张脸的表情会跟着变;你打断它,它会停下来让你先说。这些人与人之间才有的小动作,它全学了去。它还能用10秒左右的参考音频克隆一个人的声音,从说话到画面的延迟0.43秒,跟普通人打视频没什么两样。

还有个细节。看出破绽的人,几乎都在通话头20秒里就起了疑心;没看出来的,越聊越信。不过样本就54个人,时长就一分钟,参与者还被提前告知对面是另一位志愿者,打心眼里认定那是个大活人。按这个条件,说它能骗过任何人还太早。Tavus自己也没把Griffin开放给普通用户,只让少数可信测试者用,说是「AI身份披露」功能还在开发。
那为什么还是值得写?因为这套技术已经在另一个地方用上了,而那个地方恰恰缺的就是这最后一环。
Anthropic前阵子发了份报告。一家开发工作室运营着20多款交友App,匹配列表里那些嘘寒问暖的「真人」,其实是大批AI人设。两周观察期里,4700多个AI人设同时在跟2.5万多名用户聊天。整个流程里只有一件事还得真人上场,就是视频通话。用户较真要看脸的时候,真人兼职就会出现,向用户证明这个人真的存在。
诈骗流水线上,AI已经把陪聊的活全包了,唯一干不了的就是视频。Griffin这类模型要补的,正是这最后一环。当一分钟的通话就能骗过将近一半人,克隆一把嗓子只要10秒素材。
「见个面谈谈」这道保险,快要失效了。

也不用等将来,这类事已经在发生。公安部9月通报,全国侦破的AI换脸类诈骗案件超过300起,涉案金额突破5亿元。
最高法公布过一个更瘆人的案子。骗子的同伙上门到独居老人家里拨通电话,电话那头用AI合成出老人孙子的声音,就靠隔辈亲情,先后骗走三位老人共6万元。
央视曝光过一个相亲直播间,里面自称67岁、年收入600万、名下好几套房的「完美大叔」,整个人是AI画出来的。50多位中老年女性交了2000元「相亲服务费」,交完钱,人就失联了。
当然,也别反过来吓自己。48%认成真人,反过来说,52%的人识破了。跟家里人视频,又跟陌生人相亲不同,你孩子的神态、语气、口头禅,你比谁都熟,AI拿几张照片几段语音学不全这些。视频通话不是从今天起就没用了。
但防的手法真得换个版本。「怀疑换脸就让对方按按鼻子」那招已经不管用了,换脸越来越真,肉眼越来越难分辨。更靠谱的是画面之外的核实。对方提到钱,先挂断,回拨他常用的那个号码;故意问一件只有家里人才知道的事;最好平时就跟家里人约好一句暗号,暗号对不上,对面再急也先拖一拖。国家反诈中心App上线了AI内容鉴定功能,图片、视频、音频都能鉴,每天有10个免费额度,家里老人还没装的,趁这个假期帮他装上。

48%,不是说AI已经能骗过所有人,是说「眼见为实」这件事,变贵了。以后打钱之前,多问一句,多回拨一个电话,多对一遍暗号。这十几秒花得值,别拿自己的眼睛打赌。
