10 月 1 日,旧金山 AI 视频公司 Tavus 公布了新模型 Griffin 的一项测试,随后一周,“首个通过视频图灵测试”"48% 的人把 AI 当成真人"的标题刷遍了科技圈。 10 月 11 日,知乎上"新 AI 模型首过「视频图灵测试」,将对人际信任和防诈带来哪些冲击"的提问又把这事顶上了最新讨论前排。小红书知乎
这个标题之所以扎人,是因为视频通话一直是我们心里的最后一道防线:文字可以代写,声音可以合成,但让对方打开摄像头聊几句、看看表情,总该多一分把握。现在有人说这道门被踹开了。
先给结论:Griffin 是真进步,但 48% 这个数字被多数人读错了方向;对普通人来说,真正该上心的不是"以后视频都别信",而是下面这套账。
48% 测的不是"骗过了人",是"没人想到要怀疑"
把 Tavus 发布页的实验流程拆开看,这根本不是一场"人和 AI 二选一"的图灵测试。54 名受试者被招募时只被告知:等下和"另一位参与者"视频一分钟,聊聊"今年你最期待什么"。对面其实是 Griffin-Lite 实时生成的虚拟人。通话结束后,受试者要先给对面的自然度、可信度、有没有在认真听逐项打分,"是不是 AI"这个判断不是在通话中做出的,而是在事后问卷的最后一题才出现。知乎
这个标题数字读起来是:54 人里 26 人在 1 分钟视频通话后误以为对方是真人。 但它的准确读法是:在一个没人提醒你要警惕、话题压力极低的一分钟闲聊里,接近一半的人压根没启动怀疑。 一个被要求专门找破绽的裁判,和一个毫无防备的普通人,是两个难度完全不同的任务。DeepTech深科技知乎
还有三个细节值得记住。那些察觉到异样的受试者,大多在前 20 秒内就产生了怀疑——开头几秒正是人校准对面"眼神对不对、反应快不快"的窗口,撑过这个窗口,人往往就不再主动检查。两组人的分歧也没那么大:说对面是真人的一组平均确信度 79%,说对面是 AI 的一组平均确信度 81%,谁也没拍胸脯。知乎
真正的进步藏在哪:不是脸更像了,是时机对了
同一套实验流程,Tavus 上一代级联系统在同样的测试中,41 个人里只有 1 个被"骗"过,比例 2.4%;这一代跳到了 48%。 方向是真实的跃迁,但两组样本量不对称,"二十倍提升"这种说法当不得真。极客公园
跃迁的原因值得所有用过数字人产品的人留意。过去几年,数字人赛道拼的是"脸像不像",Griffin 想证明的是 AI 开始学会"像人一样聊天"。 传统级联系统是语音识别转文字、大模型想回复、语音合成、再驱动一张预设的脸,每交接一次多一层延迟、丢一层信息,脸必须等你说完才动;Griffin 改成全双工,双方可以同时说话、实时做出反应,能像真人聊天那样互相打断、点头附和、话语交叠。 人类对"接话时机"的敏感远超对五官细节的敏感——一个会在你话尾点头、会抢话再把话头让回来的对手,你下意识就把它当人。极客公园DeepTech深科技
评测分数也要挑着看。在英伟达的全双工音视频对话基准 VideoFDB 上,Griffin-Lite 的生成得分达到 3.83 分(满分 5 分),真人基准为 3.92 分。 但"追平人类"是另一个量级的说法:感知轨它离真人基准还差 0.47 分,而且裁判是语言模型不是人。DeepTech深科技
两个"延迟"数字更是营销话术和工程事实的分界。Tavus 公布的数据里,在英伟达 H100 上从音频输入到视频输出的平均延迟为 0.43 秒,比目前已公开的最快方案还要低上一半。 可宣传里反复出现的这个 0.43 秒,量的只是"音频进来、画面给出反应"这一段的生成延迟,不是整轮对话的响应延迟。 它的中位响应时间其实是 1892 毫秒,而真人的反应时间大约在 900 毫秒左右——"脸动起来快"和"开口回答快"是两回事,决定对话流畅感的恰恰是后者,评分表里最低的"对话流畅度"只有 4.9 分(7 分制)也印证了这一点。DeepTech深科技知乎
真正让人后背发凉的是另一个参数:一张参考照片、大约 10 秒语音,就能撑起一个会实时接话、会被你打断的"人"。知乎
诈骗不需要等 Griffin 上线
先说不用慌的部分:Griffin-Lite 目前只是面向选定的可信测试者提供的研究预览,尚未进入 Tavus 平台,普通客户、免费公开访问、价格或正式上线日期都没有核实。 合规也在压着它:欧盟《人工智能法案》第 50 条自今年 8 月 2 日起适用,明确规定凡是与人类直接交互的 AI 系统,必须明确让用户知晓对方的 AI 身份。 你现在想拿它骗谁或者被它骗,都还轮不到。知乎DeepTech深科技
但"看见脸也不一定是本人"这件事,根本不用等端到端生成数字人普及——诈骗用的是"换脸 + 拟声"的成熟低价方案。国内已有男子被 AI 诈骗 430 万元,骗子正是利用 AI 换脸技术在视频聊天里冒充熟人。知乎
据检察机关披露,2025 年一起案件中,诈骗团伙用 AI 换脸和语音合成虚构"军官"人设,涉及 13 名被害人,转移资金 1300 余万元。 国外的参照是 2024 年港企那起深伪视频会议诈骗案:参会者对面全是生成的假人,公司损失约 2500 万美元。 这些损失数字多为媒体转述,但方向不需要怀疑。知乎知乎
普通人的焦虑其实早就在发酵:小红书上"如何判断刷到的漂亮姐姐帅气哥哥是不是 AI"的辨别帖攒下了 900 多赞、200 多条评论。 这次只是把"视频通话到底还能不能信"顶上了台面。小红书
普通人该做的三件事:靠流程,别靠眼睛
指望肉眼在一分钟通话里识破一个全双工数字人,本来就是过高要求——人在开视频时注意力一半在内容一半在手头的事上,表情破绽会被大脑自动补全。Tavus 那场实验与其说证明了 AI 演得好,不如说证明了人不怀疑时根本不会启动取证模式。所以防线要建在流程里,不是建在视网膜上。
第一,钱相关的视频请求,一律挂断回拨。不管对面是"女儿"“领导"还是"老同学”,凡是视频里提到转账、垫资、保证金、紧急救场,先挂断,用通讯录里存的号码回拨一次。回拨走的是你自己的通信路径,骗子造不了这条路径。
第二,和一个流程较真,而不是和一张脸较真。反诈提示里"可以让对方摁鼻子观察辨别"这类动作检查,对实时换脸有效。 但对 Griffin 这种从像素层面整体生成的数字人,它只算半道防线——所以要叠加:问一件只有你们俩知道的事、让对方读一串你临时生成的数字、大额操作坚持走既有审批流程,两道以上才算保险。知乎
第三,给爸妈只教一句话:"视频里要你转钱的,先挂掉再打回来。“国家网络安全宣传周已点名 AI 换脸、AI 合成语音成为新型诈骗的高发手法,冒充"派出所”"子女"的视频通话正在真实发生。 这条规则不需要任何技术理解成本。知乎
平台侧也不是没做事:内容标识监管落地后,数字人内容不标注就会被限流,有做数字人口播的博主自述三个月被封了三个号。 接到风险账号视频通话时的手机反诈提醒,也已经在替家里的老人挂掉一些电话。这些是你不用自己动手就存在的第二层防线。知乎
接下来盯什么
三个信号放进观察列表。Griffin 正式版何时接入 Tavus 平台:官方称待合规与安全问题解决后会"很快"推出,但目前尚未公布具体的时间表和定价方案。 "强制身份披露"功能会不会随之落地;下一个评测会不会改用"强迫选择 + 长通话"口径——在低警觉、一分钟、事后单问这种宽松条件下都能做到 48%,条件收紧后掉到哪里,才是真正该盯的数字;以及国内数字人客服、面试、直播带货里"AI 身份告知"的执行力度。DeepTech深科技
回到开头那道防线:视频通话从"默认成立"变成"需要证明",是这一年消费级 AI 最实在的变化之一。它不意味着你不该开视频,而是意味着"看见脸"不再等于"确认本人",大额决策要多走一步验证流程。这一步成本很低——挂断、回拨、问一个只有你们知道的问题。但 430 万的教训说明,这步值得每次都做。