国庆第一天,旧金山AI视频公司Tavus发了个新模型Griffin,口号相当吓人:“首个通过视频图灵测试的模型”。三天里,这条消息从X传到36氪、微博、B站,官方演示视频按36氪的说法是"1700万网友在线围观"。 演示内容也确实抓人:一个AI数字人看你焊接电路板,你停下来不说话,它不接话,等你该进行下一步了才开口提示;你分享升职消息,话没说完它就有了表情反馈,跟你抢着说了几句,话题都没断。36氪
但"图灵测试"这四个字在AI圈被用得太廉价了——写作图灵测试,读作"我们找了批人试试"。这篇就想干三件事:把Tavus自己测的分、英伟达第三方榜单上的分、以及技术上真正变了的那件事,三笔账分开算清楚;再说说为什么你现在还用不上它;最后提醒一笔真正的成本——"眼见为实"这套社会默认规则,正在被谁、以多快的速度用掉。
第一笔账:48%是真的,但它是一家公司自己设计、自己执行、自己公布的"内测分"
先把实验本身摆出来。Tavus找了一个独立研究平台招募的54名受试者,告诉他们的是"和另一名参与者进行1分钟的视频通话",聊的话题是"今年自己最期待的事情"。DeepTech深科技
通话结束后填多项主观评价,问卷直到最后一题才问:刚才有没有想过对方可能不是真人?结果54人里有26人(48%)认为对面是真人。 作为对比,Tavus上一代系统用同样流程测,41人里只有1人误判,通过率2.4%。这个跨度确实是量级上的。把关键问题放在最后一题,也是个有意的设计——免得受试者带着"找AI"的任务意识进通话。微博DeepTech深科技

但数字好看归好看,折扣因子得知道。知乎上IT-Porter的拆解帖把问题说得很直:这是一项公司自行设计、自行执行、自行报告的小规模研究,不能把48%直接外推成"日常使用场景中的普遍欺骗率",海外媒体RuntimeWire、Kingy AI的解读也提到了同样的局限。 换句话说,它测的是"一分钟、闲聊、无防备、最后一题才问"这个极限宽松条件下的首印象,不是"和AI视频半小时还不穿帮"。一个同样值得记住的细节是:那些察觉到异样的受试者,大多在前20秒内就产生了怀疑——如果你从第一秒就带着警觉看,大概率半分钟内就能发现不对劲。知乎
所以这笔账的准确表述是:官方口径"骗过一半人类"里,"图灵测试"是它给自家内测起的营销名,严谨程度赶不上营销力度;但2.4%到48%的量级跳跃,是真实发生在这个实验里的。证据覆盖到哪里,结论就只能说到哪里。
第二笔账:英伟达的榜单才是第三方实锤,过了,但有两处没追平真人
真正可以被拿去做"强结论"支撑的,是另一个东西:英伟达VideoFDB。这是NVIDIA研究团队今年5月发布的业内首个全双工音视频对话基准,素材取自237段真实视频通话,覆盖视线回避、停顿、附和、话轮转换等11类非语言交流场景,由大模型按规则打分、英伟达统一评审。在这个榜上,Griffin-Lite的数据可以逐条对:
生成赛道:3.83分(满分5),真人基准3.92——离真人差0.09分。 排在第二的是基于Gemini 2.5搭配Anam数字人的级联方案,只有2.80分,断档式领先。分项里更有意思的是"双人情感呼应":Griffin拿了4.40分,反超真人的4.14分——它的反应速度和情绪贴合度,某些瞬间已经比人更像人。DeepTech深科技
但没追平的两处也很具体。 一是响应时间中位数1892毫秒,真人大概900毫秒,机器还是慢了约一倍;二是"非语言线索恰当性"2.83分,低于真人的3.18分。感知赛道上,Griffin-Lite得3.73分,真人4.20分;作为对照,开源的MiniCPM-o 4.5是3.40分,OpenAI的gpt-realtime和谷歌Gemini 3.1 Flash Live分别只有2.75分和2.84分——连"听懂当下情境"这一项,现役头部方案离人还有一截。DeepTech深科技

所以这笔账的结论不是"能以假乱真",而是:在一个第三方技术基准里暂时领先其他AI系统、且已接近真人水平;在"第一眼"级别的短盲测里,欺骗率到过48%(公司自报)。把两句话混成一句,就是这轮传播里最常见的误读。
第三笔账:真正变了的不是"画面更真",是"沉默"
这是整件事里最容易被标题党埋掉、但对行业最有信息量的部分。
以前所有实时数字人几乎都走级联架构:语音识别把话转文字→大语言模型生成回复→语音合成读出来→形象模型驱动口型表情。Tavus自己上一代就是这么干的,三个模型接力:Phoenix-4.5管渲染、Sparrow-2管对话节奏、Raven-1管感知。 这条路的问题不是画质,是交接:系统内部每交接一次,加一层延迟、丢一层信息——语气里的细微变化转成文字就没了,更糟的是,系统没法在对方说话的同时做反应,只能"你说完我再接"。所以你会观察到几乎所有语音助手和数字人都有个通病:你只是停下来想一想,它就把沉默当成轮到自己了,抢话。用户被迫反过来迁就机器,调整语速、简化用词、刻意避免冷场。DeepTech深科技
Griffin换成了端到端的全双工"视频到视频":感知、决策、生成三个环节并行跑在同一个系统里。核心的"连续对话建模引擎"以不足1秒的"微轮次"持续评估对话状态,每一拍都在判断这一刻该开口、该听、该让话、该附和还是该安静。

生成端用了自研的Tavec音频编解码器(48kHz音频压成每帧40个数值、每秒100帧,不用离散码本,最小10毫秒数据包边生成边播)和步数极少的自回归扩散视频生成器(一张参考照片出720p、25fps,连肢体和背景一起逐帧画,每个潜在表示对应320毫秒画面、扩散3步就完成渲染)。官方给的工程数字:在英伟达H100上,从音频输入到视频输出平均延迟0.43秒,比此前已公开的最快方案还低一半。DeepTech深科技

一句话总结这笔账:图灵测试那48%是营销口径,0.09分的榜单差距是结果,而"机器开始学会处理沉默"才是原因。焊接演示里那个"你不说话我也不急"的行为,过去在任何级联系统里都做不出来——不是画质不够,是架构上就不存在"同时在听、在看、在决定何时开口"这回事。
顺带交代下这家公司,免得当成野鸡团队:Tavus由Hassaan Raza和Quinn Favret在2020年创立,YC孵化,总部旧金山,最早做销售个性化视频,Meta和Salesforce都用它发过企业产品演示;2024年3月完成Scale Venture Partners领投的1800万美元A轮,2025年11月又拿了CRV领投、红杉和YC跟投的4000万美元B轮,累计融资约7000万美元。科研团队由伦敦玛丽女王大学教授Ioannis Patras和帝国理工情感与行为计算教授Maja Pantic(前Meta AI研究负责人)领衔。不是玩票,是一支学术班底在公司里做工程化——而一家累计融资七千万美元量级的小公司,在实时视频这条赛道上把榜单甩开OpenAI和谷歌的现役方案一个身位,这才是这轮发布对行业观察者最有信息量的部分。
你什么时候能用上:短期内,用不上——而且是"不敢"先用上
先说最实际的一点:这次发布的是研究预览版Griffin-Lite,只开放给少数"受信任的测试人员",连Tavus自己平台上15万开发者和企业客户(包括亚马逊、梅奥诊所、Salesforce,他们正把数字人用在招聘面试、销售外联、教育培训和客服上)都没开放,完整版后续才推。API时间表和定价,官方明确"尚未公布"。DeepTech深科技

停发的理由比发布本身更值得琢磨。Tavus自己说:正是那些让模型表现得像真人的交互特质,会让人极易误以为自己在与一个真正的人交谈——所以先不开放。这里有个合规硬背景:今年8月2日起适用的欧盟《人工智能法案》第50条要求,凡与人类直接交互的AI系统,必须明确让用户知晓对方的AI身份。 Tavus表示正在加紧开发强制身份告知的"安全披露"功能,待合规与安全问题解决后"很快"推出。它规划的首批场景也印证了这个谨慎:一对一课外辅导、帮员工预演棘手对话、盯着实操给技术指导——全是"对面坐的是孩子、求职者、新手"的高信任场景。把这些场景和"发布前必须先解决披露"放在一起看,你会明白行业现在对这项技术的真实估值:发布者自己都怕。普通用户能有的合理预期是:明年开始,你遇到的"AI面试官、AI客服"会突然变得异常自然——那大概率就是这一代全双工架构的产品。DeepTech深科技
真正的成本:"眼见为实"这套默认规则,已经在产生坏账了
如果你只打算当个围观者,这部分才是和你有关的部分。先对几笔已经发生的实账:2023年4月,福州一位公司老板接到"生意伙伴"的视频通话,十分钟内被AI换脸伪造的画面骗走430万竞标保证金; 2024年,香港Arup工程公司的员工被一场深度伪造视频会议(一张"CFO"的脸加一排"同事")骗走约2500万美元;今年8月,又有AI合成视频通话骗走186万的案例进入公共讨论。公安部通报的力度也在跟进——据经济观察报援引公安部2026年9月通报,全国已侦破AI换脸类诈骗案件逾300起,涉案金额突破5亿元,单案最高2000万元。微博知乎
而Griffin级别的技术,是往这个既有窟窿里又捅了一刀:它伪造的不只是"一张脸",而是完整的对话行为学——抢话、附和、对沉默的处理。对照Anthropic今年披露并封禁的一个案例:一家应用工作室运营20多款交友App,在匹配列表里混入4700多个由Claude驱动的AI人设,仅2026年4月两周观察期内就和至少2.5万名用户交谈,AI负责日常陪聊,真人只在需要证明"确实存在"的关键节点才露面。 过去,换脸贴图要技术门槛、陪聊要人力门槛;端到端实时生成加10秒音频克隆,是把两道门槛一起往下砍。豹变
那中国科学技术大学专家2024年教的"让对方摁鼻子看面部形变"还有效吗? 实话说:摁鼻子是针对换脸贴图渲染破绽的验法,而Griffin这张脸是逐帧端到端生成出来的,对它是否还有效,没有任何公开实测数据。别指望一招验法吃十年。真正耐用的还是那套人人嫌麻烦的老规矩:谈钱的事,挂断后回拨对方存过的号码做独立通道验证;问只有你们俩知道的旧事;对方越催,你越要停。手机端的通话换脸检测(华为、红米都已经上线)只能兜底——检测永远追生成。知乎那条高赞回答里的表述很准确:视频通话已经从"亲眼所见的证据",降级成"需要交叉验证的信息"。央视新闻知乎
结尾:接下来盯三个信号
一,Griffin完整版和"安全披露"功能同时上线的那天——披露是默认强制还是用户可关,能看出这家公司的底线,也能看出监管的实际咬合力;二,VideoFDB榜单下一次刷新——Gemini系和gpt-realtime什么时候把感知分追到3.7以上,级联架构还能撑几轮;三,国内这一挂玩家(Vidu S1今年7月已经支持实时视频通话数字人、MiniCPM-o 4.5已在榜)跟进端到端全双工的时间差——这个差,通常从发布到国内可买到服务,一年都未必需要。
最后把四笔账并成一句:模型是真的,榜单是真的,48%那笔自测分打个七折看也不冤,可用性还早。"视频图灵测试"是Tavus给自己内测起的营销名,但全双工时代确实官宣进场了——从这一周起,“眼见为实"里的"实”,不再由屏幕决定,由你的验证习惯决定。