今天早上刷到一条微博,停下来看了两遍:一位54岁的香港女星自述险些遭遇AI诈骗,骗子克隆了她弟弟的声音打电话借钱,她事后形容“以假乱真太可怕”。微博
娱乐圈的人,平时见的换脸合成比谁都多,依然被一通电话骗到差点掏钱。这事值得写,不是因为明星有话题度,而是它戳破了一个很多人心里还留着的安全感——“声音听着像,应该就是我家人吧”。
今天这篇,就把“AI声音诈骗”这事掰开讲清楚:骗子手里有什么牌、你耳朵为什么靠不住、以及一套今晚就能跟家里人布置好的核验流程。
先看时间线:这不是都市传说
把最近能核到的信号摆在一起看:
今年4月,央视《法治在线》的调查报道#AI孙子打来电话专骗养老钱#冲上热搜,随后被大量反诈、政法政务账号转发:骗子利用AI克隆亲人声音实施诈骗的案件已在多地发生,仅需一段公开语音,就能伪造出逼真的求救场景,针对老年人精准收割。几位老人因为电话里“孙子”带着哭腔的求救,取出了数万元积蓄。央视法治在线
7月,国家安全机关专门发布提示,点名AI语音克隆“冒充亲友、实施诈骗”的风险:不法分子收集受害者家属、好友的声音样本,编造车祸、疾病等紧急事由行骗。中国新闻网
小红书上,律师账号分享的真实案例里,有妈妈接到冒充“孩子”的急用钱电话,转走了10万元。小红书很多网友看完第一反应是“转给我爸妈看”。更值得警惕的是,骗子还配合伪基站让来电显示成“本机号码”,把最后一层疑心也拆掉了。
再往前,2023年内蒙古包头警方通报的AI换脸视频通话诈骗案,受害者10分钟内被骗走430万元,至今仍是被引用最多的标志性案例。中国新闻网

这些案子的共同点:骗子不攻击你的判断力,专攻你的情绪。哭腔、急事、限时、别告诉家里人——全是让你在30秒内放弃核实的钩子。
为什么“仔细听”已经不管用了
很多家庭的第一反应是:我以后听仔细点。坏消息是,这条路基本走不通了,原因在供给侧。
最近一年,开源语音合成模型的能力是肉眼可见地外溢:阿里开源的CosyVoice-2,3秒音频就能克隆音色,支持9种语言和18种以上方言,连情绪、语速都能单独控制;小红书8月中旬开源的FireRedTTS3,把零样本声音克隆、音色设计和语音编辑整合进同一个模型,号称支持24种语言;B站开源的IndexTTS-2.5,更是把部署门槛卷到了6GB显存的消费级显卡。
这些模型本身是正经的技术成果,做有声书、做配音、做无障碍辅助都大有可为。但它们同时说明一件事:克隆一个熟人声音的技术门槛和资金门槛,已经降到接近于零。国家安全机关在7月的提示里给了一个更直观的刻度:主流商业平台所需的最短训练样本时长,已从几十分钟压缩到3至5秒——你随手发的一条语音消息、短视频里的一句人声、甚至电话里的简短应答,都可能成为原料。黑产端的价格更夸张,中新网《民生调查局》调查发现,在电商平台上,克隆声音最低只要1.98元,几十元就能定制一条以假乱真的口播视频。中国新闻网北京日报骗子需要的只有两样东西:你的一段公开语音;加上一个让你着急的剧本。

而你的耳朵恰恰是最不可靠的防线。国家安全机关引用研究指出:在没有任何提示的情况下,普通人识别高质量合成语音的准确率不足50%——也就是说,基本靠猜。人对家人声音的辨识,主要靠音色和说话习惯,这两样正是声音克隆还原得最好的部分。至于呼吸声、停顿、哭腔这些细节,新一代模型正在逐个补齐。指望“听出破绽”,等于拿血肉之躯去对抗别人迭代了十几个版本的模型。
一个容易被误解的事:AI内容标识,管不到电话线
有人可能会问:不是有《人工智能生成合成内容标识办法》吗?今年4月底,网信部门还依法约谈处罚了“剪映”“猫箱”App和“即梦AI”网站,理由就是未有效落实AI生成合成内容标识要求。北京头条标识制度不是正在给AI内容上保险吗?
这里有个关键区别:标识制度管的是公开发布的内容——平台上的视频、音频、图片,要求加上显式提示和隐式元数据,让你刷到的时候知道“这是AI生成的”。
但电话通话是实时、点对点、私密的。你爸妈接到那通电话的时候,没有任何第三方机制能在中间贴一个“此声音疑似AI合成”的标签。标识是平台和创作者的义务,而电话线上的那道防线,目前只能是你自己家建的。
这不是制度失效,而是认清边界之后,把力气花在真正有用的地方。
4步核验流程:今晚就能给家里布置好
下面这套流程,是我把各地反诈提醒、警方提示和社区里讨论度最高的做法交叉比对之后,筛出来普通家庭执行成本最低的版本。核心逻辑一句话:不跟AI比听感,跟骗子比流程。
第一步:挂断,回拨。
最便宜也最被低估的一招。不管电话里的人声音多像、事情多急,只要是开口要钱的,先挂断,然后用你通讯录里存的号码主动回拨。骗子能克隆声音,但接不通你手机里存的那个号码。绝大多数AI语音骗局,死在这一步。
第二步:设一个家庭暗号。
跟父母、伴侣约定一个线下才知道的短语或问题,平时不用,只在“电话里谈到钱”的时候启用。AI能学会任何说过很多遍的话,但学不会从没出现在互联网上的暗号。这一步的成本是两分钟的饭桌对话,收益是把“无法伪造的信任锚点”装进了家里。
第三步:要问就问开放式问题。
千万别问“你是小明吗”——这种把答案送出去的问题,等于给骗子递台词。要问只有你们俩才知道的事:“我上次生日你说要送我什么?”“咱家阳台上那盆快养死的花叫什么?”让对方从记忆里找答案,而不是从你的问句里找。
第四步:视频通话,让对方动起来。
如果对方坚持视频,请他用手在脸前挥一挥、快速转头、或者凑近镜头。实时AI换脸在面部被遮挡、大幅度移动时更容易穿帮。当然,视频也不再等于安全——“AI孙子”案的升级版就是视频通话,所以这一步是加分项,前三步才是必选项。
最后给所有流程兜底的铁律只有一条:涉及钱,过夜再办。 可以顺手帮爸妈把手机和银行App里的转账额度调低、开启延迟到账。骗子剧本的命门就是“时间压力”,你拖一晚,他的戏就演不下去了。
顺带说两件跟“值得买”有关的事
第一,给长辈换手机,“AI防诈”正在变成一个真实的选购维度。8月初有小红书博主分享,给爸妈挑手机时把AI防诈、陌生来电识别这类功能放到了优先位置,评论区一片“同款需求”。各大厂商也确实在往系统里塞通话反诈能力。小红书这个趋势值得纳入换机决策——当然,功能是加分项,不能替代上面那套流程。

第二,免费的防护先用起来:国家反诈中心App、运营商的骚扰拦截、银行的到账提醒,这些都是零成本就能布置的。另外提醒一句:可以顺手检查一下自己的“声音暴露面”,公开发布的视频原声、群聊语音,理论上都是可被采集的样本。不必因噎废食删光,但家庭暗号这种东西,永远别在任何线上场合说。

接下来值得盯的三个信号
AI内容标识的执法节奏。4月底处罚剪映等是标志性动作,后续第二批、第三批名单会直接影响平台对AI语音功能的开放尺度。
通话场景的实时检测会不会落地。手机厂商和运营商手里的技术储备是有的,一旦“疑似AI合成来电提醒”变成系统级功能,普通家庭的防御成本会大幅下降,值得持续观望。
开源语音模型的“水印”进展。合成音频能否像AI图片一样嵌入可检测的隐式标识,是技术圈正在讨论的治理方向,这也是从源头压住骗局的关键变量。
声音这东西,从今往后真的不能“听声辨人”了。与其焦虑,不如把这篇转给爸妈,今晚吃饭时就把暗号定了。