7月22号那天,#别再给AI乱传文件了#冲上微博热搜,原帖一万五千多赞。微博评论区直接吵成两派:一派晒案例,说合同、内部资料、会议记录随手丢给AI,迟早出事;另一派直接开怼——“你写的那点东西AI都看不上,大模型训练根本不用用户文件,纯属焦虑”。微博
两边都言之凿凿,到底该信谁?
我把保密观通报、国安部披露的案例、还有各平台被用户扒出来的默认设置翻了一遍,结论先放这儿:两派说的都不全对。风险是真的,但不是"上传即泄密";边界也是有的,只是大多数人根本不知道边界在哪。
先回答一个最容易被误解的问题:删了对话,文件还在吗?
在。
这是这次讨论里最反常识、也最多人踩坑的一点:你在AI助手里的聊天记录和上传的文件,在服务器端是分开存的两个东西。你删掉聊天列表,只是删了你这边的对话入口,那些PDF、Word、扫描件,还躺在云存储里。
微博话题下被转得最多的一段话就是这个意思:不要以为删除对话记录就万事大吉,文件信息体量远大于普通聊天,留存时间也更长。
更进一步:很多平台的用户协议里,写明了上传内容可能被用于"改进服务"或模型训练。这个开关在大多数平台上是默认打开的,我后面会一个个说在哪关。

但先别慌,"乱传必泄密"也是吓唬人
热搜评论区的另一派虽然嘴臭,有一点没说错:对大模型厂商来说,单个用户的日常文件,训练价值确实有限。而且主流大平台的数据安全投入,也不是小作坊能比的。
真正出事的案例,几乎都踩中了同一个组合:敏感类别的文件 × 默认开启的设置 × 不设防的使用习惯。看看已经被官方通报过的:
保密观6月披露:某机关工作人员小王,电脑没设密码、违规连外网,未经安全审核就用AI分析内部文件,直接造成泄密;同期还有研究人员用AI写报告导致泄密的案例。保密观
更早的通报里,有单位把涉密会议纪要扫描后导入联网计算机,前后泄密文件多达127份。北京日报
国家安全部今年1月披露过开源AI工具窃密案;保密观通报的同类案例里,某国家机关工作人员使用开源AI工具分析内部文件,导致敏感资料被境外IP非法访问、下载。微博
企业端也不是没有代价。去年广东有网友爆料,同事把公司内部数据发给AI做表格,事情暴露后全员被谈话,老板直接下令禁用一切AI工具。律师的说法是:情节严重的,可能构成犯罪。
注意这些案例的共同点:不是"AI偷了你的数据",是人把不该上传的东西,传给了一个自己并不了解存储规则的云端服务。知乎上关于"员工将内部资料上传至AI导致公司全员被调查"的讨论里,也有答主提醒:企业不能只要求员工“多用AI”,同时也要规定什么信息不能输入。知乎
所以边界到底在哪?三档清单收好
吵来吵去没意义,直接按文件类别分三档,这是综合了保密部门提醒和社区踩坑帖之后,我认为最可执行的版本:
第一档:坚决不传
涉密和内部材料(会议纪要、内部通报、未公开的项目数据)、未公开的财务数据、客户名单和联系方式、身份证银行卡这类身份凭证、别人的隐私材料(简历、聊天记录、病历)。这一档没有"脱敏后就能传"的余地,尤其是体制内和涉密岗位,红线就是红线。
第二档:脱敏之后再传
合同、行业报告、会议记录、方案草稿这类工作文件,是大多数人最纠结的灰色地带。可以传,但动手之前先做减法:真实公司名换成"甲公司",金额、账号、人名删掉,只截需要AI处理的那一段,别整份原文丢上去。
这里要提醒一个容易被忽略的坑:有泄密案例复盘提到,就算改了暗号、剪了片段,多份碎片传到同一个AI,仍可能被拼出完整信息。所以脱敏要脱"能定位到是谁"的部分,而且同一批敏感项目的碎片,别反复喂给同一个账号。
第三档:放心传
已公开发布的研报、政策文件、新闻、说明书,你自己原创且不涉密的内容。AI读这类文档是它最值回票价的用法,没必要因噎废食。
上传之前,花两分钟做四步自查
第二步自查,比纠结"传不传"更有用,因为大部分风险其实来自默认设置:
1. 关掉"用于模型训练"的开关。 各家的藏法都不一样:豆包在个人主页"隐私与权限"里的"帮助模型改进效果",默认是全开的,要手动全关。小红书DeepSeek在设置的"数据管理"里,有用户实测发现API调用和网页版的开关并不互通,走API的要多留个心眼。ChatGPT的训练开关藏在Data Controls里,相关教程在小红书有八千多赞,说明踩坑的人真不少。小红书Kimi更绝,退出数据训练的入口被用户吐槽藏在隐私协议和帮助中心里,设置页根本看不到。小红书
2. 看一眼"删除"到底删了什么。 对话和文件分开存是普遍做法,删对话之前先想清楚这份文件还要不要留。
3. 留意平台有没有"悄悄改规则"的前科。 Google今年7月就被外媒曝出悄悄更新隐私设置,默认把用户上传的照片、语音、文件用于训练AI。微博平台的默认值是会变的,隔几个月回头看一眼设置,不亏。
4. 物理层面的坑也别踩。 8月初"#人不在工位一定要把豆包关了#"也上了热搜——原因不是产品有漏洞,而是你离开座位,别人能直接翻你的历史对话。微博输入过客户资料、内部数据的,尤其注意。

实在绕不开敏感文件,换本地方案
如果你的工作就是天天碰合同、财报、客户数据,云端AI用着实在膈应,那思路就该从"怎么安全地传"换成"能不能不传":
现在有一批本地离线方案在冒头。比如基于PaddleOCR这类开源引擎的本地文档处理工具,全部推理在你自己电脑的CPU上跑完,断网也能用,文件从头到尾不出本机。小红书还有能直接操作本地文件的AI办公助手,不用来回上传下载。企业场景更简单——走公司内网部署的模型,虽然能力未必比得上云端旗舰,但至少数据不出门。

代价也要说清楚:本地方案的效果和便利性,普遍比云端弱一档。怎么选,取决于你手上文件的敏感程度值不值这个差价。
最后说两句
这波讨论里我更认同的,是一种没什么戾气的声音:给AI传文件有风险,也不必渲染成上传即泄密;公开资料可以用,敏感信息先脱敏,涉密和内部材料坚决不传。AI能提高效率,隐私这道门还得自己守。
往后值得持续留意的信号有三个:一是各平台训练数据开关的默认值会不会变(Google已经打过样了);二是国内大厂会不会跟进"训练数据一键退出"的显性入口(Kimi那种藏法,被骂只是时间问题);三是你们公司自己的AI使用规范——很多单位已经在补这一课,别等全员谈话了才想起来看。
工具该用还得用,但把"什么能传、传完去哪、开关在哪"这三件事搞清楚,才算真的在用AI,而不是被AI用。