9月15日,还有25天,互联网会安静但彻底地变一次规则。处理着全球约20%互联网流量的Cloudflare,已经向所有AI公司下了最后通牒:9月15日前,把搜索爬虫和AI训练爬虫拆开,否则直接断网。微博如果你的工作依赖自动化数据采集——不管是办公自动化脚本、电商价格监控,还是给AI Agent抓网页——都值得在那一天之前,先做一次自查。
Cloudflare到底改了什么
7月1日,Cloudflare上线了新的AI流量控制选项,把爬虫细分成搜索、代理、训练三类,连免费用户也能分别管理。微博过去那种要么全放行、要么全拦截的粗放开关,变成了按用途分别开关。
紧接着是重头戏:从9月15日起,所有使用Cloudflare的网站,默认屏蔽混合用途的AI爬虫,只要页面上有广告,AI的训练爬虫和Agent爬虫就进不来,除非站长自己在后台手动打开。知乎注意这个逻辑翻转:以前是「默认允许,屏蔽是可选项」,现在是「默认屏蔽,放行要手动开」。这不是参数调整,是方向变了。
不过要把影响范围先说清楚。Cloudflare官方博客的表述是,所有新接入域名会默认拦截AI训练爬虫,除非域名持有者自己更改设置。Cloudflare博客而谢丹阳的表述是「新接入域名在展示广告的页面上默认拦截训练和代理类爬虫」,极客公园则说「所有使用Cloudflare的网站」。稳妥的理解是:新域名和广告页必然先被波及,存量站点扩大到什么程度,要以Cloudflare后台通知为准。不必恐慌,但也别觉得和你无关。
为什么是现在
动作这么大,是因为数据真的扛不住了。Cloudflare监测显示,网页请求里机器占57.5%,人只剩42.5%,机器超过人类的拐点比预测早了一年到来。微博Cloudflare自己的说法更直接:今年,agent流量有史以来第一次跨过了历史性门槛,互联网上超过一半的流量已经不是人类产生的了。Cloudflare博客背后的主力是Agent的渗透加速:它们能自主调用浏览器等工具进行超量的访问任务,动不动就一次性爬完上千个网站抓取数据,只为回答一个问题。微博

再看爬虫的构成,方向更清楚:到2026年6月,52%的爬虫请求已经是为了AI训练,比2025年春天的22%翻了一倍还多;混合用途爬虫占36%以上,纯搜索爬虫的份额一直在降。Cloudflare博客爬取的目的,正在从「给人类建索引」变成「喂模型、跑任务」。

内容被爬走了,流量却没回来
对内容生产者来说,爬取暴涨的另一面,是交换的崩塌:内容仍在被爬取、索引、使用,但对应的回流流量越来越少。Cloudflare博客

Cloudflare的报告提到,这股冲击最早打在新闻媒体身上,现在已经蔓延到零售、软件、IT、金融;被爬得最狠的一些行业,人类流量一年内最多跌了40%。「抓你、不付钱、还不带客人来」的模式,开放网络已经撑不住了。
对做数据采集的人意味着什么
这次规则变化,对三种角色的打击是不一样的。
如果你是采集方:你的目标站点只要用了Cloudflare保护,9月15日后就会默认拦截训练类和代理类爬虫。哪怕你的脚本伪装成浏览器,只要行为模式像Agent——高频、深抓、只取数据不产生任何「逛」的痕迹——被一起拦下的概率也会明显变高。
如果你依赖AI Agent或SaaS数据服务抓页面:上游服务会先挨打。数据接口的可用性和报价可能在9月之后波动,值得提前和上游确认抓取方式、声明身份和降级方案。
如果你自己运营网站或内容:这次变化对你是利好。可以趁机进后台,确认对每一类爬虫的策略——这也是免费用户第一次能按用途精细管理AI流量。
9月15日前要做的三件事
第一,盘点手头任务。把采集任务列一遍:目标站哪些用了Cloudflare保护、目标页面有没有广告、你的爬虫以什么身份(User-Agent)对外。三项全占的任务,现在就该准备备选方案,而不是等被拦了再救火。
第二,给爬虫做身份体检,留正规通道。Google-Extended、GPTBot、ClaudeBot这些爬虫都声明了独立的User-Agent,并在官方文档中承诺尊重robots.txt。知乎Cloudflare也上线了爬虫身份目录,可以查到常见爬虫的声明身份和用途。如果你的采集是长期生意,声明真实身份、控制频率、留下联系方式,会比伪装更稳。

第三,给数据链路留后路。单源、实时、无缓存的采集正在变成高风险动作。缓存、备用信源、降级输出,这些应该在9月15日之前就进管线,而不是被拦之后再补。
两个要避开的坑
一是反AI字体。最近冒出来「幽灵字体」、ShieldFont这类方案,号称能让AI爬虫读到乱码、人类正常阅读。但有博主写文章直接点明:反AI字体既没用,还有害。微博做站方的别急着上:它可能同时给真实用户和搜索引擎制造麻烦;做采集方的也不必慌,眼下的博弈焦点还在协议和身份层。
二是迷信验证码。整个行业的共识正在形成:验证码不再是防线,是减速带。知乎别以为加了验证码的站就安全,也别把采集的全部资源押在破解验证码上——博弈的主战场已经在往身份、行为和经济层转移。
三个值得盯的趋势
第一,基础设施层开始直接立法。Cloudflare不是唯一动手的:Patreon已经和它联手在平台禁止AI训练爬虫,早期测试里,各个人工智能训练爬虫每周尝试访问Patreon的次数从数千次骤降至零次。微博接下来,大概率会有更多平台在CDN和云层面跟进同款动作。
第二,爬虫从业者自己在换赛道。在知乎「现在学爬虫还能不能接到单」的问题下,被收藏最多的回答在7月更新了一句话:我已经转aiagent开发了。知乎原来研究怎么突破反爬的人,正在去做Agent——攻防两端在同时升级。
第三,付费通道正在成型。Cloudflare在一边拦截一边推内容交易服务,互联网有了原生变现方式,广告不是唯一途径。微博对数据采集方来说,这意味着未来稳定的数据源,会越来越多地出现「想拿就得付费」的场景。
接下来看什么
三个信号值得标记:9月15日前后,存量站点是否官宣扩大默认拦截范围;大厂爬虫是否按时拆分开搜索和训练两个身份;Patreon这样的平台方案例会不会变多。
最后问一句正在做采集的你:你的任务已经撞上Cloudflare的墙了吗,还是还在观望?评论区聊聊。