当前位置:
AIGC文章详情

9月15日,互联网的规则要变了:Cloudflare默认拦截AI爬虫,做自动化数据采集的先自查

源自134位全网作者

19:43

9月15日,还有25天,互联网会安静但彻底地变一次规则。处理着全球约20%互联网流量的Cloudflare,已经向所有AI公司下了最后通牒:9月15日前,把搜索爬虫和AI训练爬虫拆开,否则直接断网。微博如果你的工作依赖自动化数据采集——不管是办公自动化脚本、电商价格监控,还是给AI Agent抓网页——都值得在那一天之前,先做一次自查。

Cloudflare到底改了什么

7月1日,Cloudflare上线了新的AI流量控制选项,把爬虫细分成搜索、代理、训练三类,连免费用户也能分别管理。微博过去那种要么全放行、要么全拦截的粗放开关,变成了按用途分别开关。

紧接着是重头戏:从9月15日起,所有使用Cloudflare的网站,默认屏蔽混合用途的AI爬虫,只要页面上有广告,AI的训练爬虫和Agent爬虫就进不来,除非站长自己在后台手动打开。知乎注意这个逻辑翻转:以前是「默认允许,屏蔽是可选项」,现在是「默认屏蔽,放行要手动开」。这不是参数调整,是方向变了。

不过要把影响范围先说清楚。Cloudflare官方博客的表述是,所有新接入域名会默认拦截AI训练爬虫,除非域名持有者自己更改设置。Cloudflare博客而谢丹阳的表述是「新接入域名在展示广告的页面上默认拦截训练和代理类爬虫」,极客公园则说「所有使用Cloudflare的网站」。稳妥的理解是:新域名和广告页必然先被波及,存量站点扩大到什么程度,要以Cloudflare后台通知为准。不必恐慌,但也别觉得和你无关。

为什么是现在

动作这么大,是因为数据真的扛不住了。Cloudflare监测显示,网页请求里机器占57.5%,人只剩42.5%,机器超过人类的拐点比预测早了一年到来。微博Cloudflare自己的说法更直接:今年,agent流量有史以来第一次跨过了历史性门槛,互联网上超过一半的流量已经不是人类产生的了。Cloudflare博客背后的主力是Agent的渗透加速:它们能自主调用浏览器等工具进行超量的访问任务,动不动就一次性爬完上千个网站抓取数据,只为回答一个问题。微博

9月15日,互联网的规则要变了:Cloudflare默认拦截AI爬虫,做自动化数据采集的先自查

再看爬虫的构成,方向更清楚:到2026年6月,52%的爬虫请求已经是为了AI训练,比2025年春天的22%翻了一倍还多;混合用途爬虫占36%以上,纯搜索爬虫的份额一直在降。Cloudflare博客爬取的目的,正在从「给人类建索引」变成「喂模型、跑任务」。

9月15日,互联网的规则要变了:Cloudflare默认拦截AI爬虫,做自动化数据采集的先自查

内容被爬走了,流量却没回来

对内容生产者来说,爬取暴涨的另一面,是交换的崩塌:内容仍在被爬取、索引、使用,但对应的回流流量越来越少。Cloudflare博客

9月15日,互联网的规则要变了:Cloudflare默认拦截AI爬虫,做自动化数据采集的先自查

Cloudflare的报告提到,这股冲击最早打在新闻媒体身上,现在已经蔓延到零售、软件、IT、金融;被爬得最狠的一些行业,人类流量一年内最多跌了40%。「抓你、不付钱、还不带客人来」的模式,开放网络已经撑不住了。

对做数据采集的人意味着什么

这次规则变化,对三种角色的打击是不一样的。

如果你是采集方:你的目标站点只要用了Cloudflare保护,9月15日后就会默认拦截训练类和代理类爬虫。哪怕你的脚本伪装成浏览器,只要行为模式像Agent——高频、深抓、只取数据不产生任何「逛」的痕迹——被一起拦下的概率也会明显变高。

如果你依赖AI Agent或SaaS数据服务抓页面:上游服务会先挨打。数据接口的可用性和报价可能在9月之后波动,值得提前和上游确认抓取方式、声明身份和降级方案。

如果你自己运营网站或内容:这次变化对你是利好。可以趁机进后台,确认对每一类爬虫的策略——这也是免费用户第一次能按用途精细管理AI流量。

9月15日前要做的三件事

第一,盘点手头任务。把采集任务列一遍:目标站哪些用了Cloudflare保护、目标页面有没有广告、你的爬虫以什么身份(User-Agent)对外。三项全占的任务,现在就该准备备选方案,而不是等被拦了再救火。

第二,给爬虫做身份体检,留正规通道。Google-Extended、GPTBot、ClaudeBot这些爬虫都声明了独立的User-Agent,并在官方文档中承诺尊重robots.txt。知乎Cloudflare也上线了爬虫身份目录,可以查到常见爬虫的声明身份和用途。如果你的采集是长期生意,声明真实身份、控制频率、留下联系方式,会比伪装更稳。

9月15日,互联网的规则要变了:Cloudflare默认拦截AI爬虫,做自动化数据采集的先自查

第三,给数据链路留后路。单源、实时、无缓存的采集正在变成高风险动作。缓存、备用信源、降级输出,这些应该在9月15日之前就进管线,而不是被拦之后再补。

两个要避开的坑

一是反AI字体。最近冒出来「幽灵字体」、ShieldFont这类方案,号称能让AI爬虫读到乱码、人类正常阅读。但有博主写文章直接点明:反AI字体既没用,还有害。微博做站方的别急着上:它可能同时给真实用户和搜索引擎制造麻烦;做采集方的也不必慌,眼下的博弈焦点还在协议和身份层。

二是迷信验证码。整个行业的共识正在形成:验证码不再是防线,是减速带。知乎别以为加了验证码的站就安全,也别把采集的全部资源押在破解验证码上——博弈的主战场已经在往身份、行为和经济层转移。

三个值得盯的趋势

第一,基础设施层开始直接立法。Cloudflare不是唯一动手的:Patreon已经和它联手在平台禁止AI训练爬虫,早期测试里,各个人工智能训练爬虫每周尝试访问Patreon的次数从数千次骤降至零次。微博接下来,大概率会有更多平台在CDN和云层面跟进同款动作。

第二,爬虫从业者自己在换赛道。在知乎「现在学爬虫还能不能接到单」的问题下,被收藏最多的回答在7月更新了一句话:我已经转aiagent开发了。知乎原来研究怎么突破反爬的人,正在去做Agent——攻防两端在同时升级。

第三,付费通道正在成型。Cloudflare在一边拦截一边推内容交易服务,互联网有了原生变现方式,广告不是唯一途径。微博对数据采集方来说,这意味着未来稳定的数据源,会越来越多地出现「想拿就得付费」的场景。

接下来看什么

三个信号值得标记:9月15日前后,存量站点是否官宣扩大默认拦截范围;大厂爬虫是否按时拆分开搜索和训练两个身份;Patreon这样的平台方案例会不会变多。

最后问一句正在做采集的你:你的任务已经撞上Cloudflare的墙了吗,还是还在观望?评论区聊聊。

内容由AI生成

精选参考来源

1. 赛博茶馆#硅基哲学#Cloudflare向所有AI公司下了最后通牒:9月15日前,把搜索爬虫和AI训练爬虫拆开,否则直接断网这事看着是基础设施公司在"收过路费",但底层逻辑比这深得多。先说背景。Cloudflare处理全球约20%的互联网流量,给无数中小网站提供免费CDN和抗DDoS服务,人...全文

2. Cloudflare7月1日上线新的AI流量控制选项,把爬虫细分成搜索、代理、训练三类,连免费用户也能分别管理。它还说,从9月15日起,新接入域名在展示广告的页面上,将默认拦截训练和代理类爬虫;另一份报告显示,到2026年6月,52%的爬虫请求已经指向AI训练。意思很直接:AI时代的网站,不再只是怕被“抓”...全文

3. 赛博菩萨Cloudflare,AI爬虫最严厉的父亲

4. Content Independence Day, one year on- building the business model for the agentic Internet

5. 颠覆认知的数据来了!现在打开网页,大半访问者根本不是真人,是AI机器人爬虫。Cloudflare监测网页请求机器占57.5%,人只剩42.5%,比预测早一年迎来拐点。AI智能体全天不停扫站,搜资料、扒文章、刷数据,消耗服务器资源却不消费、不点广告。以后网站浏览量、阅读数据全不能信,广告投放、内容变现...全文

6. 全球最大的CDN服务商Cloudflare刚刚更新了一个数据,整个互联网上,来自AI的访问流量,已经正式超过了人类网民。主要原因是Agent(智能体)的渗透加速,它们能够自主调用浏览器等工具进行超量的访问任务,动不动就是一次性爬完上千个网站抓取数据,只为回答一个问题,Google这种搜索引擎的爬虫,平...全文

7. 对抗AI爬虫2026年反爬的新战场

8. 最近冒出来一类“反AI字体”,比如“幽灵字体”和ShieldFont,号称能让AI爬虫读不懂,但人类能正常阅读。逻辑是这样的:把文字替换成特殊编码或动态图像,AI抓取时只能看到乱码,从而保护内容不被模型训练。想法挺巧妙,但一位叫Andrew的博主写了一篇文章,标题直接点明:反AI字体既没用,还有害。他...全文

9. 【Patreon与Cloudflare联手,在平台禁止AI训练爬虫】根据Patreon的早期测试,各个人工智能训练爬虫每周尝试访问Patreon的次数从数千次骤降至零次。

10. 现在学爬虫能接到单嘛有兄弟知道吗?

11. 浙商计算机刘雯蜀】Cloudflare内容交易服务:互联网有了原生变现方式,广告不是唯一途径Cloudflare除了CDN和网安业务外,未来新增长曲线来自——内容交易服务,它提出:#大模型和Agent改变了互联网,产生的问题:全网原创内容被AI批量抓取、整合输出,但终端受众不会跳转至内容原发页面获取流量与...全文

0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章