做爬虫这两年,大家应该都有同一个感受:目标站越来越难爬了。有人以为只是对面多加了一层验证码,但这次,问题的性质变了。
7月1日,Cloudflare发了一篇名为「你的网站,你的规则」的博客,核心就一句话:从9月15日起,所有使用Cloudflare的网站,默认屏蔽混合用途的AI爬虫。36氪页面上有广告的,AI训练爬虫和Agent爬虫直接进不来,站长想放行,得自己去后台手动打开。这里的逻辑翻转值得咂摸:以前是「默认允许,你可以选择屏蔽」,现在是「默认屏蔽,你可以选择允许」。今天是8月20日,离切换还剩不到一个月。
为什么走到这一步:bot流量已经超过人类
Cloudflare的数据显示,网页请求里AI机器的访问量已经正式超过了真人。微博Cloudflare CEO Matthew Prince说,这个里程碑比所有人预期的都来得早,原本预计要到2027年才会发生。36氪也就是说,现在你打开的很多网页,「看」它们的主体已经不是人,而是一个提问就能触发几十上百次访问的AI。

更扎心的是各家AI公司的「爬取回流比」:Google平均每爬14个页面才回流1次点击,OpenAI是1,700:1,Anthropic是73,000:1。36氪搜索引擎时代的老交易是「我爬你的内容,你获得流量」,AI时代这笔账彻底算不平了:AI聊天机器人带来的引荐流量比传统搜索少大约96%,用户在AI回答里点击引用来源的概率只有约1%,出版商过去一年因此损失了两成到九成的流量和收入。旧契约崩塌,Cloudflare干脆选择在基础设施层重写规矩。
这和写爬虫的人有什么关系
先说一个绕不开的事实:Cloudflare承载着全球超过20%的网络流量。知乎你的目标站前面,大概率就站着一个Cloudflare。默认策略一翻,这批站点的反爬基线集体收紧,这不是AI公司一家的事,是所有自动化流量的准入环境都变了。
再看规则细节:这次Cloudflare把爬虫拆成Search、Agent、Training三类分开管控,并且按「最严规则优先」处理——如果一个爬虫同时执行搜索和训练两个功能,那所有适用的规则会同时生效,按最严格的那个来。36氪这意味着Googlebot这类混合爬虫,只要站长屏蔽了Training就会被一并拦下。过去对Cloudflare站点那种「默认友好」的假设不再成立,你得先想清楚自己会被归到哪条规则里。
最关键的一点是:反爬的决胜战场变了。把最近半年全网动向捋一遍,会发现攻防两边都换了打法。
反爬一方已经是三线作战。基础设施规则线上,除了这次的默认屏蔽,还有年初推出的AI Labyrinth:检测到AI爬虫时不直接403,而是投喂大量AI生成的虚假内容,让爬虫带着一堆垃圾数据迷路。知乎
内容伪装线上,巴西工作室Seneda&Abrucio联合哥本哈根字体公司Playtype做了开源字体ShieldFont,AI爬虫抓到的内容是乱码,人类看到的却是正常文字。微博

TIME周刊则按User-Agent给访客分餐:人类看到的是设计精美的HTML杂志,ClaudeBot、OpenAI这些AI爬虫拿到的只有三万多字节的Markdown「特供版」。微博
经济消耗线上,Anubis这类项目开始让爬虫先做数学题、算哈希,付出不菲的计算成本才能读到内容,这类小工具最近频繁出现在GitHub开源热榜上。哔哩哔哩内容站也开始用登录墙和API收费,让爬取付出真金白银。
爬虫这一侧,同样全面AI化。Firecrawl、Crawl4AI、Scrapling这些主流AI爬虫工具都内置了多模态理解能力:不再盯着CSS选择器,而是直接给页面截图、用视觉模型理解布局,站点改版了还能自动修复提取逻辑。知乎传统「改HTML结构让选择器失效」的防爬手艺,对它们基本无效。

验证码的沦陷速度更快。有开发者实测,同一台干净的住宅代理,原生Selenium跑reCAPTCHA v3的评分稳定在0.3到0.5之间,换上Scrapling直接跳到0.7——不是绕过验证,而是让验证系统觉得「这看起来像个人」。知乎行业共识正在形成:验证码不再是防线,是减速带。
爬虫逆向圈也在换工具。已经有人用AI加MCP的方式批量搞定大厂验证码,字节系的滑块验证被做成完整教程,标题直接喊出「炸掉爬虫圈」。哔哩哔哩所以判断很清楚:改结构、破解析的猫鼠游戏还会继续,但那已经不是决胜战场。真正的墙有两道,一道是基础设施层的默认规则,一道是经济成本。工具箱里如果只有「代理池+打码平台」,接下来半年会过得很吃力。
9月15日之前,做三件事
第一,盘一盘目标站。查一下你依赖的核心站点有多少走Cloudflare,把它们的robots和反爬配置记录下来,9月15日之后再对一遍,看有多少站的默认策略真的变了。基线留得越早,出问题时定位越快。
第二,检查身份策略。别再伪装GPTBot、ClaudeBot这类UA,新规之下,这类身份是第一批被默认屏蔽的对象。常规采集任务用诚实的标识、低频访问,尽量只碰公开页面。新规则环境里,「可识别、可控」比「伪装得像人」更稳,因为后者正是被精准打击的目标。
第三,把「买数据」列进预算。Cloudflare已经把PayPerUse端上了台面,内容出现在AI回答里产生价值时,站长可以收钱。36氪目前上桌的还只有Ceramic.ai和You.com两家小玩家,但对高价值、长期跑的采集任务来说,官方API和正版数据渠道值得提前看货。还有一条底线不能碰:不碰登录后数据和个人信息,收到429或警告,先停下来。
最后留三个观察信号:OpenAI、Google这些大户会不会加入付费生态;9月15日之后实际执行力度如何;Cloudflare覆盖不到的那八成网站会不会跟进收紧。「爬虫还能怎么爬」这个问题的答案,大概率就在接下来几个月里浮出来。
收费站没有消失,只是从搜索引擎的门口,挪到了基础设施层。先看懂规则的人,总是少踩坑。