73,000:1——这是Anthropic系的爬虫每换来一次真实点击,要从网站背后搬走的页面数。Cloudflare公布的各家爬取与回流比里,Google大约是14:1——每爬取14个页面,回流1次点击。OpenAI是1,700:1。Anthropic是73,000:1。36氪 另一份Cloudflare Radar口径的数据接近:ClaudeBot 约 23,951 : 1;GPTBot 约 1,276 : 1;PerplexityBot 约 192.9 : 1。知乎 如果你这两周正用Playwright、Crawl4AI、browser-use跑数据采集或RAG管道,大概率已经感觉到:路没有物理性被堵死,但账越来越算不过来。这一周发生的几件事,给这种体感找到了出处。
同一周落下的三锤
第一锤在Cloudflare。官方博客写明,9月15日起三大类AI流量的默认值改变:For all new domains onboarding to Cloudflare, the categories of Training and Agent will be blocked by default on the pages that display ads, while Search will remain allowed by default。Cloudflare官方博客 36氪的概括更扎手:从9月15日起,所有使用Cloudflare的网站,默认屏蔽混合用途的AI爬虫。只要你的页面上有广告,AI的训练爬虫和Agent爬虫就进不来。36氪 但精确口径要以官方为准:新增强制默认只针对新接入域名,存量站点得自己点一下采用推荐设置才生效。而一个UA同时干搜索、训练、Agent三事的混合爬虫,吃的规则是最严格的那个生效——站主一旦关掉Training,Googlebot、Applebot、BingBot这类混合UA会一并被挡在门外。

第二锤来自谷歌:目前,谷歌正在逐步推广一种新的搜索结果跳转机制,当用户点击搜索结果时,链接不再直接指向目标网页,而是为搜索结果对应的网址(URL)添加“goto”跳转参数。知乎 对普通用户,这只是链接长了点;对采集端,这是一次链路变更:以前一次HTTP请求拿到的最终URL就是答案,现在必须跟完整条重定向链,才能识别真实目标页面。第三锤,是日历本身——距离9月15日只剩半个月。
goto不是过滤器,是提价器
别把它读成“谷歌要封AI”:谷歌这个新策略并不能从技术层面过滤AI厂商的爬虫,而是大幅度提升AI爬虫的运行成本,消耗AI厂商宝贵的算力和带宽,让后者觉得爬取网站缺乏性价比。知乎 翻译成人话:重定向照样能跟,只是每一跳都多花带宽、多花解析时间、多养一套渲染栈,按请求数计费的代理池和按token计费的清洗管道,成本曲线整体右移。至于百度跟不跟,给出这个判断的作者自己也留了余地——中文内容只占全网约1.3%,百度没有替出版商维权的动力。这是观点,不是事实,先记着。
为什么偏偏是这个月
背景是一个标志性事件:互联网上的bot流量,已经超过了人类流量。36氪
搜索引擎时代的社会契约是“我爬你的内容,你拿我的流量”,而AI时代这份契约的另一半没兑现:AI聊天机器人带来的引荐流量比传统搜索少大约96%。用户在AI回答中点击引用来源的概率,只有大约1%。36氪 被抓,和被抓完之后有人来,是两回事。默认值翻转的本质,是基础设施层第一次替站主把“不给我对价、就别搬我仓库”写进了出厂设置。
后台开始有明账了
这场变局里最有意思的不是屏蔽本身,而是它附带了一本公开的账。Cloudflare给所有套餐开放了AI Crawl Control,王永兴在回答里实际点开过:进后台左侧菜单能找到"AI Crawl Control",所有套餐都能用,零配置。知乎 谁来了、抓了多少、放没放行,第一次不用去啃access log。

配套的Attribution Business Insights把爬取和回流并排放:总bot请求、被拦数、放行数之外,还给出每个爬虫带来的引荐点击和回流转化。这里最值得记的一条是:「可能产生引用」的检索型抓取,只占 AI 爬虫请求的不到 10%,其余九成是纯提取。知乎 仪表盘里的数字是演示数据,别当全网统计用,但量级逻辑是通的:你辛苦维护的抓取管道,对面仓库里九成是纯提取。而且这个九成里还有水分:50%以上的AI爬虫流量花在重复抓取未更新的页面上。36氪 这就是为什么“我们给AI供了内容”这类汇报,经不起一张后台截图。

采集端的三个坑
第一个坑:UA黑名单过时了。拦爬虫的思路正在从维护一份黑名单,转向依据行为判断这个访客究竟是谁、想干什么。知乎 有厂商的处置数据显示,电商类网站的AI爬虫访问量排在所有行业第一,某个优惠券导购平台单日命中接近20万次。更冤的是,很多拦截根本没经过站主的手——你去看看你的 CDN 和 WAF,八成是它们把 AI 爬虫当成恶意机器人,在网络层直接掐了。知乎 你以为对方封的是恶意bot,其实顺手把你的GEO流量一起埋了。
第二个坑:抓回来的数据可能是喂给你的毒饵。一旦踏进防守方布下的LLM蜜罐,不仅会导致矢量数据库(Vector DB)被污染,后续用于模型训练或 RAG 检索的结果也将严重失真。知乎 做过多年采集的老手把这层危险说得更直白:这活最危险的地方,从来不是”它抓不到”,是它抓回来一堆看着完全正常、其实是错的数据,而你不知道。知乎
顺着这个坑多说一句:这批防蜜罐教程给出的突破策略,核心一条是——接入高质量的动态住宅代理 IP 池。知乎 绕对抗的尽头是卖代理,这类文章的价值主张不在技术上,在你钱包上。
第三个坑:你看到的页面和AI看到的页面,已经不是同一份。有人拿《时代》做过双身份测试:普通浏览器打开,服务器返回约 303KB 的标准 HTML 页面;把 User-Agent 换成 ClaudeBot 或 PerplexityBot,同一个链接返回的只有约 13KB 的 Markdown 内容。知乎 响应头里明确写着 text/markdown,13KB里塞什么(包括只对AI爬虫可见的问答式赞助内容),人类读者永远看不到。国内还有更隐蔽的一层:日志里grep不到“豆包爬虫”,不是它没来,是这个UA根本不存在——国内的 AI 助手,大部分不为「答问题」单独养一支署名爬虫——它们要么复用母公司搜索引擎的现成索引,要么直接买第三方搜索 API 做联网检索。知乎
前提搞错,后面全白忙:字节从来没有公开说明过,头条搜索的抓取和豆包答案语料之间是什么关系。知乎 拿“被某AI抓了八万次”当成绩单之前,先问一句:抓取的那拨人和答题引用语料的那拨人,是不是同一拨。
站长的另一面:有人在开门
别只盯着被封,站长圈是撕裂的。一个做外贸独立站的人晒了对照:两个站除robots配置外运营完全相同,放开AI爬虫的站点,AI摘要曝光量、首页点击、精准询盘直接翻倍;被拦截的站点,关键词排名稳稳当当,后台访客却越来越少,询盘几乎断档。知乎 这是单案例,别当定律;但方向和另一拨人的动作一致:全球 llms.txt 采用站点数量从 2025 年 6 月的 4,088 个增至 2026 年 5 月的 36,120 个,12 个月增长 8.8 倍。知乎 一边在默认关窗,一边在递名片——拦和喂是同一枚硬币的两面:不是不让AI来,而是AI怎么来、留下什么,得由页主说了算。
收费站的雏形:从403到402
Cloudflare给“喂”准备了计价器,36氪梳理过它的原始逻辑:「PayPerCrawl」——按爬取次数向AI公司收费。36氪 落到协议层,被拦的请求拿到的不再是干巴巴的403,而是402 Payment Required——付一次费、取一次内容、留下可审计凭据的x402流程已经画好,Ceramic.ai、You.com这类AI搜索引擎先接了商家侧。

三类人,三笔账,三个继续盯的信号
跑采集和RAG管道的:9月15日前把目标站清单过一遍,Cloudflare后面的广告页要么走官方授权和付费通道,要么接受拿不到;同时把校验从入口挪到结果,日志是「入口体检」,问答实测是「结果体检」。知乎 蜜罐和影子页时代,只看HTTP状态码的监控等于没监控。管站点和外链建设的:先开后台AI Crawl Control看账本,免费版Metrics只能看最近24小时的数据。知乎 但够你先看清谁在抓你;llms.txt递不递,取决于你信不信被引用这单生意还能回来。纯围观的:盯三个信号——9月15日后AI爬虫的量价变化、百度对goto参数的态度、x402有没有第二家基础设施跟进。
规则翻转不是采集的末日,是把白嫖开始定价。接下来一年能活下来的管道,是那些把许可成本、重定向开销和引用回流一起算进账本的。