这两天技术圈有个数字,值得所有想从互联网上"拿点数据"的人留意:Cloudflare在二季度财报电话会上确认,其网络上超过一半的网页请求流量,已经不再由人类产生,机器流量第一次正式压过了人类。36氪
不关注技术圈的话,可能不熟Cloudflare:全球大约五分之一的网站,流量都要从它这张网上过,它是互联网上最大的"守门人"。它的CEO原本预测2027年底机器流量才会越线,后来改口2027年初,结果今年5月,团队直接跑来告诉他:已经过了。36氪财报会上还有句更狠的推算:照这个速度,五年后机器流量会是人类的1000倍,届时人类在网上只是一个"误差"。
口径先说清楚,免得夸大:Cloudflare Radar的实时图只统计返回HTML网页的HTTP请求,这个口径下机器占60.4%,人类39.6%。36氪在一些更极端的角落,数字还要夸张:直布罗陀地区的网页请求里,机器占93%,人类只剩7%。

这些机器是哪来的?很大一部分,其实是"你派出去的"。Cloudflare的CEO举过一个例子:你想买台数码相机,自己可能点开5个网站比价;但把这事交给AI助理,它会替你逛5000个网站。一次人类的念头,被放大成上千次机器的动作,业内管这叫"扇出效应"。

AI流量的结构也在质变。HUMAN Security的2026年报告显示,增长最猛的已经不是训练爬虫,而是会自己点链接、填表单、下单结账的"AI智能体",一年暴涨7851%;被观测到的AI机器人流量里,OpenAI一家约占69%,Meta约16%,Anthropic约11%,三家加起来超过九成。36氪
这不是单一来源的孤证。国内安全厂商瑞数信息发布的《2026自动化威胁报告》给出了另一组数字:Bots流量占整体流量比例攀升至约68%,其中恶意Bots占比达55%;与此同时,AIAgent驱动的新型流量从2025年初的不足1%快速增长至2026年Q2的约8%-12%,人类正常访问约占22%。36氪报告还把非人类流量重新分成传统Bot、AI增强型Bot和AI Agent三类,并给出了L1到L5的威胁分级框架。

电商侧的感受更直接。Akamai的《互联网安全态势报告》显示,2025年全球有超过17万亿次Bot访问电商网站,同比增长19%,其中亚太地区增长超63%。知乎这些AI Bot还会模拟人的作息:工作日爬取流量高、周末回落,浏览器伪装流量高达7500亿次,传统的"好爬虫、坏爬虫"二分法已经不够用了。
三家机构,三套口径,指向同一件事:互联网上的访客主体,已经换人了。这对普通人意味着什么?分三种情况说。
如果你想自己抓点数据,最直接的体感是门槛变高了。机器流量泛滥,网站的反爬也在军备竞赛:Cloudflare把Bot管理做成了收费生意,网站开始用浏览器指纹、行为节奏、信任评分来分辨"你是不是人"。知乎上做爬虫的开发者已经直言:说句实话,今年大型电商网站的爬虫已经非常困难了,光是清理cookies和模拟真人用户行为已经避免不了反爬机制。知乎
如果你想让AI替你抓,方向是对的,但坑很具体。知乎上有位作者实测:让AI写一个"每天抓一个页面的表格,存成CSV"的小脚本,AI直接给了一套带重试策略、代理池、断点续传、异常上报的完整方案。知乎用他的话说,这是"工程上正确,不是当下合适",结果他花了三倍时间,把过度设计一层层剥掉。他总结的教训特别实用:一上来就说清楚"这是一次性脚本,不考虑扩展性,能跑就行",能省掉一大堆无效返工。
如果你想学爬虫搞副业,先泼盆冷水。知乎问题"现在学爬虫能接到单吗"下面有118条评论,高赞回答的现实有点扎心:我最近这些单子基本上跟爬虫不搭边,都好久没见过爬虫单了。知乎
更值得注意的是评论区点赞最高的一条提醒:这几年爬虫这块,很容易就涉及非法入侵系统罪,相关案例特别之多,一般情况下,只要robot.txt禁止的,最好别碰。知乎评论区还有人自嘲,学了半年爬虫掌握很多东西却没接到单,反倒是别人靠AI加爬虫工具接单能自给自足。单子变少背后是两件事:AI正在替代低端采集需求,合规正在收紧供给。
法律红线不是吓唬人,今年就能翻到不少真实判例。有公司技术总监授权员工开发爬虫对接居住证平台查询数据,爬虫配置了高频访问(每秒275次),直接导致政府网站瘫痪,主犯被判3年。知乎还有人伙同他人以编写网站"爬虫软件"的方式进入四川省健康档案室云平台、重庆市人口家庭信息系统,爬取数据卖钱,5万块钱换来3年刑期。知乎
上海还有一起标志性案件:提供爬虫程序抓取"公开数据",也被认定构成提供侵入计算机信息系统程序罪。该案的讨论区里有句话说得透:公开数据也有产权归属,产权人当然有权限定访问方式。知乎当然也不必谈爬色变,相对稳妥的共识是:公开数据爬虫原则上都是合法的,前提是不破坏网站正常运营,没有用于不正当的业务。知乎落到个人身上,几条线别碰:不碰公民个人信息,不突破登录态和付费墙,不用高频请求把对方服务器拖垮,不拿数据做不正当竞争。
那么普通人有真实需求——蹲价格、整理资料、喂AI、自动化重复劳动——路该怎么选?按成本从低到高,4条路。
路线一:一行代码不写,用现成工具。目的是蹲降价的话,京东App里商品页面就有"降价提醒/关注降价",设置心理价位,降价了直接推送。知乎淘宝商品页也有类似入口,再配合比价工具的历史价格曲线,"等降价再出手"的大部分需求基本都能覆盖。零成本零风险,先用够它们。
路线二:开源AI采集工具,免费且能打。想把网页内容抓下来喂给AI分析:Crawl4AI完全本地运行,不注册、不要API Key、不按页收费,Apache-2.0协议,商用也宽松;Firecrawl用起来更省心,但自托管版本是AGPL-3.0,集成进商业产品代码也得开源,个人和团队内部用则没限制;一堆PDF、Word、Excel可以用微软的MarkItDown一键转成干净的Markdown。browser-use的做法是直接让AI Agent来控制浏览器,像真人一样点击、输入和跳转,专门对付传统爬虫进不去的复杂页面。知乎有篇知乎整理里的一句话值得抄下来:别一上来就买商业爬虫——很多按月收费的商业爬虫连价格都不标,非要你留电话邮箱等销售联系,而大多数需求,免费开源工具就够了。

路线三:让AI帮你写个小脚本。一次性、小体量、对方不反爬的场景,这是最快的路。记住三件事:需求里写明"一次性脚本,能跑就行";代码复查只让它报影响正确性的问题,别听风格优化建议;涉及敏感或涉密的数据,别走会经第三方转发请求的AI工具。
路线四:手写爬虫、大规模长期采集。Scrapy这类十几年历史的工业级框架,百万页级别的任务依然稳,但那是专业团队的活。对普通人来说投入产出比已经很低,再叠加法律风险,不建议从这里入门。
最后留三个值得持续观察的信号:一是Cloudflare等安全厂商把反爬做成收费业务的节奏,这直接决定今后抓数据的成本;二是瑞数、Akamai等报告里AI Agent流量占比的季度变化,能看出"机器化"的推进速度;三是各大平台是否开放官方数据接口——有官方通道永远是最优选,稳定,也安心。
互联网还是那个互联网,但访客的主体已经换人了。对想抓数据的人来说,这既是坏消息——反爬只会越来越严;也是好消息——AI工具把门槛降到了历史最低。关键从来不是埋头硬干,而是先看清路线,再动手。