最近刷技术信息流,大概率又被 Firecrawl 刷屏了。
一边是公众号在转"14 万星的网页抓取神器",一边是小红书上"Firecrawl 不用 API key、免注册直接用"的笔记四处飞——其中一篇拿了 900 多赞、2700 多收藏。微信公众号小红书GitHub 上,主仓库已经摸到 17.1 万星,8 月初他们新开源的文档解析工具 anydoc,20 天冲到近 1.8 万星。
但信息越热闹,越容易看花眼。我把官方文档、定价页、GitHub 实时数据,以及知乎、小红书评论区里的真实踩坑记录都翻了一遍,今天把三件事说清楚:免费到底能用到什么程度、自部署要踩哪些坑、不同情况该走哪条路。

一、"免 API key"是真的,但只有一半
先给最火的"免密"传闻做个核验。
官方确实上了 keyless 通道:用官方 MCP、CLI 或 SDK 调用,不注册、不填 key,就能直接用 search(搜索)、scrape(抓单页)、interact(浏览器交互)、parse(文档解析)这几个能力,外加 research index。微信公众号但很多爆款笔记没说的是另一半:crawl(整站爬取)、map(站点地图)、monitor(监控)、extract(结构化提取)、batch 批量抓取、agent 这些核心进阶功能,全部仍然需要注册的 API key。Firecrawl官方文档而且 keyless 档有限速,官方自己的定位是"拿不到 key 时的兜底方案",不是常规用法。
一句话:免密开放的是"试用入口",不是"完整产品"。拿来试试手感、给 Agent 接个轻量抓取,完全够用;想整站爬取、想结构化提数,还是得注册。这本身是正常的免费增值设计,不算坑,但"永久免费、无需注册"这类标题,至少夸了一半。
二、注册之后,免费额度是每月 1000 页,不结转
再看付费体系。官方定价页(8 月 23 日核验,美元、按年付费口径):
Free:每月 1000 credits,2 个并发,低速通道
Hobby:16 美元/月,5000 页,5 个并发
Standard:83 美元/月,10 万页,25 个并发
Growth:333 美元/月,50 万页,50 个并发
计费规则很直白:scrape、crawl、map 都是 1 页 1 credit;search 每 10 条结果 2 credits;浏览器交互每分钟 2 credits。Firecrawl官网两个容易忽略的细节:一是 credits 不结转到下月,用不完作废;二是目前没有按量付费档,只能订阅。微信公众号每月 1000 页是什么概念?个人做个小知识库、盯几个固定站点,够用;但如果你想给 RAG 备数据、整站爬一个中型网站,一下午就能烧完。
三、想自部署省钱?先看这份踩坑清单
Firecrawl 主仓库以 AGPL-3.0 协议开源,官方也支持自部署,于是很多人的第一反应是:自己部署,永久白嫖。
这里必须泼盆冷水:自部署的社区版和云版,几乎是两个产品。
社区版缺的东西不少:没有 Fire Engine(处理动态页面的抓取引擎)、没有代理 IP 池、没有反封锁能力、没有后台管理面板,部分场景只能爬 https 站点。知乎知乎那篇 32 收藏、12 评论的《Firecrawl 快速部署指引》写得很实用,评论区里有人直接总结:"好多网站爬不了,和官网差别很大。"教程作者的回话更直白:“毕竟人家就打算让你交钱,才不关心社区版死活。”
那篇教程的评论区,基本是个踩坑博物馆,我归了归类:
国内构建镜像大概率失败,基础镜像被墙,作者的解法是借 GitHub Actions 构建;
认证配置混乱,BULL_AUTH_KEY 和 TEST_API_KEY 到底哪个是 API key,好几个人栽在这;
和 Dify 集成时,“容器内 curl 能通,Dify 里配置了没报错也不工作”;
docker compose 的网络配置要同时挂 backend 和 default 两个网络,少一个都起不来;
某些版本的 Dify 调自部署版会"抓到了页面但不创建任务",同样的操作走云版就没问题;
教程作者后来补充:如果非要自部署,可以看看 WaterCrawl——这是个人观点,那个项目目前只有 2000 星左右,采用前自己评估。

还有一层法律账:AGPL-3.0 意味着你要是改了代码再对外提供网络服务,必须开源修改后的代码。个人学习无所谓,公司项目务必让法务过一眼。
四、结论:四条路,对号入座
只想试试水:直接走 keyless 或注册免费档,不部署不花钱。零成本验证它的 Markdown 输出质量合不合你的口味,一下午足够。
个人知识库、接 Dify 或 n8n、每月几百页:免费档大概率够。不够再考虑自部署社区版,但请预留半天到一天的排坑时间,且接受"不少网站爬不动"的现实。
生产环境、批量采集、动态页面多、反爬严:老老实实上云版,或者换下面的替代方案。为了省每月 16 到 83 美元去自部署,人力成本倒挂,而且社区版的能力天花板就在那。
硬核省钱派、愿意写代码维护:看看 Crawl4AI——7.9 万星、Apache-2.0 协议,库优先、完全免费,自己掌握一切。圈子里对两者的定位总结得很精辟:Firecrawl 是 API 优先,Crawl4AI 是库优先、可以白嫖。知乎这条路线分野,决定了你长期的成本结构。反爬特别严的站点,还可以关注 Scrapling。

五、就算你暂时不用,这两个新变化也值得盯
Firecrawl 这个 8 月刷屏,其实不是因为爬虫本身,而是两个新开源的东西:
anydoc:把 Word、PPT、Excel、RTF、EPUB 等 14 种格式统一转成干净的 Markdown,Rust 写的。官方 benchmark 跑了 100 个真实文档、对比 6 个主流工具,anydoc 单文档转换中位耗时 4.4 毫秒,LibreOffice 是 1129.5 毫秒,差出 250 多倍,质量评分也排第一。GitHub8 月 3 日上线,20 天近 1.8 万星,已经有 Claude Code 用户在拿它当 Agent Skill 用。注意它不处理扫描件 PDF。
pdf-inspector:自动判断 PDF 是扫描版还是文本版,决定走 OCR 还是直接提取,1.65 万星,和 anydoc 正好互补。知乎

加上 7300 星的官方 MCP Server,信号很清楚:这家公司已经不满足于做"爬虫",它在把网页和文档这两个"给 AI 喂数据的入口"一起吃下来。与此同时,2026 年反爬军备竞赛在升级,主流 AI 爬虫(Kadoa、Firecrawl、Crawl4AI、Scrapling)都开始内置多模态理解能力,网站侧的反制也在跟进。知乎这场拉锯会直接决定这类工具的长期可用性,值得持续观察。

最后提醒一句:工具再顺手,也要遵守目标站点的 robots.txt 和使用条款。数据合规这条线,不值得拿账号和信誉去试。