别再让编程 Agent 满网搜文档:Firecrawl 开放 7000 万份代码工件,免 Key 上手,和 Context7 的分工一次说清

源自11位全网作者

15:06

如果你每天都在用 Claude Code、Codex 或者 Gemini CLI 写代码,不妨想一个问题:你的 agent 联网,到底在搜什么?

Firecrawl 翻了自己平台的工具调用数据,答案集中在三样东西:能实现某个想法的仓库、能回答某个问题的文档页,以及修复了某个 bug 的 issue 或 PR。问题在于,这三样东西散落在 GitHub、文档站和论坛里,而通用网页搜索是给"人"设计的:词法匹配、结果不全,agent 搜完还得再抓一遍。Firecrawl 自己也承认,连它家的通用搜索和抓取,对这类查询的效果都不理想——因为 coding agent 要的不是"网页",是"工件"。Firecrawl官方博客

上周四(8 月 20 日),Firecrawl 就给 coding agent 专门开了一个索引:Developer Index。Firecrawl官方博客

索引的不是"网页",是 7000 万份工件

先看库里有什么:超过 7000 万份"代码工件",覆盖 README、外部文档站(Stripe 这一类)、GitHub issue 和 PR(含关联工件)、OpenAPI 规范,甚至流行的 agent skill 文件,大部分源每天刷新。Firecrawl官方博客

检索是语义搜索而不是关键词匹配,每条结果带稳定 ID(doc:、readme:、issue:owner/repo#123 这种),还能按仓库、语言、许可证、最低 star 数过滤;返回的不是链接列表,而是匹配到的 Markdown 原文片段,表格和代码块都不会乱,agent 拿到就能用,不用再抓第二遍。Firecrawl官方博客

入口有两个:专用端点 /search/developer,或者在普通 /search 里加 categories: [“developer”];计费与搜索一致,每 10 条结果 2 个 credits。Firecrawl定价页官方也把边界说得很清楚:它不存储代码本体,想要完整代码还得自己去 GitHub 拉,它也不是通用搜索引擎。Firecrawl官方博客

别再让编程 Agent 满网搜文档:Firecrawl 开放 7000 万份代码工件,免 Key 上手,和 Context7 的分工一次说清

在国内社区,把 Firecrawl 当编程助手"联网技能"用早就不是新鲜事:知乎上百万阅读量的 Codex 技巧回答里,作者常备的几个技能就有"用于联网搜索的 Firecrawl"和"用于获取最新技术文档的 Context7"。知乎上图就是官方教程里的真实场景:Claude Code 调用本地 Firecrawl 技能,直接从 arXiv 论文页面里解析出模型架构细节。而 Developer Index 的价值,是把"满网乱搜"这一步,升级成"在专门为编程整理过的索引里搜"。

最值钱的是 issue 和 PR,这正好是和 Context7 的分工

如果你已经装了 Context7——Upstash 家 6 万多 star 的项目,定位是"给大模型和 AI 代码编辑器提供最新代码文档"——第一反应可能是:这俩是不是重复了?GitHub不重复,分工其实很清楚。Developer Index 的 7000 万份工件里,README 和文档只是基本盘,真正的差异化是 issue 和 PR:谁踩过这个坑、报错长什么样、最后怎么修的。coding agent 调 bug 时,最有效的参考往往不是官方 API 文档,而是别人犯过同样错误的那个 issue。

从 Firecrawl 自己披露的客户结构,也能看出这个索引为什么重要:主力用户之一,是替终端用户做后端调试的 agentic 产品,Lovable、Replit、Bolt 都被点名。Firecrawl官方博客另外两类,是把内外部仓库缝成统一检索层的知识库团队,以及需要开放开发者数据做训练和评估的前沿实验室。

随索引一起发布的 DevDex 基准,把这个分工说得更直白:在 1179 条开发者搜索查询上,Developer Index 以 Recall@10 0.63 排第一,通用网页搜索只有 0.45,而 Context7 是 0.17。Firecrawl官方博客

别再让编程 Agent 满网搜文档:Firecrawl 开放 7000 万份代码工件,免 Key 上手,和 Context7 的分工一次说清

再看分赛道明细,结论更扎实:Developer Index 在"找仓库"和"找 issue/PR"两条赛道上拿到 0.76 和 0.66,文档赛道只有 0.47;官方脚注甚至写明,在文档赛道上它和 Context7 只差 0.006,完全落在 95% 置信区间内。查 API 用法这种"版本文档"问题,两者基本打平;查"这个错别人怎么修的"这种经验问题,Developer Index 优势明显。

别再让编程 Agent 满网搜文档:Firecrawl 开放 7000 万份代码工件,免 Key 上手,和 Context7 的分工一次说清

所以选型可以一句话:Context7 管"这个库的 API 怎么用",Developer Index 管"这个报错别人怎么解决的",两个一起装,不用二选一。

免 API Key,免费额度够个人开发者试水

接入门槛是这类工具里少见的低:/scrape、/search、/interact、/parse 这些核心端点,不用注册、不用申请 API Key,官方 MCP、CLI 和 SDK 客户端可以直接用。这个"免 Key"能力在 6 月中的 v2.11.0 就已上线,Developer Index 从发布第一天就沿用,想跑更高频率,才需要注册配 Key。GitHub

再算一笔账。官方定价页(截至 8 月 27 日)免费档每月 1000 个 credits,不要信用卡;开发者搜索按每 10 条结果 2 个 credits 计费,1000 credits 大约能搜 500 次,日常写代码够用了。Firecrawl定价页付费档:Hobby 16 美元/月(年付)5000 页,Standard 83 美元/月 10 万页,Growth 333 美元/月 50 万页——除非跑规模化流水线,基本碰不到。

还有个隐藏福利值得单独说:如果你的 agent 要查论文,随 v2.11.0 上线的 Research Index 在 8 月 13 日已经全部免费。Firecrawl官方博客这个免费索引的规模不小:仅生命科学领域就收录 4100 多万篇论文,官方评测称检索 recall@10 达 90%;在此之上还收录了 300 多万篇 arXiv 论文及其背后的 GitHub 代码。GitHub

别再让编程 Agent 满网搜文档:Firecrawl 开放 7000 万份代码工件,免 Key 上手,和 Context7 的分工一次说清

怎么装:一行命令

官方给了专门的 developer skill,一行命令接入 Firecrawl CLI 或 MCP 服务器。Firecrawl官方博客

```
npx -y firecrawl-cli@latest setup developer-index
```

装好后,在 Claude Code 的 /skills 列表里能看到它,单个技能大约 489 tokens,负担很小。另一个容易被忽略的细节:SKILL.md 是通用格式,同一个技能文件可以跨 Claude Code、Claude.ai 网页版、Claude API 以及 Codex CLI、Gemini CLI 这些编程 agent 运行,装一次全都有。Firecrawl官方博客

别再让编程 Agent 满网搜文档:Firecrawl 开放 7000 万份代码工件,免 Key 上手,和 Context7 的分工一次说清

想直接调 API 的话,一行 curl 就行:`https://api.firecrawl.dev/v2/search/developer?query=how do I configure retries&k=10`。还有个值得品味的设计:类型、仓库、最低 star 数这些过滤器只开放给 API,CLI 和 MCP 刻意不暴露,官方解释是 agent 不带过滤器表现更好。Firecrawl官方博客给 agent 的选项比给人的少,这个思路值得琢磨。

几句避坑提醒,先说在前面

第一,数字是单方成绩。DevDex 的 1179 条查询用同一个 Claude Opus agent、每组只配一个搜索工具评出来,基准的裁判和选手是同一家公司,前文的 0.63、0.17 也都出自官方图表,当参考可以,别当结论,等第三方复现再全信。之前"Research Index 召回率领先第二名 18%"的说法,同样是官方口径。GitHub

第二,免 Key 不等于无限量。免 Key 访问的速率限制偏低,免费档只有 2 个并发请求,真要跑批量任务还是得注册配 Key、花 credits。Firecrawl定价页社区对"按量计费"的吐槽也不是没有来由:云端搜索服务成熟归成熟,共同特征是按查询计费、数据出境、需要注册账号,这正是 wigolo 这类本地开源方案出现的原因。知乎

第三,数据要出境。它终究是云服务,项目里涉及内部代码或敏感信息时,把查询发出去之前想清楚合规问题。铁了心要本地化的话,知乎用户已经替你算过账:crawl4ai 这种库优先的方案可以白嫖,但自建 Firecrawl 全家桶,有人实测要 8 台云主机、80 核 100G 内存,部分组件还得放在海外机器上才跑得顺,家用机器就别轻易尝试了。知乎知乎

第四,不含代码本体,也还在早期。索引只收工件,完整代码还得自己去 GitHub 拉;而且 Developer Index 发布一周,Hacker News 上几乎搜不到相关讨论,还在尝鲜期,进生产流水线之前建议多观察一阵。

谁该装,怎么装

日常用 Claude Code / Codex 的个人开发者:装上 developer skill,用免 Key 模式跑一周,看 agent"找文档"的调用频率和失败率有没有下降。免费 1000 credits 足够得出结论,不够再去注册配 Key。

团队已经在用 Context7 的:不用卸载。按问题类型分工——issue 和 PR 的经验知识是 Developer Index 的长板,版本精确的文档片段仍是 Context7 的地盘。

成本敏感或要求纯本地的:先把"免 Key + 免费 credits + 全免费 Research Index"这套组合用满,自建方案算清机器成本和运维精力再决定。

接下来值得盯三个信号:DevDex 有没有第三方复现;DeepSeek Harness、Gemini CLI 这些生态什么时候默认接这个索引;免 Key 白名单(目前是 /scrape、/search、/interact、/parse 四个端点)会不会继续扩大。

Firecrawl 主仓库已经 17.2 万 star,官网自我介绍早就从"网页爬虫"换成了"context API"。GitHub从 anydoc、pdf-inspector 到 Developer Index,它做的其实是同一件事:把全网散落的信息,预处理成 agent 拿来即用的"上下文"。今天装不装随你,但这个方向值得看懂——半年后你的 agent 工具调用列表长什么样,可能现在就被决定了。

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章