最近刷 GitHub 趋势榜,大概率绕不开 pdf-inspector。Firecrawl 团队 8 月初把它开源,首日拿到 1769 星。知乎 上线不到三天,星数就冲到了 10.2k。知乎 到 8 月中旬,B 站追踪视频里的数字已经是 14k。哔哩哔哩 同一周,团队还发了文档解析工具 anydoc,也是爆火。这个能火起来,靠的是 Firecrawl 给出的一个数字:大约 54% 的 PDF 根本不需要 OCR。
先说清楚它是什么:一个纯 Rust 写的 PDF 处理库,MIT 协议,Python、Node.js、Rust、命令行都能用,甚至能编译成 WASM 直接跑在浏览器里。知乎 但它的核心卖点不是"解析",是分拣。

传统流程是拿到 PDF 不管三七二十一直接丢给 OCR——省事,但慢,而且按页花钱。扫描件要 OCR,文字版也被陪着 OCR 了一遍。pdf-inspector 的思路反过来:先花 10~50 毫秒判断这份 PDF 是原生文字版、扫描版、图片型还是混合型,能直接提取文字的,本地转成 Markdown,官方说法是文字型 PDF 通常 200 毫秒内搞定,不上传、不调 API、不加载任何模型。GitHub 真的需要 OCR 的,它会精确标记到页。

页级路由是真正的省钱点。一份 100 页的报告,只有 3 页是扫描图,以前是整份 100 页过 OCR,现在只送那 3 页。按页计费买过 OCR 服务的人,自己能算出这笔账的量级。而且本地处理还附带一个好处:合同、财报这类敏感文档不用出内网。
当然,小红书评论区也有人说它"鸡肋"。小红书 问得最典型的是:"MinerU 不行吗?“有人只回了一个字:“慢”。这其实正好点出了两者的真实差异。MinerU 是上海 AI 实验室开源的重量级选手,今年 4 月时已有 59k 星。知乎 它走模型路线,扫描件、公式、复杂版面精度更高,但部署重、CPU 上跑得慢,本地跑对显卡有要求,知乎上现在还有人在问"有没有大佬成功在本地部署 MinerU”。知乎
而 pdf-inspector 的官方 benchmark 值得多看一眼:200 份 PDF 的语料上,它综合得分 0.875、阅读顺序 0.915、表格 0.814,都是第一,200 份文档总耗时 0.47 秒——同场的 pymupdf4llm 要 17.1 秒,markitdown 16.2 秒。小红书 但注意前提:这个对比只收录"不用模型"的轻量本地引擎,MinerU、Marker 这类模型派根本不在场。GitHub 所以网上说它"碾压 MinerU"是没道理的,两者更像上下游:pdf-inspector 是分拣员,MinerU 是精加工师傅。
三个坑,社区里都有人真实踩过,提前说:
第一,垃圾文本层不是都能识别。小红书有评论提醒:很多带文本层的 PDF 本身就是早年 OCR 生成的,文字错误率很高。小红书 pdf-inspector 能自动标记"字体编码损坏"的文件并建议回退 OCR,对中文 CID 字体的支持也专门做了,但"有文本层、文本却是错的"这类情况它兜不全。GitHub 对准确率要求高的文档,抽检不能省。
第二,扫描件仍然要 OCR,它省的是"判断"和"范围",不是 OCR 本身。好消息是 Python/Node 版内置了 PP-OCRv6 Small,可以只对标记出的页面在本地跑,不用买服务。GitHub 但扫描质量差的,还是得交给 MinerU VLM 模式或商业 OCR。

第三,公式还原、可编辑还原不在服务范围内。评论区有句话说得直接:根本问题不是能不能识别,而是就算识别了面对表格和公式,没法根据原格式还原为可编辑文档。小红书 pdf-inspector 输出的是喂给大模型的 Markdown,服务的是 RAG、知识库、Agent 管线这类场景,不是办公文档还原。
所以给三类人三个答案:
做 RAG、知识库,文档以电子版报告、论文、财报、合同为主的——值得上,而且适合当默认入口。文字型直接本地过,省下的是 OCR 费用、上传延迟和隐私顾虑,MIT 协议商用也踏实。
扫描件为主、或对精度有模型级要求的——它替代不了你的主力解析器,但可以让它先跑一遍分拣:54% 的文件直接本地结案,剩下的才进 MinerU 或 OCR,账单一样能瘦。
只是偶尔转两个 PDF 的——真不用装,在线工具够了。这个工具的甜区是"批量、管线化"处理文档的人。
上手成本很低:`pip install pdf-inspector` 或 `npm install @firecrawl/pdf-inspector`,两行代码拿到类型判断和 Markdown 输出,CLI 版 `cargo install pdf-inspector` 也行。GitHub

想继续看的,B 站搜"pdf-inspector",拆解和实测视频已经有一批;官方 benchmark 的完整配置和结果放在 opendataloader-bench 的可复现分支里,不服可以自己去跑一遍。
顺带一提:8 月第一周 Firecrawl 连发 anydoc 和 pdf-inspector 两个文档处理工具。知乎 加上之前的 fireplexity、OpenLovable,这家做网页抓取起家的公司正在把"AI 数据入口"上下游一个个开源掉。微博 这个节奏值得长期盯着。