估计不少人都有过这种时刻:拿到一份扫描版 PDF,想复制一段话,鼠标划过去全是图片;手机扫描软件刚弹出"开通会员即可导出",你就开始搜"免费 OCR"。然后,几乎所有答案都会把你带到同一个名字面前——Tesseract。
但最近如果你常刷知乎和小红书,会发现气氛有点微妙。今年 3 月,百度系的 PaddleOCR 在 GitHub 上的 Star 数正式反超 Tesseract,成了 Star 数第一的 OCR 项目。小红书7 月底,一位在做老杂志数字化的博主写了篇实测帖,他花了一周给 Tesseract 做版面切割、调参数矩阵,识别率只从 35% 爬到 55%,后来换用 AI 文档解析工具,直接干到 95% 以上。知乎
一边是"开源 OCR 默认答案",一边是"被后浪拍在沙滩上"。Tesseract 到底还行不行?我把知乎、小红书、B站近两个月的讨论翻了一遍,今天把这个判断说清楚。

先把事实摆正:Tesseract 是什么段位
先给不熟悉的朋友三句话交代背景。Tesseract 1985 年起源于惠普实验室,2005 年开源,2006 到 2017 年由 Google 接手维护,之后交回社区。知乎目前 GitHub 上有超过 7.4 万 Star,是 OCR 领域 Star 数最高的项目之一。知乎Apache 2.0 协议,商用没有任何限制。

它的硬实力很明确:支持 100 多种语言,从中文到阿拉伯文都覆盖;输入 PNG、JPEG、TIFF,输出纯文本、hOCR、带文字层的 PDF、TSV、ALTO 等多种格式;本体是命令行工具加 C/C++ 库,没有官方图形界面,官方也不打算做,GUI 和 Python、Java、Node.js 等各语言封装都由第三方社区项目补齐。
再看一个容易被忽略的事实:在今年 6 月知乎"PDF OCR 最佳实践"的讨论里,一位做 AI agent 工具的开发者分享了他的生产管线——读 PDF 文本层、渲染页面、本地识别,其中 Tesseract 依然是默认本地 OCR 引擎,另一个国产引擎 RapidOCR 只作为小字和密集中文表格的兜底。知乎也就是说,在真正干活的人手里,Tesseract 没有被卸载,它只是从"唯一答案"变成了"默认底座之一"。
那为什么大家都在劝退?三个真实痛点
劝退声不是空穴来风,集中在三个地方。
第一,中文场景一直不算强项。知乎上"有没有识别准确率高的 OCR"这类问题下,一个回答的原话是:传统方案(比如 Tesseract)在中文场景下表现一直不太理想,而商业 API 又贵又不灵活。知乎这不是新话题,是社区憋了很多年的共识。
第二,它"认字"但不"懂版面"。遇到杂志多栏排版、图文混排、表格,Tesseract 会把不同栏的内容搅在一起。前面提到的那位博主,为了识别一本四栏排版的科幻杂志,自己写算法把页面横切竖 cut 分成四块再逐块识别,又叠加区域检测和二十多种参数组合,一周下来正文识别率也只到 55%,大幅插画页至今无解。他在帖子里写了句话,我觉得是全文最有价值的一句:有些东西不是参数能救的。知乎
第三,低质量扫描件要先做一堆预处理。歪斜、中缝变形、水印遮挡,都得自己先修图再识别,而修图本身又会引入新的误差。新一代 AI 解析工具则是直接喂原稿,模型自己看懂页面结构,这一步省掉了。知乎

关键结论:不是 Tesseract 不行了,是"场景分家"了
翻完这些讨论,我的判断是:2026 年选免费 OCR,问题已经不是"用不用 Tesseract",而是"你这个场景该用哪一类"。把全网讨论沉淀下来的共识整理成下面这张表:
你的场景 | 更合适的方向 | 原因 |
|---|---|---|
偶尔截个图提取文字 | Umi-OCR 等免费开源桌面工具 | 离线运行、解压即用、有图形界面,全程不上传服务器 |
批量扫描版 PDF 转文字、做可搜索文档 | RapidOCR、PaddleOCR 系工具,或 Umi-OCR 这类带批量功能的免费桌面工具 | 中文识别是这一代引擎的强项,3 月 Star 数登顶也说明社区用脚投了票 |
老书、老杂志、多栏排版、图表密集 | MinerU、olmOCR 这类 AI 文档解析 | 核心是版面理解,不是认字;95% 的识别率差距就是这么拉开的 |
英文或小语种、嵌入自动化流程、服务器跑批 | Tesseract | 100+ 语言、轻量、不依赖 GPU、Apache 2.0 商用自由,这些仍是它的独门优势 |
合同、票据、证件等敏感材料 | 上面任何一条的本地离线方案 | 隐私场景优先本地,别图省事上传在线 OCR |

几个补充判断:
如果你只是想解决"扫描件不能复制"这一个痛点,大概率连 Tesseract 的安装包都不用碰——Umi-OCR 这类工具下载解压就能用,识别全程在本地,免费版对普通用户完全够用。知乎这是目前知乎和 B站教程类内容里出镜率最高的路线。
如果你要处理的是书籍、期刊这种"有版面的东西",别再跟 Tesseract 的参数较劲了。那位博主的复盘里有个观点很清醒:AI 时代,换模型的成本远低于在旧模型上继续优化的成本。知乎他换工具之后,校对工作从"逐字纠错"降级成"抽检核验",人工成本反而降了。
反过来,如果你的需求是英文文档、多语言混排,或者要嵌到自己的程序里跑自动化,Tesseract 依然是很能打的选择——轻量、稳定、四十年验证、零费用,这也是为什么生产管线里它还坐在默认引擎的位置上。
最后算一笔值不值的账
从"什么值得买"的角度,这笔账其实很直白:
商业路线:扫描类 App 会员按年收费,商业 OCR API 按调用次数计费,量大了一笔不小的开支,优势是省心。
开源路线:一分钱不花。真正的成本是时间——而时间成本的大头不在安装配置,在识别后的校对。这也是为什么我的建议是按场景选工具:选错了工具,省下的软件钱会加倍赔进校对时间里;选对了,免费方案的产出质量已经和付费软件没有体感差距。
Tesseract 这四十年的老项目,没有被淘汰,只是回到了它最擅长的那个位置。要不要装它,先看上面那张表里你站在哪一格。
接下来可以持续观察两个信号:一是 PaddleOCR 和 Tesseract 的 Star 差距会不会继续拉大,这基本代表社区对两代技术路线的投票;二是 MinerU、olmOCR 这类 AI 文档解析工具的版本迭代,它们现在的更新节奏很快,隔几个月值得重新看一眼。有新变化我们再跟进。