7月24日,Tesseract 悄悄发布了 5.5.3 版本。到今天正好满月,我翻了翻这一个月的社区讨论,发现一个挺有意思的反差:一边是 GitHub 上 7 万多星的老牌 OCR 引擎照常更新。知乎另一边是知乎、B站上到处都在讨论"现在做文字识别,还该不该用 Tesseract"。
今天就把这事掰扯清楚:5.5.3 到底更新了什么、Tesseract 现在处于什么状态、以及最关键的——哪些场景它依然是最优选,哪些场景你该换工具了。
先看 5.5.3 更新了什么:别期待识别率提升
先给期待"新版本识别更准"的朋友泼盆冷水。我看了官方 release note,5.5.3 的更新清单是这样的:修复多页 PAGE XML 输出缺失闭合标签的问题、修复 Apple 交叉编译时 CMake 的问题、Windows 安装包新增葡萄牙语支持、修复多实例互斥、文档和 CI 依赖更新……

全是维护性工作,没有一条涉及识别模型或精度。GitHub再往前翻版本记录就更清楚了:5.5.0 是 2024 年 11 月发的,之后 5.5.1(2025年5月)、5.5.2(2025年12月)、5.5.3(2026年7月),基本保持半年到一年一个维护版本的节奏,内容也都是修 bug、改构建、更新依赖。这说明什么?Tesseract 作为引擎本身已经进入了成熟稳定期。它不会突然哪天官方宣布"中文识别率大幅提升"——从 4.0 引入 LSTM 神经网络引擎之后,大的架构演进就停在这里了。知乎想靠等官方更新来解决识别率问题,方向就错了。
社区在吵什么:中文识别率这个老话题
翻最近几个月的讨论,绕不开的还是那个经典话题:Tesseract 的中文识别。
知乎上最近几个高热度 OCR 问题下,多个回答反复表达同一个观点:这几年 OCR 发展太快,传统方案比如 Tesseract 在中文场景下表现一直不太理想,商业 API 又贵又不灵活。知乎今年 7 月底还有一篇 64 赞的实践帖很典型,作者说自己折腾 Tesseract 识别率只有 35%,被评论区点醒后改用多模态 AI 方案,干到了 95% 以上。知乎更有意思的是,已经有线上工具开始"去 Tesseract 化"。6 月份笔记软件 NoteGen 发布 v0.30.0,直接把 Tesseract 移除了,安装包瘦到 17.9MB,识别还更快了。哔哩哔哩说句公道话:这个"传统方案中文不理想"的说法最近在多个 OCR 问题下反复出现,其中不乏疑似同质化的推广回答,看的时候要留个心眼。但它指向的痛点是真实的——中文复杂场景下 Tesseract 开箱即用的体验确实一般,这一点被多个独立实践帖交叉验证过。
但先别急着下"过时了"的结论,另一边的信号同样真实:8 月初还有人专门写 SpringBoot + Tesseract 的发票识别流水线实践,6 月底还有 Tesseract LSTM 自定义训练的详细教程,至于 B站上"10分钟学会 Tesseract""安装配置全流程"这类教程,播放量几千到上万的一直都在更新。

所以真实情况不是"该不该用",而是"在哪用"。
一张表说清楚:什么场景用什么
这是我替大家梳理的重点。结合社区实践帖、对比讨论和这一个月的版本信息,不同需求对应的选择其实很清晰:
继续用 Tesseract 的场景
给 PDF 批量加可搜索文字层:ocrmypdf 这类工具底层就是 Tesseract,这条链路依然是事实标准,目前没有更好的开源替代。知乎
服务器端/嵌入式/低配机器的离线识别:体积小、C++ 写的、跨平台、不依赖深度学习运行时,Apache 2.0 协议商用无忧。这种"轻量到哪儿都能跑"的特性,新引擎反而做不到。
英文、代码、简单排版:LSTM 引擎对这些场景够用,别小看老家伙。
建议换工具的场景
中文印刷体、扫描件、截图识字:优先考虑 PaddleOCR 或它的 ONNX 移植版 RapidOCR,这也是最近对比讨论里出镜率最高的两个名字。知乎
图文混排、表格、公式、复杂版式的文档:这是传统 OCR 的弱项,社区实践普遍转向专门的文档解析工具(比如最近知乎讨论里出现的 MonkeyOCR,以及做 PDF 提取的 MinerU),或者干脆上多模态大模型。
手写体、艺术字、低质量照片:有用户实测从 35% 提到 95%+ 的路径就是换多模态 AI,这类场景训练 Tesseract 的性价比很低。

两个避坑提醒
第一,别一上来就走"自定义训练"路线。识别率低先检查这三件事:装没装 chi_sim 中文语言包、预处理(去噪、转正、二值化)做没做、PSM 页面分割模式选没选对。这三步能解决大部分问题,解决不了再考虑换工具,而不是花一周训练。
第二,别拿社区里的单一测试当绝对结论。比如那篇 35%→95% 的实践,样本是艺术字加大幅插画背景,本来就是 Tesseract 最难的场景,换个场景结论可能就反过来了。知乎选工具前,拿自己的真实样本跑一遍,比看十篇评测都管用。
写在最后
Tesseract 不是不行了,而是退居到了它最擅长的位置:轻量、离线、可嵌入、PDF 数字化基建。如果你是照着教程刚装好它、正在被中文识别率折磨的值友,先别怀疑自己的安装姿势——大概率是工具选错了场景。
接下来值得持续留意的信号:一是 Tesseract 会不会出 6.0 级别的大版本(按目前维护节奏看,短期概率不大);二是国产开源方案在中文场景的迭代速度,今年明显是这条线在领跑。有最新进展我会再来同步。
你平时用什么工具做文字识别?欢迎评论区聊聊你的场景和选择。