最近盯文档解析这块的人,大概都有同一种感觉:榜单上的冠军,快不够用了。
今年7月,阿里的OvisOCR2宣称以96.58分拿下OmniDocBench v1.6文档解析榜第一。知乎没过多久,百度发布PaddleOCR-VL-1.6,在同一榜单上拿到96.33分。而就在昨天,中国电信的NaviDC-OCR把分数刷到96.87,真正坐上了榜首。知乎

再看一眼最新排名:NaviDC-OCR第一、OvisOCR2第二、PaddleOCR-VL-1.6第三、MinerU2.5-Pro第四,前四名分差不到1.2分,每家的宣传稿却都把自己写成了唯一的赢家。顺带一提,PaddleOCR并不是突然冒出来的新面孔:早在今年3月底,它就登顶了GitHub全球OCR项目榜,把谷歌Tesseract拉下了霸榜近40年的位置。微博
可另一边,打开B站任意一条文档解析对比视频,点赞最高的评论往往是一句不带任何数据的话——“省流:用MinerU”。哔哩哔哩
一边是几家大厂轮流晒跑分,一边是评论区一句朴素到极致的结论。只是想把手里的扫描版PDF变成能用的文字,到底该听谁?我翻了最近知乎、B站、小红书上的讨论,又挖了几个热门整合包的评论区,把下载之前必须搞懂的三件事整理给你。
真相一:MinerU跑的,其实是百度的引擎
8月中旬,MinerU更新到3.4版本,更新公告写得很直白:这一版底层换上了百度的PP-OCRv6模型,整体识别准确率比旧版提升11%,解析速度直接翻倍。知乎
也就是说,这场看起来势同水火的阵营战,其实是同一台引擎上的两种改装。PP-OCRv6是百度今年开源的新一代轻量OCR引擎,用它的不只MinerU:有工业团队把它通过TensorRT部署到GPU,400张生产样图实测,稳态推理单张只要40毫秒左右。知乎Java生态里有人把它封装成一行代码就能接入的组件,还有人把它塞进香橙派这类边缘开发板。所以更准确的说法是:PaddleOCR阵营提供引擎,MinerU阵营是这套引擎上最成熟的整车之一。识别底座是同一套,真正拉开差距的是交付方式、默认配置和上手门槛。
这么看,“省流:用MinerU”不算说错——对不想碰命令行的普通人,它开箱体验更顺、CPU路线更成熟。但这也不是“PaddleOCR输了”,百度的引擎只是以另一种方式赢了。
真相二:别问谁跑分高,先问你的电脑跑不跑得动
跑分和易用性之间的鸿沟,在硬件这一关最明显。B站最火的PaddleOCR-VL-1.6整合包,评论区基本成了报错交流现场:
有GTX 1660用户问能不能跑,UP主直接回复:“1660 显卡用不了”。哔哩哔哩这类整合包走vLLM推理,对显存和算力有硬性要求,还有人卡在vLLM服务300秒未就绪的超时报错上。
有人问“只有cpu可不可以运行?慢点没事”,底下给出的方案很干脆:换MinerU的整合包,这个支持cpu。
Windows上还有一个典型坑:解压目录路径太深、文件夹名太长,会直接报缓存写入错误。评论区有人支招:把目录挪到D盘根目录、改名成PaddleOCR,就加载成功了。
VL-1.6是个0.9B的视觉语言模型,榜单成绩是在合适的算力上跑出来的;落到一台老显卡或集显机器上,等你的可能只有满屏超时。刚登顶的NaviDC-OCR也一样,这类榜单模型主要面向有GPU资源的团队。所以选工具的第一问从来不是“哪个准”,而是“我的显卡是什么水平”。
真相三:转出来干嘛,决定你走哪条路
第二个问题:你转PDF是为了什么?两种目的对应两条完全不同的路。
喂AI、搭知识库、做记忆卡。 这是目前最热的用法。小红书上“codex加paddleocr,把pdf文档变知识库”的笔记能拿到几百个收藏。小红书知乎上有人把扫描版肖1000习题册转成markdown,拆成了1147张Anki卡片。知乎

作者最后那句总结值得抄下来:转换只是入口,决定成败的是质检设计。这条路的产出物是结构化markdown,标题、表格、阅读顺序都得对。社区里踩的坑也很集中:有人把PDF传进知识库,系统不报错,切分数量却是0。知乎正确的姿势是先探一下PDF有没有文本层:能直接提取就别浪费OCR;纯扫描件走通用识别;遇到表格、公式、双栏,再开完整排版解析,最后切块入库。不然跑一整晚,检索照样抓瞎。

转成可编辑的Word、Excel。 如果是为了办公编辑,预期要放低。还是那个整合包的评论区,有人想把几百页pdf表格导出excel,得到的回复只有两个字:不能。哔哩哔哩Word导出可以用,但也有公式导出后显示异常的反馈。现阶段免费开源方案还不是几百页表格文档的一键方案,人工核对的环节请留出来。
三个问题,替你做决定
显卡是什么?近几年的N卡、显存够,可以试VL-1.6这类VLM整合包或MinerU的混合模式;老卡、集显、纯CPU,从MinerU的CPU路线或PP-OCRv6轻量路线起步。
要什么输出?喂AI、搭知识库,优先能出结构化markdown的;要Word、Excel,免费工具目前是“能用,但得人工核对”。
文件涉不涉密?这些开源方案都支持完全本地跑,文档不出自己的机器,这是对在线转换网站最大的优势。实在不想装,PaddleOCR官网有免费解析额度,每日免费页数已经从1万提升到2万。微博先拿真实文件试一遍,比看十篇评测都管用。
两个值得盯的方向,别只盯榜单
一是速度。百度开源的HPD-Parsing,把1B文档解析模型的解码步数最高压缩18倍,宣称解析效率提升3倍。知乎它的出发点是个反直觉的发现:文档解析模型真正慢的地方,不在“看”,而在“写”。

二是垂直化。MinerU这边,用扩散解码、宣称提速3.2倍的MinerU-Diffusion已经发布。知乎专攻化学文献的MinerU.Chem也出了技术报告。知乎新王NaviDC-OCR则主打弯曲、褶皱的拍照文档场景。一套模型吃下所有文档的时代,正在过去。
下次再有人问“PaddleOCR和MinerU选哪个”,把这三句甩给他:先看显卡,再看要导什么格式,最后看文件能不能上云。榜单冠军每周都可能换人,只有在你电脑上跑得动、导得出你要格式的那个,才是真的你的。