知乎上有个被问了好几年的问题:“有一说一,真有人用 paddlepaddle(飞桨)吗?”
评论区最常见的回答是:"很早之前用 paddle 跑目标检测,现在好久没用了。"深度学习框架这条战线,PyTorch 早就赢了,没什么悬念。
但 2026 年,这个问题的答案悄悄变了。飞桨手里最能打的牌,不再是框架本身,而是从它生态里长出来的 PaddleOCR——以及它背后整条文档解析战线。
先把结论放这儿:这个夏天,文档解析这个听起来不起眼的赛道,已经打成了开源圈最凶的战场。飞桨一个月连开三枪,四个方向的对手围了上来,甚至"友军"也在抢地盘。如果你正在搭 RAG 知识库、做公司文档数字化,或者就想找个趁手的 PDF 转 Markdown 工具,这一仗跟你直接相关。
一个月三枪:飞桨把子弹全打出去了
先把时间线摆出来,信息密度有点高:
6 月初,PaddleOCR-VL-1.6 发布。这是一个只有 0.9B 参数的文档视觉语言模型,在权威评测 OmniDocBench v1.6 上拿到 Overall 96.33%,把上一代的 92.86% 又往上推了一截,压过了 MinerU 2.5-Pro、dots.ocr、GLM-OCR 一众对手。知乎而且这一代不靠堆参数,核心思路是找出模型"还没学扎实"的局部区域做针对性精修,古籍、生僻字、印章、图表这些老大难场景都有明显提升。知乎

6 月 11 日,PaddleOCR 主版本 v3.7.0 上线。截至 2026 年初,PaddleOCR 在 GitHub 上的 Star 数已超过 7.33 万,是平台上星标最高的 OCR 项目。
6 月 22 日,百度又开源了 Unlimited-OCR:总参数 30 亿、推理时只激活 5.7 亿的长文档解析模型,发布 5 天 Star 破万,GitHub 和 HuggingFace 四个榜单全部登顶。它最狠的一点是用 R-SWA 机制把 KV Cache 从线性增长压成常数——传统模型越生成越慢、越吃显存,它能在 32K 长度限制下一次前向就转录几十页文档,专治财报、合同、整本书这种超长文档。知乎
还没完。7 月 23 日,PaddleOCR 团队放出 HPD-Parsing(层级并行文档解析)论文。这篇论文捅破了一层窗户纸:文档解析模型真正慢的地方不在"看",而在"写"——视觉编码几十毫秒就完了,但模型得一个字一个字把结果"抄写"出来,长文档下解码耗时能接近视觉编码的 500 倍。HPD-Parsing 把整页拆成层级结构并行生成,在 512 并发测试里吞吐做到基线的 2.6 倍以上,以 1B 参数在端到端统一模型里拿到 94.91 的新 SOTA。知乎

一个月,三发主炮加一发技术预告。这不是常规迭代,这是清库存式地秀肌肉。
围上来的四个对手
飞桨这么急,因为王座底下全是人。
最直接的对手是 MinerU,上海人工智能实验室 OpenDataLab 团队的开源文档解析引擎。社区里有个很有意思的现象:很多人实测后觉得"MinerU 在工程上真的比 PaddleOCR 做得好",但也有人在评论区指出,看源码的话,MinerU pipeline 模式用的模型大部分是 Paddle 的。这两个说法其实不矛盾——PaddleOCR 开源的更偏模型本身能力,MinerU 在业务层做了端到端的纠偏、规则过滤和结果增强。换句话说,飞桨的模型在给对手"供血",这既是排面,也是危机:用户记住的是 MinerU 的牌子。
另外三路:DeepSeek-OCR2 和智谱 GLM-OCR 轮番刷屏,7 月的评测横评里已经是和 PaddleOCR 并列的热门选手。知乎腾讯混元 7 月中旬发布 HyOCR-1.5,主打推理提速 6.37 倍——但发布页只给速度表、没给识别精度基准,社区对此并不买账,觉得"看起来对识别能力不太自信"。知乎

连百度自己都在"左右互搏":Unlimited-OCR 和 PaddleOCR 一个管长、一个管广,定位互补,但用户的注意力和 Star 是要被分走的。
抢的不是 OCR,是 AI 时代的数据入口
为什么所有大厂都盯着"把文档变成结构化文本"这点事?
因为你喂给 AI 的数据质量,上限就卡在解析这一步。RAG 知识库里塞着扫描版 PDF,检索结果就是空的;双栏论文被拼成"左一行右一行",表格变成一堆乱序数字——这些都是最近开发者在社区里集中吐槽的真实痛点。大模型训练要的高质量语料,同样得先过文档解析这一关。谁掌握入口,谁就掌握数据质量的地基。
商业上这条战线也在兑现:8 月 18 日百度发布的 2026 年 Q2 财报显示,AI 业务收入占比达到 50%、连续两个季度过半,其中 GPU 云收入同比增长 283%、连续四个季度三位数增长。飞桨和文心是这套 AI 业务的技术底座,而 PaddleOCR 是目前开源世界里把这套底座"送进千万开发者电脑"的最成功单品。
这也解释了为什么飞桨愿意把 0.9B 的小模型、长文档方案、并行解码论文全掏出来——入口之争,输不起。
社区真实声音:效果是真的好,部署是真的痛
光看跑分没意思,社区里的实测声音更值得听。
看好的一边:有用户说自己笔记本 4060、8G 显存就能跑 PaddleOCR-VL,“效果真心不错”;还有人用十年前的泰坦 1080 跑量化版,“速度也能保证”;不想折腾的人直接用飞桨网页版,“识别了几十页资料,准确度非常高,比很多大模型都好,关键是不用登录不用安装还免费”。
吐槽的一边同样真实:4090 机器处理复杂页面要将近 30 秒;网页版公式错误率还是挺高,而且上传下载只给 md 文件,“很麻烦”。高赞回答的最后一句更是扎心:部署 paddle 是一个痛苦的过程。知乎
这里面藏着一个对普通用户很重要的判断:PaddleOCR 的模型能力已经没什么可挑的,真正的体验差距在部署链路和工程化封装上。所以你会看到各种"懒人整合包"、Windows/麒麟系统部署教程在知乎上层出不穷——社区在用脚投票,也在自己动手补官方没补完的课。
四条路线,按你的情况对号入座
结合跑分、实测反馈和部署成本,给不同情况的人一个选择框架:
第一,不想安装、偶尔用一次:直接用飞桨社区网页版。免费、不用登录,普通文档准确度在线;但公式和复杂版面别指望,上传下载的流程也偏繁琐。适合处理发票、截图、普通扫描件。
第二,个人电脑本地跑、显存 8G 以上:优先 PaddleOCR-VL-1.6 本地部署。4060 级别就能跑,效果目前是第一梯队;老显卡可以找量化版。代价是环境配置要花点时间,这是社区公认的痛点,建议直接找近期的高赞部署教程或整合包,别硬啃官方文档从零配。
第三,几十页以上的长文档、批量处理:看 Unlimited-OCR。KV Cache 恒定意味着处理长文档不爆显存、不越跑越慢,财报、合同、书籍整本转录是它的舒适区。注意它发布时间短,生态和教程还不如 PaddleOCR 厚。
第四,要接入生产管线、要完整的 RAG 流程:MinerU 值得认真考虑。它的工程封装和社区口碑目前最好,虽然底层很多模型就是 Paddle 的,但开箱体验确实省心。如果你的文档表格特别多,还可以对比测试 PP-StructureV3 的版面还原效果。
三条提醒:一是上面的跑分都是各家自报的,榜单之间测试口径还有差异,切换工具前务必拿 100 页自己的真实文档跑一遍对比,你的文档类型才是唯一裁判;二是 HPD-Parsing 目前还是论文加开源代码阶段,没进主版本,等它落地再考虑用它做高并发服务;三是这条赛道半年内不会停,别为了"最优解"把项目卡死,先用起来、留好切换余地。

接下来值得盯的三个信号
一是 HPD-Parsing 什么时候并进 PaddleOCR 主线——如果落地,长文档批量解析的速度会有量级变化;二是 DeepSeek-OCR2 和 PaddleOCR-VL-1.6 的第三方横评什么时候出,官方榜单之外需要独立数据;三是 Unlimited-OCR 的社区生态能不能跟上,5 天破万 Star 的热度能不能变成持续的教程、工具和 issue 响应。
飞桨这个故事最耐人寻味的地方在于:它没有赢下框架战争,却可能赢下数据入口战争。对普通用户来说这反而是好事——大厂在入口上卷得越凶,我们能白嫖到的工具就越强。
你现在在用哪个解析工具?评论区聊聊你的文档类型和踩过的坑。