张大妈

DeepSeek 发了 OCR-2,但还是没能打过它,OCR领域的神!

源自公众号:甲木未来派

01-30 10:26

在大模型时代,OCR技术重新站上舞台中央。百度新发布的PaddleOCR-VL-1.5以仅0.9B参数量,在全球权威文档解析评测榜单OmniDocBench V1.5中取得94.5%综合精度,超越DeepSeek-OCR2等大模型,重新定义了文档解析的技术边界。

DeepSeek 发了 OCR-2,但还是没能打过它,OCR领域的神!智能速览

  • 0.9B小参数模型在全球评测中达到94.5%精度

  • 首次系统支持异形框定位,解决歪斜文档识别难题

  • 两步式架构:先布局分析,再精细解析

  • 支持多语种、公式识别、手写体等多种复杂场景

  • 发布即开源,可直接在HuggingFace部署使用

DeepSeek 发了 OCR-2,但还是没能打过它,OCR领域的神!精华内容

传统OCR的致命弱点在于假设文档是完美矩形,但现实中的文档总是歪斜、折叠、反光。PaddleOCR-VL-1.5用工程化的方式,第一次系统性地解决了这个问题。

异形框突破

PaddleOCR-VL-1.5的核心突破在于异形框定位能力。传统OCR假设文档是规则矩形,一旦遇到梯形、折痕、反光等现实场景,虽然字能认出,但结构会完全错乱。新模型不再强求文档形状,即使拍摄角度歪斜、纸张折叠,也能精准定位每行文本并保持正确阅读顺序,这在真实应用场景中意义重大。

工程化架构

该模型采用两步式设计思路:第一步由专门的布局模型PP-DocLayoutV3进行文档分区,识别出标题、正文、表格、公式等元素并确定阅读顺序;第二步由PaddleOCR-VL-1.5逐块精细解析。这种分工明确的设计避免了模型需要同时处理整页信息的复杂度,使0.9B的小参数量也能实现高精度。

实测表现

在多个复杂场景测试中表现优异:发票识别能准确提取印章信息;折痕合同可连续识别不割裂;反光PPT能保持表格结构;形近字识别全对;数学公式完美还原LaTeX语法;手写体和老化档案也有不错表现。特别是在跨折痕识别和文本定位能力上,相比前代有显著提升。

落地场景

OCR技术最核心的价值在于成为信息入口,常见应用包括:财务报销与发票识别、合同标书解析、档案数字化、会议资料整理、医疗政务表单录入等。只要涉及文档数字化,OCR就能发挥作用。识别准确率越高,后续自动化流程的执行效果就越好。

PaddleOCR-VL-1.5代表了OCR从技术炫技走向系统能力的趋势。它不追求大而全,而是专注解决实际问题,以工程化思维实现小参数、高精度、强稳定性的完美平衡。随着AI在各行业落地加速,这种稳定可用的技术基础设施将变得越来越重要。

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章