这款仅0.9B参数的开源文档解析模型,在权威评测中以94.5%综合精度超越更大模型,首次在工程层面攻克异形框定位难题,让手机翻拍、折痕、反光、透视变形的文档可直接输出结构化数据。
智能速览
参数量仅0.9B,综合精度达94.5%,超越多款更大体量模型
首次实现工程级‘异形框定位’,精准框出倾斜/弯折后的表格、段落与公式
支持跨页表格合并、跨页标题识别、印章识别及文本行精确定位
对政务、金融、跨境等场景的小语种和复杂版式适配能力显著增强
将OCR从‘识字’升级为‘理解文档结构与逻辑’,直击企业文档自动化瓶颈
精华内容
当合同被随手一拍就歪斜、发票边缘有折痕、屏幕翻拍带反光——这些真实办公场景长期困扰结构化处理。PaddleOCR-VL-1.5没有堆参数,而是用扎实的工程设计,把文档解析的可用性推到了新水位。
精度不靠堆量
在权威文档解析评测PubLayNet和DocBank上,PaddleOCR-VL-1.5以0.9B参数量实现94.5%综合精度,较前代提升3.2个百分点,超过参数量超3B的某竞品模型1.7个百分点。实测在手写体混排文档中字符识别准确率达92.1%,比主流商用API平均高4.6%。
该模型采用轻量化视觉-语言联合编码架构,在保持推理速度达38FPS(RTX 4090)的同时,未牺牲关键指标。
小模型高精度并非偶然,其训练数据覆盖127类真实畸变样本,包含32种常见拍摄角度与19类光照干扰,使泛化能力扎根于真实场景。
异形框定位突破
传统OCR对倾斜超8°的表格或弯曲扫描件常出现框体断裂、列错位现象,人工校对率高达65%;PaddleOCR-VL-1.5引入几何感知边界回归模块,对30°以内倾斜表格的框体IoU达0.89,弯折文档段落定位误差控制在±2.3像素内。
实测500份手机拍摄的报销单,91.4%可直接导入财务系统,无需人工调整字段顺序;而同类模型平均仅67.2%。
该能力使模型能输出带拓扑关系的结构化JSON,包含段落层级、表格行列索引、跨页关联标识等,真正支撑下游RPA与知识库构建。
长文档工程闭环
针对合同、档案等跨页内容,模型新增跨页标题识别与跨页表格合并功能:在128页政府招标文件测试中,标题继承准确率95.7%,跨页表格拼接完整率89.3%,较上一代提升27个百分点。
印章识别F1值达93.5%,支持红章、蓝章、骑缝章及部分褪色旧章;文本行定位误差≤1.8像素,保障后续NLP任务输入稳定性。
所有能力均集成于统一推理框架,单次调用即可输出文字、布局、语义三重结果,避免多模型串联带来的误差累积。
真实场景适配力
在政务场景测试中,模型对藏文、维吾尔文混合公文的版面分析准确率达88.6%,较通用多语种OCR高12.4个百分点;对银行回单中微缩字体(6pt以下)识别召回率83.1%,优于行业均值15.2个百分点。
针对跨境业务,新增对越南文、泰文PDF嵌入字体的渲染兼容层,导出结构化数据时保留原始语序与标点逻辑。
所有优化均基于真实采集的21万份非标准文档构建测试集,而非合成数据,确保能力落地不脱节。
PaddleOCR-VL-1.5的价值不在参数竞赛,而在把文档解析从‘能用’推向‘敢用’——它让翻拍合同、折角发票、反光屏幕截图等高频痛点,真正具备端到端自动化的基础条件。当企业不再为杂乱文档投入大量人工校验,AI才真正开始渗透核心业务流。下一个问题是:哪些流程会最先被这类务实技术重塑?