张大妈

DeepSeek OCR 2 发布:OCR 终于不只是“识字工具”了

源自公众号:苍狮技术团队

02-03 11:31

传统OCR长期困于表格错乱、语义丢失、后处理繁重等痛点。DeepSeek OCR 2首次将文档识别升级为结构化理解,支持标题层级识别、字段关系建模与可推理输出,真正打通非结构化文档与大模型应用之间的关键断点。

DeepSeek OCR 2 发布:OCR 终于不只是“识字工具”了智能速览

  • 不再仅输出纯文本,而是生成带层级、字段、语义关系的结构化结果

  • 表格识别准确保留行列结构与表头,免去200行正则修复

  • 对合同、公文等复杂文档可识别标题层级与段落逻辑,直接支持RAG与问答

  • 开源并支持私有化部署,适配企业内网、AI Agent及制度知识库场景

  • 解决企业80%沉睡在图片/扫描件中的非结构化数据接入难题

DeepSeek OCR 2 发布:OCR 终于不只是“识字工具”了精华内容

OCR的进化不是识别率提升几个百分点,而是从‘像素转字符’跃迁至‘看懂文档意图’。它让一张扫描件第一次具备了被大模型直接消化、推理和响应的能力。

识别→理解

传统OCR输出是无序文本流,需人工或规则二次清洗;DeepSeek OCR 2直接输出JSON结构化数据,包含document_type、heading_level、table_cells、field_key等12类语义标签。

实测某国企采购合同扫描件,旧OCR识别后需47分钟人工校对字段,新模型端到端输出结构准确率达93.6%,字段级召回率比Tesseract 5.3高41%。

关键差异在于模型内置文档布局分析(DLA)与业务语义解析双模块,能判断‘甲方签字栏’与‘乙方盖章处’的逻辑绑定关系,而非仅标注坐标。

表格不再失序

旧方案中,PDF表格经OCR后常出现跨行错位、表头丢失、合并单元格塌陷等问题;DeepSeek OCR 2采用图神经网络建模单元格拓扑,保持原始行列索引与span属性。

在财务报销单测试集(含217张含合并单元格的发票)中,行列关系还原完整度达98.2%,表头识别F1值95.7%,较PaddleOCR v2.6提升29个百分点。

输出结果可直连数据库ETL流程,跳过人工整理环节,某制造业客户上线后票据录入耗时下降76%。

文档即知识源

针对制度文件,模型能识别一级标题‘第四章 保密义务’、二级标题‘第十七条 保密期限’,并标记条款间引用关系(如‘见第二章第十二条’)。

在某银行内部制度知识库项目中,结合RAG系统后,员工提问‘离职后竞业限制多久’的准确回答率从51%升至89%,响应延迟压至1.2秒内。

输出内容天然支持chunking+embedding,无需额外切分逻辑,知识片段平均语义连贯性评分达4.6/5.0(人工评估)。

Agent的真实眼睛

在AI Agent工作流中,该模型可解析网页截图、系统弹窗、移动端APP界面截图,并输出可操作语义:如‘按钮:提交申请’‘输入框:身份证号(需18位)’‘警告文案:余额不足’。

某政务自助终端Agent实测中,OCR模块将界面理解准确率从68%提至94%,任务完成率对应提升42%。

其输出格式与LangChain Tool Calling协议兼容,Agent可直接调用字段结果触发后续动作,形成‘看-解-决’闭环。

DeepSeek OCR 2标志着文档智能进入语义理解阶段。它不只优化一个工具链环节,更重塑了企业知识流动的底层路径——当扫描件能被机器真正读懂,沉淀在纸质与图片中的经验才开始真正活起来。下一个问题是:哪些业务场景,会最先因这一能力发生质变?

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章