张大妈

DeepSeek-OCR 2如何像人一样读懂文档?

源自新浪微博:新浪热点

01-28 17:27

DeepSeek发布的最新一代文档识别模型DeepSeek-OCR 2,通过引入“视觉因果流”技术,让AI能模仿人类视觉逻辑,动态调整信息处理顺序。这项突破不仅解决了传统OCR在复杂版式中的识别难题,还在性能和稳定性上带来了实质性提升,为高精度文档解析提供了新的解决方案。

DeepSeek-OCR 2如何像人一样读懂文档?智能速览

  • DeepSeek-OCR 2核心升级在于新型视觉编码器DeepEncoder V2。

  • 模型通过“视觉因果流”技术,模仿人类跳跃式阅读逻辑。

  • 在OmniDocBench v1.5基准测试中,整体得分提升3.73%至91.09%。

  • 阅读顺序准确度显著提高,编辑距离从0.085降至0.057。

  • 生产环境中的识别重复率大幅降低,稳定性更强。

DeepSeek-OCR 2如何像人一样读懂文档?精华内容

传统OCR模型如同逐格扫描,而人类阅读是跳跃且基于逻辑的。DeepSeek-OCR 2正是为了弥合这一差距,让机器更懂文档的内在结构。

传统OCR的局限

过去,视觉语言模型处理图像时,通常将其切分为固定数量的视觉token,并严格遵循从左上到右下的栅格顺序。这种方法实现简单,但完全忽略了文档内容的语义和逻辑关系。尤其是在处理学术论文、财报等版式复杂的文档时,人类会根据标题、图表、公式的关联性进行跳跃式阅读,而固定的空间顺序会限制模型对文档深层结构的理解能力。

视觉因果流技术

DeepSeek-OCR 2的突破在于引入了名为DeepEncoder V2的新型视觉编码器,并提出了“视觉因果流”概念。该结构用类语言模型替代了原先的CLIP视觉编码模块,并在内部加入了可学习的“因果流查询token”。模型通过双向注意力对图像进行全局感知,再通过因果注意力让查询token逐步建立符合语义的阅读顺序。最终,只有经过智能重排的查询token才会被送入解码器生成结果。

性能显著提升

在包含学术论文、杂志、报告等多种中英文文档的OmniDocBench v1.5基准测试中,DeepSeek-OCR 2展现了更强的综合能力。其整体得分达到91.09%,相较于前代模型提升了3.73%。尤其在衡量阅读顺序准确度的关键指标上,编辑距离从0.085大幅降低至0.057,这表明新模型在还原文档逻辑结构方面的能力得到了显著增强。

生产环境更稳定

除了基准测试的亮眼数据,DeepSeek-OCR 2在实际应用中也表现出更高的可靠性。根据在线用户日志和批处理PDF数据的统计,模型的识别重复率均有下降。其中,在线图像的重复率从6.25%降至4.17%,批处理PDF的重复率从3.69%降至2.88%。这些改进证明了其在真实复杂场景下的稳健性,为商业化应用提供了有力保障。

DeepSeek-OCR 2通过重构视觉编码逻辑,让AI文档识别从“看图识字”向“理解结构”迈出了关键一步。这项技术不仅提升了识别精度,更开拓了处理复杂信息的新思路,未来在自动化办公、知识管理等领域的应用潜力值得期待。

DeepSeek-OCR 2如何像人一样读懂文档?关键评论

  • 部分网友看好其在文档整理和笔记场景的应用价值。

  • 众多网友对DeepSeek的技术进展和深度思维表示赞叹。

精选参考来源

#DeepSeek又上新了##DeepSeek开源OCR2#【DeepSeek-OCR 2 发布:让 AI 像人一样“读懂”复杂文档,识别性能提升 3.73%】DeepSeek 今日公布了其最新一代文档识别模型 DeepSeek-OCR 2。很显然,该模型是在 DeepSeek-OCR 的基础上升级而来,核心变化集中在视觉编码器设计上。研究团队提出了一种名为 DeepEncoder V2 的新型编码器结构,它能够根据图像语义动态调整视觉信息的处理顺序,使模型在进行文字识别前先对视觉内容进行智能排序。这项技术突破源于对传统视觉语言模型处理方式的重新思考,旨在让机器更贴近人类的视觉阅读逻辑。在传统的视觉语言模型中,图像通常会被切分为若干视觉 token,并按照从左上到右下的固定栅格顺序送入模型处理。这种方式虽然实现简单,但与人类在阅读文档、表格或公式时基于语义和逻辑关系进行跳跃式浏览的方式并不一致。DeepSeek 论文指出,尤其在版式复杂的文档场景中,视觉元素之间往往存在明确的逻辑先后关系,仅依赖空间顺序可能限制模型对内容结构的理解能力。DeepSeek-OCR 2 的改进重点在于引入“视觉因果流”的概念。在 DeepEncoder V2 中,研究团队用一种类语言模型结构替代了原先基于 CLIP 的视觉编码模块,并在编码器内部引入可学习的“因果流查询 token”。其编码器同时包含双向注意力与因果注意力两种处理模式,原始视觉信息通过双向注意力进行全局感知,而新增的查询标记则通过因果注意力逐步建立语义顺序,从而在编码阶段对视觉 token 的顺序进行动态重排。最终,只有经过因果重排后的查询 token 会被送入后续的解码器,用于生成识别结果。在整体架构上,DeepSeek-OCR 2 仍沿用了前代模型的编解码框架。编码器将图像转换为视觉标记并进行压缩,被压缩为较少数量的视觉 token,再由 DeepEncoder V2 进行语义建模和顺序重组,最后交由一个基于混合专家架构(MoE)的语言模型解码。DeepSeek 论文指出,该设计在不显著增加解码负担的前提下,将单页文档所使用的视觉 token 数量控制在 256 到 1120 之间,与前代模型及同类系统的资源开销保持在相近水平。为验证模型性能,研究团队在 OmniDocBench v1.5 基准上进行了全面评估。该基准涵盖多种类型的中英文文档,包括学术论文、杂志、报告等,重点考察文本识别、公式解析、表格结构还原以及阅读顺序等指标。测试结果显示,在视觉 token 上限更低的情况下,DeepSeek-OCR 2 的整体得分达到 91.09%,相较 DeepSeek-OCR 提升了 3.73%。特别是在阅读顺序准确度方面,编辑距离从 0.085 降至 0.057,表明新模型能够更合理地理解文档内容结构。IT之家注意到,DeepSeek-OCR 2 在生产环境中也表现出更好的稳定性。在线用户日志图像的重复率从 6.25% 降至 4.17%,批处理 PDF 数据的重复率从 3.69% 降至 2.88%。这些改进使得模型在保持高压缩率的同时,提升了实际应用场景中的可靠性。(IT之家)
内容由AI生成

精选参考来源

#DeepSeek又上新了##DeepSeek开源OCR2#【DeepSeek-OCR 2 发布:让 AI 像人一样“读懂”复杂文档,识别性能提升 3.73%】DeepSeek 今日公布了其最新一代文档识别模型 DeepSeek-OCR 2。很显然,该模型是在 DeepSeek-OCR 的基础上升级而来,核心变化集中在视觉编码器设计上。研究团队提出了一种名为 DeepEncoder V2 的新型编码器结构,它能够根据图像语义动态调整视觉信息的处理顺序,使模型在进行文字识别前先对视觉内容进行智能排序。这项技术突破源于对传统视觉语言模型处理方式的重新思考,旨在让机器更贴近人类的视觉阅读逻辑。在传统的视觉语言模型中,图像通常会被切分为若干视觉 token,并按照从左上到右下的固定栅格顺序送入模型处理。这种方式虽然实现简单,但与人类在阅读文档、表格或公式时基于语义和逻辑关系进行跳跃式浏览的方式并不一致。DeepSeek 论文指出,尤其在版式复杂的文档场景中,视觉元素之间往往存在明确的逻辑先后关系,仅依赖空间顺序可能限制模型对内容结构的理解能力。DeepSeek-OCR 2 的改进重点在于引入“视觉因果流”的概念。在 DeepEncoder V2 中,研究团队用一种类语言模型结构替代了原先基于 CLIP 的视觉编码模块,并在编码器内部引入可学习的“因果流查询 token”。其编码器同时包含双向注意力与因果注意力两种处理模式,原始视觉信息通过双向注意力进行全局感知,而新增的查询标记则通过因果注意力逐步建立语义顺序,从而在编码阶段对视觉 token 的顺序进行动态重排。最终,只有经过因果重排后的查询 token 会被送入后续的解码器,用于生成识别结果。在整体架构上,DeepSeek-OCR 2 仍沿用了前代模型的编解码框架。编码器将图像转换为视觉标记并进行压缩,被压缩为较少数量的视觉 token,再由 DeepEncoder V2 进行语义建模和顺序重组,最后交由一个基于混合专家架构(MoE)的语言模型解码。DeepSeek 论文指出,该设计在不显著增加解码负担的前提下,将单页文档所使用的视觉 token 数量控制在 256 到 1120 之间,与前代模型及同类系统的资源开销保持在相近水平。为验证模型性能,研究团队在 OmniDocBench v1.5 基准上进行了全面评估。该基准涵盖多种类型的中英文文档,包括学术论文、杂志、报告等,重点考察文本识别、公式解析、表格结构还原以及阅读顺序等指标。测试结果显示,在视觉 token 上限更低的情况下,DeepSeek-OCR 2 的整体得分达到 91.09%,相较 DeepSeek-OCR 提升了 3.73%。特别是在阅读顺序准确度方面,编辑距离从 0.085 降至 0.057,表明新模型能够更合理地理解文档内容结构。IT之家注意到,DeepSeek-OCR 2 在生产环境中也表现出更好的稳定性。在线用户日志图像的重复率从 6.25% 降至 4.17%,批处理 PDF 数据的重复率从 3.69% 降至 2.88%。这些改进使得模型在保持高压缩率的同时,提升了实际应用场景中的可靠性。(IT之家)

0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章
相关兴趣推荐