面对AI领域的飞速迭代,DeepSeek OCR2的发布为文本识别技术带来了新视角。它直面复杂版式文档的识别难题,通过一种自适应的视觉令牌读取机制,显著提升了非标准排版内容的处理能力,为自动化文档处理提供了更优解。
智能速览
DeepSeek OCR2专为解决复杂版式文档的识别难题而设计。
其核心创新是利用查询令牌来自适应地学习视觉信息的读取顺序。
模型采用SAM作为分词器,相较于CLIP更关注底层视觉特征。
通过分块机制,最高支持1120个令牌的高分辨率文档处理。
在专业OCR基准测试中,其性能超越了多个主流系统。
精华内容
传统OCR工具在处理报纸等复杂版式时常显力不从心,DeepSeek OCR2是如何通过结构创新突破这一瓶颈,实现更精准的文本识别呢?
OCR的版式挑战
传统的基于视觉Transformer(ViT)的OCR模型,其处理方式是将图像分割成2D的patch,并按固定的从左到右、从上到下顺序进行编码。然而,现实中的文档,如报纸或杂志,版式布局灵活多变,阅读顺序并非总是线性的。这种固定编码方式与实际阅读逻辑之间的错位,限制了模型在复杂文档上的识别精度。
DeepSeek OCR2正是为了解决这一问题而生,它认为需要一种更自适应的顺序来捕捉文档的语义结构。
自适应读取机制
DeepSeek OCR2的核心思想在于引入了一个强大的语义读取网络,即一个大型语言模型(LM)充当视觉编码器。它并非直接处理原始的2D patch序列,而是使用一组可学习的查询令牌(query tokens)。
这些查询令牌能够根据图像内容,动态地、自适应地学习到最重要的视觉令牌组合,无论其空间位置如何。这种机制让模型能够智能地“阅读”文档,先看标题还是先读正文,都由模型根据上下文自主决定,极大地提升了对复杂布局的适应性。
技术实现细节
在具体实现上,DeepSeek OCR2选用了Segment Anything Model(SAM)的tokenizer。普遍认为,SAM相较于偏语言对齐的CLIP,能提供更底层的视觉表示,更适合精细的视觉任务。
为处理不同分辨率的图像,模型设计了巧妙的分块机制。一个全局视图使用256个查询令牌,若需更高分辨率,则可增加6个分块,每个分块补充144个令牌,总计可达1120个,与Gemini 3 Pro的水平相当。最终,这些被提炼出的视觉令牌会送入一个57亿参数的LLM解码器进行文本生成。
性能与未来展望
在权威的OmniDocBench v1.5基准测试中,该基准包含大量具有丰富版式的文档,DeepSeek OCR2展现出了超越Paddle OCR、MinerU等传统OCR系统及部分VLM的优异效果。
此外,在视觉令牌的压缩效率上,它也显著优于之前的NaVIT方案,这意味着更高的处理效率。作者还探讨了该方案在更多模态上的应用潜力,认为这是迈向“原生多模态”的一条可行路径。
DeepSeek OCR2通过解耦视觉信息读取与语言解码,为处理非结构化文档提供了新范式。它不仅性能出色,更展现了对多模态融合的深刻思考。未来,这种专用模块化设计与端到端大型VLM将如何演进,或许将共同定义下一代AI的感知能力。