DeepSeek新开源的OCR 2模型,通过革新性的架构设计,解决了传统OCR在处理复杂文档时语义断裂的问题。它弃用CLIP,引入轻量语言模型进行视觉标记的因果推理与动态重排,实现了媲美顶尖模型的性能,为文档数字化处理提供了更智能高效的路径。
智能速览
核心升级为DeepEncoder V2,实现视觉标记的因果推理与动态重排。
弃用CLIP组件,改用轻量语言模型Qwen2-0.5B构建编码器。
在OmniDocBench基准上性能媲美Gemini-3 Pro,准确率提升3.73%。
通过双流注意力机制,模拟人类阅读时的视觉信息流。
项目已在GitHub与Hugging Face完全开源,提供论文与模型。
精华内容
DeepSeek-OCR 2的突破并非简单的参数堆砌,而是源于对“阅读”这一行为的深度理解与模拟。其核心,便是全新的DeepEncoder V2编码器。
架构革新
传统OCR模型遵循固定的“光栅扫描”顺序,即从左到右、从上到下处理图像,这常导致在处理双栏或表格等复杂版面时,语义逻辑被切断。DeepSeek-OCR 2的核心升级DeepEncoder V2彻底改变了这一逻辑。
它将前代模型中的CLIP组件替换为一个轻量化的语言模型(Qwen2-0.5B)。这一改变赋予编码器因果推理能力,使其能在信息传递给主解码器之前,就根据图像内容智能地重排视觉标记,使其更符合人类的阅读习惯和逻辑顺序。
技术核心
为实现视觉标记的智能重排,DeepEncoder V2引入了全新的双流注意力机制。其核心是一个定制的注意力掩码,它区分处理两种信息:视觉标记和因果流查询。
视觉标记采用双向注意力,确保每个标记都能“看”到整幅图,保留了全局建模能力。而附加的可学习查询向量则采用因果注意力,每个查询只能关注它之前的查询及所有视觉标记。这种设计确保了视觉信息在所有处理层中都保持“活跃”,并与因果查询进行深度交互,从而在编码器内部就完成了“逻辑理顺”。
性能验证
在权威的OmniDocBench v1.5基准测试中,DeepSeek-OCR 2取得了91.09%的准确率,相比基线提升了3.73%。其阅读顺序(R-order)的编辑距离从0.085显著降至0.057,有力证明了其重排视觉信息的有效性。
在与顶尖模型的对比中,在相似的标记预算(1120)下,DeepSeek-OCR 2的文档解析编辑距离(0.100)优于Gemini-3 Pro(0.115)。实际应用数据也显示,其在线用户日志的重复率从6.25%降至4.17%,PDF生产数据重复率从3.69%降至2.88%,验证了模型在真实场景中的逻辑理解能力。
DeepSeek-OCR 2的成功不仅在于其出色的性能,更在于它为多模态模型发展提供了新思路。用语言模型架构处理视觉信息,证明了通往统一全模态编码器的可行性,未来的文档理解或许将因此变得更加智能和自然。