DeepSeek-OCR 2 的发布带来了OCR技术的新思考。它通过创新的架构,将视觉信息的组织前移至编码器,大幅提升了处理效率,为解决传统模型在处理复杂视觉信息时的难题提供了全新路径。
智能速览
DeepSeek-OCR 2 已发布并开源,核心升级在于全新的 DeepEncoder V2。
架构创新:在编码器侧引入因果阅读流,实现先组织后推理。
效率显著提升:视觉 token 数量大幅减少,远低于主流端到端模型。
视觉编码器替换:用 LLM 风格架构取代了原有的 CLIP ViT。
引入双流注意力机制,平衡全局感受野与因果推理能力。
精华内容
这项技术突破的关键,在于重新定义了机器“阅读”图像的方式,从被动解码转向了主动组织。
架构升级
新版本最基础的变化,在于视觉编码器的替换。上一代 DeepEncoder 采用了 CLIP ViT 架构,参数量为300M。DeepSeek-OCR 2 则全面转向了类似大语言模型的架构,具体为 Qwen2-0.5B,参数量达到500M。这一改变不仅是参数规模的增长,更是为后续引入更复杂的因果推理能力奠定了结构基础,让视觉编码器不再是简单的特征提取器。
因果阅读流
本次升级的核心创新,是引入了因果流查询机制。传统OCR模型通常采用从左到右、从上到下的光栅扫描方式处理图像,这种方法忽略了图像的语义结构。DeepSeek-OCR 2 通过可学习的 query tokens,让编码器能够根据图像内容动态调整视觉 token 的阅读顺序。这使得模型可以像人一样,沿着语义逻辑“阅读”图像,例如先识别标题再阅读正文,实现了信息组织的智能化。
双流注意力
为了在全局感知和因果推理之间取得平衡,模型设计了精巧的双流注意力机制。一方面,视觉 token 之间采用双向注意力,确保模型能够捕捉到图像的全局信息,不会因为局部重排而丢失整体语境。另一方面,因果流查询则使用单向的因果注意力,以保证阅读顺序的逻辑性。两者通过混合注意力掩码拼接,共同构成了高效的编码流程。
效率飞跃
架构创新的直接成果是处理效率的大幅提升。DeepSeek-OCR 2 将视觉 token 的数量控制在256到1120个之间。作为对比,许多主流的端到端模型需要生成6000至7000个甚至更多的视觉 token。更少的 token 意味着更低的计算开销和更快的推理速度,这为高分辨率图像的实时识别和大规模文档处理提供了可能,是模型实用性的关键突破。
DeepSeek-OCR 2 不仅是模型性能的提升,更是对OCR技术范式的探索。它所倡导的“先组织,后推理”思路,为后续研究开辟了新方向。这种持续的结构创新,正是推动AI领域不断向前的关键动力。