近日,DeepSeek团队发布并开源了其新一代文档识别模型——DeepSeek-OCR 2,该模型在视觉编码领域实现了重大突破,旨在让AI能够像人类一样,以符合逻辑的顺序“阅读”和“理解”复杂的文档。
传统OCR(光学字符识别)技术在处理文档时,大多采用固定的“光栅扫描”模式,即机械地从左上角到右下角逐行读取。这种方式在面对多栏排版、跨页表格、公式或图文混排等复杂布局时,往往会打乱内容原有的逻辑关系,导致识别结果支离破碎。DeepSeek-OCR 2的核心创新正是为了解决这一痛点,它引入了名为“视觉因果流”(Visual Causal Flow)的全新概念,实现了从“固定扫描”到“语义推理”的范式转变。

这一变革的关键在于其全新的DeepEncoder V2视觉编码器。与前代及多数模型采用的CLIP视觉编码器不同,DeepSeek-OCR 2创新性地使用了轻量级的大语言模型架构(Qwen2-0.5B)作为编码器。其内部设计了一种独特的双流注意力机制:对于从图像中提取的原始视觉信息(视觉token),模型采用双向注意力,使其能够像人眼扫视一样,先对整个页面布局有全局性的感知;同时,模型引入了与视觉token等量的“因果流查询”(causal flow query),这部分则采用因果注意力机制。这些可学习的查询token能够根据图像的整体语义,动态地学习并构建一个符合逻辑的阅读顺序,对视觉信息进行智能重排。
整个工作流程形成了一种两级因果推理:DeepEncoder V2在视觉层面完成对内容的逻辑重排,决定“先看哪里、后看哪里”;然后,这个经过排序的、信息密度极高的视觉序列才被送入后续的解码器(一个3B参数的MoE模型)进行文本生成。这样一来,解码器接收到的是已经“理顺”了的信息,从而能更准确地还原文档的自然阅读顺序和结构。
凭借这一创新架构,DeepSeek-OCR 2在性能和效率上都取得了显著提升。在效率方面,它通过视觉分词器和多裁剪策略,将处理一整页复杂文档所需的视觉token数量控制在256到1120个之间,相较于其他模型动辄需要数千个token,极大地降低了计算开销。在性能方面,根据官方技术报告,该模型在权威文档理解基准测试OmniDocBench v1.5上取得了91.09%的综合得分,相较前代提升了3.73%。尤其在衡量阅读顺序准确性的指标上,其编辑距离从0.085显著下降至0.057,证明其逻辑理解能力大幅增强。在同等资源限制下,其文档解析能力甚至超越了部分顶尖的闭源模型。

DeepSeek-OCR 2的发布及开源,不仅为文档处理、RAG(检索增强生成)等应用领域提供了更强大的基础工具,也为多模态技术的发展探索了新的方向。它验证了让语言模型参与到视觉编码过程中的可行性,为未来构建能够处理图像、文本、音频等多种信息的统一全模态(omni-modal)编码器提供了富有前景的思路。