传统视觉模型按固定顺序处理图像,忽视了人类视觉的因果逻辑。DeepSeek-OCR 2 提出“视觉因果流”架构,通过级联一维因果推理,使模型能根据语义动态理解图像,为二维视觉推理开辟新路径,并在文档解析上实现显著提升。
智能速览
DeepSeek-OCR 2 引入“视觉因果流”新范式,模拟人类视觉逻辑。
架构由类 LLM 编码器与 LLM 解码器级联构成,实现两阶段因果推理。
在 OmniDocBench v1.5 等基准测试上,相比前代有显著性能提升。
该架构具备进化为统一多模态编码器的潜力。
精华内容
为何视觉模型需要理解因果?DeepSeek-OCR 2 通过重构编码器,让模型从被动扫描变为主动推理,其技术核心在于一个名为 DeepEncoder V2 的创新设计。
模拟人类视觉
人类视觉系统遵循由语义驱动的因果流,例如追踪螺旋线条时,每一次注视都依赖于前一次。然而,现有视觉编码器通常按照从左上到右下的固定光栅顺序扫描图像,这种刻板的顺序与人类自然的阅读模式背道而驰,尤其在处理文本、表格等非线性布局内容时,会忽视语义间的真实关联。
为了解决这一问题,DeepSeek团队从人类视觉中汲取灵感,旨在让模型学会像人一样根据视觉语义来决定信息的处理顺序,而非依赖空间坐标。
架构级联推理
DeepSeek-OCR 2 的核心创新在于构建了一个由类 LLM 编码器与 LLM 解码器级联的架构,实现了两阶段的因果推理。第一阶段,编码器通过可学习的“因果流 query”对视觉 token 进行语义层面的重排,将二维的图像信息转化为符合因果逻辑的一维序列。
第二阶段,LLM 解码器在这个已经过因果排序的序列基础上,执行具体的视觉任务推理,如生成文本。这种设计有效地弥合了二维空间结构与一维因果语言建模之间的鸿沟。
双流注意力机制
为了在编码器中实现这一目标,DeepEncoder V2 采用了双流注意力机制。视觉 tokenizer 生成的 token 采用双向注意力,以保留类似 CLIP 的全局建模能力。而新引入的“因果流 query”则采用因果注意力,每个 query 只能关注到所有视觉 token 以及排在它前面的 query。
这种设计使得模型能够自适应地拟合视觉语义,自然地与 LLM 的单向注意力模式对齐。最终,只有这些蕴含了因果逻辑的 query 输出才会被送入解码器,确保了推理过程的连贯性与逻辑性。
性能与未来
实验数据表明,DeepSeek-OCR 2 的架构革新带来了实质性的性能飞跃。在与前代模型 DeepSeek-OCR 的对比中,其在复杂的文档理解基准 OmniDocBench v1.5 上取得了显著的性能提升,特别是在视觉阅读逻辑方面展现出优势。
更值得关注的是其未来潜力。该架构具备进化为统一多模态编码器的可能,通过共享注意力等模块,仅需配置特定模态的可学习 query,即可兼容处理文本、语音、视觉等多种信息,为实现更全面的多模态智能奠定了基础。
DeepSeek-OCR 2 不仅是模型升级,更是一次架构思想的革新。它通过将二维理解分解为两个一维因果推理任务,为通往更通用的视觉智能提供了宝贵路径。未来,这种架构能否成为多模态大一统模型的基石?