DeepSeek发布了全新的OCR 2模型,通过引入DeepEncoder V2架构,实现了视觉编码从“固定扫描”到“语义推理”的范式转变。这项创新让模型能像人类一样动态理解复杂文档布局,显著提升了信息还原的逻辑性和准确性,为构建统一的全模态编码器提供了新思路。
智能速览
DeepSeek-OCR 2的核心创新在于引入了DeepEncoder V2架构,实现了从“固定扫描”到“语义推理”的范式转变。
该模型用轻量级语言模型替换CLIP编码器,并引入因果流查询,赋予模型动态重排视觉Token的能力。
在保持极高压缩效率的同时,模型仅需256至1120个视觉Token即可覆盖复杂文档页面。
在OmniDocBench v1.5评测中,模型综合得分达到91.09%,阅读顺序识别逻辑性更强。
生产环境数据显示,新模型显著降低了OCR识别结果的重复率,提升了信息还原的准确性。
精华内容
DeepSeek-OCR 2究竟是如何实现这一突破的?其背后的技术架构与设计哲学,尤其是DeepEncoder V2,值得深入探究。
架构革新
DeepSeek-OCR 2的关键升级在于其编码器——DeepEncoder V2。它放弃了传统的CLIP ViT结构,转而采用类似LLM的轻量级语言模型(Qwen2-500M)作为核心。这种改变带来了全新的处理能力,让模型不再局限于从左到右、从上到下的死板扫描模式,为后续的语义理解奠定了基础。
因果流设计
新架构的核心是引入了“因果流查询”机制。模型通过双流注意力,对视觉Token进行全局建模,同时利用因果注意力让查询Token根据语义动态重排。这种两级级联的1D因果推理结构,使得模型能够更精准地还原表格、公式等复杂文档的自然阅读逻辑,就像赋予了机器人类的阅读习惯。
高效性能
得益于先进的架构设计,DeepSeek-OCR 2在性能上实现了显著突破。模型仅需256到1120个视觉Token即可覆盖一页复杂文档,极大地降低了下游LLM的计算开销。在权威的OmniDocBench v1.5评测中,其综合得分达到91.09%,较前代提升了3.73%,尤其在阅读顺序识别上,编辑距离从0.085降至0.057,逻辑性大幅增强。
生产验证
在真实的生产环境中,DeepSeek-OCR 2同样展现了强大的实用性。与DeepSeek-OCR相比,新模型在处理在线用户日志图像时,识别结果的重复率从6.25%降至4.17%;在批量PDF处理场景中,重复率也从3.69%降至2.88%。这些数据证明了新架构在提升信息还原质量和逻辑性方面的实际价值。
DeepSeek-OCR 2的发布,不仅是OCR技术的进步,更是在视觉-语言融合路径上的一次重要探索。它所展示的“视觉因果流”架构,为构建统一的全模态编码器提供了可行方向。未来,同样的方法能否用于处理视频、音频等更多模态的数据?