DeepSeek OCR V2的发布标志着单阶段文档识别技术的新进展。该版本摒弃了主流的CLIP-ViT架构,采用自回归LM Vision Encoder,通过语义重排序优化了视觉特征与LLM解码模式的兼容性。此次技术迭代在多项基准测试中取得了超越同类单阶段模型的SOTA表现,为高精度文档理解提供了新的解决方案。
智能速览
采用自回归LM Vision Encoder替代传统CLIP-ViT架构。
通过语义重排序替代空间位置编码,优化视觉特征。
在OmniDocBench v1.5上超越两阶段模型MinerU2.5。
综合表现略逊于两阶段模型PaddleOCR-VL。
在单阶段基线模型中达到SOTA(最优)水平。
精华内容
V2版本的核心突破源于架构层面的革新,它如何重塑视觉特征的提取与解码过程,并最终体现在性能数据上?
架构革新
DeepSeek OCR V2最重要的升级在于其视觉编码器的变革。它放弃了业界广泛采用的CLIP-ViT架构,转而使用自回归的LM Vision Encoder。这一改变的根本目的,是让视觉特征的提取过程更好地与大型语言模型(LLM)的单向解码模式相匹配,从而在信息传递上实现更高的一致性。
语义重排序
为配合新架构,V2版本引入了语义重排序机制。传统方法依赖空间位置编码来确定元素关系,而新方法通过内容的语义联系进行排序。这种方式使模型能更准确地理解文档内容的逻辑结构,而非仅仅依赖物理位置,尤其适用于排版复杂的文档场景。
性能实测
在权威的OmniDocBench v1.5基准测试中,DeepSeek OCR V2展现了其架构优势。其表现成功超越了两阶段的MinerU2.5模型,证明了单阶段架构的潜力。虽然综合评分略逊于另一两阶段模型PaddleOCR-VL,但它在所有单阶段基线模型中取得了SOTA(最优)成绩,确立了其在单阶段OCR领域的领先地位。
DeepSeek OCR V2通过架构创新,为单阶段OCR模型树立了新的性能标杆。其开源特性不仅推动了技术社区的共同进步,也为实际应用中寻求高效率与高精度平衡的场景提供了强有力的工具。未来,这种架构思路是否能进一步拓展到其他多模态任务,值得期待。