张大妈

重磅!DeepSeek开源全新OCR模型,首创“视觉因果流”

源自公众号:蔚公子说AI

01-30 10:29

DeepSeek开源的全新OCR 2模型,通过引入创新的“视觉因果流”技术,让AI告别了机械的扫描模式。模型能够像人一样,根据内容逻辑动态调整阅读顺序,显著提升了在处理复杂排版文档时的识别准确率,为视觉理解领域带来了新的思路。

重磅!DeepSeek开源全新OCR模型,首创“视觉因果流”智能速览

  • DeepSeek开源全新OCR 2模型,采用创新的DeepEncoder V2方法。

  • 模型用轻量级大语言模型Qwen2-0.5B替代了传统的CLIP编码器。

  • 引入“因果流查询”机制,实现基于内容的智能重排。

  • 解决了传统OCR在双栏、表格等复杂排版下的读串行问题。

  • 实现了16倍的Token压缩,处理速度更快,更节省显存。

重磅!DeepSeek开源全新OCR模型,首创“视觉因果流”精华内容

这项技术的核心在于,它让机器第一次理解了“物理位置”不等于“阅读顺序”,通过先理顺逻辑再翻译文字,从根本上攻克了复杂文档的识别难题。

核心架构升级

DeepSeek-OCR 2的关键进步在于其编码器的升级,即DeepEncoder V2。该架构由三部分组成。首先是视觉分词器,它将图像分割成视觉Token。其次是视觉编码器,这里用轻量级大语言模型Qwen2-0.5B替代了传统的CLIP模型,让模型在“看图”时就具备初步的思考能力。最后是解码器,负责将整理好的信息翻译成最终文字。

因果流查询机制

传统OCR模型如同死板的扫描仪,只能从左到右、从上到下机械读取,遇到双栏排版或复杂表格时极易出错。DeepEncoder V2引入了创新的因果流查询机制,赋予模型内容感知重排能力。模型会先全盘观察图像,然后像图书管理员一样,根据内容的逻辑关系自主决定阅读顺序,从而解决了读串行的核心痛点。

双流注意力分工

为实现智能阅读,模型采用了独特的双流注意力机制。视觉流允许每个图像碎片在观察时都能看到全局,保证了局部与整体的关联。查询流则像在做笔记,在生成每个步骤时,既能回看原图,也能参考之前的笔记,但不受未来信息的干扰,保证了信息梳理的逻辑性和顺序性。

级联推理与效率

整个推理过程分为清晰的两个阶段。第一阶段在编码器内部完成,通过查询机制对图像Token进行语义重排,理顺逻辑。第二阶段由解码器将有序的信息包直接翻译成文字。这种级联推理不仅更聪明,还实现了16倍的Token压缩,大幅提升了处理速度并节省了显存资源,使模型在处理复杂文档时既准又快。

DeepSeek-OCR 2的出现,标志着OCR技术从模式识别向因果理解的跨越。它不仅解决了一个具体的技术难题,更为AI的视觉理解能力打开了新的想象空间,未来的应用场景值得期待。

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章