张大妈

DeepSeek-OCR 2 来了,让 AI 也能像人一样,带着逻辑去看图

源自公众号:Ai学习的老章

01-31 10:35

DeepSeek-OCR 2的发布标志着OCR技术的重要突破。传统OCR模型像机器人一样死板扫描,而DeepSeek-OCR 2引入视觉因果流概念,让AI能够像人类一样带着逻辑去阅读图片,特别适合处理复杂版面、多栏排版等场景,为文档智能处理提供了全新思路。

DeepSeek-OCR 2 来了,让 AI 也能像人一样,带着逻辑去看图智能速览

  • 引入视觉因果流概念,模拟人类跳跃式阅读逻辑

  • 首次使用LLM(Qwen2-0.5B)作为视觉编码器

  • 在OmniDocBench测试中准确率达91.09%

  • 专门解决分栏、表格、公式等复杂版面识别问题

  • 提供vLLM和Transformers两种推理方式

  • 架构设计接近纯LLM,便于后续扩展优化

DeepSeek-OCR 2 来了,让 AI 也能像人一样,带着逻辑去看图精华内容

传统OCR模型就像只会按顺序念书的机器人,遇到复杂排版就会出错。DeepSeek-OCR 2通过视觉因果流技术,让模型学会像人一样思考阅读顺序。

架构革新

DeepSeek-OCR 2的核心创新在于DeepEncoder V2编码器。这不再是简单的CLIP视觉编码器,而是基于Qwen2-0.5B魔改的小型LLM。它能够理解图片内容,将视觉信息重新排列组合成符合人类逻辑的顺序,再传给解码器处理。这种设计让模型具备了推理能力,而不只是像素识别。

相比V1版本,V2通过可学习的Query向量让模型自主决定阅读顺序,打破了传统的光栅扫描限制。

技术突破

视觉因果流是DeepSeek-OCR 2的核心技术亮点。模型通过Learnable Query机制,模拟人类的跳跃式阅读习惯,会先看标题,再读图表,最后看正文。这解决了传统OCR在处理报纸、学术论文等多栏内容时容易读串行的问题。

在OmniDocBench v1.5基准测试中,整体准确率达到91.09%,比上一代提升3.73%,在阅读顺序准确性上更是大幅领先。

性能表现

虽然增加了一个0.5B的LLM编码器,但DeepSeek-OCR 2通过高效压缩技术,将视觉Token数量控制在256-1120之间,兼顾了信息量和推理速度。这种设计符合类似Gemini 3 Pro的Token预算理念,确保在实际应用中的可行性。

实测显示,模型在处理复杂文档时的逻辑清晰度明显优于传统方案,特别是对多栏排版、嵌套表格、数学公式等场景的处理更加准确。

DeepSeek-OCR 2不仅是一个性能提升的OCR模型,更是验证了"用语言模型做视觉编码器"这条技术路线的可行性。它重新定义了AI看图的方式,从像素级识别提升到逻辑级理解。如果你需要处理复杂文档、构建RAG系统或进行文档智能分析,这个开源模型值得一试。

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章