DeepSeek-OCR 2的发布标志着OCR技术的重要突破。传统OCR模型像机器人一样死板扫描,而DeepSeek-OCR 2引入视觉因果流概念,让AI能够像人类一样带着逻辑去阅读图片,特别适合处理复杂版面、多栏排版等场景,为文档智能处理提供了全新思路。
智能速览
引入视觉因果流概念,模拟人类跳跃式阅读逻辑
首次使用LLM(Qwen2-0.5B)作为视觉编码器
在OmniDocBench测试中准确率达91.09%
专门解决分栏、表格、公式等复杂版面识别问题
提供vLLM和Transformers两种推理方式
架构设计接近纯LLM,便于后续扩展优化
精华内容
传统OCR模型就像只会按顺序念书的机器人,遇到复杂排版就会出错。DeepSeek-OCR 2通过视觉因果流技术,让模型学会像人一样思考阅读顺序。
架构革新
DeepSeek-OCR 2的核心创新在于DeepEncoder V2编码器。这不再是简单的CLIP视觉编码器,而是基于Qwen2-0.5B魔改的小型LLM。它能够理解图片内容,将视觉信息重新排列组合成符合人类逻辑的顺序,再传给解码器处理。这种设计让模型具备了推理能力,而不只是像素识别。
相比V1版本,V2通过可学习的Query向量让模型自主决定阅读顺序,打破了传统的光栅扫描限制。
技术突破
视觉因果流是DeepSeek-OCR 2的核心技术亮点。模型通过Learnable Query机制,模拟人类的跳跃式阅读习惯,会先看标题,再读图表,最后看正文。这解决了传统OCR在处理报纸、学术论文等多栏内容时容易读串行的问题。
在OmniDocBench v1.5基准测试中,整体准确率达到91.09%,比上一代提升3.73%,在阅读顺序准确性上更是大幅领先。
性能表现
虽然增加了一个0.5B的LLM编码器,但DeepSeek-OCR 2通过高效压缩技术,将视觉Token数量控制在256-1120之间,兼顾了信息量和推理速度。这种设计符合类似Gemini 3 Pro的Token预算理念,确保在实际应用中的可行性。
实测显示,模型在处理复杂文档时的逻辑清晰度明显优于传统方案,特别是对多栏排版、嵌套表格、数学公式等场景的处理更加准确。
DeepSeek-OCR 2不仅是一个性能提升的OCR模型,更是验证了"用语言模型做视觉编码器"这条技术路线的可行性。它重新定义了AI看图的方式,从像素级识别提升到逻辑级理解。如果你需要处理复杂文档、构建RAG系统或进行文档智能分析,这个开源模型值得一试。