张大妈

DeepSeek OCR2: 别打了,快学不动了!

源自小红薯:李磊NLP

03-02 16:17

面对复杂版式的 OCR 挑战,DeepSeek OCR 2 提出了一种自适应视觉 token 的新方法。它通过语义读出网络动态理解图像布局,显著提升了对非常规排版文档的识别精度,为多模态处理开辟了新路径。

DeepSeek OCR2: 别打了,快学不动了!智能速览

  • 核心思想是解决传统 2D 扫描顺序与复杂版式不匹配的问题。

  • 采用 LM 作为视觉编码器,通过查询 token 学习自适应的视觉序列。

  • 使用 SAM 作为 tokenizer,以获取更底层的图像表示。

  • 通过分块机制灵活处理不同分辨率,最高可达 1120 个 token。

  • 在复杂版式基准测试 OmniDocBench v1.5 上表现优异。

DeepSeek OCR2: 别打了,快学不动了!精华内容

传统 OCR 在处理复杂版式时捉襟见肘,DeepSeek OCR 2 的创新之处在于跳出固定扫描模式,让模型学会像人一样“阅读”。

自适应阅读

传统的视觉模型将图像分割成 2D 补丁,并按固定的从左到右、从上到下的顺序处理。这种模式在面对报纸、杂志等复杂版式时效率低下。

DeepSeek OCR 2 的核心创新在于引入了自适应顺序,它不再依赖固定的物理顺序,而是让模型根据图像内容动态学习最佳的“阅读”路径。

语义读出网络

为实现自适应阅读,该模型采用了一个强大的语义读出网络,具体表现为一个作为视觉编码器的语言模型。

通过一组可学习的查询 token,该网络能够从 2D 视觉补丁序列中提炼出与内容布局高度相关的视觉 token。这些 token 携带了语义和位置信息,为后续的识别任务提供了更高质量的输入。

设计与细节

模型在设计上选择了 SAM 作为 tokenizer,因为它相比 CLIP 能提供更底层的视觉特征。

为应对不同分辨率的图像,DeepSeek OCR 2 采用了分块机制,全局视图使用 256 个 token,高分辨率模式下每块可额外补充 144 个 token,总计可达 1120 个,与 Gemini 3 Pro 的 token 数量持平。解码则由一个 5.7B 参数的 LLM 完成。

效果与展望

在专门评估复杂版式的 OmniDocBench v1.5 基准测试中,DeepSeek OCR 2 展现了优于 Paddle OCR、MinerU 等传统方案及一些 VLM 模型的效果,同时保持了更高的视觉 token 压缩比。

这种解耦设计不仅提升了 OCR 性能,也为迈向更统一的原生多模态处理提供了新的思路。

DeepSeek OCR 2 的探索,不仅是对 OCR 技术的一次有力革新,更体现了 AI 模型在理解世界方式上的进化。它让机器更接近人类灵活的阅读习惯,未来的应用前景值得期待。

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章
相关兴趣推荐