DeepSeek-OCR 2 正式发布,其首创的「视觉因果流」技术,让模型能够模拟人类的阅读顺序来理解文档。这一突破不仅解决了传统 OCR 的阅读顺序错误问题,还通过极高的 token 压缩率,大幅提升了处理效率,为文档 AI 领域带来了新的可能性。
智能速览
引入「视觉因果流」技术,让模型像人一样阅读。
实现 16 倍视觉 token 压缩,每张图仅需少量 token。
阅读顺序错误率降低 33%,生产环境错误减少 30-40%。
在 OmniDocBench v1.5 基准测试中准确率达 91.09%。
获得 vLLM Day-0 支持,便于快速部署和集成。
精华内容
这款新模型的真正价值在于其技术创新与实际性能的结合。通过视觉因果流,它在提升精度的同时,也实现了效率的飞跃,具体数据表现尤为亮眼。
核心技术:视觉因果流
DeepSeek-OCR 2 的核心是其首创的「视觉因果流」(Visual Causal Flow)。不同于传统的固定光栅扫描方式,它通过学习到的因果 token 重排来理解文档,使其阅读路径更接近人类。这种模拟人类认知过程的处理方式,由其 DeepEncoder V2 架构实现,为提升文档理解准确性奠定了基础。
性能与效率飞跃
新模型在性能上表现卓越。它实现了 16 倍的视觉 token 压缩,处理一张图像仅需 256 至 1120 个 token,显著降低了计算成本。在 OmniDocBench v1.5 基准测试中,其准确率达到了 91.09%,相比之前提升了 3.73%。更关键的是,阅读顺序错误降低了 33%,生产环境中的重复错误减少了 30% 至 40%,实用性大幅增强。
生态与部署便利
为了加速新技术的落地应用,DeepSeek-OCR 2 发布即获得了 vLLM 的 Day-0 支持。这意味着开发者可以在第一时间将其集成到自己的系统中。官方仓库已采用 vLLM 0.8.5 作为推理后端,为用户提供了稳定且高效的部署环境,欢迎社区进行测试和使用。
DeepSeek-OCR 2 的出现,不仅是 OCR 技术的一次重要迭代,也为文档 AI 的发展指明了新方向。通过模拟人类阅读逻辑,它在精度和效率上都取得了实质性突破。未来,这类技术将如何在更多复杂场景中发挥作用?