张大妈

🚀DeepSeek-OCR 2 发布: vLLM Day 0 支持

源自小红薯:vLLM

02-05 23:36

DeepSeek-OCR 2 正式发布,其首创的「视觉因果流」技术,让模型能够模拟人类的阅读顺序来理解文档。这一突破不仅解决了传统 OCR 的阅读顺序错误问题,还通过极高的 token 压缩率,大幅提升了处理效率,为文档 AI 领域带来了新的可能性。

🚀DeepSeek-OCR 2 发布: vLLM Day 0 支持智能速览

  • 引入「视觉因果流」技术,让模型像人一样阅读。

  • 实现 16 倍视觉 token 压缩,每张图仅需少量 token。

  • 阅读顺序错误率降低 33%,生产环境错误减少 30-40%。

  • 在 OmniDocBench v1.5 基准测试中准确率达 91.09%。

  • 获得 vLLM Day-0 支持,便于快速部署和集成。

🚀DeepSeek-OCR 2 发布: vLLM Day 0 支持精华内容

这款新模型的真正价值在于其技术创新与实际性能的结合。通过视觉因果流,它在提升精度的同时,也实现了效率的飞跃,具体数据表现尤为亮眼。

核心技术:视觉因果流

DeepSeek-OCR 2 的核心是其首创的「视觉因果流」(Visual Causal Flow)。不同于传统的固定光栅扫描方式,它通过学习到的因果 token 重排来理解文档,使其阅读路径更接近人类。这种模拟人类认知过程的处理方式,由其 DeepEncoder V2 架构实现,为提升文档理解准确性奠定了基础。

性能与效率飞跃

新模型在性能上表现卓越。它实现了 16 倍的视觉 token 压缩,处理一张图像仅需 256 至 1120 个 token,显著降低了计算成本。在 OmniDocBench v1.5 基准测试中,其准确率达到了 91.09%,相比之前提升了 3.73%。更关键的是,阅读顺序错误降低了 33%,生产环境中的重复错误减少了 30% 至 40%,实用性大幅增强。

生态与部署便利

为了加速新技术的落地应用,DeepSeek-OCR 2 发布即获得了 vLLM 的 Day-0 支持。这意味着开发者可以在第一时间将其集成到自己的系统中。官方仓库已采用 vLLM 0.8.5 作为推理后端,为用户提供了稳定且高效的部署环境,欢迎社区进行测试和使用。

DeepSeek-OCR 2 的出现,不仅是 OCR 技术的一次重要迭代,也为文档 AI 的发展指明了新方向。通过模拟人类阅读逻辑,它在精度和效率上都取得了实质性突破。未来,这类技术将如何在更多复杂场景中发挥作用?

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章