张大妈

百度1月29日放出的0.9B小模型,正在 quietly 改写AI落地的规则

源自今日头条:甜甜的小蛋糕

02-17 14:51

百度悄然发布的PaddleOCR-VL-1.5模型以不到10亿参数的体量,在OCR地狱副本OmniDocBench V1.5榜单上取得94.5%准确率,超越DeepSeek-OCR2达3.41个百分点。这个能本地部署的小模型,正在重新定义AI文档理解的边界。

百度1月29日放出的0.9B小模型,正在 quietly 改写AI落地的规则智能速览

  • 百度PaddleOCR-VL-1.5以0.9B参数登顶OCR全球榜单

  • 轻量几何理解层让AI学会’看懂皱纸的物理结构’

  • 开源Apache 2.0协议,本地部署成本大幅降低

  • OCR-RAG成为AI应用落地的关键基础设施

百度1月29日放出的0.9B小模型,正在 quietly 改写AI落地的规则精华内容

这场OCR技术革命的背后,是从像素识别到物理结构理解的范式转变,小模型正在撬动AI落地的最后一公里。

技术突破

PaddleOCR-VL-1.5的核心创新在于建立了轻量几何理解层,不再是简单的框字识别,而是能够估算文档的卷边、反光、折叠压痕等物理变形,并将这些变形’熨平’。这种方法让文档阅读顺序预测错误率直接砍掉一半,能够按人类阅读节奏自动拆解财报附注表格、法院传票手写批注等复杂场景。

性能碾压

在权威的OmniDocBench V1.5测试中,PaddleOCR-VL-1.5获得94.5%准确率,而同期DeepSeek-OCR2仅为91.09%。3.41个百分点的差距在OCR领域属于压倒性优势。更值得注意的是,这是用0.9B参数实现的,MacBook M2即可流畅运行,学生党二手笔记本加2060显卡就能本地部署。

实战表现

实测中,对一张被胶带粘贴、强光反光、指甲划痕的快递单,模型输出的结构化JSON完美分离了收件人、电话、运单号、签收状态等信息,甚至能区分’已签收(本人)'和’代收人:张姐’的细微差别。财税SaaS企业接入后,发票识别响应速度从4秒降至0.8秒,准确率提升11个百分点。

开源生态

百度采用Apache 2.0协议开源,连训练代码和标注规范一并公开,无需云API排队或月费。这种开放策略加速了技术落地,开发者可以直接根据自身场景定制优化。百度在OCR领域积累的1700多件专利为此提供了坚实的技术储备。

当大模型还在参数竞赛中狂奔,百度用0.9B小模型证明了AI落地的真谛:不是算力的堆砌,而是对真实物理世界的深度理解。这种’低头看纸’的能力,或许才是AI真正走向实用的关键一步。

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章