当前位置:
文章详情

图像识别库哪家强,唯有它

2024-07-03 22:27:15 4点赞 17收藏 0评论

近几年,人脸、车辆、人体属性、卡证、交通标识等经典图像识别技术,开始在我们当前数字化工作及生活中发挥着极其重要的作用。

当然,业内也不乏顶尖公司提供的可直接调用的 API、SDK,但这些往往面临着定制化场景泛化效果不好、价格昂贵、黑盒可控性低、技术壁垒难以形成多诸多痛点。

今天,给大家推荐一个在 GitHub 上完全开源、覆盖人、车、OCR 等 9 大经典识别场景、在 CPU 上可 3 毫秒实现急速识别、一行代码就可实现迭代训练的图像识别项目!

图像识别库哪家强,唯有它

话不多说,先递上传送门,感兴趣的小伙伴可以尝试一下。

GitHub 地址:https://github.com/PaddlePaddle/PaddleClas

下面,就来详细拆解下这个项目的过人之处吧!

图像识别库哪家强,唯有它

亮点一:完美平衡精度与速度

从大名鼎鼎的 Resnet50 到如今火热的 Swin-Transformer,模型精度不断被刷新,但是预测效率并不高。即使是 Swin-Transformer 最小的模型,在 CPU 上的预测速度也超过 100ms,远远无法满足产业实时预测的需求。

而使用 MobileNet 系列等轻量化模型可以保证较高的预测效率,在 CPU 上预测一张图像大约 3ms,但是模型精度往往和大模型有很大差距。

而 PaddleClas 推出的超轻量图像分类方案(Practical Ultra Light Classification,简称 PULC),就完美解决上述产业落地中算法精度和速度难以平衡的痛点。

图像识别库哪家强,唯有它

如图所示,它的精度与 Swin-Transformer 等大模型比肩,预测速度却可以快 30 倍以上,在 CPU 上的推理时长仅需 2ms!

亮点二:易用性极强

PULC 方案不仅完美的平衡了精度与速度,还充分考虑了产业实践过程中需要定制化的对算法快速迭代的需求,只需一行命令,就可完成模型训练。

与此同时,PaddleClas 团队还发布了包括人、车、OCR 在内的 9 大场景模型,仅需 2 步就能实现业务 POC 效果验证,训练、推理、部署一条龙,真正实现 “开箱即用”!

不仅如此,项目还匹配了详细的中文使用文档及产业实践范例教程。

图像识别库哪家强,唯有它

亮点三:集成超多硬核技术

超轻量图像分类方案(PULC)集成了业界 4 大业界领先的优化策略:

图像识别库哪家强,唯有它

PP-LCNet 轻量级骨干网络

PP-LCNet 作为针对 CPU 量身打造的骨干网络模型,在速度、精度方面均远超如 MobileNetV3 等同体量算法,多个场景模型优化后,速度较 SwinTransformer 的模型快 30 倍以上,精度较 MobileNetV3_small_0.35x 高 18 个点。

SSLD 预训练权重

SSLD 半监督蒸馏算法可以使小模型学习到大模型的特征和 ImageNet22k 无标签大规模数据的知识。在训练小模型时,使用 SSLD 预训练权重作为模型的初始化参数,可以使不同场景的应用分类模型获得 1-2.5 个点的精度提升。

数据增强策略集成

该方案融合了图像变换、图像裁剪和图像混叠 3 种数据增强方法,并支持自定义调整触发概率,能使模型的泛化能力大大增强,提升模型在实际场景中的性能。模型可以在上一步的基础上,精度再提升 1 个点左右。

SKL-UGI 知识蒸馏算法

SKL (symmetric-KL) 在经典的 KL 知识蒸馏算法的基础上引入对称信息,提升了算法的鲁棒性。同时,该方案可以方便的在训练中加入无标签训练数据(Unlabeled General Image),可以进一步提升模型效果。该算法可以使模型精度继续提升 1-2 个点。

展开 收起
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

相关文章推荐

更多精彩文章
更多精彩文章

向阳紫火花

本号分享的软件等收集自互联网,若侵权或违规,请联系删除。 软件仅供学习使用,禁止商用,请购买正版软件。 软件使用造成的一切风险由用户自行承担,本号 不负任何责任。 涉及商业机密或者个人隐私的请警慎使用

发文累计获赞2501,内容被1.8万人收藏

关注 打赏
作者其他文章
最新文章 热门文章
17
扫一下,分享更方便,购买更轻松