张大妈

华为开源7B多模态模型,昇腾端侧推理性能强悍

源自公众号:量子位

01-12 14:54

华为开源了openPangu-VL-7B模型,这是一个专为昇腾硬件优化的7B级多模态大模型。它在视觉定位、OCR等任务上表现出色,且推理延迟低,为端侧部署和个人开发者提供了新的高性能选择,丰富了昇腾生态。

华为开源7B多模态模型,昇腾端侧推理性能强悍智能速览

  • 华为开源openPangu-VL-7B多模态模型,针对昇腾硬件深度优化。

  • 模型推理性能强悍,单卡推理时延仅160毫秒,支持实时推理。

  • 在视觉问答、文档OCR及视觉定位等核心任务上表现突出。

  • 创新采用加权损失设计,解决长短样本训练不均衡问题。

  • 采用千分位带填充坐标格式,显著提升定位任务的格式遵从性。

华为开源7B多模态模型,昇腾端侧推理性能强悍精华内容

依托昇腾原生架构,该模型在推理速度与训练稳定性上实现了显著突破,多项核心指标展现强大竞争力。

昇腾原生优化

模型针对昇腾芯片进行了深度适配,设计了专用的高性能视觉编码器。在相同参数量下,该编码器的吞吐量较使用窗注意力的ViT-H系列提升了15%。

实测数据显示,720P图像在单张Ascend Atlas 800T A2卡上首字推理时延仅160毫秒,能够实现5FPS的实时推理,训练阶段的MFU更是达到42.5%。

视觉定位与OCR

openPangu-VL-7B在通用视觉问答、文档图表理解及OCR、视觉定位等任务上表现出色。得益于多标签对比学习框架,模型具备了更优的细粒度理解能力。

例如,它能精准识别菜品图中的樱桃番茄并计数,也能将年报截图直接转化为Markdown格式,有效解决了信息抽取痛点。

创新训练策略

为了解决不同长度训练样本的学习均衡问题,团队创新采用了“加权逐样本损失+逐令牌损失”的混合训练方案。加权系数由令牌位置和样本重要性动态决定。

这一设计使得模型在训练中能够充分吸收长回复数据,同时兼顾短回复信息,消融实验已充分验证了其有效性。

高效数据格式

在视觉定位数据格式上,模型没有沿用业界主流的0-999定位方案,而是采用000-999千分位带填充相对坐标。这种整齐的三个Token结构不仅降低了模型的学习难度,还显著提升了格式遵从性。

这一改进让定位任务的精度和效率得到同步提升。

openPangu-VL-7B的开源,填补了昇腾生态中高性能端侧多模态模型的空白。其轻量化设计与强劲性能,为开发者落地应用提供了极大便利。这一举动是否会加速昇腾在端侧AI领域的普及?值得期待。

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章