华为开源盘古7B与72B混合专家模型,昇腾AI性能提升突破50%瓶颈
在2025年夏季的科技领域焦点事件中,华为一系列开源动作引发了行业热议。这家中国科技巨头于6月30日将两项重要技术成果向全球开放——包括700亿参数的盘古7B稠密模型和720亿参数的Pro MoE混合专家模型的核心代码与权重文件,同时披露了基于昇腾处理器的超大规模模型推理框架。这是该公司推进昇腾AI生态战略的关键布局,标志着国产大模型进入开放协作新阶段。
作为开源项目的核心,Pro MoE 72B模型展现了华为在架构层面的创新突破。面对传统混合专家模型存在的专家激活不均衡问题,研发团队首创分组路由机制(MoGE),通过将专家网络划分固定组别并约束每组激活数量,使得昇腾300I Duo推理卡的单卡吞吐量提升至321 tokens/s,800I A2平台更达到1528 tokens/s。在实际应用中,这种改进让硬件资源有效利用率突破50%的行业瓶颈,对能源、制造等依赖实时推理的行业具有特殊价值。

技术优势在第三方评测中得到了验证。根据SuperCLUE最新榜单,这款参数量仅为同类型产品三分之一的模型,在中文理解、代码生成等场景获得了与千亿级产品相仿的59分综合评分。值得注意的是,其16B的激活参数量甚至低于部分中小型稠密模型,这在自动驾驶实时决策、工业质检等高并发场景展现出明显性价比优势。目前昇腾AI云服务已支持超过1300家企业客户,覆盖从科研机构到互联网平台的多维需求。
华为同期公布的昇腾AI云服务平台升级方案同样值得关注。该平台采用自主设计的CloudMatrix 384超节点架构,通过高速互联技术整合384颗昇腾NPU和192颗鲲鹏CPU,构建出可弹性扩展的超级计算单元。在实际测试中,这种设计使得单机推理吞吐量达到传统架构的四倍,而16万卡互联形成的超大规模集群,更打开了十万亿参数级大模型的商用化空间。

从产业视角观察,此次开源不仅提供了可供商用的代码资源库,更重要的是完成了昇腾计算体系的技术验证。基于分组路由的MoGE架构成功攻克了专家负载均衡难题,在东莞模具厂的实际应用中,该技术帮助精密零件调试时间从8小时缩短至20分钟,显示出工程落地的实效性。对于正在构建自主AI生态的中国市场而言,这套包含算法创新、硬件适配、云端协同的完整方案,正在为金融预测、气象模拟等专业领域提供新的基础设施选项。
