AI产业高速发展,但算力资源利用率普遍低于40%成为行业瓶颈。华为发布并开源的Flex:ai容器技术,通过精细化的XPU池化与智能调度,有效解决了小模型独占整卡与大模型算力不足的矛盾,为提升算力利用率提供了可落地的解决方案。
智能速览
AI行业算力平均利用率普遍低于40%,资源浪费严重。
华为Flex:ai技术通过XPU池化,可将单卡算力切分至10%粒度。
跨节点虚拟化技术能唤醒通用服务器的“休眠”算力。
Hi Scheduler调度器实现对多品牌异构算力的全局最优调度。
该技术与英伟达50亿收购的Run:ai核心产品功能类似。
华为宣布将Flex:ai开源,旨在推动算力高效利用新范式。
精华内容
面对AI算力利用率低的行业难题,华为并非孤军奋战。继英伟达天价收购Run:ai后,华为联合高校推出Flex:ai,从虚拟化、调度、聚合三个维度给出了自己的解法。
算力精细切分
针对AI小模型训推场景中“一张卡跑一个任务”的资源浪费问题,华为与上海交通大学联合研发了XPU池化框架。该框架可将单张GPU或NPU算力卡精准切分为多份虚拟算力单元,切分粒度最小可达10%。
通过弹性灵活的资源隔离技术,实现了“用多少,切多少”的按需分配模式。此技术方案能使单卡同时承载多个AI工作负载,将该场景下的整体算力平均利用率提升30%,显著提高了单卡的服务能力。
唤醒闲置算力
许多通用服务器因缺乏GPU、NPU等智能计算单元,只能处于算力“休眠”状态。为解决此问题,华为与厦门大学共同研发了跨节点拉远虚拟化技术。
该技术能将集群内各节点的空闲XPU算力聚合起来,形成一个巨大的“共享算力池”。这使得不具备智能计算能力的通用服务器,也能通过高速网络将AI工作负载转发到远端资源池中执行,从而促进了通用算力与智能算力的深度融合。
全局智能调度
在由多品牌、多规格设备构成的算力集群中,统一调度是核心痛点。华为与西安交通大学共同打造的Hi Scheduler智能调度器,为此提供了解决方案。
该调度器能自动感知集群负载与资源状态,并结合AI工作负载的优先级、算力需求等多维参数,对本地及远端的虚拟化GPU、NPU资源进行全局最优调度,实现了AI工作负载对资源的分时复用,最大化了集群的整体效能。
Flex:ai的发布与开源,不仅是华为对AI算力难题的技术回应,更是一场推动AI平民化的实践。通过开放合作,它有望构建起算力高效利用的新范式。未来,这种开源模式能否加速整个AI产业的普惠进程?