从闷声到亮剑:大厂AI芯片的算力突围

源自公众号:AI 芯研社

01-14 19:55

长久以来低调潜行的国产AI芯片,正迎来高调时刻。华为、百度等大厂接连公布详细的芯片迭代路线图与超节点集群方案,一改往日“啥都不敢讲”的谨慎。这不仅是抢占市场、展现技术自信的信号,更标志着在供应链突围后,国产AI算力正试图以系统性创新,弥补单点性能的差距,开启一场全新的算力突围战。

从闷声到亮剑:大厂AI芯片的算力突围智能速览

  • 华为、百度打破沉默,高调公布AI芯片迭代路线图,抢占市场先机。

  • 华为未来三年将推四款昇腾芯片,首创业内P/D分离路线,优化推理效率。

  • 百度昆仑芯推出M系列芯片,并计划构建千卡、四千卡乃至百万卡级超节点集群。

  • 面对单芯片工艺限制,“超节点+集群”成为国产算力弥补性能差距的核心解决方案。

  • 国产AI芯片主攻推理市场,训练市场仍由华为昇腾主导,但需付出更高成本。

从闷声到亮剑:大厂AI芯片的算力突围精华内容

面对先进制程受限的客观现实,单纯追求单颗芯片的性能突破已难以为继。国产AI芯片的破局之路,正转向一场围绕互联、集群与系统架构的全方位较量,这考验的早已不止是芯片本身。

战略转向:从低调到高调

过去数年,受制于外部环境,国产AI芯片公司普遍选择低调行事,其最新产品与参数信息往往秘而不宣。一位与大厂关联密切的芯片公司负责人坦言:“这几年做芯片比较敏感,我们出来讲得也比较少。”

然而,这一局面近期被彻底打破。华为宣布未来三年将发布四款昇腾AI芯片,百度也规划两年内推出两款昆仑芯。与百度仅披露型号和用途不同,华为更是将互联带宽、算力、内存等核心参数悉数公开,颗粒度之细,近年罕见。

国际投资研究机构盛博分析师林清源将此视为“里程碑式的转折”。他认为,此举旨在向客户呈现清晰的产品路线图,以抢占英伟达留下的市场蛋糕,同时让投资者看到大厂可依赖国产算力持续发展。国产半导体供应链的突围,尤其是7纳米产线设备的国产化替代,为这一转变提供了坚实基础。

技术路线:华为与百度的不同打法

华为打响了高调的第一枪,其公布的路线图展现了深厚的技术积累。华为计划在2026至2028年相继推出昇腾950、960和970系列。其中,950系列创新性地分为950PR和950DT两款,分别对应模型推理的预填充和解码阶段,即业内兴起的P/D分离路线。

具体参数上,950PR采用自研低成本HBM,内存容量128GB,带宽1.6TB/s,主打性价比;而950DT则采用高性能HiZQ 2.0内存,容量达144GB,带宽高达4TB/s,应对训练和解码的高要求。二者互联带宽均为2TB/s。

百度紧随其后,公布了昆仑芯的路线图:2026年初推出针对大规模推理场景的M100芯片,2027年初发布面向超大规模训练的M300芯片。相较于华为,百度披露的参数较少,但其超节点产品已实现核心部件国产化。一台搭载昆仑芯P800的64卡超节点,单卡功耗约400瓦,FP16总算力超20 PFlops,单卡算力约为英伟达A100的一半。

破局关键:“超节点”补短板

由于国产芯片先进制程被限制在7纳米,华为与百度不约而同地将“超节点+集群”作为突围关键。华为轮值董事长徐直军表示,这是在极限制裁下被逼出来的范式,是提供可持续算力的唯一途径。

传统计算集群采用横向扩展架构,通过通用以太网连接服务器,但网络带宽和时延成为瓶颈,严重影响大模型训练效率。超节点方案则采用纵向扩展,通过高速互联协议将大量芯片在逻辑上整合为一台“巨型计算机”

华为的Atlas 950超节点计划在2026年四季度支持8192张昇腾950DT芯片,2027年迭代至支持15488张昇腾960芯片。其已发布的CloudMatrix 384超节点(384颗昇腾910C)被分析机构认为可与英伟达NVL72竞争,虽然功耗是其4.1倍,但芯片数量是5倍,足以弥补单卡性能不足。百度也规划了“天池”系列超节点,预计在2029年点亮百万卡级单集群。

现实挑战:训练与稳定性

尽管前景广阔,但国产AI芯片在应用层面仍面临严峻挑战。在训练市场,绝大多数宣称“训推一体”的芯片实际只能用于推理或小模型微调。华为昇腾910C是少数能用于部分大模型训练任务的芯片,但其主要应用场景仍是推理。科大讯飞曾透露,为在国产算力平台训练模型,额外付出了两个月的适配时间成本。

此外,大规模集群的硬件稳定性是另一大难题。训练任务高度同步,任何一颗芯片故障都会导致整个集群暂停。百度智能云科学家王雁鹏指出,国产芯片的故障率被放大,甚至会出现难以定位的“静默故障”,可能导致“整个集群就完蛋了”。因此,集群必须具备快速自愈和恢复能力,这对芯片厂商的系统化能力提出了极高要求。

市场博弈:主攻推理与内部循环

面对训练市场的技术壁垒,众多国产AI芯片厂商涌入门槛相对较低的推理领域。IDC数据显示,2025年上半年中国GenAI IaaS服务市场中,推理场景占比已上升至42%。百度智能云高管判断,国产推理芯片已能满足当前先进模型的使用需求,一台8卡国产推理服务器即可运行DeepSeek R1-671B模型。

对于华为、百度、阿里等大厂而言,自研芯片拥有天然优势——内部庞大的云业务和AI业务提供了稳定的需求和验证环境。这不仅为芯片迭代提供了宝贵的数据反馈,也避免了向外部供应商支付高额利润,从而大幅降低成本。百度集团执行副总裁沈抖透露,百度绝大多数推理任务已运行在自研的昆仑芯P800芯片上。在服务内部需求的基础上,昆仑芯也已中标中国移动集采,开始向外拓展市场。

从被动沉默到主动亮剑,国产AI芯片的集体高调,是技术突围与市场自信的体现。尽管单点性能仍有差距,但通过超节点集群的系统创新,中国大厂正走出一条独特的算力发展路径。未来,这条道路能否真正撼动全球格局,仍需商业化落地的持续检验。

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章