国产GPU也能跑万亿级大模型!海光DCU Day0适配Kimi K3:896专家并行不卡顿

2026-07-28 14:24:31 0点赞 0收藏 1评论

快科技7月28日消息,海光信息宣布已完成Kimi K3在海光DCU平台的全栈适配与性能验证,这意味着国产GPU也能跑万亿级大模型了。

海光DCU从底层算子到推理引擎完成了全栈优化,模型代码无需任何调整即可运行,迁移成本几乎为零,开发者拿到算力即可上线部署,兼容性出色。

国产GPU也能跑万亿级大模型!海光DCU Day0适配Kimi K3:896专家并行不卡顿

针对KDA注意力和896专家MoE架构,海光完成算子级定制优化。即使896个专家并行工作,在百万级上下文的重载场景下推理依然高效稳定,不会卡顿。

场景落地方面,K3在海光DCU上可支撑长程智能体工程、视觉闭环创作和自主芯片设计等前沿场景,国产算力用户也可以跑通万亿级开源模型。

需要提及的是,月之暗面在发布K3前,已联合海光、曙光完成完整兼容性调优。曙光基于海光DCU硬件栈,打通了Kimi MoE架构的分布式训练与多卡并行推理链路。

海光DCU则通过底层硬件与软件栈的协同优化,在曙光8000集群上实现了长文本推理的稳定运行。

官方实测显示,国产卡性能折损控制在12%以内,已达到商用部署标准。

国产GPU也能跑万亿级大模型!海光DCU Day0适配Kimi K3:896专家并行不卡顿

编辑:红茶

【本文结束】如需转载请务必注明出处:快科技

展开 收起
1评论

  • 精彩
  • 最新
  • 国产cpu,随着ai的介入越来越深,越来越多agentic ai出现,最先死掉的就是海光信息。

    校验提示文案

    提交
提示信息

取消
确认
评论举报

相关文章推荐

更多精彩文章
更多精彩文章
最新文章 热门文章
0
扫一下,分享更方便,购买更轻松