如果你的机房里已经躺着一批 openEuler 的信创服务器,而最近业务侧开始问"能不能顺便把大模型推理也跑起来",那这篇文章值得你花十分钟看完。
过去这个夏天,openEuler 社区干了一件不太起眼但很实的事:悄悄把"跑 AI 负载"从一个需要自己拼环境的手工活,变成了系统级的能力。6 月 30 日,24.03 LTS SP4 发布,官方给这个版本定的主旋律就是两个词——“AI for OS"和"OS for AI”。知乎知乎随版本带来的智能运维工具 Witty,也已经能用自然语言完成性能采集、分析和调优。8 月 24 日社区又专门开了一场直播,主题就叫"openEuler 社区 AI 亲和有哪些新变化"。哔哩哔哩这场直播回放现在只有几十次播放,但里面讲的东西,恰恰是信创一线最缺的那块拼图。
我把发布说明、直播回放、KADC 2026 分论坛和 FlagOS 社区最近两个月的公开信息都翻了一遍,帮你把"AI 亲和"这盘菜拆成两类:现在就能装的,和还得再等等的。

先说结论:6 个现在就能用的东西
1)AI 容器镜像:把 NVIDIA 和昇腾的软件栈直接打包进镜像。这是解决"系统装好了、AI 环境配崩了"这个经典痛点最直接的方案。openEuler 把不同算力平台的软件栈做了容器化封装,拉下来开箱即用,不用再跟驱动版本、依赖矩阵搏斗。知乎跑过 openEuler 上 Docker 环境各种怪问题的人应该懂这个含金量——社区里光是宝塔面板建容器失败、onload 驱动装不上这类踩坑帖,最近两个月就没断过。知乎知乎
2)XPU Turbo:面向"鲲鹏 + xPU"异构协同的大模型推理加速运行时,专门提升单机多卡场景的吞吐和并发。知乎它瞄准的是国产算力最典型的一个现实:CPU 是鲲鹏,卡是 NPU/GPU,两者怎么配合把推理效率榨出来,以前基本靠业务自己调。
3)GMem:异构内存统一管理框架。关键能力一句话:当加速卡的 HBM 不够用时,可以把 CPU 内存透明地拿来做缓存、超分 HBM,应用层不用手动 swap,也不用处理内存搬移。知乎显存焦虑这个事,它给了一条系统级的路。
4)ModelFS:优化大模型推理启动阶段的模型加载。做法是在内核里做了可编程页缓存框架,针对模型加载定制缓存策略。知乎模型越大、冷启动越频繁,这个越有感。
5)xSched:面向中小模型的 NPU 调度框架,支持任务抢占、时间片切分、算力带宽管控、显存容量管控。知乎它解决的是一个很实际的浪费问题:中小模型独占一张卡太奢侈,在线推理和离线推理混部又没人管,xSched 就是把这件事管起来的组件。
6)推理容器秒级恢复:基于 CRIU 做进程状态 dump/restore,还做了 NPU 驱动状态的导入导出,并对接 K8s 生态,把推理容器故障恢复从分钟级压到秒级。知乎生产环境跑过推理服务的人都知道,凌晨三点服务挂了、重启要等几分钟,这个特性就是冲这个场景去的。
再说 3 个还得再等等、或者有门槛的
1)Witty 的智能调优和慢节点定位:Witty 确实已经能用自然语言做性能采集、分析和调优,还接入了 MCP 协议做调优意图识别。知乎AI 集群慢节点定位基于 sysTrace 时序分析,思路很新。但它目前更像一个"聪明的助手"而不是成熟的自动化平台,效果取决于你的场景和知识库积累,建议先在测试环境玩,别一上来就接生产。
2)超节点相关能力(UB 设备管理、跨节点内存池化、URMA 通信):SP4 里这部分写得很重,方向也确实是面向未来的——KADC 2026 分论坛的主题就是"夯实超节点算力底座,面向 Agentic AI 演进"。哔哩哔哩但要提醒一句:这套东西绑定灵衢(UnifiedBus)硬件体系,你机房里如果没有对应的超节点设备,这部分就当新闻看,别为它升级。知乎

3)FlagOS 接入:智源的 FlagOS 正在把跨芯片 AI 系统软件栈接进 openEuler、deepin、openKylin 这些传统 OS 生态,7 月两边已经官宣合作。哔哩哔哩但 FlagOS 本身还在快速迭代期(6 月底刚发 2.1),现在上生产偏早,值得放进观察清单。知乎
一个值得单独盯的变量:多芯片适配
如果你的机柜里不止一种卡,FlagOS 这条线的进展值得认真看。最近两个月它的社区动作非常密集:腾讯混元 Hy3 发布当天完成七颗芯片 Day0 适配,开箱性能达到英伟达原生的 97.7%。知乎8 月 13 日 Qwen3.8 发布首日,2.4 万亿参数版本完成九芯适配。知乎三天后 27B 版本把适配芯片扩到 11 款,覆盖平头哥、摩尔线程、沐曦、昆仑芯、昇腾、海光、燧原等主流国产芯片。知乎换句话说,"新模型发布当天、多芯片同时能跑"这件事,正在从口号变成常态。而 openEuler 作为这些芯片服务器最常见的底座,是这个趋势的直接受益方。

顺带说一句生态面的背景信号:8 月下旬,航空工业计算所的天脉 Linux 通过了 openEuler 社区技术测评。微博openEuler 香港用户组也正式成立。知乎底座生态在往行业纵深和海外两头扩,这对"押不押欧拉"这个决策来说,算是正向筹码。

给你的行动建议,按场景分
已经在 24.03 LTS 上跑业务:SP4 是增强版本(内核 6.6),建议先在测试机升级验证,重点试 AI 容器镜像 + ModelFS,这两个见效最快、风险最小。知乎
准备在信创机器上起大模型推理:先别急着裸装驱动和框架,优先看官方 AI 容器镜像路线;鲲鹏 + 昇腾组合再叠加 XPU Turbo 测一轮吞吐。
有多租户、多模型混部诉求:xSched + 秒级恢复值得专门搭一套环境压测,这是 SP4 里差异化最明显的部分。
手里芯片种类杂:关注 FlagOS 在 openEuler 上的适配进展,Season 2 的 SGLang 算子优化挑战赛正在进行,后续会持续产出跨芯片性能数据,是很好的参考锚点。知乎
最后留个观察信号:按 openEuler 的节奏,9 月前后通常有创新版动作,年底还有 openEuler Summit。SP4 这套"AI 亲和"特性目前是 LTS 线上最完整的形态,接下来半年社区怎么把 Agentic AI 的故事做实,值得保持关注。
你的信创机器上现在跑的是哪套大模型方案?裸装 CANN、容器镜像还是别的路线?评论区聊聊,踩过的坑也欢迎补充。