Arm发布史上最强C2 Ultra CPU、首个AI原生GPU:打造新一代移动计算平台

2026-09-08 11:47:54 0点赞 0收藏 0评论

快科技9月8日消息,过去两年,生成式AI让手机等终端能回答问题,如今的智能体(Agent)AI则要求终端能完成任务替人办事,这个转变看起来只差一步,对终端硬件的要求却是完全不一样。

生成式AI只需要处理一次请求,一次推理,一次响应,算力峰值过后系统回到低功耗待命。但智能体AI需要感知用户意图、检索记忆、推理规划、跨应用执行,整个过程涉及语音识别、向量检索、小模型推理、大模型调用等多个环节的串联。

Arm发布史上最强C2 Ultra CPU、首个AI原生GPU:打造新一代移动计算平台

这种工作负载的特征是:延迟敏感、突发性强、内存密集、高度异构,没有任何单一计算单元能独立胜任,CPU负责编排调度,GPU负责并行计算,加速器负责特定任务,云端的超大模型随时待命。

问题在于,这些组件之间的数据传输效率、任务调度协同、内存访问延迟,才是决定用户体验的关键。

对此Arm在Everywhere China活动上,正式发布了第二代移动终端计算子系统CSS for Mobile 2,这也是首个AI原生移动计算平台,它集成了最新的Arm C2 CPU集群、首个AI原生Mali GPU G2-Ultra NX。这并非一个单纯更快的CPU或GPU,而是从架构设计、物理实现到软件生态,共同展开的系统级协同优化。

Arm发布史上最强C2 Ultra CPU、首个AI原生GPU:打造新一代移动计算平台

C2 CPU集群

在CSS for Mobile 2平台中,承担中枢调度角色的是C2 CPU集群,旗舰参考配置采用2+6布局,两颗支持SME2可扩展矩阵延伸指令集的C2-Ultra核心,搭配六颗C2-Pro核心,通过DSU共享L3缓存。

Arm发布史上最强C2 Ultra CPU、首个AI原生GPU:打造新一代移动计算平台

C2-Ultra是Arm迄今最强大的移动CPU核心,能效方面,根据Arm公布的数据,GeekBench 6.3单线程提升15%,多线程提升12%;Speedometer 3.1网页浏览性能提升15%;应用启动加速12%;而在相同性能输出下,C2-Ultra的功耗相比上一代C1-Ultra 大幅降低了38%。

Arm发布史上最强C2 Ultra CPU、首个AI原生GPU:打造新一代移动计算平台

从微架构层面看,相比上一代C1-Ultra,C2-Ultra的改进集中在三个方向:

更大的执行引擎。C2-Ultra在4.45GHz+频率下实现了超过15%的峰值性能提升,核心能够同时容纳更多在途指令,具备更高的指令级并行度,配合智能推测机制,每个活跃周期能完成更多有效工作,因数据依赖导致的空闲等待周期明显减少。

Arm发布史上最强C2 Ultra CPU、首个AI原生GPU:打造新一代移动计算平台

更聪明的数据搬运。数据加载效率提升,依赖数据返回后相关工作能更快启动;Load/Store缓冲区扩容,核心能同时跟踪更多内存操作;预取更精准,可预测的数据流在核心请求前就被拉近。这三项叠加,大幅减少了后端停顿。

Arm发布史上最强C2 Ultra CPU、首个AI原生GPU:打造新一代移动计算平台

更精准的分支预测。在浏览器、应用启动及各类基准测试场景下,大幅降低了复杂工作负载中的分支误预测,减少错误路径执行造成的资源浪费。配合更强大的取指能力、目标地址预测,以及更快的误预测恢复机制,确保了核心拥有持续稳定的指令流供给。

Arm发布史上最强C2 Ultra CPU、首个AI原生GPU:打造新一代移动计算平台

SME2与LUTi

SME2可扩展矩阵延伸指令集是C2 CPU集群AI能力的核心,要知道端侧智能体并不是一个大模型包办一切,而是一组各司其职的专用小模型,语音、记忆检索、推理各用各的模型,由CPU上的编排层统一调度,SME2 的价值正体现在这些轻量模型上。

Arm发布史上最强C2 Ultra CPU、首个AI原生GPU:打造新一代移动计算平台

C2-Ultra 还引入了对 LUTi查表指令的支持,该指令专为查找密集型工作负载设计,能够大幅减少频繁的内存访问,在2-bit超低精度量化模型下进一步释放内存带宽压力。

Arm发布史上最强C2 Ultra CPU、首个AI原生GPU:打造新一代移动计算平台

在实际运行中,编码阶段是计算受限,用SME2提高计算密度;解码阶段是带宽受限,用LUTi 负责内存与带宽优化,两者强强联合,完成了对端侧AI模型全链路推理的高效覆盖。这也是为什么Arm强调SME2“天然适合构成移动端智能体的轻量模型积木”。

Arm发布史上最强C2 Ultra CPU、首个AI原生GPU:打造新一代移动计算平台

实测数据显示,在语音识别(Moonshine、Parakeet)、个人记忆检索(LFM 2.5-Colbert-350M 多语言搜索)以及推理生成(LFM 2.5 1.2B、Qwen 3.5 0.8B/2B、MiniCPM 5 1B、Gemma 4 E2B 等端侧小模型)三类工作负载中,2×C2-Ultra + SME2相比2×C1-Ultra + SME2,实现了平均1.7 倍的性能提速。

Arm发布史上最强C2 Ultra CPU、首个AI原生GPU:打造新一代移动计算平台

Arm发布史上最强C2 Ultra CPU、首个AI原生GPU:打造新一代移动计算平台

Arm发布史上最强C2 Ultra CPU、首个AI原生GPU:打造新一代移动计算平台

Arm还用一个“策划周年纪念晚餐”Agent工作流演示了体验:语音转文字阶段,C2-Ultra比C1-Ultra提速40%;记忆检索阶段快41%;推理生成结构化提示词阶段提速25%。整个流程的总耗时从C1-Ultra的约450毫秒缩短至C2-Ultra的约280毫秒,而在启用SME2后,延迟被进一步压缩24%。

Arm发布史上最强C2 Ultra CPU、首个AI原生GPU:打造新一代移动计算平台

能在约200毫秒级完成“感知-记忆-推理-执行”的全链路闭环,这意味着端侧AI智能体的响应速度已正式跨入用户无感等待的即时交互区间。

Arm发布史上最强C2 Ultra CPU、首个AI原生GPU:打造新一代移动计算平台

还有一个值得注意的细节是C2 CPU集群的灵活性,Arm提供了从入门级2N到旗舰2U+6Pro的多种配置,三档不同微架构(Ultra/Pro/Nano)可在同一集群内混搭,每档核心独立调频,合作伙伴可以根据产品定位灵活配置。

Mali G2-Ultra NX:首款AI原生Mali GPU

CPU之外,图形一侧的压力同样急剧攀升,更高分辨率、更大规模的开放世界、更复杂的光线追踪,负载复杂度的增速已经超过手机功耗预算的增长上限。在1–2W的功耗与散热约束下,全分辨率、逐帧完整渲染的传统渲染路径,已无法平衡桌面级画质与高持续帧率的需求。

Arm发布史上最强C2 Ultra CPU、首个AI原生GPU:打造新一代移动计算平台

Arm 给出的破局方案是神经图形(Neural Graphics):采用选择性渲染,并利用AI算法重建画面细节、中间帧及光照。原生渲染的像素占比可大幅降低至1/8,剩余7/8的画面全由 AI 重建,同时保持与原生渲染相媲美的画质水平。其设计目标是在1W的功耗预算内,实现高保真的神经图形渲染体验。

Arm发布史上最强C2 Ultra CPU、首个AI原生GPU:打造新一代移动计算平台

Mali G2-Ultra NX是首款AI原生Mali GPU,AI原生主要体现在三个架构层面的创新:

Arm发布史上最强C2 Ultra CPU、首个AI原生GPU:打造新一代移动计算平台

第一,神经加速器(NX)直接嵌入着色器核心。将专用神经加速电路与GPU的执行引擎、内存系统、控制结构紧密集成。NX单元支持INT8与INT16精度计算,运行频率最高可达GPU频率的2倍,支持完整张量运算与权重压缩,还集成了运动引擎与光流加速器。

这种深度集成使得神经图形任务能够与传统图形、计算流水线并行执行,并直接复用GPU的缓存与内存子系统,极大减少了跨单元的数据搬运开销。

Arm发布史上最强C2 Ultra CPU、首个AI原生GPU:打造新一代移动计算平台

第二,全新执行引擎(EE)。这是7代以来最大的ISA(指令集架构)重构,直接面向虚幻引擎5的Nanite虚拟几何体与Lumen动态全局光照而设计。面对日益复杂的现代着色器,寄存器溢出往往是导致性能暴跌的主因。

而新一代EE将每个Warp的寄存器容量直接翻倍,并支持16-Warp粒度的动态宽寄存器分配,大幅减少了溢出损失,GPU能更高效地运行更大规模的着色器程序,为更丰富的场景、更高视觉保真度与更稳帧率预留算力余量。

Arm发布史上最强C2 Ultra CPU、首个AI原生GPU:打造新一代移动计算平台

第三,第三代光线追踪单元(RTU v3)。移动端光追的核心瓶颈在于,随着场景几何复杂度激增,传统BVH结构中的三角形节点数据急剧膨胀,迅速挤爆缓存并吃满带宽。RTU v3引入了更紧凑的三角形存储结构,重复边与共享顶点不再需要重复存储,从而将更多数据塞进缓存,大幅释放DRAM带宽压力。

Arm发布史上最强C2 Ultra CPU、首个AI原生GPU:打造新一代移动计算平台

同时,硬件级不透明度微图(OMM)的引入,让光线与复杂透明/半透明几何体(如树叶、栅栏)的命中测试变得极度精确,降低了透明物体的光追计算成本。官方数据显示使用OMM可使帧率提升30%,同时将光线追踪工作负载最多降低70%。

Arm发布史上最强C2 Ultra CPU、首个AI原生GPU:打造新一代移动计算平台

Arm发布史上最强C2 Ultra CPU、首个AI原生GPU:打造新一代移动计算平台

得益于架构层面的创新,Mali G2-Ultra NX带来三项神经图形技术:

Arm发布史上最强C2 Ultra CPU、首个AI原生GPU:打造新一代移动计算平台

NSS(神经超级采样):以低分辨率进行渲染,并通过神经网络重建出高分辨率图像。支持将540p的渲染输入重建为1080p的高保真输出,画质表现直逼桌面级神经超分方案,且原生渲染的像素量仅为原来的1/4。

Arm发布史上最强C2 Ultra CPU、首个AI原生GPU:打造新一代移动计算平台

实测数据显示,在持续功耗约束下,NSS实现了1.9–2.1倍的帧率提升,同时将DRAM带宽开销削减50%,单帧动态能耗降低50%–60%。

NFRU(神经帧率提升):由前后两帧原生渲染画面提供颜色、深度与运动矢量(Motion Vector)作为输入,结合硬件级光流加速器,辅助神经网络生成高质量的中间帧。在实际测试中,NFRU能够将游戏的持续帧率从60FPS拉升至120 FPS,同时将DRAM访存流量降低了33%。

Arm发布史上最强C2 Ultra CPU、首个AI原生GPU:打造新一代移动计算平台

Arm发布史上最强C2 Ultra CPU、首个AI原生GPU:打造新一代移动计算平台

NSSD(神经超级采样与降噪):专为光追场景打造的神经重建技术。移动端光追因功耗限制,初始渲染往往处于极低采样率状态,导致画面充满了高频噪点。NSSD利用神经网络同时接管超采样放大与光追降噪两大核心工序,直接一步到位输出清晰、无噪点的高分辨率光追画面。

Arm发布史上最强C2 Ultra CPU、首个AI原生GPU:打造新一代移动计算平台

NSS、NFRU模型已在Hugging Face与GitHub开源,虚幻引擎等主流引擎插件即插即用;Arm表示改造现有游戏周期在3至6个月,新作则在18个月以内。

Arm发布史上最强C2 Ultra CPU、首个AI原生GPU:打造新一代移动计算平台

Arm还演示了与Sumo Digital联合打造的《光影新生》(Neural Dawn)手游,作为首款在移动端落地UE5.5 MegaLights的作品,它在无需预烘焙光照的前提下支持最多1400个动态光源,这种负载过去在手机上不可想象。

Arm发布史上最强C2 Ultra CPU、首个AI原生GPU:打造新一代移动计算平台

在上一代CSS G1-Ultra平台上只能跑15FPS,在Mali G2-Ultra NX上就能以60 FPS持续运行,4倍帧率提升,70%能效提升,70% DRAM流量降低。官方确认该游戏将于2026年内随首批Mali G2-Ultra NX设备推出。

Arm发布史上最强C2 Ultra CPU、首个AI原生GPU:打造新一代移动计算平台

传统图形性能方面,Mali G2-Ultra NX同样带来了全方位的两位数提升:传统光栅化与光追游戏基础性能均提升9%;在各大基准测试中,Steel Nomad Light提升17%,Invitro 2提升18%,安兔兔v11提升20%,Solar Bay Extreme更是大幅提升24%。综合来看,其平均游戏性能提升约20%,且光追场景下的单帧DRAM带宽需求降低了14%。

Arm发布史上最强C2 Ultra CPU、首个AI原生GPU:打造新一代移动计算平台

SI L2系统互连

CPU和GPU再强,如果数据在系统中的传输效率低下,整个平台的性能就会被拖后腿。CSS for Mobile 2用新一代SI L2系统互连接替了SI L1,通过通道化互连架构,把C2 CPU集群、Mali G2-Ultra NX、统一内存与各类设备组织为一个整体。

Arm发布史上最强C2 Ultra CPU、首个AI原生GPU:打造新一代移动计算平台

SI L2 的核心能力主要体现在四大维度:

带宽与内存:完整支持LPDDR6标准,为统一内存架构提供更高吞吐的带宽保障;

访存延迟:显式访存请求(Demand Load)从CPU到DRAM的延迟相比SI L1骤降约45%,这正是端侧AI实现即时响应的关键底层支撑;

Arm发布史上最强C2 Ultra CPU、首个AI原生GPU:打造新一代移动计算平台

系统协同:提供面向软件编程模型的高效可扩展硬件一致性(Hardware Coherency),以及针对多元流量画像的高级QoS机制,确保CPU、GPU高并发运行与共享数据时的秩序与效率;

安全与PPA:实现了高能效的MTE(内存标签扩展)与DVM(分布虚拟内存)支持,兼顾低面积与低功耗的物理设计。

Arm发布史上最强C2 Ultra CPU、首个AI原生GPU:打造新一代移动计算平台

高达45%的内存延迟削减,叠加LPDDR6带来的高吞吐带宽,才是C2-Ultra与Mali G2-Ultra NX性能提升能够全面兑现的系统性前提。这也是Arm以计算子系统(CSS)形态交付的真正价值所在,在AI原生时代,单纯堆砌最快的CPU和最强的GPU,根本拼不出最低的系统级延迟。

软件生态:让硬件能力开箱即用

软件生态同样是Arm布局最深、最久的一环。作为软硬协同的核心加速引擎,主力开发者工具KleidiAI已实现100+第三方应用集成、12+主流AI框架深度适配,并积淀了200+经过深度优化的微内核与14万行代码,为Arm CPU搭建起极致高效的算子执行路径。

Arm发布史上最强C2 Ultra CPU、首个AI原生GPU:打造新一代移动计算平台

例如Qwen3-TTS、HY-MT1.5-1.8B-2Bit等前沿大模型,在经过Arm针对性优化后,均可直接部署并无缝跑在C2-Ultra的SME2算力单元之上。

全新的Arm AI Portal作为面向AI应用开发者的统一入口,提供预优化模型、性能与精度数据、代码示例和部署资源,还集成了MCP服务器以支持智能体AI开发环境。

Arm发布史上最强C2 Ultra CPU、首个AI原生GPU:打造新一代移动计算平台

开发者可以在平台上找到适合特定工作负载的模型,了解其在Arm硬件上的性能表现,加速从评估到部署的全流程。对于有自研模型的开发者,Arm还提供早期访问版模型优化工具。

Arm发布史上最强C2 Ultra CPU、首个AI原生GPU:打造新一代移动计算平台

神经图形方面,Arm神经图形开发套件(ArmNG SDK)提供NSS和NFRU的开放模型(已在Hugging Face和GitHub发布)、Vulkan ML扩展、虚幻引擎插件和自定义引擎SDK,配套性能分析、图形优化、训练和模型优化工具。

CSS for Mobile 2反映的是Arm对移动计算演进方向的判断,手机等移动终端AI的发展将由智能体AI与AI原生图形两类工作负载共同定义,这两类负载的需求既有交叉也有差异。

Arm发布史上最强C2 Ultra CPU、首个AI原生GPU:打造新一代移动计算平台

智能体AI最关键的是响应链路,从语音、记忆检索、推理到应用调用的多阶段串行流程,每一步的延迟都会累积成用户可感知的等待,因此Arm 把重心放在CPU的编排能力、SME2/LUTi 对低精度小模型的加速,以及SI L2对内存延迟的削减上。

AI原生图形则更关注吞吐与能效,在1–2W的功耗预算内同时维持高帧率与高画质,因此Arm选择把神经网络加速器做进着色器核心、用选择性渲染加AI重建绕开渲染墙。

但这两类负载还有一个共同点,它们对计算平台系统级协同的要求远超以往,CPU、GPU、互连、内存与软件整体协同效率的提升,远比任何单点峰值算力重要。

CSS for Mobile 2是Arm这个判断的完整落地,至于实际情况如何,且等搭载它的旗舰SoC用实测说话。

Arm发布史上最强C2 Ultra CPU、首个AI原生GPU:打造新一代移动计算平台

编辑:黑白

【本文结束】如需转载请务必注明出处:快科技

展开 收起
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

相关文章推荐

更多精彩文章
更多精彩文章
最新文章 热门文章
0
扫一下,分享更方便,购买更轻松