Arm全新手机计算平台降临!首个AI原生GPU,超分、帧生成都有了

2026-09-09 08:53:39 0点赞 0收藏 0评论
Arm全新手机计算平台降临!首个AI原生GPU,超分、帧生成都有了

随着生成式AI、智能体AI逐步在云、边、端普及开来,作为底层算力支持的硬件,无论是传统的CPU、GPU还是新兴NPU乃至网络等等,都在发生翻天覆地的变化,必须适应当下乃至未来的新趋势。

眼下,AI的能力正在发生革命性的质变,一个新的时代正在悄然到来。

过去的生成式AI,只能被动响应指令,交互频次很低,输出的都是通用内容,并且以云端计算为主。

未来的智能体AI,要求第一能够自主感知相关上下文信息、预判用户意图、规划任务流程;

第二可以代表用户,协调各类应用与服务,自动执行任务,形成端到端的完整工作流;

第三必须高度个性化,拥有长久记忆和学习能力,精准匹配不同用户、不同场景的不同需求,提供持续的辅助。

芯硬件认为,本质上,这就是从单一AI助手,进化为多个AI智能体协同;从简单的AI功能,跃迁为设备系统的一部分;从“回答问题”,升级为“完成目标”。

可以预料,今后的最佳AI体验,必将是云端与本地智能协同,工作负载部署在体验最优的位置,并且本地运行的占比会越来越高。

Arm全新手机计算平台降临!首个AI原生GPU,超分、帧生成都有了

在各种本地和边缘设备中,智能手机移动平台无疑是最特殊的一个,因为AI最渴求的就是算力,而高算力往往意味着高功耗、高发热,这可是移动平台一贯的不可承受之痛。

同时,日益复杂的工作负载、智能体工作流、图形技术,都对移动计算设备提出了新的要求,不同层面的性能都必须与时俱进,包括各个任务阶段的执行速度、数据在不同计算引擎间的传输效率、系统对全任务流程的协同调度能力。

所以,一款优秀的移动平台,既要提供足够高的算力、足够多的特性,又要严格控制尺寸、能效,在极为有限的空间内发挥最大能力。

Arm全新手机计算平台降临!首个AI原生GPU,超分、帧生成都有了

Arm作为移动行业的龙头,早已成为边缘AI的基础、普适算力平台,全面覆盖从PC到手机、从个人AI计算设备到智能硬件的各类终端,仅凭借单一Arm架构平台,即可支撑全品类边缘设备的AI体验。

早在2023年,Arm就打造了全新的CSS(计算子系统)方案,将旗下各种IP整合成一套完整的平台级解决方案,逐渐完整覆盖了数据中心基础设施(Neoverse)、PC、手机、汽车(Zena),为客户提供了极大的便利。

Arm全新手机计算平台降临!首个AI原生GPU,超分、帧生成都有了

如今,Arm CSS for Mobile 2正式诞生!

这是Arm第一款原生支持AI的移动计算平台,包括原生AI图形技术与智能体AI全面适配,尤其是在GPU中首次集成了神经网络加速器(NX),可用于各品类边缘计算设备。

你可能会问了,既然有“2”,那么“1”在哪里?

其实,上代Lumex CSS就是“1”,不过为了更好地突出定位,Arm重新梳理了命名,Arm CSS for PC面向笔记本,Arm CSS for Mobile面向手机,如今自然就是第二代啦。

Arm全新手机计算平台降临!首个AI原生GPU,超分、帧生成都有了

Arm CSS for Mobile 2包括全新的C2系列CPU、 G2系列GPU,以及多种系统IP,还有配套软件、开发工具,共同组成了一个完整的平台。

接下来我们先看GPU,再看CPU、系统IP。

【GPU:首次原生AI,带来三大神技】

目前,全世界超过99%的智能手机,都配备了Arm架构的处理器,其中Arm Mali GPU的累计出货量已经超过140亿颗,是全球最大的GPU平台,具备无可比拟的产业生态优势。

放眼整个图形产业,正在发生根本性的扭转,从传统的光栅化图形,加速向AI加速图形(神经图形)演进。

同时,桌面级图形技术突飞猛进,不断带来更高的分辨率、帧率,更复杂的几何、光照、光线追踪,并且持续向移动平台转移渗透,进入平台融合新阶段,跨设备的统一图形体验成为刚需。

但是,移动端在散热、电池性能始终缺乏明显改进,所以如何在功耗、续航的限制下提升图形处理能力,是非常考验平台设计的。

Arm全新手机计算平台降临!首个AI原生GPU,超分、帧生成都有了

Arm新一代GPU名为“Mali G2-Ultra NX”,是首款AI原生的Mali GPU,包括三大新的核心模块:

一是神经网络加速器(NX):

深度集成AI加速,可在1W低功耗下实现逼真的神经网络渲染图形,突破传统移动GPU的渲染瓶颈。

正因为突破如此之大,所以GPU型号命名中就带有NX字样。

二是新的新执行引擎(EE):

Mali GPU 7代以来最大的ISA指令集架构升级,已全面适配UE5虚幻引擎的Nanite(虚拟几何)、Lumen(全局光照)。

三是第三代光追单元(RTU):

支持全场景的实时光照与阴影,并支持OMM(不透明度微图)。

与之配套的软实力,则是开放的软件栈、全生态的赋能。

Arm全新手机计算平台降临!首个AI原生GPU,超分、帧生成都有了

根据Arm官方的数据,Mali G2-Ultra NX对比上代Mali G1-Ultra,综合基准性能平均提升20%,其中光追的3DMark Solar Bay Extreme提升24%、In Vitro 2提升18%,非光追的安兔兔v11提升20%、3DMark Steel Nomad Light提升20%。

游戏性能提升最多14%,比如《崩坏:星穹铁道》提升9%、《绝区零》提升9%、《堡垒之夜》提升14%。

另外,内存带宽占用也降低最多13%。

但,这还只是基础性能,神经网络加速器和三大AI技术才是它的绝技。

Arm全新手机计算平台降临!首个AI原生GPU,超分、帧生成都有了

Arm全新手机计算平台降临!首个AI原生GPU,超分、帧生成都有了

不过在聊神经网络加速器之前,先看看新的执行引擎。

这一代的执行引擎,是过去七代Mali GPU产品以来,规模最大的一次ISA指令集架构升级,充分汲取了UE5引擎的Lumen、Nanite设计灵感。

它支持的每个线程束的寄存器数量,比上代增加了一倍,并采用16个宽度的动态寄存器分配机制,有助于在着色程序规模扩大、复杂度增加的情况下,减少寄存器的溢出。

如此,GPU就可以更高效地运行规模更大的着色器程序,为呈现更丰富的场景、更高的视觉保真度、更稳定的帧率预留充足的算力余量。

Arm全新手机计算平台降临!首个AI原生GPU,超分、帧生成都有了

第三代硬件光追技术可以使移动设备支持更复杂的光照、阴影、反射和几何效果,并节约最多13%的内存带宽占用,从而在场景复杂度不断增加时减少内存压力。

新架构采用了更小巧、更高效的光线-三角形数据结构,可以消除重复边缘、实现边缘共享、减少几何冗余数据,最终大幅降低光追负载的成本。

硬件支持不透明度微贴图(OMM),可以提升光线命中、未命中判断的准确率,更高效地处理复杂的透明几何体,从而呈现更丰富的植被、更精细的纹理和多层材质表面,以及其他复杂场景元素。

根据Arm的演示,OMM可带来30%的帧率提升,从没法玩到至少保证30FPS,并降低多达70%的光追负载。

另外,随着光照度复杂度的增加,计算和数据转移需求会迅速膨胀,神经网络技术也可以配合其他技术,有效控制光追成本,在移动设备上更高效地呈现更丰富的视觉细节。

Arm全新手机计算平台降临!首个AI原生GPU,超分、帧生成都有了

Arm全新手机计算平台降临!首个AI原生GPU,超分、帧生成都有了

Mali G2-Ultra NX新引入的神经网速加速器,直接集成在GPU着色核心之,可以高效复用GPU内存与控制结构、一致性缓存,能够精细调度分配神经、图形、计算等不同任务。

它支持INT8/INT16数据精度,拥有独立的时钟频率,最高达GPU的两倍,还支持完整的张量运算、权重压缩、光流矢量加速。

Arm全新手机计算平台降临!首个AI原生GPU,超分、帧生成都有了

神经网络加速器有三个典型的应用技术与场景:

一是NSS(神经超采样):

类似NVIDIA、AMD、Intel的超分技术。

首先以较低分辨率渲染画面,然后基于AI重建为更高分辨率画面,再输出显示,能够以更低的着色渲染成本,获得更高的画质。

在输入端的原始数据,是低分辨率的色彩、运动向量、深度、帧历史数据。

这些数据都会喂给NSS模型,通过神经网络进行细节重建,同时保持时序的稳定性,并且集成抗锯齿,无需单独的抗锯齿流程。

最终输出的,就是高分辨率、高品质、无锯齿的精细画面。

Arm全新手机计算平台降临!首个AI原生GPU,超分、帧生成都有了

利用NSS,可以轻松将540p低分辨率画面,重建为1080p高分辨率画面,不但只需渲染原来1/4的像素,还能得到媲美桌面级的画质。

Arm全新手机计算平台降临!首个AI原生GPU,超分、帧生成都有了

在1080p分辨率、稳定功耗释放下,NSS对比原生渲染可将帧率提升1倍左右,内存带宽占用降低50%,而每一帧画面所需能耗可降低最多60%。

跑得快,还省电,鱼与熊掌是可以兼得的。

Arm全新手机计算平台降临!首个AI原生GPU,超分、帧生成都有了

二是NFRU(神经帧率提升):

就是帧生成技术。

首先渲染少量完整帧画面作为参考依据,结合光流、深度信息,通过AI生成中间插帧,还支持硬件加速光流以运动平滑度。

最终,NFRU能够以更低的帧渲染成本,提升帧率和流畅度。

针对伴随帧生成而不可避免带来的延迟增加问题,Arm解释说,这需要开发者配合使用帧步调(Frame Pacing)方案。

因为在实际运行过程中,帧与帧之间的时间间隔并不总是完全一致的。虽然AI插值的延迟相对固定,但每一帧的实际渲染时间可能会有所波动。

因此,需要借助安卓平台或游戏引擎提供的帧步调方案,确保画面能够以稳定的节奏持续输出。

Arm确认,这一代GPU的首要目标是打造轻量化、高效的AI神经网络,在移动端市场快速落地,所以NFRU目前仅支持单帧生成,但未来也会迈向多帧生成。

Arm全新手机计算平台降临!首个AI原生GPU,超分、帧生成都有了

NFRU可将60FPS的原生帧率,通过插帧输出为稳定的120FPS,同时降低33%的内存带宽占用。

Arm全新手机计算平台降临!首个AI原生GPU,超分、帧生成都有了

三是NSSD(神经超采样与降噪):

在NSS的基础上,专门针对光追设计的。

结合基于神经网络的超分辨率重建与降噪技术,在具有复杂光照和阴影的高负载光追场景中,全面提升画质。

比如《暗区突围:无限》中,开启NSSD之后,光追画质与光影质感都得到了显著提升。

Arm全新手机计算平台降临!首个AI原生GPU,超分、帧生成都有了

NSS超分或NSSD超分降噪结合NFRU帧生成,可以大大减少原生渲染的工作量,最多能做到1/8像素渲染、7/8像素AI生成。

这就可以在极为有限的1-2W功耗空间内,大大减轻GPU和整个系统的压力,获得桌面级的图形体验、流畅的帧率性能,并赋予游戏开发者更大的自由度。

Arm全新手机计算平台降临!首个AI原生GPU,超分、帧生成都有了

Arm全新手机计算平台降临!首个AI原生GPU,超分、帧生成都有了

NFRU、NSSD相互结合,更是可以在光追场景下将帧率提升3倍之多,内存带宽占用降低多达70%,单帧能耗降低多达75%。

Arm全新手机计算平台降临!首个AI原生GPU,超分、帧生成都有了

那么,未来会不会出现越来越多的像素都是AI生成,而原生渲染只占很少的比例?

Arm表示,从行业发展趋势来看,相信AI增强图形会逐渐成为行业标配,但这并不意味着传统图形渲染会被AI彻底取代。未来,Arm一方面会持续增强AI相关功能,另一方面也会不断推进传统图形渲染技术的演进。

另外,Arm使用的网络是卷积神经网络(CNN),而不是Transformer网络,因此不像大语言模型那样通过生成内容来工作,而是首先用GPU渲染出真实画面,再利用CNN进行超分处理,并补全最终细节,从而生成插值帧或更高分辨率的画面。

关键在于,这些网络是基于真实内容训练而成的,即便游戏拥有非常独特的美术风格,也可以利用Arm的AI技术,对游戏内容重新训练模型,让模型学习游戏特有的视觉特征。

这样一来,无论是在生成插值帧还是提升分辨率,输出结果都能够保持正确的视觉效果,并符合开发者的预期。

目前,NSS、NFRU的开源模型已经托管在Hugging Face、GitHub、ArmNG SDK,NSSD将在今年内面向开发者开启早期访问。

Arm全新手机计算平台降临!首个AI原生GPU,超分、帧生成都有了

新一代GPU技术的代表性应用和首发应用,就是《光影新生》,英文名Neural Dawn,字面意思即“神经曙光”,充分应用了新一代神经网络加速器。

《光影新生》并非技术演示DEMO,而是一款实打实的手游作品,由Arm牵头,联合英国工作室、腾讯海外子公司Sumo Digital共同开发,一个只有17人的小团队只用了18个月就搞定了。

它支持Arm NSSD、NFRU技术,充分展现了一个小团队如何利用AI原生图形技术,将游戏内容的复杂度翻一倍。

它还是首款支持UE5 MegaLights(海量动态直接光照)技术的手游,支持多达1400个动态光源,而且不需要预先烘焙光照,还有完整的光追光照与阴影,支撑玩法与叙事设计。

如果是上代G1-Ultra GPU运行此游戏,帧率只有可怜的15FPS。

如今有了G2-Ultra NX、AI原生图形技术,输入540p低分辨率画面,即可输出1080p高分辨率降噪画面,帧率也可以轻松达到60FPS,性能和能效都是原来的4倍之多。

Arm全新手机计算平台降临!首个AI原生GPU,超分、帧生成都有了

Arm全新手机计算平台降临!首个AI原生GPU,超分、帧生成都有了

为了更好地服务开发者,加速新的GPU图形技术商用落地,Arm提供了丰富的生态支持。

比如开放软件栈,通过Hugging Face等托管平台提供NSS/NFRU模型,支持NSSD早期访问,还有神经图形模型库。

比如生态工具,广泛提供游戏引擎插件(UE5)、SDK开发包、示例代码、文档。

如果是现有游戏更新适配AI新技术,只需3-6个月,即便是开发全新的游戏,周期也可以控制在18个月之内。

其实早在Mali G2-Ultra NX发布的前两年,Arm就通过神经网络技术(Neural Technology)和面向神经图形的开放开发套件,着手布局软件生态。

因此,内容创作者、工具开发者和游戏引擎提供商可以提前接触神经网络技术,并在新的硬件发布之前,就将其集成到现有工作流中。

如今,Arm打造了完整的神经图形开发套件(Neural Graphics Development Kit),全面提供推动相关工作迈向量产所需的软件和工具,支持主流图形API、游戏引擎以及定制化开发流程。

目前,Arm新一代GPU与AI图形技术的合作伙伴和代表作品包括:

Unity中国及其团结引擎、EpicGames及其UE虚幻引擎、腾讯游戏及其《暗区突围:无限》、网易及其《燕云十六声》、叠纸游戏及其《无限暖暖》。

除了旗舰级的Mali G2-Ultra NX,这一代GPU后续还会加推Mali G2-Premium NX、Mali G2-Pro NX两款中高档型号,匹配不同级别的移动设备。

Arm全新手机计算平台降临!首个AI原生GPU,超分、帧生成都有了

【CPU:全链路加速智能体AI,最多提升70%】

相较于新一代GPU的翻天覆地,CPU的变化就没那么大了,主要是强化了对智能体AI的支持。

从数据中心到PC再到手机,GPU一度是AI的核心支柱,但随着智能体AI的兴起,CPU再次得到重用,回归C位。

因为,只有CPU才是端侧AI、智能体AI的核心载体,承担调度与编排作用,保证感知→记忆→推理→执行的完整工作流。

CPU具备完全的可编程性,可以支持任意AI模型、应用落地速度快;极低的延迟,可以在本地执行AI推理,避免了云端的延迟问题,尤其适合实时语音、AR等延迟敏感性场景;还有极高的安全性,数据完全不出端,从而保障用户隐私与数据安全。

Arm CPU更是具备广泛的普及性,全世界99%的智能手机等边缘设备都搭载Arm CPU,软件可以轻松跨生态移植。

这些都要求CPU不但要具备更强的单线程性能,还得拥有更强的多线程并行能力,同时负责异构场景下的任务调度。

Arm全新手机计算平台降临!首个AI原生GPU,超分、帧生成都有了

Arm CSS for Mobile 2平台的CPU集群,包括超大核C2-Ultra、大核C2-Pro

官方称单线程性能提升15%、多线程性能提升12%、网页浏览性能提升15%、App启动性能提升12%,AI性能的提升幅度更是70%。

今年没有新的Nano小核心,它的迭代更新周期更久,一般两到三年左右才会升级一次。

Arm全新手机计算平台降临!首个AI原生GPU,超分、帧生成都有了

新一代CPU集群延续了Arm一贯的多架构协同并存设计,Ultra/Premium、Pro、Nano大中小三种核心可以共处于同一个集群内,各自具备独立的运行频率。

每一个CPU核心都有自己独享的二级缓存,轻负载下延迟更低。

三级缓存依然是所有核心共享,容量也得到了提升,可以有效覆盖更大数据集、提升多核性能。

本地缓存具备较高的命中率,这就大大减少了对系统缓存、内存的访问需求,自然延迟更低、性能更好、功耗更少。

Arm全新手机计算平台降临!首个AI原生GPU,超分、帧生成都有了

Arm CPU集群支持非常灵活的配置,不同核心几乎可以任意组合,灵活满足不同性能、成本的需要。

针对入门级设备,可以只用两个Nano小核心,SME2都不需要,也可以选择4个Nano、2个Pro+4个Nano。

面向主流市场的典型配置包括2个Pro+6个Nano、4个Pro+4个Nano等。

高端领域可以选择1个Premium+3个Pro+4个Nano或者2个Premium+6个Pro等灵活组合。

旗舰设备就可以直接上2个Ultra+6个Pro这样的巅峰组合,最高甚至可以配置多达14个不同核心。

Arm表示,最高配相比最低配的性能有多达17倍的空间,芯片面积的差距更是可以达到25倍。

Arm全新手机计算平台降临!首个AI原生GPU,超分、帧生成都有了

Arm没有公布C2-Ultra CPU的底层架构图,但详细介绍了多处主要改进:

一是更大的执行引擎,允许更多指令实时并行。

二是更智能的数据搬运,让数据更靠近CPU核心,减少延迟和停顿。

三是智能的执行调度,可提前发现可用的指令,减少等待浪费。

Arm宣称,C2 Ultra CPU的运行频率可以达到4.45GHz甚至更高,峰值性能提升超过15%。

当然,具体频率的高低,还要看芯片的制造工艺和整体设计。

Arm全新手机计算平台降临!首个AI原生GPU,超分、帧生成都有了

C2 Ultra CPU的流水线进行了深度优化,号称分支预测错误率可降低16%。

分支预测更准,可减少错误路径执行。

指令获取能力更强,可提升拾取与目标预测能力,避免核心闲置浪费。

恢复更快,在预测失败后可以迅速回归正常工作。

Arm全新手机计算平台降临!首个AI原生GPU,超分、帧生成都有了

指令级并行优化方面,支持更大的执行窗口,可以在指令流中提前发现独立的指令,从而在每个时钟周期内完成更多的有效工作。

同时,智能推断可以提前启动依赖受限的工作,验证正确性之后再提交,不但可以解决依赖性,还能减少闲置的时钟周期。

Arm全新手机计算平台降临!首个AI原生GPU,超分、帧生成都有了

内存子系统优化方面,通过多项努力,大大减少了后端数据等待的时间,最多可以节省90%。

具体包括更快的加载可用性,当数据返回后,依赖任务可以更快地启动。

更多的实时内存操作,核心追踪数据任务的能力更强。

更智能的预取,可以在核心发出请求之前,就预先搬运数据流。

Arm全新手机计算平台降临!首个AI原生GPU,超分、帧生成都有了

当然,普通用户对这些技术细节并不关心,只看你的性能、功耗表现。

根据Arm提供的数据,基于 GeekBench 6.3的测试,C2-Ultra对比上代峰值性能可提升15%,此时功耗只是略高。

而在同等性能下,功耗可降低最多达38%。

Arm全新手机计算平台降临!首个AI原生GPU,超分、帧生成都有了

具体到不同的实际场景中,GeekBench、SPECint等基准测试中提升最多15%(单核性能),Speedometer网页性能也是提升最多15%。

谷歌地图、Gmail、Ins、**等App启动速度提升最多12%,游戏性能和UI性能也有12%的样子。

AI方面才是C2-Ultra的绝活儿,都算上SME2指令集的加持,对比上代C1-Ultra,在语音、个性化记忆、预填充和推理方面都实现了跨越式的进步,最多幅度达70%!

Arm全新手机计算平台降临!首个AI原生GPU,超分、帧生成都有了

具体到智能体AI工作流的四大阶段,在感知环节,比如语音转文字(STT)任务,C2-Ultra相比上代可提速多达40%。

在记忆环节,多语言搜索与记忆检索任务可以提速41%

在推理环节,0.8-2B级参数的小模型,首字延迟(TTFT)可以提速最多25%。

最后的执行环节,自然是整合前三步的所有信息,执行最终的复杂提示词,完成任务,而前三步的调优,正是为了让最终大模型输出最佳结果。

当然,以上环节的对比,两代CPU都开启了SME2指令集加速。

Arm全新手机计算平台降临!首个AI原生GPU,超分、帧生成都有了

Arm全新手机计算平台降临!首个AI原生GPU,超分、帧生成都有了

Arm全新手机计算平台降临!首个AI原生GPU,超分、帧生成都有了

综合四个步骤,智能体AI完整执行一个任务,两个C2-Ultra CPU核心只需不到1.6秒钟(1600毫秒),对比上代可以节省大约280毫秒的时间,提速15%。

再开启SME2指令集加速,时间更是可以节省450毫秒左右,进一步提速8%,合计提速24%。

具体到不同的子场景,包括网页浏览、地图、社交、编解码等,全链路都有不同程度的加速。

不过这里并没有对比C1-Ultra开启SME2指令集的情况。

这也再次证明,CPU才是智能体AI编排与体验的基础,全面支撑规则决策、安全、权限、模型调度。

Arm全新手机计算平台降临!首个AI原生GPU,超分、帧生成都有了

特别值得一提的是,在推理环节,SME2、LUTi都可以有效节省内存带宽,给低精度、小尺寸AI模型带来很好的加速效果。

其中,SME2指令集可以在编码阶段计算更多的MAC,最多提速76%,主要针对提示词处理场景。

LUTi就是查表指令集,可以消除查表类负载的内存访问,降低内存带宽需求,在解码阶段可以提速最多60%,主要针对文本生成场景。

Arm全新手机计算平台降临!首个AI原生GPU,超分、帧生成都有了

Arm自豪地宣称,从第一代Cortex-X开始,超大核设计历经七代演进,累计性能提升幅度已经超过80%,而且每一代都在稳步前进。

Arm表示,这主要得益于Arm CPU的全栈创新,从前端到核心再到内存子系统,都在不断改进,共同驱动了整体的进步。

这其中肯定有工艺和频率的贡献,但也离不开微架构层面的持续创新,每一代都在持续提升IPC同频性能,最终转化为越来越好的用户体验。

Arm全新手机计算平台降临!首个AI原生GPU,超分、帧生成都有了

最后来个简单的一图总结。

Arm全新手机计算平台降临!首个AI原生GPU,超分、帧生成都有了

都对了,你可能会问,CPU+GPU+NPU是如今全行业都认可的AI基础硬件三大家,Arm这次怎么完全没有提NPU?

Arm对此解释说,Arm一贯的思路是将NPU层面的技术创新,更多交由合作伙伴主导,因为合作伙伴对其自研AI方案有着独到的理解,并且在执行“第一方AI应用”(厂商自研AI应用)方面表现更出色。

【其他:首发支持LPDDR6统一内存】

Arm CSS平台并不是只有GPU、CPU,还有配套的其他各种系统IP,都针对AI应用做了适配优化。

比如新一代SI L2系统互联通道,作为一套完整的通道化片上Fabric,由一致性互联网络(Coherent Fabric)、非一致性片上网络(NoC)、系统缓存(SLC)、内存控制器节点(MCN)等模块组成,承担着连接CPU、GPU、NPU、MMU(内存管理单元)等诸多模块,使之高效通信的重任。

SI L2同样针对智能体AI应用进行了升级,具备更高的带宽、更低的延迟、更高的安全性(支持MTE/DVM)、更高效的缓存一致性(可扩展的硬件一致性以服务软件编程模型)、更高级的QoS(质量服务)、进一步优化的PPA(更小面积和更低功耗),等等。

尤为重要的是,新平台首次支持新一代LPDDR6内存,而且是统一内存,同时继续支持LPDDR5/5X。

这真是小米玄戒O3首发LPDDR6的基础支撑,正好匹配长鑫存储首发量产LPDDR6。

对比上代,SI L2配合统一内存,将CPU到内存的访问延迟降低了足足约45%,非常有利于直接加速智能体AI工作负载的内存访问速度,提升响应度。

当然,客户也可以选择不采购SI L2,而是自行设计系统级互连网络。

Arm全新手机计算平台降临!首个AI原生GPU,超分、帧生成都有了

Arm全新手机计算平台降临!首个AI原生GPU,超分、帧生成都有了

上代CSS手机平台引入的SME2(第二代可扩展矩阵扩展指令集),这一代没有升级,官方只是说进行了更多优化。

SME2非常适合在端侧为智能体AI的各个基础能力模块进行加速。

因为智能体背后都不是单一的超大规模模型,而是由多个专用的小模型组成,比如多模态感知、记忆与检索、推理等等,都是轻量级负载,这是SME2最擅长的。

SME2引擎部分和上代完全相同,不过支持单个集群配置双SME2引擎,方便客户部署更多单元。

再结合新的C2-Ultra CPU,AI性能依然提升了最多达70%,而且是各个基础模块的提升效果都非常明显。

Arm全新手机计算平台降临!首个AI原生GPU,超分、帧生成都有了

目前,SME2的生态合作已经非常广泛,基本覆盖了全产业链。

这里举的例子有:安卓系统、谷歌、三星、OPPO、vivo、腾讯混元、百度飞桨、网易伏羲、阿里通义千问、支付宝、淘宝、Stability.AI、远景科技、虚幻引擎、Unity中国(团结引擎),等等。

目前几乎所有的旗舰手机,无论安卓还是iPhone,都已支持SME2 AI 加速,典型的比如vivo X300系列、OPPO Find X9系列、三星Galaxy S26系列等机型。

Arm全新手机计算平台降临!首个AI原生GPU,超分、帧生成都有了

Arm全新手机计算平台降临!首个AI原生GPU,超分、帧生成都有了

Arm自己推出的KleidiAI加速中间件,可以针对支持SME2指令集的Arm AI平台进行透明化加速。

目前,KleidiAI的代码已经超过14万行(遵循宽松型Apache 2.0开源协议),集成了100多个第三方应用、超过12个AI框架,针对200多个微内核进行了优化。

合作的模型包括:Gemma、腾讯混元、Stability.AI、通义千问等。

Arm全新手机计算平台降临!首个AI原生GPU,超分、帧生成都有了

【结语】

芯硬件认为,Arm CSS for Mobile 2平台的发布,预示着一个新的移动端AI世界的开始,也是智能体AI在手机等移动终端商全面普及的强力推进剂。

Mali G2-Ultra、G2-Premium、G2-Pro GPU进行了大刀阔斧的改革,进行了七代产品以来最大的创新,首次从AI原生出发进行设计,首次将神经网络加速器直接引入GPU着色器内部,利用神经网络技术开辟视觉新体验,还有新的执行引擎、第三代光追单元。

技术上支持NSS(神经超采样)、NFRU(神经帧率提升)、NSSD(神经超采样与降噪)三大技能,将原本只属于桌面级的超分、帧生成图形技术,第一次全面引入到移动端,在功耗、散热的苛刻限制下,重塑手游画面与性能。

C2-Ultra、C2-Pro CPU虽然没有GPU那么大的颠覆性,但围绕智能体AI进行了全面的优化,结合SME2指令集,不仅大大提升了移动应用的日常计算性能,更进一步增强了端侧AI能力,为各种负载提供强力支持。

Arm全新手机计算平台降临!首个AI原生GPU,超分、帧生成都有了

SI L2系统互连架构,面向移动设备进行了全面升级和优化,可保证CPU、GPU、NPU、内存之间无缝衔接,为各种异构负载提供最佳的支持。

软件生态支持更是无可挑剔。基于Arm数十年的软件投入,以及全球超过2200万的Arm开发者社区,开发者可以通过熟悉的框架和开发环境,轻松调用Arm CSS for Mobile 2的平台能力,全面释放GPU、CPU、SME2的深层潜力,匹配优化各种模型、应用、场景。

下一个移动AI时代,不再是单一跑分成绩或单一加速器决定的,而是取决于整个系统平台自动感知并理解用户意图、再自主执行的综合能力。

尤其是随着智能体AI的持续演进,并融入日常生活、工作的交互,底层平台将成为最关键的支撑因素。

这,正是Arm CSS for Mobile 2平台的目标和使命!

Arm全新手机计算平台降临!首个AI原生GPU,超分、帧生成都有了

展开 收起
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

相关文章推荐

更多精彩文章
更多精彩文章
最新文章 热门文章
0
扫一下,分享更方便,购买更轻松