两项关键技术撑起一颗NPU:骁龙8EE6如何让智能体更懂你
今年高通的双旗舰策略早在发布会之前就已经确定,只是命名在最后的发布会上才正式揭晓。标准版和高定位版两款芯片分别是Snapdragon 8 Elite Gen 6和Snapdragon 8 Elite Extreme Gen 6。其中Snapdragon 8 Elite Extreme Gen 6和网传的命名有些许差异,此前坊间普遍猜测它会叫“骁龙8 Elite Gen 6 Pro 6。虽然名称猜错了,但也无伤大雅,毕竟大家实际上更关注的还是芯片的性能。在正式发布前,对芯片名称的广泛猜测和争论,恰恰说明了这款芯片在用户心中的分量。
随着搭载骁龙 8 Elite Extreme Gen 6的高端旗舰机型陆续上市,网上有一些关于这款芯片的一些小插曲:个别用户反馈搭载这颗芯片的机型有黑屏死机现象,从目前能查到的信息来看,这些反馈主要集中在个别用户的高负载场景,而非规模化事件,而且系统更新后会修复。也有分析认为台积电N2P作为第一代GAA工艺在初期量产阶段的调校磨合,这属于新制程落地初期的常见现象,随着厂商调教和系统更新,会很快解决。
抛开这些小插曲,这一次骁龙8 Elite Extreme Gen 6值得关注的亮点很多,其中最让人出乎意料的还是NPU。第一次把NPU做成了智能体的专属大脑,而支撑这个大脑运转的,是两项关键技术:全新的Element Accelerator,以及扩容50%的共享内存系统。

端侧AI的老毛病,终于有人治了
如果你用过手机上的端侧AI,大概会有两个感受:一是慢,二是记不住。慢,是因为NPU在处理Transformer模型推理时,面对智能体那种“多轮次、长上下文”的工作负载,依然不够快。记不住,是因为NPU的片上共享内存太小,KV缓存存不下,只能频繁去DDR内存里“翻旧账”,上下文窗口一大就卡。第六代骁龙8超级至尊版对这两个问题的回应,就是Element Accelerator和共享内存扩容。
Element Accelerator:让智能体“思考”得更快
有人问,Element Accelerator到底是个什么东西?简单说,它是Hexagon NPU内部新增的一个专用计算单元,坐在标量、向量和张量单元旁边,专门为Transformer推理加速。它不负责通用计算,只做一件事:让智能体更快响应、更快思考。
效果有多直接?在INT4精度模型下,NPU的预填充速度最高提升50%。预填充是智能体处理长上下文时最耗时的环节——你输入一段话、打开一个文档、调用一个工具,都需要先“预填充”才能进入解码阶段。这个环节快了50%,意味着你在同样的时间里,能让智能体处理更多轮次、更复杂的任务。
换句话说,Element Accelerator让NPU不再是一个“什么都干但什么都慢”的通用单元,而是变成了一个专门为智能体推理优化的加速器。有实测数据显示,首个词元生成耗时低于1.5秒,达成了近乎实时的人机交互体验。

共享内存扩容50%:让智能体的记忆更持久
Element Accelerator解决的是“快”,共享内存扩容解决的是“记住”。第六代骁龙8超级至尊版的NPU大容量共享内存相比上一代增加了50%。这个数字看起来不大,但它带来的变化很关键。
NPU在处理大模型推理时,KV缓存需要频繁读写。如果片上空间不足,数据就得在NPU和主内存之间来回搬运,不仅慢,还费电。共享内存扩容50%之后,NPU可以把最多32K的上下文窗口留在自己“身边”,不需要每次生成Token都跑去DDR内存里找。
用高通的话说,就是“把高频访问的模型数据留在NPU附近”。智能体不再因为上下文太长就“忘事”,处理长文档、多轮对话、并发任务时,响应速度不会因为“翻旧账”而下降。
这个变化对于AI智能体尤其重要。与传统的问答式AI不同,AI智能体需要连续完成多个步骤——理解用户需求、制定执行计划、调用不同工具、分析返回结果,再继续执行下一步操作。在整个过程中,模型状态和上下文需要持续保存,更大的共享内存能让更多相关数据留在距离计算单元更近的位置,从而改善推理效率。

两项技术合在一起,意味着什么
Element Accelerator和共享内存扩容,看起来是两个独立的升级,但实际上服务于同一个目标:让智能体从“能用”变成“好用”。
过去端侧AI的体验瓶颈,恰恰是这两项技术要解决的问题。Element Accelerator加速了推理的前段,共享内存扩容优化了推理的后段,两者配合起来,智能体在处理复杂任务、调用多个工具、维持长上下文时,才能保持流畅。
这也解释了为什么第六代骁龙8超级至尊版能在本地运行300亿参数的MoE模型。MoE架构每次推理只激活约30亿参数,计算负载本来就低,加上Element Accelerator的加速和更大的共享内存,端侧跑大模型的可行性才真正成立。
高通携手阶跃、无量火与江波龙开展的四方合作,已在峰会现场完成基于高通参考设计的演示。从邮件理解到行程规划、日历同步、航班酒店推荐、行程分享到邮件草拟,整个智能体工作流全程本地完成,无需云端调用。无量火的Ember推理引擎在不修改模型结构、不损失推理精度的前提下,使运行内存需求较行业常规方案降低超50%。
未来已来
以前咱们打开手机,得自己一个个App去找功能、填信息、做决定。而现在,智能体帮你把活干了——它记住你的习惯,知道你下周要出差,提前把航班和酒店都看好,甚至连回邮件的草稿都写好了。
以前觉得,这样的未来还很遥远。但现在,第六代骁龙8超级至尊版的Element Accelerator和扩容50%的共享内存,已经把端侧智能体的地基给打好了。接下来,我们就可以合理期待,搭载Snapdragon 8 Elite Extreme Gen 6的旗舰手机,它们的AI表现到底有多猛了。
