英伟达详解Vera CPU:88核心、176线程、最高1.5 TB LPDDR5X内存

2026-07-23 22:02:46 0点赞 0收藏 0评论
英伟达公布了其最新定制Armv9.2 Vera CPU的更多细节,既可作为NVL机架级系统的一部分协同运行,也可独立部署。英伟达表示Vera CPU针对数据分析、高性能单线程任务、AI智能体和大规模软件操作优化了设计,覆盖了广泛的用例场景,已看到客户对在企业中部署Vera CPU表现出浓厚兴趣

英伟达详解Vera CPU:88核心、176线程、最高1.5 TB LPDDR5X内存

英伟达的Vera CPU采用基于定制化Armv9.2的Olympus核心架构,单片式计算晶圆设计,并集成了第二代英伟达可扩展一致性结构(SCF)、机密计算(支持 TEE-I/O)以及x16 PCIe Gen6 CXL 3.1等关键技术。整个Olympus CPU核心分为四个主要区域:前端、中核、执行引擎和缓存子系统。

英伟达详解Vera CPU:88核心、176线程、最高1.5 TB LPDDR5X内存

在前端部分,英伟达开发了一个分支预测器,它与指令获取单元协同工作,持续为核心提供有效指令。智能体运行时、编译器和大规模数据处理等工作负载通常涉及控制流变化,这可能导致CPU中的执行单元闲置。"Olympus" 核心采用10路宽解码引擎,确保指令持续流向执行单元,使其保持充分利用。

为了为执行准备数据通路,英伟达创建了一个神经网络分支预测器,减少错误路径的执行,每个周期最多支持两个已采用分支。这对于大规模数据处理中软件执行突然发生控制流变化时至关重要。

英伟达详解Vera CPU:88核心、176线程、最高1.5 TB LPDDR5X内存

接下来是中核,即"Olympus"内部的重命名部分。CPU核心的这一部分旨在当CPU的其他部分处于等待状态时,挖掘出独立的可执行工作。这意味着重排序缓冲区会不断加载指令以准备执行,使乱序执行达到更深的深度。重命名和分配映射将指令解码为物理资源,这些特性共同利用指令级并行性来维持高效执行,尤其在突然发生变化的软件工作流中。

对于执行这些已准备好的指令,英伟达的执行引擎接管工作。当指令被分解为微操作后,每个微操作被分配到相应的标量或向量处理引擎。"Olympus" 执行引擎采用动态调度,以低延迟分发这些标量、向量、浮点、加密和加载/存储资源微操作,从而实现每秒处理更多指令的数量。英伟达尚未透露太多关于这一部分的细节,因为这很可能是新核心设计中大部分创新发生的领域。

英伟达详解Vera CPU:88核心、176线程、最高1.5 TB LPDDR5X内存

为了完善整个系统,英伟达的缓存子系统旨在快速从CPU外部检索数据。AI智能体工作负载要求苛刻,因为它们需要的数据无法全部容纳在CPU缓存内,这就需要高吞吐量来检索稀疏数据、数据库、运行时对象、检索索引和许多其他数据结构。"Olympus" 核心具有深度缓存层级结构、多个用于更快数据检索的预取引擎,以及专用于图数据的预取器。

传统x86 CPU的同步多线程(simultaneous multithreading,SMT)的一个主要区别在于,这些设计创建了两个共享单个核心的硬件线程。在现代环境中,这可能导致"吵闹邻居(noisy neighbor)"效应——两个线程争夺相同资源,造成停顿。英伟达通过在将资源分配给每个线程之前对资源进行分区来解决这一问题,因为"Olympus"核心的宽度允许即时资源分区,确保每个任务都能得到有效分配。

英伟达详解Vera CPU:88核心、176线程、最高1.5 TB LPDDR5X内存

连接整个系统的是英伟达的可扩展一致性互联结构,它提供3.4 TB/s的互联带宽,并在CPU晶粒上集成了164 MB的统一L3缓存。外部连接包括SOCAMM2 LPDDR5X内存,总带宽达到1.2 TB/s,英伟达每个CPU最高可配备1.5 TB LPDDR5X内存。其展示了与AMD EPYC "Turin" 9755 CPU 的初步单核性能对比,声称在特定工作负载下可实现高达1.8倍的性能提升。

展开 收起
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

相关文章推荐

更多精彩文章
更多精彩文章
最新文章 热门文章
0
扫一下,分享更方便,购买更轻松