NVIDIA Vera CPU技术详解:88核Olympus、176线程与1.2TB/s内存 NVIDIA于2026年7月21日进一步公开Vera CPU的Olympus核心、Spatial Multithreading、SCF、SOCAMM2内存、NUMA与I/O细节。Vera采用兼容Armv9.2-A的NVIDIA自研Olympus核心定位不仅是GPU Host也覆盖Agent沙箱、RL环境、数据处理与分析等CPU侧负载。1Vera CPU规格项目Vera CPU架构兼容Armv9.2-ANVIDIA自研Olympus核心核心 / 线程88核 / 176线程L1 / L2 / L3每核64KB L1I、96KB L1D、2MB L2 / 每CPU 164MB统一L3SIMD每核6×128-bit SVE2支持FP8SCF第二代最高3.4TB/s双向截面带宽内存8个SOCAMM2模块最高1.5TB LPDDR5X-9600内存带宽最高1.2TB/s总计最高约14GB/s每核NVLink-C2C最高1.8TB/s双向一致性带宽I/OPCI Express Base Specification 6.4PCIe 6.0代际、CXL 3.1单路最多88条、双路176条通道功耗可配置TDP 250W—4502Agent负载对CPU提出了什么要求Agent循环会在GPU模型推理之外执行Python或JavaScript、编译代码、调用数据库和浏览器、读取检索结果、压缩数据并管理沙箱。这些路径通常分支密集、指针密集、指令依赖长同时要运行大量并发环境。因此CPU评估不能只看核心总数。单线程进度、满载时的每线程性能、内存带宽、共享缓存、NUMA访问和尾延迟都会影响GPU等待工具结果的时间。3Olympus前端10-wide与神经分支预测Olympus前端使用高带宽取指和10-wide解码公开资料显示取指单元每周期最多获取16条64-bit指令并配有48条指令的Decode Queue。神经分支预测器针对统计偏置且难预测的分支分支预测子系统每周期最多可处理两条预测为跳转的分支。这类设计适用于解释器、运行时、编译器和图遍历等控制流复杂的软件。10-wide是解码宽度不代表每周期一定退休10条指令缓存未命中、数据依赖和分支错误仍会降低实际IPC。4Mid Core与执行引擎中端包含宽重命名与分配、较大的重排序缓冲区和物理寄存器资源通过内存重命名、值预测与关键路径加速降低长依赖链停顿。执行端包含4个Load与2个Store流水线以及6组128-bit SVE2向量资源其中部分支持加密运算这些能力用于CPU侧向量与数据处理不等同于GPU Tensor Core级大模型计算能力。缓存子系统加入多类预取器其中包括面向图与不规则访问的Graph Prefetcher。目标是提高内存级并行减少指针追踪与图结构访问造成的串行等待。5Spatial Multithreading每个Olympus核心支持两个硬件线程。NVIDIA将其称为Spatial Multithreading强调对宽核心资源进行更有效的空间划分。核心既可让主线程运行关键任务、兄弟线程承接管理活动也可为两个线程提供隔离程度更高的执行上下文。该机制面向沙箱与多租户环境中的noisy-neighbor问题。公开资料没有提供所有资源的静态分区比例具体调度方式、软件控制接口与不同负载下的收益仍需后续文档和独立测试确认。6SCF与统一L3第二代Scalable Coherency Fabric连接88个核心、164MB统一L3、内存控制器、I/O和NVLink-C2C提供最高3.4TB/s双向截面带宽。Vera把核心与共享缓存置于单一计算裸片减少计算裸片之间的Hop。SCF的作用是维持片上一致性与可预测访问路径。它与外部内存带宽是两个不同指标3.4TB/s描述片上Fabric双向截面能力1.2TB/s描述SOCAMM2内存子系统的聚合带宽。7SOCAMM2 LPDDR5XVera最高支持1.5TB SOCAMM2 LPDDR5X聚合带宽最高1.2TB/s。SOCAMM2把LPDDR5X做成可现场更换的模块在保留较短电气路径的同时满足服务器维护与RAS要求。对高并发Agent、图分析、ETL、KV Cache卸载和RL环境带宽可减少多核同时访问大工作集时的争用。容量与带宽仍要分开1.5TB解决数据是否放得下1.2TB/s解决数据供应速度。8单NUMA与双路扩展每颗Vera对软件呈现一个NUMA域双路系统是两个NUMA节点。两颗CPU通过第二代NVLink-C2C建立一致性连接。较简单的拓扑有利于线程、内存和I/O放置也减少应用跨多个片内NUMA区调优的复杂度。这并不等于NUMA问题消失。双路系统仍有本地与远端内存区别应用仍需关注线程绑定、内存首次触碰和设备亲和性只是节点数量与拓扑层级更清晰。9PCIe、CXL与机密计算Vera支持PCIe 6.4和CXL 3.1双路配置提供176条PCIe通道可连接GPU、DPU、NIC、存储与CXL内存设备。CXL 3.1可用于一致性内存扩展、内存池化与可组合基础设施。机密计算基于Arm CCA与RME并包含RME-DA、RME-CDA设备分配、每VM加密密钥、TDISP设备隔离和C2C链路认证加密MPAM可用于缓存与内存资源的分区和监控。它们属于硬件与平台能力实际可用性仍取决于Hypervisor、操作系统、固件、驱动、设备和认证链支持。10性能结果如何解读NVIDIA给出的“相对x86最高1.8倍”针对其选定的Agent CPU负载和满载时持续每线程性能不代表Vera在全部CPU工作负载上普遍领先1.8倍。其双路预生产参考系统SPEC CPU 2026 Integer估算值为925对照同样使用GNU 15.2的双路EPYC 9755为898。测试边界上述SPEC结果由NVIDIA于2026年7月内部测量并归类为估算值不是SPEC正式提交。公开数据库中采用其他编译器和平台配置的EPYC 9755存在更高成绩因此925对898不能写成通用吞吐排名。NVIDIA也尚未提供足够完整的同等级浮点数据不能据此判断Vera在传统HPC浮点计算中的位置。Phoronix已在NVIDIA提供的单路Vera平台上完成首轮Linux测试88核176线程、8×96GB LPDDR5-9600、450W TDP、Ubuntu 24.04和GCC 16.1覆盖编译、Python、Java、压缩、数据库与内存带宽等负载。该测试由第三方执行但属于早期、有限平台验证不替代OEM量产系统的长期测试。11Vera在系统中的位置Vera Rubin NVL72使用36颗Vera CPU连接72颗Rubin GPU。在目标工作流中Vera主要承接工具调用、数据处理、调度与CPU端执行Rubin主要承担模型计算实际任务划分取决于框架和应用实现。NVLink-C2C提供缓存一致性和统一地址空间能力可减少部分显式数据复制实际收益取决于CUDA、框架、内存管理与工作集访问方式。12总结Vera的设计可以概括为用宽核心和分支预测提高串行路径速度用176线程提高环境密度用SCF与SOCAMM2维持满载供数用单NUMA和NVLink-C2C简化CPU—GPU协同。