
NVIDIA Vera CPU 深度解读Olympus 自研核心为什么是 Agentic AI 的关键拼图NVIDIA 昨天7 月 21 日发布了 Vera CPU 的技术博客和架构白皮书。这可能是 NVIDIA 迄今为止最详细的一次 CPU 技术披露——从 Olympus 核心的微架构到双路 NUMA 拓扑全摊开了。我读完之后最强烈的感受NVIDIA 在为 GPU 空转等 CPU 这个问题建护城河。而且这堵墙 x86 短期翻不过去。Vera vs Grace不只是迭代参数Grace (2024)Vera (2026 H2)变化核心72× Neoverse V2 授权88× Olympus 自研全自研线程72176 (空间多线程)144%解码宽度610 指令/周期67%L21 MB/核2 MB/核翻倍L3114 MB164 MB 统一43%SCF 对分带宽—3.4 TB/s全新内存带宽512 GB/s1.2 TB/s (14 GB/s/核)134%NVLink-C2C900 GB/s1.8 TB/s翻倍PCIeGen 5Gen 6.4新标准双路无单 NUMA 双路新能力FP8❌✅ 首个原生 FP8 CPU关键新能力机密计算—Arm CCA/RME 机架级可信新能力Olympus 核心微架构NVIDIA 将 Olympus 核心拆为四个子系统前端、中核、执行引擎、缓存子系统。前端10-wide Decode 神经分支预测器。当前 x86 最高Zen 5/6是 8-wideARM 公版 Neoverse V2 是 6-wideOlympus 直接拉到 10-wide——对标 Apple M 系列的设计规模。背后的支撑是神经分支预测器Neural Branch Predictor每周期处理两个 taken branch。Agent 代码全是 if-else 和动态调用分支预测命中率直接决定有效 IPC。中核价值预测 内存重命名 关键路径加速。价值预测Value Prediction——猜 load 指令会返回什么值不等 DRAM 直接继续执行后面的指令。这在学术圈研究了二十年商业 CPU 中大规模部署的极少。内存重命名Memory Renaming解决指针链的 alias 问题。关键路径加速标记最长依赖链上的指令给予优先调度。再加上大 ROB 大物理寄存器堆in-flight 指令数远超 Grace。执行引擎SVE2 FP8。6×128-bit SVE2 向量单元单线程双线程时各 3×128-bit。FP8 原生支持是 CPU 史上首次——之前的 Intel AMX 和 ARM SME 把 FP8 放在矩阵加速器里不在核心流水线中。LLM 推理前的 token 量化——过去在 GPU 上浪费 GPU 算力Vera 在 CPU 上以 FP8 精度完成直接通过 NVLink-C2C 喂给 GPU。缓存子系统图预取器Graph Prefetcher。标准 prefetcher 对规律访问有效。Agent 的数据结构完全不同——每一步地址取决于上一步取值传统 prefetcher 完全失效。图预取器通过学习内存访问中的指针模式来预测下一个 load 地址。Intel 和 AMD 的 CPU 里没见过——NVIDIA 专门为 Agent 负载做的差异化投资。空间多线程名字就叫 SMT但和你知道的那个完全不一样NVIDIA 的 Spatial Multithreading 缩写也叫 SMT。两个 SMT 的区别传统 SMTIntel Hyper-Threading两个线程共享分支预测器、解码带宽、执行单元、Load/Store 队列、L1/L2 Cache。一条线程的 cache miss 驱逐另一条的数据。结果0-30% 吞吐提升延迟完全不可预测。Vera 空间多线程Olympus 核心足够宽物理分两个线程槽。单线程模式时全部资源给一条线程兄弟线程只跑后台管理。双线程模式时资源物理平分互不干扰。结果接近 100% 吞吐提升延迟完全可预测。为什么确定性延迟对 Agentic AI 是刚需一个 Rubin GPU 集群每秒烧几千美元。如果 CPU 线程竞争导致 Kernel Launch 抖动 30ms——1 个 GPU 空转 → 72 个 GPU 一起等NVL72 紧耦合→ 1 次抖动 2.16 GPU-秒浪费。每天几千次 几万 GPU-秒。空间多线程把这种不确定性归零。x86 SMT 可以提供接近的平均延迟但无法消除尾延迟。SCF 互联与 SOCAMM2 内存子系统SCFScalable Coherency Fabric是 Vera 的片上骨干3.4 TB/s 对分带宽164 MB 统一 L3所有 88 核在单片 Die 上无跨 Die NUMA。SOCAMM2 LPDDR5X 是 Vera 在内存形态上的关键创新LPDDR 的低功耗和高带宽1.2 TB/s DIMM 的可维护性 企业级 RASECC/内存镜像/rank sparing。之前这三个需求互斥LPDDR 必须焊死才能维持短电气路径NVIDIA 通过模块化设计突破了这个限制。双路单 NUMA和 Chiplet 路线说再见x86 双路服务器的 NUMA 地狱Socket 0 内 2-4 NUMA Socket 1 内 2-4 NUMA 总共 4-8 个 NUMA 域。线程放哪、内存在哪、I/O 走哪——需要专门的性能工程师。Vera 的方案每个 Socket单 NUMA 域单片 Die 的自然结果双路 两个 NUMA 域。NVLink-C2C Gen 2 做 Socket 间互联。NVIDIA 博客原话“avoids the die-hop latency and variability common in fragmented chiplet designs”。软件优先。性能1.8× Agent 负载提升博客 Figure 6“Vera CPU delivers up to 1.8x higher performance on agentic workloads”。注意限定词“up to”——最好情况。“agentic workloads”——Python 执行、代码编译、工具驱动路径不是 SPEC 整数。“loaded single-thread performance”——全 socket 跑满 176 线程时的单线程性能不是单核空跑峰值。这个指标比单核峰值难得多88 个核心同时争抢 L3、内存带宽、SCF 对分带宽。单核的邻居越多单核越难维持高性能。Vera 在这个场景下比 Grace 好 1.8 倍。我的几个判断第一Olympus 自研核心是 NVIDIA CPU 战略的梭哈时刻。Grace 是试水ARM 公版 NVLink 包装Vera 是全栈自研——核心、互联、内存、NUMA 全部自己定义。这个跨越相当于 AMD 从 Bulldozer 到 Zen。第二神经预测器 价值预测 图预取器一起出现说明 NVIDIA 对 Agent 负载做了深度 profiling。不是比 x86 快 10%“而是x86 架构在 Agent 负载上有 30-50% 的无用功”。这三个技术没有一个是传统服务器 CPU 的标配。第三单片 Die 短期很对长期有天花板。88 核是物理极限。SCF 正在为未来多 Die 扩展做准备。Vera-next2028?必须面对 Chiplet 问题——那时 Rubin GPU 的计算密度又翻了一倍。第四NVLink-C2C 1.8TB/s 是 x86 翻不过去的结构性壁垒。不是技术问题是商业模式——Intel 和 AMD 不可能为 NVIDIA 定制 CPU-GPU 一致性互联协议。第五白皮书里的 SPEC 分数才是硬验证。博客是架构叙事1.8× 是定性结论。等拿到白皮书原文我会补上 SPEC 分析。发布时间2026年7月22日来源NVIDIA Developer Blog “Inside NVIDIA Vera CPU: Olympus Cores Built for Maximum Single-Threaded Performance in Agentic AI” (2026.7.21)、NVIDIA Vera CPU Architecture Whitepaper