news 2026/7/24 6:16:20

NVIDIA Vera CPU 深度解读:Olympus 自研核心为什么是 Agentic AI 的关键拼图

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
NVIDIA Vera CPU 深度解读:Olympus 自研核心为什么是 Agentic AI 的关键拼图

NVIDIA Vera CPU 深度解读:Olympus 自研核心为什么是 Agentic AI 的关键拼图

NVIDIA 昨天(7 月 21 日)发布了 Vera CPU 的技术博客和架构白皮书。这可能是 NVIDIA 迄今为止最详细的一次 CPU 技术披露——从 Olympus 核心的微架构到双路 NUMA 拓扑,全摊开了。

我读完之后最强烈的感受:NVIDIA 在为 GPU 空转等 CPU 这个问题建护城河。而且这堵墙 x86 短期翻不过去。


Vera vs Grace:不只是迭代

参数Grace (2024)Vera (2026 H2)变化
核心72× Neoverse V2 授权88× Olympus 自研全自研
线程72176 (空间多线程)+144%
解码宽度610 指令/周期+67%
L21 MB/核2 MB/核翻倍
L3114 MB164 MB 统一+43%
SCF 对分带宽3.4 TB/s全新
内存带宽512 GB/s1.2 TB/s (14 GB/s/核)+134%
NVLink-C2C900 GB/s1.8 TB/s翻倍
PCIeGen 5Gen 6.4新标准
双路单 NUMA 双路新能力
FP8✅ 首个原生 FP8 CPU关键新能力
机密计算Arm CCA/RME + 机架级可信新能力

Olympus 核心微架构

NVIDIA 将 Olympus 核心拆为四个子系统:前端、中核、执行引擎、缓存子系统

前端:10-wide Decode + 神经分支预测器。当前 x86 最高(Zen 5/6)是 8-wide,ARM 公版 Neoverse V2 是 6-wide,Olympus 直接拉到 10-wide——对标 Apple M 系列的设计规模。背后的支撑是神经分支预测器(Neural Branch Predictor),每周期处理两个 taken branch。Agent 代码全是 if-else 和动态调用,分支预测命中率直接决定有效 IPC。

中核:价值预测 + 内存重命名 + 关键路径加速。价值预测(Value Prediction)——猜 load 指令会返回什么值,不等 DRAM 直接继续执行后面的指令。这在学术圈研究了二十年,商业 CPU 中大规模部署的极少。内存重命名(Memory Renaming)解决指针链的 alias 问题。关键路径加速标记最长依赖链上的指令给予优先调度。再加上大 ROB + 大物理寄存器堆,in-flight 指令数远超 Grace。

执行引擎:SVE2 + FP8。6×128-bit SVE2 向量单元(单线程),双线程时各 3×128-bit。FP8 原生支持是 CPU 史上首次——之前的 Intel AMX 和 ARM SME 把 FP8 放在矩阵加速器里,不在核心流水线中。LLM 推理前的 token 量化——过去在 GPU 上浪费 GPU 算力,Vera 在 CPU 上以 FP8 精度完成,直接通过 NVLink-C2C 喂给 GPU。

缓存子系统:图预取器(Graph Prefetcher)。标准 prefetcher 对规律访问有效。Agent 的数据结构完全不同——每一步地址取决于上一步取值,传统 prefetcher 完全失效。图预取器通过学习内存访问中的指针模式来预测下一个 load 地址。Intel 和 AMD 的 CPU 里没见过——NVIDIA 专门为 Agent 负载做的差异化投资。


空间多线程:名字就叫 SMT,但和你知道的那个完全不一样

NVIDIA 的 Spatial Multithreading 缩写也叫 SMT。两个 SMT 的区别:

传统 SMT(Intel Hyper-Threading):两个线程共享分支预测器、解码带宽、执行单元、Load/Store 队列、L1/L2 Cache。一条线程的 cache miss 驱逐另一条的数据。结果:0-30% 吞吐提升,延迟完全不可预测。

Vera 空间多线程:Olympus 核心足够宽,物理分两个线程槽。单线程模式时全部资源给一条线程,兄弟线程只跑后台管理。双线程模式时资源物理平分,互不干扰。结果:接近 100% 吞吐提升,延迟完全可预测。

为什么确定性延迟对 Agentic AI 是刚需?

一个 Rubin GPU 集群每秒烧几千美元。如果 CPU 线程竞争导致 Kernel Launch 抖动 30ms——1 个 GPU 空转 → 72 个 GPU 一起等(NVL72 紧耦合)→ 1 次抖动 = 2.16 GPU-秒浪费。每天几千次 = 几万 GPU-秒。空间多线程把这种不确定性归零。x86 SMT 可以提供接近的平均延迟,但无法消除尾延迟。


SCF 互联与 SOCAMM2 内存子系统

SCF(Scalable Coherency Fabric)是 Vera 的片上骨干:3.4 TB/s 对分带宽,164 MB 统一 L3,所有 88 核在单片 Die 上,无跨 Die NUMA。

SOCAMM2 LPDDR5X 是 Vera 在内存形态上的关键创新:LPDDR 的低功耗和高带宽(1.2 TB/s)+ DIMM 的可维护性 + 企业级 RAS(ECC/内存镜像/rank sparing)。之前这三个需求互斥(LPDDR 必须焊死才能维持短电气路径),NVIDIA 通过模块化设计突破了这个限制。


双路单 NUMA:和 Chiplet 路线说再见

x86 双路服务器的 NUMA 地狱:Socket 0 内 2-4 NUMA + Socket 1 内 2-4 NUMA = 总共 4-8 个 NUMA 域。线程放哪、内存在哪、I/O 走哪——需要专门的性能工程师。

Vera 的方案:每个 Socket单 NUMA 域(单片 Die 的自然结果),双路 = 两个 NUMA 域。NVLink-C2C Gen 2 做 Socket 间互联。NVIDIA 博客原话:“avoids the die-hop latency and variability common in fragmented chiplet designs”。软件优先。


性能:1.8× Agent 负载提升

博客 Figure 6:“Vera CPU delivers up to 1.8x higher performance on agentic workloads”。

注意限定词:“up to”——最好情况。“agentic workloads”——Python 执行、代码编译、工具驱动路径,不是 SPEC 整数。“loaded single-thread performance”——全 socket 跑满 176 线程时的单线程性能,不是单核空跑峰值。

这个指标比单核峰值难得多:88 个核心同时争抢 L3、内存带宽、SCF 对分带宽。单核的邻居越多,单核越难维持高性能。Vera 在这个场景下比 Grace 好 1.8 倍。


我的几个判断

第一,Olympus 自研核心是 NVIDIA CPU 战略的梭哈时刻。Grace 是试水(ARM 公版 + NVLink 包装),Vera 是全栈自研——核心、互联、内存、NUMA 全部自己定义。这个跨越相当于 AMD 从 Bulldozer 到 Zen。

第二,神经预测器 + 价值预测 + 图预取器一起出现,说明 NVIDIA 对 Agent 负载做了深度 profiling。不是"比 x86 快 10%“,而是"x86 架构在 Agent 负载上有 30-50% 的无用功”。这三个技术没有一个是传统服务器 CPU 的标配。

第三,单片 Die 短期很对,长期有天花板。88 核是物理极限。SCF 正在为未来多 Die 扩展做准备。Vera-next(2028?)必须面对 Chiplet 问题——那时 Rubin GPU 的计算密度又翻了一倍。

第四,NVLink-C2C 1.8TB/s 是 x86 翻不过去的结构性壁垒。不是技术问题,是商业模式——Intel 和 AMD 不可能为 NVIDIA 定制 CPU-GPU 一致性互联协议。

第五,白皮书里的 SPEC 分数才是硬验证。博客是架构叙事,1.8× 是定性结论。等拿到白皮书原文我会补上 SPEC 分析。


发布时间:2026年7月22日来源:NVIDIA Developer Blog “Inside NVIDIA Vera CPU: Olympus Cores Built for Maximum Single-Threaded Performance in Agentic AI” (2026.7.21)、NVIDIA Vera CPU Architecture Whitepaper

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/7/24 5:50:30

《天灵诀》手游正版下载与安全验证全攻略

1. 项目概述:天灵诀手游正版获取的核心价值最近在手游圈子里,《天灵诀》这款东方玄幻题材的MMORPG突然火了起来。作为一款主打"开放大世界门派养成"的手游,它独特的御剑飞行系统和法宝炼化玩法吸引了不少玩家。但我在各大游戏论坛发…

作者头像 李华
网站建设 2026/7/23 4:41:33

Linux操作系统C盘扩容方式

一) 闲置空间分区(分出你所需要扩容的空间大小) 进入fdisk工具 sudo fdisk /dev/sdd image查看现有分区列表 输入 p 回车,确认存在分区:sdd3 (系统)、sdd4 (100G 空闲)、sdd5 (数据盘)删除原来整块 100G 的 sdd4 分区 输入&#x…

作者头像 李华
网站建设 2026/7/23 4:40:03

从工具提效到智能原生:中国企业 AI 转型的四级进阶体系与标杆实践

从国务院“智能原生企业”发展方向看中国知名企业AI转型 【摘要】基于国务院 “人工智能 ” 行动意见明确的智能原生企业培育方向,拆解企业 AI 转型的五级判定维度与四级进阶路径,结合金融、制造、科技、互联网四类标杆企业落地实践,为技术管…

作者头像 李华
网站建设 2026/7/24 8:59:20

UE4物体操控核心:空间转换、旋转处理与性能优化实战

1. 项目概述:为什么UE4物体操控总让人“血压升高”?如果你在UE4里做过物体移动、旋转或者基于外接设备(比如手柄、VR控制器)的交互,大概率遇到过这样的场景:代码逻辑看着天衣无缝,编译也没报错&…

作者头像 李华
网站建设 2026/7/24 8:25:04

根治英伟达显卡驱动崩溃损坏问题(亲测有效)

整体总流程: (不要使用鲁大师或者驱动精灵,会循环损坏安装驱动) DDU 安全模式清理驱动NVIDIA 官方驱动清洁安装 设置【Windows 更新不包括驱动程序】(测试驱动是否生效)插上 HDMI 外接显示器,测试扩展投屏 一、 DDU安全模式清理驱动 1. 下…

作者头像 李华
网站建设 2026/7/23 4:33:23

4小时原则,杀死了我的SCI拖延症

四小时原则用来写论文,真的是绝杀。如果你也和我一样,写SCI容易拖延,打开文档坐了一天,写了删删了写,一上午过去就剩三行字。真的建议你用这个4小时学习法:每天只抽出4小时集中搞科研,坚持2周就…

作者头像 李华