AI资讯 / 产业

产业 / 官方

面向智能体时代的极致单线程 CPU

NVIDIA AI

NVIDIA 推出面向智能体 AI 时代的新型 CPU——Vera,主打规模化场景下的极致单线程性能。Vera 采用自研 Olympus 核心,单周期指令数较上一代 Grace 提升 50%,并通过单片计算芯片设计,让全部 88 个核心都能享受完整内存性能,避免小芯片架构带来的速度损耗。在实际智能体负载下,Vera 的每核持续性能可达 x86 架构的 1.8 倍,Perplexity 的代码沙箱测试中,任务完成速度提升约 1.5 倍,并发启动速度提升最高 1.9 倍。在 SQL 分析与实时流处理等数据侧负载中,Vera 同样取得 3 倍以上加速与最高 6 倍延迟下降。Vera 还将作为 NVIDIA Vera Rubin 平台与 BlueField-4 STX 存储处理器的统一 CPU,使整座 AI 工厂共享一套架构与工具链。

在智能体系统的整个生命周期里,CPU 始终是推理、响应和学习的关键路径。模型给出指令后,CPU 需要执行工具调用、代码运行、数据处理、KV 缓存以及结果分析等任务,CPU 的速度直接决定智能体每一步的快慢。对于部署大量智能体的 AI 工厂而言,GPU 是最核心的收入来源,一旦 CPU 拖累任务进度,就会拉低 GPU 利用率与整体营收。

然而,当前主流数据中心 CPU 的演进方向并不以单线程性能为优先。为了在云端实现更高的核心密度与更低的单核成本,芯片厂商普遍采用小芯片架构,把更多面积分配给核心数量而非单核性能,结果是每个核心可用的内存带宽受限,并出现了"小芯片税"。在智能体持续高负载运行的场景下,这种设计让单核速度成为整条链路的瓶颈。

智能体的工作模式是持续并行的循环:模型推理一步,CPU 执行一步,结果回到模型,再决定下一步。每一步都依赖前一步的输出,因此核心数量无法缩短单步耗时,单核性能才是决定循环速度的关键。NVIDIA 将这种场景所需的能力总结为"规模化极致单线程 CPU":在满载状态下仍能为每个核心提供稳定的高性能、足够的内存带宽以及可预测的延迟。

NVIDIA Vera 正是为这一目标从零设计的产品。其核心是自研 Olympus 核心,单周期指令数较 Grace 提升 50%;同时配备最高 1.2TB/s 的 LPDDR5X 内存带宽,单片计算芯片让 88 个核心都能直连完整内存,配合 3.4TB/s 的核间互联带宽,彻底消除传统小芯片架构带来的瓶颈。

在实际智能体负载测试中,Vera 的每核持续性能达到 x86 服务器 CPU 的 1.8 倍。Perplexity 用 Vera 跑真实的代码沙箱流程,任务完成速度提升约 1.5 倍,并发沙箱启动速度最高提升 1.9 倍,已计划在新一代生产系统中部署。此外,Starburst 大规模 SQL 分析提速 3 倍,Redpanda 实时流处理延迟下降最高 6 倍,体现出 Vera 在数据侧负载上的通用优势。

Vera 还是 NVIDIA Vera Rubin 平台与 BlueField-4 STX 存储处理器共同采用的 CPU,使整座 AI 工厂可以用同一套架构与工具链完成推理、训练与存储。NVIDIA 还预告了下一代 Rosa CPU 与 Rigel 核心,将继续沿 Arm v9.2 路线提升单核性能,为智能体时代提供更长远的算力底座。

要点

  • CPU 已成为智能体时代的关键路径处理器,单线程性能直接决定 AI 工厂的吞吐与 GPU 利用率。
  • 传统数据中心 CPU 为追求核心密度牺牲了单核速度与内存带宽,难以满足持续并行的智能体负载。
  • NVIDIA Vera 以 Olympus 核心、单片设计与 1.2TB/s 内存带宽,实现满载下 88 个核心均保持极致单线程性能。
  • Vera 在实际智能体负载中提供 1.8 倍于 x86 的每核性能,并被 Perplexity 等创新者用于生产部署。
  • Vera 与 NVIDIA Rubin GPU、BlueField-4 STX 共享架构,使 AI 工厂具备统一的算力与存储底座。
查看原始来源

原始标题:AI Innovators Adopt NVIDIA Vera — Why Max Single-Threaded CPU at Scale Matters

本文由 DataHub 基于公开来源整理,用于信息发现与摘要阅读;具体事实、数据和后续更新以原始来源为准。