AI资讯 / 产业

产业 / 官方

AI 基础设施能效的终极衡量标尺

NVIDIA AI

NVIDIA 发布技术博客指出,电力已成 AI 基础设施不可回避的硬性约束,单位功率下的 token 生成能力直接决定 AI 工厂的营收与盈亏。围绕 MoE 架构的推理负载,Blackwell NVL72 平台通过硅片到软件的全栈协同设计,在 DeepSeek V4、GLM5.1、Kimi K2.6 等前沿模型上较 Hopper 代实现最高 25 倍、20 倍和 10 倍的每瓦性能提升。下一代 Vera Rubin 平台进一步将 NVLink 升级至第六代,并依托 NVIDIA DSX MaxLPS 实时功率调度,使同等电网功率下可多运行 40% 的 GPU。Anthropic、OpenAI 以及 CoreWeave、Perplexity、Fireworks AI 等多家机构已在生产环境中部署该平台。

在电网容量与机房电力日益成为 AI 产业瓶颈的背景下,NVIDIA 把每瓦性能定位为衡量 AI 基础设施效率的核心指标。固定功率预算内能产出的 token 数量,直接决定 AI 工厂的收入上限与利润空间,这一指标只能靠真实生产结果积累,无法通过账面配置来粉饰。

当前几乎所有前沿 AI 模型都采用混合专家 MoE 架构,在机柜级别进行推理对系统与软件各层的协同设计提出了极高要求。NVIDIA Blackwell NVL72 平台已构建并验证了这一机柜级底座,在 DeepSeek V4 Pro 上实现较 Hopper 代最高 25 倍的每瓦性能,在 GLM5.1 上达到约 20 倍,在面向长周期 Agent 任务的 Kimi K2.6 上也达到约 10 倍。

Blackwell 平台的高能效源自贯穿硅片与软件的全栈协同。第六代 NVLink 交换机专为大模型 Scale-Up 域设计,并通过 SHARP 在网计算为 GPU 减负;Dynamo、TensorRT LLM 配合 SGLang、vLLM 提供 NVFP4 量化、解耦式推理、大规模专家并行与 KV 感知路由等能力,叠加 DeepSeek V4 一个月内最高 5 倍的持续软件优化,使每张 GPU 的有效产出成倍放大。

AI 工厂中制冷与机柜级损耗往往导致约 40% 的电网电力无法转化为有效算力。NVIDIA DSX MaxLPS 软件通过实时在 GPU 与机柜之间调度电力并支持温水液冷,使运营方在同等功率预算下可多运行高达 40% 的 GPU,缩小可用算力与入网电力之间的差距。

机柜级系统在生产规模下的可靠性需要长期工程沉淀。Anthropic、OpenAI 等前沿实验室以及 CoreWeave、Perplexity、Fireworks AI 等推理服务商均已在 Blackwell NVL72 上支撑数百万日请求的生产负载,这些跨代际与跨模型的部署经验将成为下一代 Vera Rubin 平台加速落地的关键起点。

要点

  • 每瓦性能是电力约束时代衡量 AI 工厂竞争力的核心指标,直接关联营收与利润。
  • Blackwell NVL72 在 DeepSeek V4、GLM5.1、Kimi K2.6 三类模型上较 Hopper 代分别实现最高 25 倍、20 倍、10 倍的每瓦性能跃升。
  • 全栈协同设计——从第六代 NVLink、SHARP 在网计算到 NVFP4 与解耦推理软件——是高效推理的关键乘数。
  • NVIDIA DSX MaxLPS 通过实时功率调度与液冷支持,可让同等电网功率下运行的 GPU 数量提升最多 40%。
  • ['Anthropic、OpenAI、CoreWeave、Perplexity、Fireworks AI 等已在 Blackwell 平台承载生产推理负载。', 'Vera Rubin 平台将在此基础上进一步抬高机柜级能效基准。']
查看原始来源

原始标题:Why Performance per Watt Is the Ultimate Metric for AI Infrastructure Efficiency

本文由 DataHub 基于公开来源整理,用于信息发现与摘要阅读;具体事实、数据和后续更新以原始来源为准。