产业 / 官方
把智能性价比推到极致,重塑智能体时代后训练范式
NVIDIA发布Vera Rubin平台,将“每美元智能”确立为智能体时代后训练的核心指标。不同于预训练阶段,后训练通过强化学习让模型学会规划、调工具与自我纠错,是持续运行的闭环。文章以Nemotron 3 Ultra为例,展示其以5500亿参数MoE架构在SWE-bench上取得71.7%的成绩。Vera Rubin从底层硬件、CPU、网络到软件栈协同设计,较Blackwell仅用四分之一GPU即可训练同规模模型。Prime Intellect、Perplexity、Together AI等企业已在该平台上实现持续强化学习与异步权重同步。
在智能体时代,AI模型不再是一次性交付的工具,而是要持续适应环境、调用工具并从失败中恢复的执行者。NVIDIA指出,后训练已从一次性收尾环节演变为永不停止的循环:生产环境中的新问题源源不断地回流,工具栈可能周周变,部署场景各有差异,这让后训练成为驱动“每美元智能”提升的核心负载。
后训练是智能真正成型的地方。预训练只让模型学会预测下一个token,获得流畅度而非能力;后训练则通过强化学习让模型在每次尝试中编写方案、调用工具、处理错误,再用奖励信号反向更新权重。成千上万次尝试累加,智能便从中长出。这一循环对算力要求极高,涉及大规模环境并行采样、奖励验证与权重回流,需要可复用的基础设施支撑。
NVIDIA将“每token成本”与“每美元智能”区分开来。前者衡量推理工厂的运营效率,后者衡量打造并持续维护一个值得部署的模型所需的整体投入。两者嵌套而非对立:底层硬件降低token成本,自然也会拉低模型每一点智能的建设成本;而每一点智能提升,又让推理服务的每个token更有价值。
Nemotron 3 Ultra是这一理念的集中体现。这个5500亿参数的开放权重MoE模型,在SWE-bench Verified真实软件缺陷基准上达到71.7%,即每10个开源项目中的真实bug,约7个能产出可被项目测试验证通过的修复方案。其后训练全流程基于NeMo RL运行,并对外完整披露配方向业内展示如何在大规模强化学习下兼顾质量与效率。
Vera Rubin平台从芯片到软件全程协同设计,目标就是把后训练的“每美元智能”推到极致。它在训练同等规模模型时只需Blackwell时代四分之一的GPU,却能容纳更多并行采样、更多并发环境,支持永不停歇的训练周期。Vera CPU与RL沙箱场景深度集成,使Prime Intellect实测吞吐量较其他x86架构高出约30%。
在实际工作流中,Perplexity通过RDMA权重传输引擎,将数千亿参数模型在训练与推理节点间同步耗时压到两秒以内;Together AI则把监督微调、强化学习与直接偏好优化打包成后训练即服务,并计划迁移至Vera Rubin。NVIDIA以全栈平台贯穿训练与推理两个环节,让“每美元智能”成为贯穿AI工厂的统一度量。
要点
- 后训练已从一次性环节变为智能体时代持续运行的闭环,是“每美元智能”提升的核心驱动
- Nemotron 3 Ultra以5500亿参数MoE架构在SWE-bench Verified上取得71.7%,验证开放权重后训练配方的可行性
- Vera Rubin以端到端协同设计实现同等规模模型训练仅需Blackwell四分之一的GPU
- Vera CPU在真实RL沙箱负载下较其他x86架构平均吞吐量提升约30%
- Perplexity实现万亿参数模型在训练与推理节点间2秒内权重同步,将持续后训练变为工程现实
原始标题:NVIDIA Vera Rubin Maximizes Intelligence per Dollar for Post-Training Workloads — a Key Metric for Agentic AI
本文由 DataHub 基于公开来源整理,用于信息发现与摘要阅读;具体事实、数据和后续更新以原始来源为准。