AI资讯 / 工程

工程 / 工程

用 NVIDIA Cosmos 3 在 SageMaker HyperPod 上构建 Physical AI 模型工厂

AWS Machine Learning

构建机器人或自动驾驶车辆等 Physical AI 系统,无法依靠单次训练任务完成,而需要一条持续运转的流水线:循环生成合成数据、对感知与策略模型进行后训练,再在闭环仿真中评估效果。AWS 近期发布技术文章,介绍如何以 NVIDIA Cosmos 3 为核心引擎,在 Amazon SageMaker HyperPod 与 Amazon EKS 上搭建这样一座「Physical AI 模型工厂」。Cosmos 3 采用混合 Transformer(MoT)架构,将视频、图像、动作与声音统一为单一 token 流,同一模型主干可在世界模型、动作标注器和部署策略三种模式下运行,从而将原本需要独立 GPU 资源池的三个阶段合并到一个持久化集群上统一调度。文章重点强调,在持续占用 GPU 容量的前提下,衡量成本效益的关键指标不是单个任务的峰值吞吐量,而是整条流水线每保留 GPU 小时所产生的有效进展,即 GPU goodput。

Physical AI 系统的开发本质上是一个闭环迭代过程。以自动驾驶车辆或工业机器人为例,系统需要不断消化真实世界采集的新数据,生成合成场景以覆盖长尾情况,对感知与策略模型进行后训练,再通过仿真评估验证效果,然后进入下一轮循环。这种持续运转的流水线被称为「Physical AI 模型工厂」,其核心挑战在于如何在保持 GPU 资源高效利用的同时,让各阶段无缝衔接、稳定运行。

NVIDIA Cosmos 3 的架构设计正是为这一场景量身打造。它将视频、图像、动作向量和音频统一编码为单一 token 序列,模型主干由「推理者」和「生成者」两个专家组成,通过每层的双流注意力机制相互关联,使生成过程在每一层都受到推理输出的约束,而非仅在最终层进行一次交叉注意力。这种混合 Transformer(MoT)设计让同一套权重能够承担合成数据生成、动作标注和策略推理三项任务,无需为每个阶段维护独立模型。

Cosmos 3 支持三种动作模式,通过改变哪些 token 作为噪声输入来切换。前向动力学模式(世界模型)以动作为条件预测下一帧视频,用于生成真实采集难以覆盖的稀有场景;逆向动力学模式(动作标注器)从无标注视频中反推动作序列,将原始遥操作录像或第三方视频转化为带标注的训练数据;策略模式则直接输出机器人未来 32 个关节位置,预测的视频帧作为副产品为动作预测提供语义锚定。训练与推理之间存在刻意的非对称设计:训练时运行完整去噪流程并解码视频像素,部署时仅执行少量去噪步骤且跳过视频解码,大幅降低推理开销。

在基础设施层面,SageMaker HyperPod 与 Amazon EKS 的组合为模型工厂提供了持久化、高弹性的 GPU 节点池。传统做法是为合成数据生成、后训练和评估分别申请独立的 GPU 容量,各自独立启停,导致资源碎片化且调度复杂。Cosmos 3 的统一架构使三个阶段可以作为三类工作负载调度到同一集群,通过时间共享方式复用容量。配套的开源仓库 awsome-distributed-ai 提供了完整的基础设施模板和任务清单,涵盖集群配置、多 TB 共享存储层搭建以及三类分布式后训练工作负载的端到端示例,其中机器人策略阶段以公开的 DROID 数据集为基准进行了完整演示。

GPU goodput 是贯穿整篇文章的核心度量指标。当团队为整条流水线预留 GPU 容量时,无论流水线是否在有效推进,费用都在持续产生。因此,优化目标不应是某个单一任务的峰值吞吐量,而是每保留 GPU 小时在整条流水线上产生的有效模型进展。通过将三个阶段整合到一个持久集群并统一调度,可以显著减少节点启停带来的空闲损耗,从而在相同容量预算下获得更高的实际产出。Cosmos 3 以 Linux 基金会 OpenMDW-1.1 许可证开源发布,提供 Nano(16B 参数)和更大规模两个版本供不同场景选用。

要点

  • Physical AI 开发需要合成数据生成、模型后训练与闭环评估三阶段持续循环,单次训练任务无法满足需求
  • Cosmos 3 的 MoT 架构将多模态统一为单一 token 流,同一模型主干可承担世界模型、动作标注器和部署策略三种角色,消除了为每阶段单独维护 GPU 资源池的必要
  • 训练与推理之间的非对称设计使部署时跳过视频解码成为可能,在保持动作预测质量的同时大幅降低推理计算量
  • GPU goodput(每保留 GPU 小时的有效流水线进展)是评估 Physical AI 模型工厂成本效益的关键指标,优于单任务峰值吞吐量
  • AWS 提供了完整的开源参考实现,包括 SageMaker HyperPod 集群配置、共享存储层搭建和三类分布式后训练工作负载的任务清单
查看原始来源

原始标题:Build a Physical AI model factory with NVIDIA Cosmos 3 on SageMaker HyperPod

本文由 DataHub 基于公开来源整理,用于信息发现与摘要阅读;具体事实、数据和后续更新以原始来源为准。