AI资讯 / 工程

工程 / 工程

在 SageMaker HyperPod 上部署 Amazon Nova 多轮强化学习基础设施

AWS Machine Learning

AWS 在 SageMaker HyperPod 上推出面向 Amazon Nova 的多轮强化学习基础设施。文章解析了多轮 RL 与单轮 RLHF 的差异,介绍了由 HyperPod 集群、Fargate 奖励环境、Nova Forge SDK 与 Step Functions 组成的两阶段事件驱动架构,并给出在 S3 上传数据即可自动触发 GRPO 训练的部署流程。文末附带 CDK 配置、实例配额、每小时成本等前置条件与关键参数说明,便于团队将 Wordle 示例替换为自有业务任务。

传统 RLHF 只能孤立地优化单轮回复,而企业级智能体往往要查询数据库、调用 API、串联多个步骤并在过程中恢复错误,单步动作的质量要等到几步之后才能体现。多轮强化学习正是为这一痛点而生,它把整段交互序列作为优化目标,让智能体通过试错学会工具编排、错误恢复与多步推理。SFT、RAG 与持续预训练可以作为补充,但难以独立承担这种序列决策能力的培养。

整套方案采用事件驱动设计:只要把数据集上传到 S3,基础设施就会自动完成算力调度、奖励路由与多轮 RL 训练。底层由三层协作:SageMaker HyperPod 集群负责生成回复并执行 GRPO 权重更新;ECS on Fargate 承载自定义奖励环境;Nova Forge SDK 的代理层在模型与环境之间转发消息,并维护跨轮次对话状态。AWS Step Functions 与 EventBridge 负责编排整个流程。

架构被刻意拆成两阶段:首次部署通过 CDK 一次性创建 VPC、EKS/HyperPod、ECS、S3、IAM 等长期资源;每次训练再按需启动临时算力。这样 GPU 不会在两次任务之间空转,迭代新实验时也无需重新部署整套栈。Nova 模型可在 NOVA_MICRO、NOVA_LITE、NOVA_LITE_2、NOVA_PRO 之间切换,默认使用 P5 实例运行 vLLM 生成副本。

部署前需要准备 Nova Forge 订阅、至少 10 块 ml.p5.48xlarge 的 HyperPod 配额(生产建议 12–14 块)、Python 3.12+、AWS CDK v2、AWS CLI v2 与 Docker。CDK 上下文中的 project_tag 与 sdk_resource_prefix 是两个必填项,其余参数如 instance_count、max_steps、generation_replicas、global_batch_size 等都可在 cdk deploy 时覆盖。文章也提醒,运行期间每小时成本约 786 到 1180 美元,不训练时应及时销毁栈。

训练任务以 Wordle 作为占位示例,方便快速验证管线。开发者只需将数据上传到配置好的 S3 桶,Step Functions 就会被 EventBridge 触发,自动拉起 Fargate 奖励 worker、SQS 队列与训练任务,最终通过 GRPO 完成多轮策略更新。这一闭环让团队可以专注于业务奖励函数的设计,而把基础设施编排交给 AWS。

要点

  • 多轮 RL 把整段交互序列作为优化目标,比单轮 RLHF 更适合训练执行多步工作流的企业智能体。
  • 方案采用两阶段部署:CDK 一次性创建长期资源,每次训练按需拉起临时 GPU,避免算力闲置。
  • 核心组件包括 SageMaker HyperPod(GRPO 训练)、ECS on Fargate(奖励环境)与 Nova Forge SDK(消息路由与状态追踪)。
  • 默认需要至少 10 块 ml.p5.48xlarge 实例,运行期间每小时成本约 786 到 1180 美元。
  • 只需把数据集上传到 S3,Step Functions 就会被 EventBridge 自动触发,完成从数据落到模型更新的全流程。
查看原始来源

原始标题:Deploying Multi-Turn RL Infrastructure for Amazon Nova on Amazon SageMaker HyperPod

本文由 DataHub 基于公开来源整理,用于信息发现与摘要阅读;具体事实、数据和后续更新以原始来源为准。