AI资讯 / 工程

工程 / 工程

用 AI 智能体驱动 SageMaker 集群全生命周期管理

AWS Machine Learning

在大规模基础模型工作负载场景下,Amazon SageMaker HyperPod 的运维工作往往是一条由多个相互依赖步骤构成的链条:网络与控制平面搭建、加速器容量挂载、集群依赖安装、存储与身份准备、分布式任务容错恢复,以及模型服务部署。每个环节都有独立的 API 和等待周期,交接点正是运维痛点所在。HyperPod InstantStart 是一个围绕这一编排问题构建的开源控制平面,以单一带外管理容器的形式运行于用户 AWS 账户中。它同时提供 Web 界面和 AI 智能体两种交互方式,两者调用完全相同的后端 API、经过相同的校验逻辑,并共享同一份持久化操作状态。用户只需在终端输入一句自然语言,AI 智能体便可规划多阶段工作流、逐步启动各阶段并轮询异步 AWS 操作直至完成,仅在可用区、实例类型等真正需要人工决策的节点暂停等待确认。

HyperPod InstantStart 的核心设计理念是将操作规则编码进控制平面 API,而非直接将原始 CLI 暴露给 AI 智能体。这一区别至关重要:当校验逻辑集中在后端 REST API 层时,无论是浏览器界面还是智能体调用的 MCP 工具,都会经过同一套保护机制。任何一处新增的校验规则会同时对两个入口生效,从根本上避免了智能体绕过安全边界直接执行危险操作的风险,使智能体驱动的基础设施具备真正意义上的可靠性。

从架构层面看,InstantStart 将整个环境组织为四个层次。基础设施层负责分阶段的 EKS 创建或导入、依赖协调、网络布局与多集群状态管理,底层依托 AWS CloudFormation 和 Amazon EKS。容量与弹性层处理实例组工作流、容量类型选择及托管功能配置,并与 HyperPod 的健康监控、自动节点恢复和持续供应能力深度集成。工作负载与数据层涵盖训练配方、两种推理路径、模型下载与存储工作流以及 MLflow 集成。接口层则提供 Web UI、REST API、MCP 工具和智能体技能四种访问方式。

在存储与可观测性集成方面,InstantStart 将 Amazon S3、Amazon FSx for Lustre 和 Amazon ECR 分别用于承载镜像、数据集和检查点。集群健康与资源利用率指标被推送至 Amazon Managed Service for Prometheus 和 Amazon Managed Grafana,训练过程中的实验指标与模型产物则由 Amazon SageMaker AI 上的托管 MLflow 接收。这些集成均通过控制平面统一编排,用户无需手动配置各服务之间的连接关系。

HyperPod 托管能力与用户自管理的 EKS 之间存在清晰的责任边界,这是理解整个系统的关键。Kubernetes 侧由用户管理,包含 Kubernetes API、以 EKS 插件形式安装的 HyperPod 训练与推理算子,以及由这些算子协调生成的训练和推理 Pod。AWS 侧由 SageMaker HyperPod 托管,涵盖基础设施健康监控、容量持续供应、训练过程级恢复和推理智能路由四大能力。两者在 HyperPod 实例组层面交汇,Kubernetes 负责调度 Pod,HyperPod 负责管理实例组本身。

在实际部署流程上,用户需要提前完成若干准备工作:为计划使用的每种实例类型申请 SageMaker 服务配额提升,对于高端加速器类型还需购买 Amazon SageMaker 灵活训练计划以预留容量,同时检查 VPC 配额(默认每个集群会创建独立 VPC)。项目提供了 CloudFormation 模板用于一键创建管理环境、共享 S3 存储桶及所需 IAM 角色。完成部署后,在实例上克隆代码仓库并运行启动脚本,即可获得包含 Web 界面和智能体接口的完整控制平面。整个过程中,所有创建的资源均为标准 AWS 或 Kubernetes 资源,可通过 AWS CLI 和 kubectl 直接检查。

要点

  • HyperPod InstantStart 将 AI 智能体与 Web 界面统一接入同一套后端 API,校验逻辑集中管理,确保智能体驱动操作与人工操作具备同等安全保障。
  • 控制平面以带外管理容器形式运行,不介入训练或推理数据路径,所有创建资源均为标准 AWS 或 Kubernetes 资源,保持完整的可观测性与可审计性。
  • HyperPod 托管能力(健康监控、自动恢复、持续供应)与用户自管理的 EKS 之间存在明确责任边界,在实例组层面交汇,便于故障定位与分工处理。
  • AI 智能体通过 MCP 工具调用后端 REST API,可自动规划并执行多阶段集群创建工作流,仅在可用区、实例类型等关键决策点暂停等待用户确认。
  • 部署前需提前申请实例配额并考虑购买灵活训练计划以预留加速器容量,这是影响实际可用时间的关键前置条件。
查看原始来源

原始标题:Run agent-driven Amazon SageMaker HyperPod operations with InstantStart

本文由 DataHub 基于公开来源整理,用于信息发现与摘要阅读;具体事实、数据和后续更新以原始来源为准。