工程 / 工程
SageMaker HyperPod 新增多层数据采集、Hugging Face 直连、NVMe 加速与自动 DNS
Amazon SageMaker HyperPod 推理服务迎来五项新能力。首先是三层数据采集:可在 SageMaker 端点、应用负载均衡器和模型 Pod 三个层级独立配置请求与响应记录,用于审计、调试与模型改进,并支持采样率、KMS 加密和负载大小限制。其次是直接对接 Hugging Face Hub 等社区仓库,免去预置权重的步骤,并支持门控访问、版本固定与跨 vLLM、TGI、SGLang 等运行时的 token 隔离。第三是从节点本地 NVMe 加载权重以缩短冷启动时间,并在必要时自动回退至云端存储。第四是自动托管 Route 53 自定义域名的 DNS 记录。第五是通过自定义服务账号实现 Pod 级 IAM 权限控制,强化安全边界。这些能力共同提升了 HyperPod 在性能、可观测性与合规性方面的企业就绪程度。
Amazon SageMaker HyperPod 推理服务新增多层数据采集能力,覆盖从 SageMaker AI 端点到应用负载均衡器再到模型 Pod 的完整请求链路。每一层都可以通过声明式自定义资源(CRD)独立开启,按需选择采集深度。SageMaker 端点层适合需要与 Model Monitor 兼容的场景,负载均衡器层用于记录客户端 IP、路径和延迟等元数据,模型 Pod 层则在推理容器处捕获完整的输入和输出负载,支持采样率、缓冲配置和负载上限设置。所有采集结果统一写入指定的 S3 存储桶,并支持 KMS 加密。
在模型部署方面,HyperPod 现已支持直接从 Hugging Face Hub 等社区仓库拉取模型权重,无需预先上传到对象存储或文件系统。该能力内置对门控模型的访问控制、版本固定以及跨 vLLM、TGI、SGLang 等主流推理运行时的 token 隔离机制。这一改动缩短了从模型发布到生产部署的链路,也减少了运维团队为每个新模型准备存储介质的工作量。
针对冷启动延迟问题,HyperPod 引入从节点本地 NVMe 存储加载模型权重的路径,显著缩短推理节点从启动到可服务的等待时间。当本地磁盘不存在所需权重时,系统会自动回退至云端存储,确保部署不会因缓存缺失而失败。这一机制与企业常见的弹性扩缩容场景高度契合,避免新节点每次都从远端拉取大量权重。
在域名与网络层面,HyperPod 自动管理 Route 53 上的自定义域名 DNS 记录,团队不再需要手工维护 A/AAAA 记录或编写额外的自动化脚本。该项集成降低了将企业内部域名指向推理端点的运维成本,也减少了因 DNS 配置不一致引发的可用性问题,配合 ALB 访问日志与端点审计能力形成完整的可观测链路。
安全方面,HyperPod 通过自定义服务账号实现 Pod 级 AWS IAM 权限分配,基础设施团队可以按工作负载设定最小权限边界。该能力让推理 Pod 仅访问其所需的 S3 桶、KMS 密钥或监控目标,从而在多团队共享集群的场景下避免权限放大。结合端点级数据采集开关,运维与合规团队能够在数据流向和访问控制两端同时加强治理。
整体来看,这五项增强覆盖了模型加载、请求采集、网络接入与权限隔离等推理生产链路的多个关键节点。对于运行自有基础模型或需要在企业内部署开源生成式 AI 模型的企业团队而言,HyperPod 在性能、可观测性与合规性之间的取舍变得更加均衡。
要点
- HyperPod 推理新增端点、负载均衡器、模型 Pod 三层独立可配置的数据采集能力,支持采样率、KMS 加密和负载上限控制
- 支持直接从 Hugging Face Hub 等社区仓库部署模型,无需预置权重,并内置门控访问、版本固定与跨运行时 token 隔离
- 节点本地 NVMe 权重加载显著缩短冷启动时间,并在缺失时自动回退到云端存储
- Route 53 自动 DNS 管理让自定义域名接入推理端点更省心
- 通过自定义服务账号实现 Pod 级 IAM 权限控制,强化多团队共享集群的安全边界
原始标题:Enhancing enterprise inference on Amazon SageMaker HyperPod with data capture, Hugging Face, NVMe, and Route 53 integration
本文由 DataHub 基于公开来源整理,用于信息发现与摘要阅读;具体事实、数据和后续更新以原始来源为准。