AI资讯 / 工程

工程 / 工程

Amazon SageMaker 推理服务2026年度功能全盘点

AWS Machine Learning

生成式 AI 推理面临模型体积庞大、延迟要求严苛、冷启动耗时长、GPU 资源紧张等多重挑战。Amazon SageMaker AI 为此提供两条部署路径:托管端点适合希望将基础设施运维交由 AWS 处理的团队,HyperPod Inference 则面向需要对专属 GPU 集群进行 Kubernetes 原生管控的团队。2026年截至目前,SageMaker AI 已在这两条路径上累计发布13项新能力,涵盖推理实例推荐与基准测试、容量感知实例池、OpenAI 兼容 API、容器缓存、可观测性增强、异步推理内联载荷、前缀感知路由、分层 KV 缓存、数据捕获、性能优化特性、分离式预填充与解码,以及模型缓存等。这些更新旨在帮助企业、初创公司和公共部门更快速、更稳定地将大模型推向生产环境。

在推理实例推荐与基准测试方面,SageMaker AI 于2026年4月推出了自动化端到端推荐流程。过去,为生成式 AI 模型选择合适的实例类型、服务容器和优化配置,通常需要两到三周的人工基准测试,涉及超过1000种组合,且对专业知识要求极高。新功能允许用户指定模型和性能目标(成本、延迟或吞吐量),SageMaker 随即自动完成实例筛选、目标对齐优化(包括 EAGLE 3.0 推测解码、内核调优、张量并行)以及基于真实 GPU 基础设施的多轮置信度基准测试,最终输出包含 TTFT、ITL、P50/P90/P99 延迟分位数及成本预测的部署就绪配置包。

容量感知实例池于2026年5月上线,解决了单一实例类型在容量不足时导致端点部署失败的痛点。用户可定义最多五种实例类型的优先级列表,SageMaker 在端点创建、扩容和缩容时自动按优先级依次尝试。扩容时,优先级列表中下一个可用类型承接流量;缩容时,回退实例优先释放,使集群逐步回归首选硬件。每种实例类型均可关联独立的优化模型配置,例如高内存实例使用张量并行、中端实例使用推测解码、较小回退实例使用量化,推理推荐功能可自动生成这些差异化配置。

OpenAI 兼容 API 的推出消除了将现有应用迁移至 SageMaker 托管模型的主要障碍。此前,基于 OpenAI SDK、LangChain 或 Strands Agents 构建的应用需要编写自定义客户端适配器并重写认证逻辑。现在,SageMaker 端点暴露 /openai/v1 路径,支持带流式传输的 Chat Completions 接口,迁移时仅需修改端点 URL,SDK 调用、流式逻辑和提示词格式保持不变。认证采用由现有 AWS 凭证生成的 Bearer Token,有效期最长12小时,省去了 SigV4 签名的复杂性,目前已在14个 AWS 区域上线。

容器缓存功能于2026年6月发布,针对自动扩缩容场景中大型容器镜像拉取耗时过长的问题。此前,超过10 GB 的服务容器在流量峰值触发新实例时,需要从 Amazon ECR 完整拉取镜像,这一过程本身就会造成显著延迟。容器缓存通过在实例层面预缓存镜像层,大幅缩短了扩容时的冷启动时间,使新实例能够更快响应请求,提升了端点在突发流量下的整体弹性表现。

面向 HyperPod Inference 的能力同样持续扩展。分层 KV 缓存允许将键值缓存分级存储于不同介质,在保持推理质量的同时降低高内存占用带来的成本压力。分离式预填充与解码(Disaggregated Prefill and Decode)将两个计算阶段拆分至不同节点,使预填充和解码可以独立扩展,从而在长上下文场景下显著改善首 Token 延迟与整体吞吐量之间的权衡。模型缓存则减少了跨部署的权重重复加载,进一步压缩了大模型的冷启动时间。这些能力共同构成了 HyperPod 在 Kubernetes 原生环境下的完整推理优化体系。

要点

  • 2026年 SageMaker AI 已发布13项推理新能力,覆盖托管端点与 HyperPod 两条路径,系统性解决生成式 AI 推理的核心工程挑战
  • 推理实例推荐功能将原本需要两到三周的人工基准测试自动化,可将吞吐量提升至原来的2倍,且不产生额外费用
  • 容量感知实例池通过最多五种实例类型的优先级回退机制,消除了单点容量故障风险,并支持每种实例独立配置优化策略
  • OpenAI 兼容 API 将现有应用迁移至 SageMaker 的成本降至最低,仅需修改端点 URL 即可完成切换
  • HyperPod Inference 的分离式预填充与解码、分层 KV 缓存等特性,为长上下文大模型提供了更精细的性能与成本调控手段
查看原始来源

原始标题:Amazon SageMaker Inference: 2026 year-to-date launches in review

本文由 DataHub 基于公开来源整理,用于信息发现与摘要阅读;具体事实、数据和后续更新以原始来源为准。