AI资讯 / 工程

工程 / 工程

Amazon SageMaker HyperPod 推理网关正式发布:首Token延迟最高降低82%

AWS Machine Learning

Amazon正式推出SageMaker HyperPod Inference Gateway,这是一款面向Amazon EKS的Kubernetes原生GPU感知路由插件。传统Kubernetes负载均衡器采用轮询或最少连接算法,对GPU内部状态毫无感知,导致请求堆积在繁忙Pod后方、空闲算力白白浪费,首Token延迟在流量高峰时可飙升至4秒以上。HyperPod Inference Gateway通过实时采集每个Pod的Prometheus指标,综合KV缓存利用率、请求队列深度、LoRA适配器驻留情况及前缀缓存命中率等维度,将每条推理请求路由至最适合的后端Pod。整套系统以单一EKS托管插件形式部署,无需修改模型服务器或客户端代码,兼容OpenAI标准接口。基准测试显示,首Token延迟最高可降低82%,聊天机器人用户等待时间从4.4秒缩短至800毫秒以内。

在GPU集群上大规模运行大语言模型成本高昂,而默认的Kubernetes负载均衡策略正在加剧这一问题。轮询与最少连接算法对GPU内部状态完全不可见,无法感知哪些Pod的KV缓存已接近饱和、哪些正在处理长上下文生成任务,或哪些已在显存中加载了请求所需的LoRA适配器。结果是请求不断堆积在繁忙Pod之后,空闲算力无法被有效利用,团队不得不通过过度配置来应对延迟抖动,造成大量GPU资源浪费。

HyperPod Inference Gateway采用两层架构设计,全部基于Kubernetes原生原语构建。第一层为每集群网关,以EKS托管插件形式安装,包含三个核心组件:高性能L7代理Envoy Gateway负责终止HTTPS流量并暴露单一私有端点;基于请求体的路由器(BBR)解析OpenAI兼容请求体中的model字段并将流量分发至对应模型池,支持单网关多模型路由;端点选择器(EPP)则是整套系统的智能核心,实时消费各Pod的Prometheus指标并通过加权评分算法选出最优后端。

EPP的评分维度涵盖KV缓存利用率、请求队列深度、LoRA适配器驻留情况、前缀缓存命中率以及当前运行请求数,每个维度均可配置权重,团队可根据延迟敏感型聊天或吞吐量优先型批处理等不同场景灵活调整路由策略。对于LoRA适配器路由,EPP会优先将请求发送至已在GPU显存中加载对应适配器的Pod,彻底消除适配器换入换出带来的额外延迟;若无Pod已加载该适配器,则路由至可用容量最充裕的Pod以快速完成加载。

整套网关的部署流程极为简洁,仅需四步即可完成:通过AWS CLI安装EKS插件、为现有模型Pod添加标签、创建InferenceGatewayConfig自定义资源声明模型与路由行为,最后直接向网关暴露的标准OpenAI兼容端点发送推理请求。全程无需引入Sidecar、服务网格或任何应用代码改动,现有客户端代码可直接复用,也无需SigV4签名。

在可靠性方面,网关在各层级均实现了优雅降级:Pod故障时EPP自动排除指标过期的Pod并路由至健康实例;资源池耗尽时返回带Retry-After头的HTTP 429响应;集群故障时全局推理路由器(GIR)在35秒内检测到心跳超时并重定向流量;区域故障时跨区域路由自动激活,仅带来轻微延迟增加而不影响可用性。可观测性方面,网关在Pod、资源池、集群及机队四个层级分别输出指标,无缝接入Prometheus、Grafana及Amazon CloudWatch。

基准测试覆盖参数量从8B到235B的四款模型,分别部署在搭载H100的p5.48xlarge实例和搭载A10G的g5实例上。测试结果显示,相较于默认Kubernetes路由策略,HyperPod Inference Gateway可将首Token延迟最高降低82%。目前即将推出的第二层全局推理路由器(GIR)将进一步支持跨集群、跨区域的流量协调、全局限速与成本感知流量整形,为多集群大规模推理场景提供更完整的解决方案。

要点

  • HyperPod Inference Gateway通过实时GPU指标驱动的加权评分算法,将首Token延迟最高降低82%,聊天场景响应时间从4.4秒缩短至800毫秒以内。
  • 系统以单一EKS托管插件形式部署,兼容OpenAI标准接口,无需修改模型服务器、客户端代码或引入服务网格,接入成本极低。
  • 端点选择器(EPP)综合KV缓存利用率、队列深度、LoRA适配器驻留及前缀缓存命中率等多维度评分,支持按场景灵活配置权重。
  • 网关在Pod、资源池、集群及区域四个层级均实现优雅降级与自动恢复,全局推理路由器可在35秒内完成跨集群故障切换。
  • 即将推出的第二层全局推理路由器将支持跨集群跨区域流量协调与成本感知流量整形,进一步扩展大规模推理场景的调度能力。
查看原始来源

原始标题:Introducing Amazon SageMaker HyperPod Inference Gateway

本文由 DataHub 基于公开来源整理,用于信息发现与摘要阅读;具体事实、数据和后续更新以原始来源为准。