AI资讯 / 工程

工程 / 工程

Amazon SageMaker 推出前缀感知路由,大幅降低大模型推理延迟

AWS Machine Learning

Amazon SageMaker Inference 正式推出前缀感知路由(Prefix-Aware Routing)功能,专为大语言模型推理场景设计。在实际应用中,发送给模型的提示词通常由固定的系统指令和可变的用户输入两部分组成。以客服机器人为例,每条请求都携带相同的数千 token 系统提示,模型却需要对其反复计算,造成大量资源浪费。虽然 vLLM 等推理框架已支持 KV 缓存复用,但在多实例部署场景下,传统随机路由会将请求分散至不同机器,导致缓存无法有效积累。前缀感知路由通过识别请求开头内容,将共享相同前缀的请求稳定地导向同一实例,使该实例的 KV 缓存持续保持热态。基于 Llama 3.1 70B 的基准测试显示,P50 首字节时间最高降低 77%,KV 缓存命中率从约 25% 提升至 80% 以上,吞吐量提升最高达 16%,而路由本身仅增加约 1.3 至 1.9 毫秒的额外开销。

在构建基于大语言模型的应用时,提示词通常由两部分构成:固定的上下文信息(如系统指令、参考文档、对话历史)和动态的用户输入。以客服机器人为例,每条请求开头都包含相同的 3000 个 token 的策略说明,而用户问题可能仅有 50 个 token。这意味着在数百乃至数千次请求中,模型需要反复处理完全相同的前缀内容,造成大量重复计算。

vLLM、TensorRT-LLM 等主流推理框架已通过前缀缓存机制解决了单实例场景下的重复计算问题——当相同前缀再次出现时,模型直接复用已缓存的 KV 键值对,仅处理新增 token,从而显著降低首字节时间。然而,当服务扩展至多实例部署时,传统随机路由策略会将请求分散至不同机器,每台实例接收到相同前缀的频率不足以建立有效缓存,前缀缓存的优势因此大打折扣。

Amazon SageMaker Inference 新推出的前缀感知路由策略从根本上解决了这一问题。系统在请求到达端点时自动分析其开头内容,并将共享相同前缀的请求持续路由至同一实例,使该实例的 KV 缓存得以稳定积累和复用。该功能内置两项保护机制:当目标实例负载过高时自动转发至空闲实例以防止过载;在扩缩容操作期间,仅有少量流量发生迁移,已有缓存不会因实例变动而失效。

AWS 使用 Llama 3.1 70B Instruct 模型在 7 台 ml.p5.48xlarge 实例上进行了系统性基准测试,覆盖 16 种配置组合。在长上下文场景(8000 token 共享前缀,持续 1 小时)中,P50 首字节时间降低 71% 至 77%,P90 首字节时间降低 33% 至 37%,KV 缓存命中率从约 25% 提升至 82%,吞吐量提升 15% 至 16%。在短上下文场景(ShareGPT 风格对话,30 分钟)中,P50 首字节时间降低 13% 至 16%,缓存命中率同样从约 30% 提升至 80%。

前缀感知路由最适合以下几类典型场景:检索增强生成(RAG)应用中,多个用户针对同一文档提问时共享相同的文档前缀;多轮对话场景中,随着对话历史不断积累,共享前缀持续增长,路由至同一实例可保持缓存连续性;以及使用长篇系统提示的模板化助手和机器人。共享前缀越长,收益越显著,因为每次缓存命中可跳过的计算量更大。

此次发布后,Amazon SageMaker Inference 实时端点共提供三种路由策略:RANDOM(默认)适用于通用工作负载;LEAST_OUTSTANDING_REQUESTS 适用于请求处理时间差异较大的场景;PREFIX_AWARE 则专为共享提示前缀的大模型推理场景设计。用户可在端点配置中按生产变体设置路由策略,并通过更新配置在三种策略间切换,无需重新部署模型。

要点

  • 前缀感知路由将共享相同提示前缀的请求稳定导向同一实例,使 KV 缓存命中率从约 25% 提升至 80% 以上
  • 在 Llama 3.1 70B 长上下文基准测试中,P50 首字节时间最高降低 77%,吞吐量提升最高达 16%
  • 路由策略本身仅引入 1.3 至 1.9 毫秒额外延迟,且流量分布保持均衡,7 台实例各承载 13.3% 至 15.4% 的请求
  • 内置过载保护与扩缩容稳定性机制,确保在实例数量变化时已有缓存不会大规模失效
  • RAG 应用、多轮对话及模板化助手是最能受益于该功能的典型场景,共享前缀越长收益越大
查看原始来源

原始标题:Reduce LLM latency with prefix-aware routing on Amazon SageMaker Inference

本文由 DataHub 基于公开来源整理,用于信息发现与摘要阅读;具体事实、数据和后续更新以原始来源为准。