研究 / 官方
SGLang 两周内实现 GLM5.2 NVFP4 智能体工作负载 500 TPS 服务
SGLang 团队在两周内对 GLM5.2 NVFP4 模型的服务进行了深度优化,在 8 块 B300 GPU 上实现了超过 500 TPS 的吞吐量。优化包括运行时层面的零开销调度和 Spec V2 重叠解码,以及内核层面的 TopK-V2 索引器和索引器序言融合。这些改进使得解码迭代间的 GPU 空闲气泡消失,TopK 内核延迟在 80K 输入长度下从 40.7 微秒降至 17.5 微秒,加速比达 2.33 倍。在长上下文场景下,加速效果更为显著,1M 输入长度时延迟从 372.1 微秒降至 36.6 微秒,加速比达 10.17 倍。
SGLang 团队近日宣布,通过一系列运行时和内核优化,成功在 8 块 B300 GPU 上为 GLM5.2 NVFP4 模型实现了超过 500 TPS 的吞吐量。GLM-5.2 模型在保持原有 DSA 架构和 DeepSeek-V3 风格 MoE 的基础上,新增了 IndexShare 和 MTP 两大架构变化。团队从零开始支持该模型,并在一周内完成了从初始版本到优化版本的性能飞跃。
在运行时优化方面,SGLang 引入了 Spec V2 重叠调度器,让 GPU 在运行当前模型前向计算的同时,CPU 为下一步准备 KV 分配和元数据,从而隐藏 CPU 开销。团队进一步优化了 DSA 草稿扩展路径的 CUDA 图支持,移除了不必要的同步操作,并融合了元数据操作。这些改进使得解码迭代间的 GPU 气泡完全消失,端到端 TPS 提升了 11%。
针对 GLM-5.2 的 MTP 头部,SGLang 实现了 IndexShare 机制,允许在草稿步骤间复用 DSA 索引器的 top-k 结果,避免了重复计算。在长上下文场景下,这一优化将草稿步骤成本降低了约 1.9 倍,且不影响输出质量。同时,团队通过重叠调度器的中继缓冲区正确传递种子信息,确保了异步执行下的正确性。
内核优化方面,SGLang 将 DSA 索引器的 TopK-V1 内核升级为 TopK-V2,将 TopK 问题从排序问题转变为选择问题。新内核使用 10 位直方图进行粗粒度分箱,再通过 FP32 精确选择边界候选,并融合了页表转换。在 80K 输入长度下,平均内核延迟从 40.7 微秒降至 17.5 微秒,加速比达 2.33 倍;在 1M 输入长度下,延迟从 372.1 微秒降至 36.6 微秒,加速比高达 10.17 倍。
此外,团队还进行了索引器序言融合优化,将原本分离的多个小内核和投影操作合并为两个融合内核。具体包括将 wk 和 weights_proj 融合为单个 BF16 投影,以及将键路径和查询路径的元素级操作分别融合。这一优化减少了内核启动开销,进一步提升了整体性能。
要点
- SGLang 在 8 块 B300 GPU 上为 GLM5.2 NVFP4 模型实现了超过 500 TPS 的吞吐量,优化周期仅两周。
- Spec V2 重叠调度器通过隐藏 CPU 开销,消除了解码迭代间的 GPU 气泡,带来 11% 的端到端 TPS 提升。
- IndexShare MTP 机制在草稿步骤间复用索引器结果,将长上下文下的草稿步骤成本降低约 1.9 倍。
- TopK-V2 内核将 TopK 问题从排序转变为选择,在 80K 输入长度下加速 2.33 倍,在 1M 输入长度下加速 10.17 倍。
- 索引器序言融合将多个小内核合并,减少了内核启动开销,提升了整体性能。
原始标题:Serving GLM5.2 NVFP4 Agentic Workload with SGLang: Reaching 500 TPS in 2 Weeks
本文由 DataHub 基于公开来源整理,用于信息发现与摘要阅读;具体事实、数据和后续更新以原始来源为准。