AI资讯 / 模型

模型 / 官方

美团龙猫开源推理引擎 SGLang-FluentLLM,释放长上下文模型推理潜力

Meituan LongCat GitHub

美团龙猫团队近日在 GitHub 上开源了推理引擎 SGLang-FluentLLM,这是其 LongCat 系列模型「模型与系统协同设计」理念的重要组成部分。该引擎基于 SGLang 代码库构建,针对投机解码流程进行了重构,将 Target、Verify、Draft 三个阶段合并为单一 CUDA 图,显著降低推理开销,并支持 Eagle、MTP、PLD 等多种投机解码方式。在 KVCache 管理方面,引擎引入了逐层 KVCache 传输机制,实现预填充计算与通信的重叠,并通过 Decode Radix Tree Cache 减少 PD 间的 KVCache 传输量。与此同时,团队还开源了 FlashMLA SwapAB 优化、FlashMLA FP8 KVCache 与 FP8 计算优化,以及 DeepGemm 和 FlashInfer 的通信计算融合内核等多项底层优化成果。该项目目前已在 Nvidia H800 和 H20 GPU 上完成测试验证。

美团龙猫团队将旗下 LongCat 系列模型的核心推理引擎 SGLang-FluentLLM 正式对外开源。LongCat 系列模型长期遵循「模型与系统协同设计」原则,这一理念在带来模型能力提升的同时,也对训练和推理系统提出了独特挑战。此次开源旨在帮助社区更好地采用和使用 LongCat 模型,降低工程落地门槛。

在推理引擎层面,SGLang-FluentLLM 对投机解码工作流进行了深度重构,使其与重叠调度机制兼容。最关键的改进是将 Target、Verify、Draft 三个阶段合并为单一 CUDA 图,从而大幅减少投机解码的额外开销。引擎同时支持 Eagle、MTP 和 PLD 三种主流投机解码风格,为不同场景提供灵活选择。

KVCache 管理是长上下文推理的核心瓶颈之一。SGLang-FluentLLM 引入了逐层 KVCache 传输机制,通过将预填充计算与 KVCache 通信进行重叠,有效隐藏传输延迟。此外,Decode Radix Tree Cache 的引入进一步减少了 Prefill 与 Decode 节点之间的 KVCache 传输量,整体提升了长序列场景下的推理吞吐效率。

在底层内核方面,团队同步开源了多项优化成果。FlashMLA 方向包括 SwapAB 优化以及 FP8 KVCache 与 FP8 计算的联合优化,后者的技术细节已在论文 SnapMLA 中详细阐述,该论文聚焦于通过硬件感知的 FP8 量化流水线实现高效长上下文 MLA 解码。DeepGemm 方向则提供了 SwapAB Offset 与 PDL 优化,FlashInfer 方向贡献了通信与计算融合内核的优化方案。

值得注意的是,SGLang-FluentLLM 在架构上做出了若干取舍。团队采用 Dynamo 进行 KVCache 感知的请求调度,因此移除了 SGLang 原有的 sgl-model-gateway 组件。多模态支持也因架构差异而未纳入本次开源范围,但团队表示在内部实践中,SGLang-FluentLLM 仍作为多模态推理的 LLM 骨干被使用。该项目目前已在 Nvidia H800 和 H20 GPU 上完成测试,代码以 Apache-2.0 协议开源,欢迎社区参与贡献。

要点

  • 美团龙猫开源推理引擎 SGLang-FluentLLM,基于 SGLang 构建,专为 LongCat 长上下文模型优化
  • 投机解码流程重构将 Target、Verify、Draft 合并为单一 CUDA 图,支持 Eagle、MTP、PLD 多种解码方式
  • 逐层 KVCache 传输与 Decode Radix Tree Cache 机制协同降低长序列推理延迟和传输开销
  • 同步开源 FlashMLA FP8 量化、DeepGemm 及 FlashInfer 通信计算融合等多项底层内核优化
  • 项目移除了多模态支持与 sgl-model-gateway,以 Apache-2.0 协议在 H800/H20 GPU 上完成验证
查看原始来源

原始标题:meituan-longcat/SGLang-FluentLLM

本文由 DataHub 基于公开来源整理,用于信息发现与摘要阅读;具体事实、数据和后续更新以原始来源为准。