AI资讯 / 研究

研究 / 官方

在H20 GPU上高效部署DeepSeek-V4-Pro的实践方法

LMSYS Blog

DeepSeek-V4-Pro是一个拥有1.6万亿参数的混合专家模型,原生支持FP8与FP4权重格式。尽管NVIDIA Blackwell系列GPU凭借原生FP4张量核心和更高HBM容量具备明显优势,H20 GPU仍因大规模部署基础而被广泛使用。LMSYS团队针对H20硬件约束,系统性地设计了多套场景专属服务配置,涵盖预填充、低延迟解码与高吞吐解码三类工作负载。通过引入Humming MXFP4AFP8量化方案压缩权重占用、在线C128扩展KV缓存容量,以及优化DSpark推测解码路径,团队在单节点H20-141GB上实现了批大小为1时每秒271个输出token的解码速度,与B300报告的383.7 tokens/s相比差距缩小至1.42倍。预填充方面,优化后的系统可达每节点8450个输入token/秒,并能在43.7秒内处理100万token的超长上下文。该研究提供了一套在算力、内存与互联带宽约束下部署前沿大模型的实用方法论。

DeepSeek-V4-Pro以其1.6万亿参数规模和混合专家架构,对推理基础设施提出了极高要求。NVIDIA Blackwell GPU凭借原生FP4张量核心、更高FP8吞吐量和更大HBM容量,在理论上是此类模型的理想载体。然而,H20 GPU凭借其大规模部署基础和900 GB/s的NVLink带宽,仍是众多团队的现实选择。LMSYS的研究正是在这一硬件约束下展开,目标是通过系统级优化最大限度地释放H20的服务潜力。

研究团队首先明确了不同服务角色对硬件的差异化需求。预填充阶段不需要长期保存每个请求的状态,其性能瓶颈主要在于首token延迟、计算效率和通信开销,因此采用HBM容量相对较小的H20-96GB节点即可满足需求。解码阶段则需要在整个生成过程中持续保存所有活跃请求的KV缓存,HBM容量直接决定了可支持的上下文长度和并发规模,因此选用H20-141GB节点承担解码任务。这种按角色分配硬件的策略,是整体架构设计的基础。

在内存容量优化方面,团队采用了两项关键技术。其一是Humming MXFP4AFP8量化方案,利用MXFP4格式存储专家权重、FP8格式处理在线激活值,在H20这类缺乏原生FP4张量核心的GPU上有效降低了权重内存占用和内存带宽压力。其二是在线C128 KV缓存压缩技术,通过消除离线方案中每个压缩页面所需的额外索引状态,为KV缓存腾出更多空间。两项技术叠加后,系统可支持的全量KV token容量显著提升。

预填充路径的优化聚焦于计算与通信的平衡。团队选择MoE-TP(张量并行)而非MoE-EP(专家并行)作为预填充的并行策略,并对Attention-CP8与MoE-TP8的上下文并行通信进行了深度融合与加速。针对长上下文与短上下文工作负载产生的不同专家路由分布,团队还对Humming量化内核进行了专项调优。最终,优化后的预填充系统在每节点吞吐量上达到8450个输入token/秒,处理100万token超长提示仅需43.7秒。

解码路径的优化则围绕推测解码和MoE执行效率展开。在低延迟场景下,团队将DSpark推测解码机制扩展至流水线并行的多个阶段,采用PP2-TP8拓扑结构,在批大小为1时实现了每秒271个输出token的单节点峰值速度,与B300的差距从硬件理论差距大幅收窄至1.42倍。在高吞吐场景下,DP32-EP32配置结合Humming量化与在线C128压缩,进一步消除了高并发下的执行瓶颈;效率参考配置DP16-EP16则达到每节点4670个输出token/秒,平均每输出token延迟为27.4毫秒。

LMSYS团队强调,此次研究的核心贡献是一套方法论,而非单一的基准测试数字。不同的服务配置针对不同的上下文长度、延迟目标、吞吐需求和容量约束分别优化,各项最优结果来自不同的配置组合。这一思路对于在算力、内存或互联带宽受限环境下部署前沿大模型的工程团队具有重要参考价值,表明在无法获取最新旗舰硬件的情况下,系统级优化仍能显著缩小与顶级硬件之间的实际性能差距。

要点

  • 在H20 GPU上通过场景专属服务配置,批大小为1时的解码速度可达271 tokens/秒,与B300旗舰GPU的性能差距缩小至1.42倍
  • Humming MXFP4AFP8量化与在线C128 KV压缩技术组合,可在不牺牲精度的前提下显著扩展H20的模型权重与KV缓存容量
  • 预填充与解码应分配至不同规格的GPU节点,并采用独立优化的并行策略,以分别满足TTFT和TPOT的服务级目标
  • 优化后的预填充系统可在43.7秒内处理100万token超长上下文,每节点吞吐量达8450个输入token/秒
  • 系统级优化方法论的价值在于为不同工作负载找到各自最优的运行点,而非追求单一配置下的极限数字
查看原始来源

原始标题:Pushing the Limits of Serving DeepSeek-V4-Pro

本文由 DataHub 基于公开来源整理,用于信息发现与摘要阅读;具体事实、数据和后续更新以原始来源为准。