工程 / 工程
在 Amazon SageMaker HyperPod 上部署 Qwen3.8-2.4T-A95B 大模型
2026 年 8 月 12 日,阿里巴巴 Qwen 团队发布了 Qwen3.8-2.4T-A95B,这是 Qwen-Max 级别模型首次以开放权重形式对外公开。该模型拥有 2.4 万亿总参数,每个 token 激活约 950 亿参数,采用混合线性与全注意力架构,原生支持 262K token 上下文窗口,最高可扩展至 100 万 token。AWS 机器学习团队发布技术指南,详细介绍如何在 Amazon SageMaker HyperPod 上,借助 vLLM 框架与 NVFP4 量化技术,将该模型部署在配备 8 块 NVIDIA B300 Blackwell Ultra GPU 的 ml.p6-b300 实例上。整套方案涵盖集群配置、模型权重下载、兼容 OpenAI 接口的推理端点搭建,以及内置推理控制、工具调用和原生多 token 预测投机解码等核心能力,为企业自托管前沿大模型提供了完整的工程参考路径。
Qwen3.8-2.4T-A95B 是 Qwen 家族迄今规模最大、能力最强的模型。其架构采用细粒度混合专家(MoE)设计,共有 512 个路由专家加 1 个共享专家,每次前向传播仅激活约 10 个路由专家,使实际服务成本与激活参数量挂钩,而非全量 2.4 万亿参数。模型共 92 层,以 3:1 的比例混合 Gated DeltaNet 线性注意力层与 Gated Attention 全注意力层,在长上下文场景下有效控制计算量与显存占用。
混合注意力设计是该模型高效处理长上下文的关键。69 层 Gated DeltaNet 采用线性注意力与固定大小的循环状态,避免了传统 KV 缓存随上下文增长而膨胀的问题;23 层 Gated Attention 则保留全二次方注意力以维持高保真度的 token 交互。这一设计使模型在上下文逼近 100 万 token 时,计算与显存开销依然可控,对于需要跨多轮积累工具输出、代码和推理轨迹的智能体工作负载尤为重要。
在量化与硬件适配方面,社区已提供 MXFP4 和 NVFP4(W4A4)量化版本,可将模型压缩至约 1.2 TB,恰好能在单个配备 8 块 B300 Blackwell Ultra GPU 的节点上完整加载。AWS 指南选用 ml.p6-b300.48xlarge 实例,并通过灵活训练计划(Flexible Training Plans)预留容量,避免与按需资源池竞争,消除冷启动风险。NVFP4 量化在大幅降低显存压力的同时,保留了模型在编程、推理和指令跟随等核心任务上的性能表现。
Amazon SageMaker HyperPod 以 Amazon EKS 为控制平面,通过 HyperPod Inference Operator 提供声明式部署体验。开发者只需编写一份 YAML 清单,描述模型来源、容器镜像、GPU 资源需求和 vLLM 启动参数,Operator 便会自动完成权重下载、容器调度、健康检查、滚动更新及基于 KEDA 的弹性伸缩。节点健康持续监控与自动替换机制,显著降低了 7×24 小时推理服务的运维负担。
Qwen3.8 内置推理深度控制参数 reasoning_effort,支持 low、medium、high 三档,开发者可按请求粒度在计算成本与推理深度之间灵活权衡。原生多 token 预测(MTP)投机解码无需额外草稿模型即可提升吞吐量。根据厂商基准测试,该模型在研究工作流(PaperBench 93.0)、指令跟随(IFBench 82.8)和终端编程(86.6)等方向表现突出,对于寻求自托管替代方案的企业而言,是具备前沿竞争力的可行选择。
此次部署指南是 AWS 在 Amazon SageMaker HyperPod 上部署开放万亿参数模型系列文章的第二篇,前一篇聚焦 Kimi K3 模型。整套方案将基础设施编排、量化优化与推理服务能力整合为一条完整链路,展示了云原生 GPU 集群在承载超大规模开放权重模型方面的工程成熟度,也为企业在数据主权、推理定制化与规模化成本控制之间寻求平衡提供了切实可行的技术路径。
要点
- Qwen3.8-2.4T-A95B 是首个以开放权重发布的 Qwen-Max 级模型,2.4 万亿参数经 NVFP4 量化后可压缩至约 1.2 TB,适配单节点 8 卡 B300 部署
- 混合线性与全注意力架构以 3:1 比例设计,使长上下文推理的计算与显存开销保持可控,原生支持最高 100 万 token 上下文
- HyperPod Inference Operator 通过声明式 YAML 配置实现从权重下载到端点上线的全流程自动化,并内置节点健康监控与弹性伸缩能力
- 内置 reasoning_effort 参数与原生 MTP 投机解码,允许开发者在推理深度与吞吐量之间按需调节,无需额外草稿模型
- 对于需要数据主权和推理行为定制的企业,自托管方案可规避按 token 计费的 API 成本,但需配套专用 GPU 基础设施与运维能力
原始标题:Deploying Qwen3.8-2.4T-A95B on Amazon SageMaker HyperPod with vLLM
本文由 DataHub 基于公开来源整理,用于信息发现与摘要阅读;具体事实、数据和后续更新以原始来源为准。