AI资讯 / Agent

Agent / 官方

秒级权重同步框架,让强化学习训练与推理无缝衔接

inclusionAI GitHub

inclusionAI 在 GitHub 上开源了 Awex,一个专为强化学习工作流设计的高性能训练-推理权重同步框架。其核心目标是将训练侧的参数更新以秒级延迟传递至推理侧,确保 rollout 阶段始终使用最新模型权重。Awex 支持 NCCL、RDMA 和共享内存三种传输模式,可充分利用 NVLink、NVSwitch 及 RDMA 带宽。在千卡规模集群的基准测试中,10B 参数模型的权重同步仅需 0.8 秒(NCCL)或 0.5 秒(RDMA),而万亿参数(1T)模型的同步时间分别为 20 秒和 6 秒,相比对照方案 Verl 有显著提升。框架采用纯 Python 实现,支持 Megatron、vLLM、SGLang 等主流训练推理引擎,并提供统一权重适配层,自动处理不同并行策略和张量布局之间的格式差异。

强化学习(RL)训练流程中,训练端与推理端的权重同步长期是制约迭代效率的瓶颈。每次策略更新后,推理引擎若无法及时获取最新参数,rollout 阶段产生的样本质量便会下降,进而影响整体训练效果。Awex 正是针对这一痛点而生,旨在将参数同步延迟压缩至秒级,让训练与推理两侧始终保持一致。

Awex 的架构由三个核心组件构成:运行于每个训练进程的 WeightWriter、运行于每个推理实例控制进程的 WeightReader,以及作业级别的全局元数据服务器 MetaServer。MetaServer 负责训练与推理引擎之间的服务发现和权重元数据交换,并在共置部署场景下提供事件通知能力。三者协同工作,构成完整的点对点权重传输链路。

在权重传输的核心流程上,Awex 将整个过程拆解为五个模块:统一格式转换、全局权重元数据计算与交换、P2P 传输执行计划构建、基于 NCCL 的点对点传输,以及基于 RDMA 的全局负载均衡传输。其中,零冗余传输机制仅传输必要的权重分片,并支持在推理侧 GPU 内存上进行原地更新,避免了额外的内存分配和数据拷贝开销。

性能基准数据颇具说服力。在千卡集群上,10B 模型的权重同步时间从 Verl 的 3.5 秒降至 Awex NCCL 模式的 0.8 秒,RDMA 模式进一步缩短至 0.5 秒;100B 模型从 35 秒降至 9 秒(NCCL)和 3.2 秒(RDMA);1T 模型(FP8 精度,约 1000GB)则可在 20 秒(NCCL)或 6 秒(RDMA)内完成同步,Verl 在该规模下无对应数据。

在工程易用性方面,Awex 以纯 Python 库形式发布,支持 Python 3.8 及以上版本,可通过 pip 一键安装。框架提供了针对 Megatron 训练引擎和 SGLang 推理引擎的快速接入示例,并内置张量级权重校验工具,可将文件系统加载的权重与传输模式加载的权重进行细粒度对比,确保传输正确性。此外,框架设计具备良好的可扩展性,支持接入新的训练和推理引擎。

目前 Awex 已在 GitHub 上以公开仓库形式发布,获得 169 个 Star 和 20 次 Fork。项目支持同置(co-location)和分离(separation)两种部署模式,可无缝适配同步与异步 RL 算法。对于正在探索大规模 RLHF 或基于推理的强化学习(如 GRPO、PPO)的团队而言,Awex 提供了一个值得关注的工程化解决方案。

要点

  • Awex 将千卡集群下万亿参数模型的训练-推理权重同步时间压缩至 6 秒(RDMA)或 20 秒(NCCL),相比现有方案有数量级提升。
  • 框架采用零冗余传输与原地 GPU 内存更新机制,有效降低内存开销,支持 NCCL、RDMA 和共享内存三种传输后端。
  • 统一权重适配层自动处理不同并行策略和张量布局的格式差异,兼容 Megatron、vLLM、SGLang 等主流引擎,扩展性强。
  • 纯 Python 实现,pip 一键安装,内置张量级权重校验工具,降低工程接入门槛。
  • 同时支持共置与分离两种部署模式,可适配同步和异步 RL 训练算法,覆盖多样化的大模型强化学习场景。
查看原始来源

原始标题:inclusionAI/Awex — A high-performance RL training-inference weight synchronization framework, designed to enable second-level parameter updates from training to inference in RL wo…

本文由 DataHub 基于公开来源整理,用于信息发现与摘要阅读;具体事实、数据和后续更新以原始来源为准。