研究 / 官方
统一的分离式与协同式推测解码框架及新开源草稿模型
LMSYS 团队于2026年8月4日发布 SpecForge v0.3.0,带来了对推测解码训练框架的重大架构升级。新版本的核心变化是将目标模型推理与草稿模型训练彻底分离:由打补丁的 SGLang 服务器负责捕获目标模型的隐藏状态特征,通过 Mooncake 进行张量传输,训练进程则通过独立控制平面消费轻量级元数据引用。这一解耦设计使推理与训练两侧可以独立扩展。在8张H20显卡的测试环境中,采用3个 SGLang 服务器加5个训练进程的拓扑结构,端到端训练吞吐量较此前协同部署方案提升约10%。新版本还统一支持 EAGLE3、EAGLE3.1、P-EAGLE、DFlash、Domino 和 DSpark 等多种推测解码算法族,并同步发布了由社区贡献、仅使用开放数据训练的多个草稿模型。此外,本次更新还引入了训练与服务一致性验证机制,可在正式训练前快速检验整个流程的正确性。
SpecForge 最初发布时,训练任务同时持有冻结的目标模型和正在优化的草稿模型,两者共享同一进程生命周期和资源拓扑。这种协同部署设计虽然让 EAGLE3 草稿模型训练变得可行,并与 SGLang 直接兼容,但也带来了明显局限:推理与训练的比例固定,无法单独扩展某一侧;两个工作负载在同一作业内相互竞争资源;任何一侧的故障都会波及另一侧,形成共同的失败边界。
v0.3.0 的核心设计思路是:训练进程不需要拥有目标模型,只需要获取训练目标所需的 token 序列、掩码和目标特征即可。新架构将系统划分为生产者池和消费者池:生产者负责在多个打补丁的 SGLang 捕获服务器上调度提示词,SGLang 将特征张量写入 Mooncake 存储,SpecForge 仅通过控制平面传递轻量级的 SampleRef 元数据;训练进程在准备构建批次时再解析这些引用,从而实现大张量与控制信令的彻底分离。
新运行时通过三个明确的契约来保障系统协调运行。捕获契约规定每个 SGLang 服务器对应一个 rollout 工作进程,各工作进程从共享控制器中租用互不重叠的提示词,捕获容量可独立调整。交付契约通过 FeatureDataLoader 将引用解析为携带张量的训练批次,训练循环依赖 FeatureStore 接口而非特定传输层,因此本地特征、共享目录和 Mooncake 在线捕获可以无缝切换。生命周期契约则通过高低水位线机制控制在途样本数量,防止生产者过度超前于训练进程,并在优化器步骤边界将已完成的样本 ID 记录到 SQLite 账本,支持中断后的断点续训。
在算法支持层面,v0.3.0 将单一的 EAGLE3 扩展为涵盖 EAGLE3、EAGLE3.1、P-EAGLE、DFlash、Domino 和 DSpark 的完整推测解码算法族,DFlash 还可选配 D-PACE 训练目标。这意味着研究人员和工程师可以在同一套框架下训练和比较不同的草稿模型方法,无需为每种算法维护独立的训练基础设施,显著降低了探索新推测解码技术的门槛。
本次发布还同步开源了多个草稿模型,覆盖不同的推测解码方法和目标模型,其中大部分由社区合作伙伴和个人贡献者训练,且全部仅使用开放数据。为保障训练流程的正确性,新版本引入了训练与服务一致性验证门控机制,可在受控样本上验证捕获、训练、导出和 SGLang 服务四个环节的输出是否一致,帮助用户在投入完整训练资源之前快速发现潜在问题。
要点
- SpecForge v0.3.0 将目标模型推理与草稿模型训练彻底解耦,推理侧和训练侧可独立扩展,在8xH20测试环境中端到端训练吞吐量提升约10%。
- 新架构通过捕获契约、交付契约和生命周期契约三层设计,实现大张量走数据平面、控制信令走控制平面的分离,并支持断点续训。
- 单一运行时现已统一支持 EAGLE3、EAGLE3.1、P-EAGLE、DFlash、Domino、DSpark 等多种推测解码算法族,降低了多方法对比研究的基础设施成本。
- 本次同步开源了多个社区贡献的草稿模型,全部基于开放数据训练,覆盖不同目标模型和推测解码方法。
- 新增训练与服务一致性验证机制,可在正式训练前快速检验整个流程的正确性,减少因配置错误导致的资源浪费。
原始标题:a Unified Disaggregated and Colocated Speculative Decoding Stack, and New Open SpecBundle Draft Models
本文由 DataHub 基于公开来源整理,用于信息发现与摘要阅读;具体事实、数据和后续更新以原始来源为准。