AI资讯 / 研究

研究 / 官方

为扩散语言模型强化学习引入去噪感知信用分配

Apple Machine Learning

扩散大语言模型(Diffusion LLM)被视为自回归模型的有力替代方案,但现有针对扩散模型的强化学习方法存在两项根本性缺陷:一是在去噪轨迹中缺乏时序信用分配,二是用于策略优化的均场似然估计存在系统性偏差和高方差问题。苹果机器学习研究团队提出 DACA-GRPO(去噪感知信用分配 GRPO),作为一种轻量级即插即用增强方案,可适配任意 GRPO 风格的训练器。该方法引入两项互补机制:去噪进度分数(Denoising Progress Scores)和分层掩码似然(Stratified Masking Likelihood)。在三种 GRPO 基础方法之上应用 DACA-GRPO 后,研究团队在涵盖数学推理、代码生成、约束满足和受限生成的七项基准测试中均取得一致性提升,最高分别达到 5.6、7.4、36.3 和 5.9 个百分点。

扩散大语言模型近年来受到学界广泛关注,其核心思路是通过迭代去噪过程生成文本,与自回归模型逐词生成的范式形成鲜明对比。然而,当研究者尝试将强化学习引入扩散语言模型时,现有方法普遍将去噪轨迹中的每一步视为同等重要,忽视了不同去噪阶段对最终输出质量的差异化贡献,这一简化假设在实践中带来了明显的性能瓶颈。

苹果机器学习研究团队在论文中明确指出两项根本性弱点。其一,现有方法缺乏跨去噪轨迹的时序信用分配机制,无法区分哪些去噪步骤对最终奖励贡献更大;其二,用于策略优化的均场似然估计存在系统性偏差,且方差较高,导致梯度信号不稳定,进而影响模型的学习效率与最终性能。

为解决上述问题,研究团队提出 DACA-GRPO,并在其中引入两项互补机制。第一项是去噪进度分数,该机制从中间预测中提取每个词元的重要性权重,无需额外的前向传播计算,因此几乎不增加训练开销。第二项是分层掩码似然,通过将词元位置划分为多个层级,确保每个词元在预测时能够获得序列中大部分内容作为上下文,从而系统性地降低均场偏差。

在实验验证方面,研究团队将 DACA-GRPO 叠加于三种不同的 GRPO 基础方法之上,并在七项基准测试中进行评估,覆盖数学推理、代码生成、约束满足和 JSON 模式遵循等多个任务类型。结果显示,DACA-GRPO 在所有基础方法和所有基准上均取得一致性提升,其中约束满足任务的提升幅度最为突出,最高达 36.3 个百分点,充分验证了该方法的普适性与有效性。

DACA-GRPO 的设计定位为轻量级即插即用模块,这意味着研究者和工程师无需对现有训练框架进行大规模改造,即可将其集成到已有的 GRPO 风格训练流程中。这一特性降低了方法的落地门槛,也为后续在更多扩散语言模型架构和任务场景中的应用提供了便利。该研究由俄亥俄州立大学与苹果公司合作完成,论文已于 2026 年 9 月正式发布。

要点

  • 现有扩散语言模型强化学习方法将所有去噪步骤等同对待,忽视时序信用分配,且均场似然估计存在系统性偏差,是制约性能的两大根本缺陷。
  • DACA-GRPO 通过去噪进度分数和分层掩码似然两项机制,在不增加额外前向传播成本的前提下,同时解决信用分配和偏差问题。
  • 在七项基准测试中,DACA-GRPO 相较基线方法最高提升 36.3 个百分点(约束满足),在数学推理、代码生成和 JSON 模式遵循任务上也有显著增益。
  • 该方法以即插即用方式兼容任意 GRPO 风格训练器,具备较强的通用性和工程落地价值。
查看原始来源

原始标题:DACA-GRPO: Denoising-Aware Credit Assignment for Reinforcement Learning in Diffusion Language Models

本文由 DataHub 基于公开来源整理,用于信息发现与摘要阅读;具体事实、数据和后续更新以原始来源为准。