研究 / 官方
苹果研究院提出探针引导法,刷新扩散语言模型生成性能
苹果机器学习研究院联合加州理工学院研究人员提出了一种名为「探针引导」(probe guidance)的新方法,用于引导流匹配模型的生成过程。该方法利用现有扩散模型的冻结内部状态构建引导信号,原理上与「自引导」(autoguidance)类似,但无需在推理阶段额外执行一次前向传播,同时为弱模型与强模型之间的动态一致性提供了可靠保障。研究团队将该方法应用于连续扩散语言模型,在无条件文本生成任务上刷新了当前最优性能。当应用于参数量达17亿的扩散语言模型时,探针引导在多个多选题问答基准上持续带来性能提升。此外,研究还揭示了自引导机制背后的实际运作原理——弱模型检查点必须来自训练过程的低熵区域,这一发现为理解和改进扩散语言模型提供了新的理论视角。
苹果机器学习研究院于2026年9月发布论文,介绍了一种名为「探针引导」的新型引导方法,专门针对流匹配模型设计。该方法的核心思路是提取扩散模型推理过程中的冻结内部状态,将其作为构建引导信号的来源,从而在不改变原有模型权重的前提下,对生成过程施加有效控制。
与此前广泛使用的「自引导」方法相比,探针引导最显著的工程优势在于推理效率。传统自引导需要在每个推理步骤中额外运行一次弱模型的前向传播,而探针引导通过复用模型内部的中间状态,彻底消除了这一额外计算开销,在保持引导效果的同时显著降低了推理延迟。
研究团队在连续扩散语言模型上对探针引导进行了系统评测。实验结果显示,该方法在无条件文本生成任务上达到了新的最优水平。当应用于参数量为17亿的大规模扩散语言模型时,探针引导在多个多选题问答基准测试中均实现了一致性的性能提升,验证了其在实际语言理解任务中的有效性。
除了方法本身的实用价值,该研究还借助探针对自引导机制的内在原理进行了深入分析。研究发现,在传统自引导框架中,作为弱模型使用的检查点必须来自训练过程的低熵阶段,这一约束条件此前并未被充分认识。这一发现不仅为自引导的实际应用提供了更明确的操作指引,也填补了该机制理论理解上的空白。
扩散语言模型近年来受到学界广泛关注,被视为自回归模型的重要替代范式。相比逐词生成的自回归方式,扩散语言模型可以并行处理序列中的所有位置,在长文本生成场景下具有吞吐量和延迟方面的潜在优势。探针引导方法的提出,为进一步提升扩散语言模型的生成质量提供了一条切实可行的技术路径,有望推动该领域在更大规模上的应用落地。
要点
- 探针引导利用扩散模型的冻结内部状态构建引导信号,无需推理阶段的额外前向传播,显著降低计算开销
- 该方法在无条件文本生成任务上刷新最优性能,并在17亿参数扩散语言模型的多选题问答基准上持续提升表现
- 研究揭示自引导机制的关键约束:弱模型检查点必须来自训练过程的低熵区域,为该机制提供了首个系统性理论解释
- 探针引导为扩散语言模型的实用化提供了高效引导方案,有助于缩小其与自回归模型之间的性能差距