研究 / 官方
苹果研究揭示推理性能关键差异
自回归语言模型(ARM)长期主导大语言模型领域,通过逐个预测下一个词元完成文本生成,但其固有的顺序依赖导致算术强度偏低,推理效率受限。扩散语言模型(DLM)作为新兴替代架构,能够并行生成所有输出词元,理论上可突破顺序解码的瓶颈。苹果机器学习研究团队与加州大学伯克利分校合作,发表了一项对两类架构进行系统性性能刻画的研究。研究结合理论分析与实证剖析,发现DLM虽然凭借跨词元位置的并行性实现了更高的算术强度,但在长上下文场景下扩展能力不足。研究者进一步探索了分块解码策略,使DLM的算术强度与序列长度解耦,改善了长上下文扩展性。在批量推理方面,ARM因能更充分利用批内序列并行性而表现出更优的吞吐量。研究最终指出,减少采样步骤数是开源DLM降低推理延迟、追平ARM的关键路径。
自回归语言模型自GPT系列以来一直是大语言模型的主流范式,其核心机制是在所有已生成词元的条件下逐步预测下一个词元。这种顺序生成方式在文档处理、代码生成等任务上取得了顶尖精度,但也带来了明显的推理瓶颈:由于每一步生成都依赖前序输出,模型在硬件上的算术强度普遍偏低,难以充分发挥现代加速器的并行计算能力。
扩散语言模型近年来作为一种有潜力的替代架构受到学界关注。与自回归模型不同,DLM通过迭代去噪过程并行生成所有输出词元,从根本上规避了顺序解码的限制。然而,DLM相对于已大规模部署的ARM在实际推理性能上的优劣,此前缺乏系统性的量化研究,两类架构之间的权衡关系尚不明朗。
苹果机器学习研究团队联合加州大学伯克利分校等机构的研究人员,针对上述问题开展了全面的性能刻画研究。研究发现,DLM确实能够通过跨词元位置的并行性实现比ARM更高的算术强度,但这一优势在长上下文场景下会显著衰减——随着序列长度增加,DLM的扩展效率明显下滑,无法有效维持性能优势。
为解决DLM在长上下文下的扩展瓶颈,研究者探索了分块解码(block-wise decoding)策略。该方法将DLM的算术强度与序列总长度解耦,使模型能够以类似ARM的方式扩展至更长的上下文,同时保留一定程度的并行生成能力。这一策略为DLM在长文本生成任务中的实用化提供了新的技术路径。
在批量推理场景下,研究结果显示ARM具有更优的吞吐量表现。原因在于ARM能够更充分地利用批内多序列并行性,而DLM在这一维度上的收益相对有限。研究还特别指出,对于开源DLM而言,减少每次推理所需的采样步骤数是降低端到端延迟、使其在实际部署中具备与ARM竞争力的最关键优化方向。
这项研究为学界和工业界评估扩散语言模型的实用价值提供了重要的量化参考。随着DLM规模不断扩大、开源生态逐步成熟,如何在算术强度、长上下文扩展性与推理吞吐量之间取得平衡,将成为下一代语言模型架构设计的核心议题之一。苹果此次发布的系统性分析,也为后续针对DLM的硬件协同优化研究奠定了基础。
要点
- 扩散语言模型通过并行生成词元可实现更高算术强度,但在长上下文场景下扩展能力弱于自回归模型
- 分块解码策略可将DLM的算术强度与序列长度解耦,有效改善其长上下文推理性能
- 批量推理场景中,自回归模型因更充分利用批内并行性而具备更高吞吐量优势
- 减少采样步骤数是开源扩散语言模型降低推理延迟、追平自回归模型的最关键优化方向
- 该研究为两类架构的硬件协同优化与实际部署决策提供了系统性量化依据
原始标题:Beyond Next-Token Prediction: A Performance Characterization of Diffusion versus Autoregressive Language Models
本文由 DataHub 基于公开来源整理,用于信息发现与摘要阅读;具体事实、数据和后续更新以原始来源为准。