研究 / 官方
苹果研究团队将分类流映射扩展至17亿参数,4步推理生成高质量文本
自回归模型长期主导语言建模领域,但连续扩散与流匹配模型正逐渐展现出替代潜力,其优势包括加速采样与概率倾斜等。苹果机器学习研究团队发表论文,系统探索了分类流映射(Categorical Flow Maps,CFMs)在大规模场景下的可行性。研究团队在2.1万亿个token上训练了一个17亿参数的基础流模型,并通过自蒸馏将其转化为CFM,最终实现仅需4步推理即可生成多样、高质量文本,同时保持接近数据级别的token熵。此前,CFM方法仅在不足10亿参数的规模下得到验证,其可扩展性存在较大疑问。本研究不仅填补了这一空白,还引入了半离散设置下CFM的似然下界,并在标准语言模型基准测试中取得了与离散扩散方法相当的成绩。论文同时揭示了大规模训练中的若干挑战,并就损失加权与时间调度提供了具体指导建议。
自回归语言模型通过逐token预测的方式生成文本,已成为当前大语言模型的主流范式。然而,这一方式在推理速度和采样灵活性上存在固有局限。连续扩散与流匹配模型作为替代方向,理论上可以解锁加速采样、概率倾斜等自回归方法难以实现的特性,但如何将其应用于离散的文本数据,一直是研究难点。
近年来,多项研究证明了通过高斯分布与one-hot编码数据分布之间的流匹配过程,可以连续地生成离散数据。在此基础上,分类流映射(CFMs)进一步实现了加速采样,在少步推理场景下展现出具有竞争力的样本质量。然而,这些工作的验证规模均未超过10亿参数,CFM能否在更大规模下有效运作,始终是一个悬而未决的问题。
苹果机器学习研究团队此次在2.1万亿个token上训练了一个17亿参数的基础流模型,随后通过自蒸馏技术将其转化为CFM。实验结果表明,该模型仅需4步推理即可生成多样且高质量的文本,同时token熵维持在接近真实数据的水平。这一结果有力证明了CFM方法在十亿参数量级上的可扩展性。
在理论层面,研究团队为半离散设置下的CFM引入了似然下界,使模型能够在标准语言模型基准测试上进行评分。测试结果显示,CFM的表现与离散扩散方法处于同一水平,进一步验证了该方法作为语言建模工具的实用价值,而不仅仅停留在生成质量的层面。
论文还系统梳理了大规模训练CFM时面临的若干挑战,并提供了关于损失加权策略与时间调度设计的具体建议。这些实践层面的洞察对于后续研究者复现或进一步扩展该方法具有重要参考价值,有助于推动非自回归语言模型研究走向更成熟的工程实践。
这项研究由牛津大学与苹果公司合作完成,通讯作者Oscar Davis在苹果实习期间参与了该工作。随着CFM在大规模语言建模中的可行性得到验证,连续流匹配方法有望在未来与自回归范式形成更直接的竞争,为语言模型的效率与灵活性带来新的突破空间。
要点
- 苹果研究团队在2.1万亿token上训练了17亿参数流模型,并通过自蒸馏转化为CFM,首次在十亿参数量级验证了分类流映射的可扩展性。
- 该CFM模型仅需4步推理即可生成高质量、多样化文本,同时保持接近真实数据水平的token熵,大幅降低了推理成本。
- 研究引入了半离散设置下的CFM似然下界,使其可在标准语言模型基准上评分,结果与离散扩散方法相当。
- 论文提供了大规模训练CFM时关于损失加权与时间调度的具体实践建议,具有较高的工程参考价值。
- 连续流匹配方法在语言建模中的潜力得到进一步证实,为自回归范式提供了一条具有竞争力的替代路径。