AI资讯 / 研究

研究 / 官方

实现令牌级长度建模的可扩展价值预训练

Apple Machine Learning

苹果机器学习研究团队提出长度价值模型(LenVM),这是一种令牌级框架,在每个解码步骤建模剩余生成长度。通过将长度建模转化为价值估计问题,并为每个生成令牌分配恒定负奖励,LenVM预测有界、折扣的回报,作为剩余生成时长的单调代理。该方法无需标注、密集、无偏且可扩展。在LLM和VLM上的实验表明,LenVM在推理时提供高度有效的信号。在LIFEBench精确长度匹配任务中,将7B模型的长度得分从30.9提升至64.8,显著超越前沿闭源模型。LenVM还支持性能与效率之间的连续控制,在GSM8K上以200令牌预算维持63%的准确率,而基线仅为6%。此外,LenVM能从提示边界准确预测总生成长度,其令牌级价值提供生成动态的可解释视图,揭示特定令牌如何将推理转向更短或更长模式。

在现代自回归模型中,令牌是计算的基本单元,生成长度直接影响推理成本和推理性能。然而,现有方法主要基于粗粒度的序列级别进行长度建模,缺乏细粒度的控制。苹果机器学习研究团队提出的长度价值模型(LenVM)填补了这一空白,通过令牌级框架在每个解码步骤预测剩余生成长度,实现了更精确的长度管理。

LenVM的核心创新在于将长度建模转化为价值估计问题。具体而言,它为每个生成的令牌分配一个恒定的负奖励,并预测一个有界、折扣的回报,该回报作为剩余生成时长的单调代理。这种公式化方法产生的监督信号无需标注、密集、无偏且可扩展,为模型提供了丰富的训练信号。

实验结果显示,LenVM在多个任务上表现卓越。在LIFEBench精确长度匹配任务中,应用于7B模型时,长度得分从30.9跃升至64.8,显著优于前沿闭源模型。在GSM8K数学推理任务中,当令牌预算限制为200时,LenVM维持了63%的准确率,而传统令牌预算基线仅为6%,展示了其在资源受限场景下的高效性。

除了长度控制,LenVM还具备强大的预测和解释能力。它能够从提示边界准确预测总生成长度,其令牌级价值提供了生成动态的可解释视图,揭示了特定令牌如何影响推理路径的长度。这种能力有助于研究人员理解模型行为,并优化生成策略。

LenVM的提出为长度建模提供了一个通用框架,并可作为长度特定的价值信号支持未来的强化学习训练。苹果团队认为,生成长度可以有效地建模为令牌级价值信号,这为提升大语言模型和多模态模型的效率与可控性开辟了新途径。

要点

  • LenVM通过令牌级价值估计实现细粒度长度建模,无需人工标注。
  • 在LIFEBench任务中,LenVM将7B模型长度得分从30.9提升至64.8。
  • LenVM支持性能与效率的连续控制,在200令牌预算下保持63%准确率。
  • LenVM能预测总生成长度,并提供生成动态的可解释视图。
  • 该框架可作为长度特定价值信号,支持未来强化学习训练。
查看原始来源

原始标题:Length Value Model: Scalable Value Pretraining for Token-Level Length Modeling

本文由 DataHub 基于公开来源整理,用于信息发现与摘要阅读;具体事实、数据和后续更新以原始来源为准。