AI资讯 / 工程

工程 / 工程

Amazon Nova 监督微调的新思路

AWS Machine Learning

在监督微调(SFT)中,为训练数据生成高质量思维链(CoT)推理轨迹往往成本高昂且不切实际。然而,推理能力是 Amazon Nova 2 系列模型的关键特性,能显著提升在编码、数学等难题上的表现。本文提出自蒸馏推理(SDR)方法,通过复用基础 Amazon Nova 2 Lite 模型的思维链作为非推理数据集的替代,在三个基准测试中验证了其效果。实验表明,SDR 不仅能提升目标任务性能,还能有效缓解灾难性遗忘,相比模型合并,在保留通用性能的同时,平均目标任务性能提升超过 6.5%。该方法无需人工标注,适用于任何领域的现有 SFT 数据集。

当使用监督微调(SFT)定制模型时,为训练数据创建高质量的思维链(CoT)推理轨迹往往不切实际且成本高昂。因此,许多开发者选择在 SFT 中跳过推理,仅使用输入和输出进行训练。然而,推理是 Amazon Nova 2 系列模型的核心能力,已被证明能显著提升预测性能,尤其是在编码和数学等难题上。通过 Amazon Nova 2 定制功能,用户可以利用 SFT 和强化微调(RFT)等技术,在特定领域发挥思考模型的威力。对于 SFT,解锁这些增益的关键在于 SFT 数据集中包含经过验证和清洗的黄金 CoT 轨迹。

本文探索了一种为缺乏推理轨迹的数据集生成思考令牌的思路。首先分析了推理抑制问题:在推理模式开启的情况下,对非推理数据集进行 SFT 训练会导致模型在推理时丧失推理能力,即使显式开启推理模式也无济于事。这一现象源于训练目标同时对推理和输出令牌计算损失,当训练数据仅包含输入-输出对时,模型无法获得生成连贯推理轨迹的监督信号,损失函数实际上惩罚了不直接贡献于最终输出的令牌,迫使模型绕过推理机制。

为解决这一问题,本文提出了自蒸馏推理(SDR)方法。SDR 复用基础 Amazon Nova 2 Lite 模型的思维链作为非推理数据集的替代。通过实验,我们观察到 SDR 在提升目标任务性能的同时,还能有效缓解灾难性遗忘。例如,在数学基准测试中,普通 SFT 导致性能从 70% 骤降至 6%,而 SDR 几乎完全恢复了这一能力。SDR 通过在数据集中加入模型自身的推理轨迹,实现了训练中的正则化,无需单独的教师模型或事后插值。

与模型合并相比,SDR 在保留通用性能方面更为有效。模型合并是一种常见的缓解灾难性遗忘的方法,但往往以牺牲 SFT 检查点上获得的增益为代价。而 SDR 在保持与纯 SFT 相当或更优目标任务性能的同时,几乎保留了全部通用性能。实验数据显示,自蒸馏在数学性能上达到 70%(模型合并为 68%),同时平均目标任务性能提升超过 6.5%。这一发现与近期倡导自蒸馏作为缓解灾难性遗忘强大机制的研究相吻合。

基于这些发现,本文提供了实用建议:对于缺乏推理轨迹的 SFT 用例,SDR 是一种无需人工标注、适用于任何领域现有 SFT 数据集的有效方法。它不仅能提升目标任务性能,还能有效保留基础模型的通用能力。未来,随着推理模型在更多场景中的应用,SDR 有望成为定制化微调的标准实践之一。

要点

  • 自蒸馏推理(SDR)通过复用模型自身思维链,有效解决了非推理数据集 SFT 中的推理抑制问题。
  • SDR 在提升目标任务性能的同时,能显著缓解灾难性遗忘,相比模型合并平均目标任务性能提升超过 6.5%。
  • 该方法无需人工标注,适用于任何领域的现有 SFT 数据集,且不依赖单独的教师模型。
  • 实验表明,SDR 在数学基准测试中几乎完全恢复了因普通 SFT 丢失的推理能力(从 6% 恢复到 70%)。
  • SDR 通过在训练中引入模型自身的推理轨迹实现正则化,是一种比模型合并更有效的技能保留策略。
查看原始来源

原始标题:Exploring self-distilled reasoning for supervised fine-tuning with Amazon Nova

本文由 DataHub 基于公开来源整理,用于信息发现与摘要阅读;具体事实、数据和后续更新以原始来源为准。