AI资讯 / 研究

研究 / 官方

基于评分标准的对齐框架让开放域问答质量提升6.5%

Apple Machine Learning

苹果机器学习研究团队发布论文,提出一种名为「基于评分标准的对齐框架」(Rubric-Based Alignment)的新方法,专门针对开放域问答任务中奖励信号难以设计的痛点。该框架能够根据每个查询动态生成专属评分标准,这些标准以检索到的证据为基础,并被分解为多个质量维度,从而在模型后训练阶段提供更细粒度的监督信号。实验结果显示,与经过指令微调的基线模型相比,该方法在组成质量、事实依据和指令遵循三个评估维度的平均得分上提升了6.5%,相较于「扁平化评分标准」变体也提升了4%,且在所有评估数据集上均取得一致性增益。这一研究表明,有据可查、多维分解的评分标准能够为复杂问答任务提供更有效的奖励监督。

开放域问答是大语言模型落地应用的核心场景之一,但为其设计有效的奖励信号一直是强化学习对齐研究中的难题。高质量的回答需要同时满足事实准确性、逻辑连贯性、格式规范性以及对用户指令的忠实遵循等多个维度,而传统的单一标量奖励目标难以全面捕捉这些复杂要求,往往导致模型在某些维度上表现优异却在其他维度上出现退化。

苹果团队提出的评分标准框架(Rubric-Based Reward Framework)的核心创新在于两点:其一是「查询专属性」,即针对每一个具体问题动态生成对应的评分标准,而非使用通用的固定规则;其二是「证据锚定性」,即评分标准的生成以检索增强(RAG)系统返回的相关文档为依据,确保评估维度与实际可用的知识来源紧密挂钩,从而提升事实支撑的可靠性。

在质量维度分解方面,该框架将评分标准拆解为多个相互独立的子维度,分别对应回答的组成质量(Composition)、事实依据充分性(Grounding)以及指令遵循程度(Instruction-Following)。这种分解式设计使得后训练阶段的监督信号更加精细,模型能够针对每个维度的不足进行有针对性的优化,而不是在模糊的整体评分下进行盲目调整。

实验结果验证了该方法的有效性。与指令微调基线相比,三个评估维度的平均提升幅度达到6.5%;与仅使用单层扁平化评分标准的变体相比,提升幅度也达到4%。值得注意的是,这些增益在所有测试数据集上均保持一致,说明该方法具备良好的泛化能力,而非针对特定数据集过拟合的结果。

从更宏观的视角来看,这项研究为大语言模型的对齐方法提供了一条新的技术路径。当前主流的对齐方式(如RLHF)依赖人类偏好标注,成本高且难以扩展;而基于评分标准的框架通过将质量要求显式化、结构化,有望在减少人工标注依赖的同时,提供更具可解释性和可控性的奖励信号。这对于需要高度事实准确性的企业级问答应用场景尤具参考价值。

要点

  • 苹果提出的评分标准框架为每个查询动态生成专属评分维度,相比通用奖励信号更能捕捉问答质量的多元需求
  • 将评分标准锚定于检索证据可显著提升回答的事实支撑质量,与RAG系统形成协同增效
  • 多维度分解的评分标准在组成、依据、指令遵循三个轴上平均提升6.5%,且跨数据集增益一致
  • 该方法为减少对人工偏好标注的依赖提供了可行思路,有助于降低大规模对齐的成本与复杂度
  • 研究结果对企业级开放域问答系统的后训练优化具有直接的工程参考价值
查看原始来源

原始标题:From Preferences to Principles: Rubric-Based Alignment for Grounded Knowledge Answers

本文由 DataHub 基于公开来源整理,用于信息发现与摘要阅读;具体事实、数据和后续更新以原始来源为准。