AI资讯 / 研究

研究 / 官方

苹果研究团队深度剖析多模态大模型的偏好对齐机制

Apple Machine Learning

偏好对齐技术已成为提升大语言模型性能的关键手段,但其在多模态大语言模型中的作用机制至今仍缺乏系统性研究。苹果机器学习研究院近期发表论文,由十余位研究人员联合完成,对多模态大模型的对齐问题进行了全面梳理。研究指出,多模态模型不仅会像纯语言模型一样产生事实性幻觉,还会生成与图像内容相矛盾的回答,这使得对齐目标更加复杂。论文将对齐算法分为离线与在线两大类,发现两者结合在特定场景下能显著提升模型表现。研究团队还系统回顾了现有多模态偏好数据集的构建细节对模型性能的影响,并在此基础上提出了一种名为「偏差驱动幻觉采样」的新型数据构建方法,无需人工标注或外部模型辅助,即可在多项基准测试中达到与已发表工作相当的竞争性表现。

偏好对齐是当前大语言模型研究的核心议题之一,直接关系到模型输出是否符合人类期望。然而,相比纯文本语言模型,多模态大语言模型在对齐方面的研究明显滞后。苹果机器学习研究院此次发布的论文,正是针对这一空白展开的系统性探索,旨在厘清数据集构建、基础模型选择与对齐算法三者之间的相互影响。

多模态模型的幻觉问题比纯语言模型更为复杂。除了常见的事实性错误,多模态模型还可能生成与输入图像内容相悖的描述,例如错误识别物体、误判空间关系或捏造图中并不存在的细节。这种「视觉幻觉」使得对齐目标需要同时兼顾语言层面的准确性与视觉层面的一致性,对数据和算法设计均提出了更高要求。

研究团队将现有对齐算法归纳为离线与在线两大类。离线方法以直接偏好优化(DPO)为代表,依赖预先收集的偏好数据进行训练;在线方法则在训练过程中动态生成偏好信号,典型代表为在线DPO。论文通过实验表明,在某些任务场景下,将两类方法结合使用能够取得优于单一方法的效果,为实践中的算法选择提供了参考依据。

在数据集层面,研究团队系统梳理了多个已公开的多模态偏好数据集,重点分析了数据构建细节对最终模型性能的影响。研究发现,数据的来源、标注方式、正负样本的对比强度等因素均会对对齐效果产生显著影响,而现有文献中这些细节往往被忽视,导致不同工作之间的结果难以直接比较。

基于上述分析,研究团队提出了一种新型多模态偏好数据构建方法——偏差驱动幻觉采样(Bias-Driven Hallucination Sampling,BDHS)。该方法利用模型自身的偏差倾向来生成包含幻觉的负样本,无需借助人工标注或额外的外部模型,大幅降低了数据构建成本。实验结果显示,基于BDHS构建的数据在多项多模态基准测试中均能达到与现有对齐工作相当的竞争性表现。

这项研究的价值不仅在于提出了新方法,更在于为多模态对齐领域建立了一套系统性的分析框架。通过独立拆解算法、数据与模型三个维度的影响,研究团队为后续工作提供了更清晰的对比基准。随着多模态模型在图像理解、视觉问答等应用场景中的持续渗透,对齐技术的完善将直接影响这些系统在实际部署中的可靠性与安全性。

要点

  • 多模态大模型的幻觉问题兼具事实性错误与视觉内容不一致两个维度,对齐难度高于纯语言模型
  • 离线对齐方法与在线对齐方法结合使用,在特定场景下可带来超越单一方法的性能提升
  • 偏好数据集的构建细节(来源、标注方式、样本对比强度)对对齐效果有显著影响,但常被现有研究忽视
  • 苹果提出的BDHS方法无需人工标注或外部模型,即可生成有效的多模态偏好数据,降低对齐成本
  • 该研究为多模态对齐领域建立了系统性分析框架,有助于推动不同工作之间的公平比较与可复现性
查看原始来源

原始标题:Understanding Alignment in Multimodal LLMs: A Comprehensive Study

本文由 DataHub 基于公开来源整理,用于信息发现与摘要阅读;具体事实、数据和后续更新以原始来源为准。