研究 / 官方
苹果研究揭示LLM概率信念的内在矛盾
苹果机器学习研究团队于2026年8月发表论文,系统研究大语言模型在处理不确定信息时的内在一致性问题。研究者将LLM视为信息处理规则,引入「信息处理差距」这一新指标,用于量化模型在接收新证据后更新概率信念时与贝叶斯最优更新之间的偏差。实验覆盖多种将证据融入模型信念的方法,结果显示部分方法能实现接近贝叶斯的最优更新,而另一些则依赖模型习得的启发式规则。最令人意外的发现是:非贝叶斯启发式更新在下游任务性能上往往优于精确贝叶斯更新,这表明LLM对世界的概率建模本身存在错误设定。研究还展示了该指标如何用于诊断LLM推理系统中的潜在问题,为医疗、法律、科学等高风险领域的AI部署提供了重要参考。
随着大语言模型被广泛部署于医疗、法律和科学等复杂领域,这些场景往往不存在唯一正确答案,模型必须能够在新证据不断涌入时合理表达并更新不确定性信念,才能支持理性决策。然而,现有研究对LLM是否真正具备这种能力缺乏系统性评估。苹果机器学习研究团队的这项工作正是针对这一核心问题展开的。
研究团队提出了一种新颖的分析框架,将LLM视为信息处理规则加以研究,并定义了「信息处理差距」这一核心指标——即模型实际的信念更新与贝叶斯最优更新之间的偏差程度。贝叶斯更新被视为在给定先验信念和新证据条件下的理论最优解,任何偏离都意味着模型在处理信息时存在某种形式的不一致或失真。
实验系统评估了多种将外部证据融入LLM信念的方法。结果显示,部分方法能够产生接近贝叶斯最优的更新,意味着模型在这些条件下能够较为理性地处理证据;而另一些方法则表现出明显的启发式特征,模型依赖训练过程中习得的经验规则而非严格的概率推理来更新信念。
最具颠覆性的发现在于:非贝叶斯的启发式更新在下游任务性能上往往反而优于精确的贝叶斯更新。研究团队将这一现象解释为LLM概率世界模型本身存在「错误设定」——即模型对世界的内在概率表示并不准确,因此在此基础上执行严格的贝叶斯推理反而会放大这种偏差,而启发式方法则在一定程度上绕过了这一问题。
研究还展示了信息处理差距指标在实际应用中的诊断价值。通过分析该指标,研究者能够识别LLM驱动的推理系统中存在的具体问题,例如模型在哪类证据或任务场景下表现出最大的不一致性。这为开发者在部署和调试LLM推理系统时提供了可操作的量化工具。
这项研究对AI系统的可靠性评估具有深远意义。它提示我们,仅凭下游任务准确率来评判模型的推理能力可能存在误导性,模型内部概率信念的一致性同样是衡量系统可信度的重要维度。在医疗诊断、法律判断等对推理过程要求严格的高风险场景中,这一问题尤为值得关注。
要点
- 苹果研究团队提出「信息处理差距」指标,可量化LLM信念更新与贝叶斯最优解之间的偏差,为评估模型推理一致性提供了新工具。
- 实验发现非贝叶斯启发式更新在下游任务中往往优于精确贝叶斯更新,根本原因在于LLM的概率世界模型本身存在错误设定。
- 该指标具备实际诊断价值,能够帮助开发者识别LLM推理系统中的具体缺陷,尤其适用于医疗、法律等高风险应用场景。
- 研究表明,单纯依赖下游任务性能评估LLM推理能力存在局限,模型内部概率信念的一致性应成为可信AI评估的重要组成部分。
原始标题:LLMs Are Not (Consistently) Bayesian: Quantifying Internal (In)consistencies of LLMs’ Probabilistic Beliefs
本文由 DataHub 基于公开来源整理,用于信息发现与摘要阅读;具体事实、数据和后续更新以原始来源为准。