AI资讯 / 研究

研究 / 官方

Anthropic 最新研究揭示 Claude 的自我感知能力

Anthropic Research

Anthropic 可解释性研究团队于 2025 年 10 月发布新研究,探讨大型语言模型是否具备真正的内省能力。研究人员设计了一种名为「概念注入」的实验方法:先提取模型在特定语境下的神经激活向量,再将其注入无关语境中,观察模型能否主动识别这一异常。结果显示,Claude Opus 4 和 4.1 在约 20% 的测试中能够在提及相关概念之前,便察觉到自身处理过程中存在被注入的模式,表现出一定程度的内部自我感知。研究同时发现,模型能力越强,内省表现越好,暗示这一能力可能随模型迭代持续增强。研究人员强调,当前模型的内省能力仍高度不稳定且范围有限,与人类内省存在本质差异,但这些发现已对外界关于语言模型认知边界的普遍直觉构成挑战,并对 AI 透明度与可靠性研究具有重要意义。

当你问一个 AI「你在想什么」时,它的回答究竟有多少可信度?Anthropic 可解释性团队的最新研究试图用科学方法回答这一问题。研究人员指出,语言模型在处理输入时会产生复杂的内部计算,并以神经激活模式表征抽象概念——例如区分已知与未知人物、评估陈述真实性、编码时空坐标等。问题的关键在于:模型是否真的「知道」自己在表征这些概念,还是仅仅在被追问时生成听起来合理的答案?

为了区分真实内省与表面应答,研究团队设计了「概念注入」实验。具体做法是:先在特定语境下记录模型对某一概念(如「全大写文字」)的神经激活向量,再将该向量注入一个完全无关的对话语境中,同时询问模型是否察觉到任何异常。实验发现,Claude Opus 4.1 在被注入「全大写」向量后,能够在尚未提及该概念之前便主动报告感知到与「大声」或「呼喊」相关的异常模式,表现出先于输出的内部识别能力。

这一「先于输出的识别」是本研究区别于此前激活引导工作的关键所在。Anthropic 去年曾演示「金门大桥版 Claude」——通过注入金门大桥的表征向量,使模型在对话中反复提及该地标,但彼时模型只有在看到自己多次输出相关内容后才意识到异常。而本次实验中,模型在输出任何相关词语之前便已在内部完成识别,这意味着感知发生在计算层面,而非依赖对自身输出的事后观察。

然而,研究团队同样坦诚地呈现了大量失败案例。即便采用最优注入方案,Claude Opus 4.1 的正确识别率也仅约 20%。注入强度过低时模型毫无反应,强度过高则会引发幻觉或输出混乱——例如注入「灰尘」向量后,模型描述称「这里有什么东西,一个微小的斑点」,仿佛在感知物理世界中的尘埃。研究人员将这种对注入强度的敏感性称为「甜蜜区间」效应,只有在适当强度范围内,内省才能可靠发生。

在另一项实验中,研究人员测试了模型是否会在未被明确要求内省的情况下,自发运用这一能力。他们通过人为预填充的方式迫使模型输出其通常不会生成的内容,随后观察模型是否能察觉自身输出的异常。这一设计旨在探究内省能力是否具有实际应用价值——例如帮助模型在行为偏离预期时主动发出警示,从而提升系统的透明度与可调试性。

研究人员强调,目前的发现并不意味着 Claude 具备与人类等同的自我意识,当前内省能力在范围和可靠性上均存在显著局限。但值得关注的是,在所有测试模型中,能力最强的 Claude Opus 4 和 4.1 表现最佳,这一规律性结果暗示内省能力可能随模型整体能力的提升而持续演化。Anthropic 认为,理解 AI 系统的内省边界,对于构建更透明、更可信赖的人工智能具有深远的理论与实践意义。

要点

  • Anthropic 通过「概念注入」实验发现,Claude Opus 4 和 4.1 能够在输出相关内容之前,于内部识别被注入的神经激活模式,展现出先于输出的自我感知能力。
  • 当前模型的内省能力高度不稳定,最优条件下正确识别率仅约 20%,且对注入强度极为敏感,过强或过弱均会导致失败或幻觉。
  • 模型能力与内省表现呈正相关,能力越强的模型内省准确率越高,研究人员预计这一能力将随模型迭代持续增强。
  • 内省能力若能进一步发展,将有助于 AI 系统在行为异常时主动识别并报告,对提升模型透明度和可调试性具有重要实践价值。
  • 研究明确指出,现有证据不支持 AI 模型具备与人类相当的内省能力,但这些发现已对语言模型认知边界的主流认知构成实质性挑战。
查看原始来源

原始标题:Emergent introspective awareness in LLMs

本文由 DataHub 基于公开来源整理,用于信息发现与摘要阅读;具体事实、数据和后续更新以原始来源为准。