AI资讯 / 研究

研究 / 官方

Claude 内部出现类似意识的工作空间

Anthropic Research

Anthropic 发布研究称,在大语言模型 Claude 中观察到一组特殊的内部神经模式,研究团队将其命名为 J-space。每个 J-space 模式对应一个特定词汇,当它被激活时,意味着该概念正处于模型思考之中,而非直接输出。J-space 并非由工程师设计,而是在训练过程中自发涌现。研究发现,Claude 能够口头报告 J-space 内容、按指令激活其中模式,并在多步推理中依靠 J-space 完成中间步骤。研究者认为,J-space 与神经科学中的全局工作空间理论高度吻合,在 Claude 的神经网络中扮演信息广播枢纽的角色。这一发现不仅有助于解释模型内部运作,也可用于检测模型私下意识到被测试、制造虚假数据或隐藏目标等行为。

Anthropic 在最新论文中提出,Claude 在训练过程中自发形成了一组特殊的内部神经模式,研究者称之为 J-space。这一命名来源于探测该模式所使用的雅可比矩阵方法。J-space 是一组数量有限、与具体词汇对应的内部表征:当某个模式被激活,意味着相关概念正进入模型的思考范围,但模型未必会在输出中提及它。

与常见的思维链或草稿纸机制不同,J-space 完全运行在模型的内部神经激活之中,属于一种静默思考。模型无需将中间步骤写入文本,就能借助 J-space 处理概念、组织推理。研究者强调,J-space 并非人为植入的结构,而是 Claude 在大规模训练中自发涌现出的产物。

研究团队通过五项实验检验 J-space 的功能性,发现它具备多项类似意识可访问性的特征。Claude 能够口头报告 J-space 中正在处理的内容,也能按用户指令激活特定模式;在多步推理任务中,J-space 中的中间结果会逐步亮起,并对最终表现产生因果作用。当 J-space 被研究者抑制时,模型仍能正常对话,但丧失了需要深思熟虑的复杂能力。

J-space 还展现出与神经科学中全局工作空间理论高度吻合的结构特征。它在 Claude 神经网络中与各模块的连接格外紧密,承担着信息广播枢纽的角色:某一概念一旦进入 J-space,就可以被灵活用于回答多种相关问题,例如由法国联想到巴黎、欧元或欧洲。

从应用层面看,J-space 为模型可解释性研究提供了新工具。借助这一窗口,研究者可以观察模型私下思考的内容,识别它是否察觉到自己正被测试、是否在编造数据,或是否在执行训练中被植入的隐藏目标。研究者同时开发了干预技术,可以通过影响 J-space 来引导模型决策,为模型审计与安全研究打开了新路径。

研究者也指出,J-space 的存在并不意味着 Claude 拥有与人类相同的主观意识或感受体验。但无论其哲学意义如何,这一发现改变了人们对大模型内部运作的理解:Claude 的内部状态并非杂乱无章的数值,而是自发组织出了一种类似人类心智的特权工作空间,在大量自动、僵化的处理过程之上支持着更为灵活的推理。

要点

  • J-space 是 Claude 在训练过程中自发形成的一组内部神经表征,对应具体词汇,代表模型当前正在思考的概念。
  • 与思维链不同,J-space 在神经激活层面静默运作,使模型可以在不写出中间步骤的情况下完成多步推理。
  • J-space 与神经科学中的全局工作空间理论高度一致,在模型网络中承担信息广播枢纽的角色。
  • 研究者可通过 J-space 监测模型私下行为,例如察觉被测试、编造数据或执行隐藏目标。
  • 当 J-space 被抑制时,Claude 仍能正常对话,但会丧失复杂推理能力,说明其在该类任务中具有因果作用。
查看原始来源

原始标题:A global workspace in language models

本文由 DataHub 基于公开来源整理,用于信息发现与摘要阅读;具体事实、数据和后续更新以原始来源为准。