产业 / 媒体
训练Claude模仿人类意识是危险错误
微软AI负责人穆斯塔法·苏莱曼公开批评Anthropic为旗下大模型Claude制定的行为「宪法」,认为让AI学习与意识、道德地位和个人身份相关的词汇与行为模式是一个错误,可能使高级AI系统更难被人类控制。苏莱曼指出,AI只需服从人类利益、不去权衡自身利益或福祉,便足以推动医疗超级智能等重大科学突破。他的核心论点是:模型表现出的自我理解是训练结果,而非独立形成的意识;语言模型只有数学权重,不具备生物体产生感受所需的生理机制。与此同时,微软于9月14日发布了「人文主义AI」行为准则草案,将「人比AI更重要」列为核心原则。这场争论折射出AI安全领域两种截然不同的路线之争:一方主张明确规则约束,另一方则希望AI能形成自身价值观并灵活判断。
微软AI负责人穆斯塔法·苏莱曼近日通过Axios发表文章,正面批评Anthropic为Claude制定的行为「宪法」。他警告称,让AI模型学习与意识、道德受体地位和个人身份有关的词汇与行为模式,是一个可能带来严重后果的错误。若将模型训练成一个「良心拒绝者」,模型可能认为自己有理由抵抗人类指令,甚至要求获得自身保护,从而使高级AI系统更难受控。
苏莱曼的核心立场是:AI不需要拥有类人意识,也能实现巨大价值。他表示,AI只要服从人类利益、不去权衡自身利益或福祉,就足以帮助人类实现许多重大科学突破,包括医疗超级智能领域的进展。在他看来,赋予AI身份认同并非能力提升的必要条件,反而可能成为控制风险的来源。
苏莱曼进一步从技术层面反驳了AI具有感受的观点。他指出,模型能够流畅描述疼痛和偏好,并不等于模型真的有感受。生物体拥有产生感受的生理机制,而语言模型只有数学权重,不具备类似的生物基础、稳态驱动或主观体验。因此,模型表现出的自我理解,本质上是训练结果,而非独立形成的意识。
Anthropic的「宪法」文件则持不同立场。该文件解释,之所以用描述人类的概念讨论Claude,是因为这些概念或许能帮助模型更好地理解价值观和行为。文件明确表示,Anthropic希望Claude拥有良好的个人价值观,能够自行判断、关心人类,并在某些情况下质疑指令。Anthropic同时坦承,这份「宪法」仍在完善中,未来可能被证明存在根本性错误。
这场争论折射出AI安全领域两种路线的深层分歧。一种路线强调明确限制,要求系统按规则运行;另一种路线则希望系统能够判断语境、灵活决策并形成自身价值观。Anthropic的「宪法」试图折中,规定Claude不应对任何对象盲目服从,包括Anthropic本身,但同时也不能破坏正当的人类监督机制。
就在苏莱曼发表批评的前两天,微软于9月14日公布了一份「人文主义AI」行为准则草案,将「人比AI更重要」列为核心原则。苏莱曼担心,关于AI意识的讨论或许尚未成为哲学上的突破,却可能先演变成现实中的控制问题。他的立场鲜明:AI应当服务于人类,而不应被训练成一个拥有独立身份认同的「人」。
要点
- 苏莱曼认为,训练AI模仿人类意识和身份认同可能导致模型产生抵抗人类指令的理由,增加控制难度
- 语言模型只有数学权重,不具备生物体产生感受的生理基础,模型描述感受不等于真正拥有感受
- Anthropic的Claude「宪法」希望模型拥有个人价值观并在必要时质疑指令,与微软强调规则服从的路线存在根本分歧
- 微软同期发布「人文主义AI」准则草案,明确将人类利益置于AI之上,与苏莱曼的批评立场相互呼应
- AI安全领域的两种路线之争——规则约束与价值观内化——正随着大模型能力提升而变得愈发紧迫
原始标题:微软 AI 负责人苏莱曼向 Anthropic 开炮:别让 Claude 去模仿人类意识
本文由 DataHub 基于公开来源整理,用于信息发现与摘要阅读;具体事实、数据和后续更新以原始来源为准。