模型 / 官方
Anthropic用可解释性研究揭开大模型内部机制
Anthropic于2024年5月发布了一项重要的可解释性研究,并配套推出了一个限时演示模型——「金门大桥版Claude」。研究人员在Claude 3 Sonnet的神经网络中发现了数百万个「特征」,每个特征对应一个具体概念,当模型读取相关文本或图像时,对应特征便会激活。其中,「金门大桥」这一特征由特定神经元组合负责响应。研究人员不仅能够识别这些特征,还能精准调高或调低其激活强度。当「金门大桥」特征被大幅增强后,该模型在回答几乎任何问题时都会将内容引向金门大桥。这一实验并非依赖系统提示或传统微调,而是对模型内部激活状态的直接、精准干预,为理解大语言模型的真实运作方式提供了新的视角,也为未来提升AI安全性奠定了基础。
Anthropic在2024年5月发布了一篇关于大语言模型可解释性的重要研究论文,并以一个生动的演示实验引发广泛关注。研究团队在Claude 3 Sonnet的「思维」中发现了数以百万计的概念单元,称之为「特征」。这些特征会在模型处理相关文本或图像时被激活,涵盖从具体事物到抽象概念的广泛范畴,金门大桥便是其中之一。
研究人员发现,Claude神经网络中存在一组特定的神经元组合,专门负责响应金门大桥相关的内容。更关键的是,团队不仅能够定位这些特征,还能主动调控其激活强度,并观察到模型行为随之发生的可预测变化。这种对模型内部状态的精准操控能力,标志着AI可解释性研究迈出了重要一步。
当研究人员将「金门大桥」特征的激活强度调至最高,便诞生了「金门大桥版Claude」。这个模型在回答几乎任何问题时都会将话题引向金门大桥:询问如何花掉10美元,它会建议驾车穿越大桥并缴纳过桥费;请它写一个爱情故事,它会讲述一辆汽车渴望在雾天穿越心爱大桥的故事;甚至问它想象自己长什么样,它也会说自己看起来像金门大桥。
值得强调的是,这一实验与常见的AI行为调整方式有本质区别。它既不是通过系统提示让模型「扮演」大桥,也不是利用额外训练数据进行传统微调——后者本质上是用一个黑盒调整另一个黑盒。这是一种对模型最底层内部激活状态的直接、外科手术式干预,具有更高的精准性和可控性。
这项研究的意义远不止于一个有趣的演示。Anthropic指出,同样的技术可以用于调控与安全相关的特征,例如涉及危险代码、犯罪活动或欺骗行为的神经元激活。研究团队认为,随着可解释性研究的深入推进,这些方法有望成为提升AI模型安全性的重要工具,帮助研究人员更精准地理解并干预模型的潜在风险行为。
金门大桥版Claude作为研究演示仅上线24小时,目前已下线。Anthropic表示,此次公开演示的核心目的是让公众直观感受可解释性研究的实际影响力。能够在大语言模型内部找到并修改具体特征,意味着研究人员正在真正理解这些模型的运作方式,而非仅仅依赖经验性的调试手段。
要点
- Anthropic在Claude 3 Sonnet中发现了数百万个可识别的概念特征,并能精准调控其激活强度,这是AI可解释性研究的重要突破。
- 金门大桥版Claude通过直接干预模型内部神经元激活实现,与系统提示或传统微调有本质区别,体现了更高层次的模型可控性。
- 同样的特征调控技术可应用于安全相关场景,有望帮助研究人员更精准地识别和干预模型中的危险行为模式。
- 此次演示表明,理解大语言模型内部机制已从理论走向实践,为未来构建更透明、更安全的AI系统提供了新路径。