研究 / 官方
Anthropic首次绘制大型语言模型内部概念图谱
Anthropic于2024年5月发布重要可解释性研究成果,首次对一款生产级大型语言模型的内部状态进行了详细映射。研究团队借助经典机器学习中的「字典学习」技术,从Claude 3.0 Sonnet的中间层成功提取出数百万个特征,将原本难以理解的神经元激活数值转化为人类可识别的概念。这些特征涵盖城市、人物、化学元素、科学领域及编程语法等广泛实体,同时具备多模态与多语言响应能力。研究还发现,模型内部的概念组织方式与人类对相似性的直觉判断存在对应关系,这或许正是Claude能够进行类比与隐喻的根本原因。通过人为放大或抑制特定特征,研究人员还验证了这些特征对模型输出的实际影响,为未来提升AI安全性奠定了重要基础。
长期以来,大型语言模型被视为一个「黑箱」:输入内容进去,输出响应出来,但模型为何给出特定答案而非其他答案,始终缺乏清晰解释。这种不透明性使得评估模型安全性极为困难——若无法了解模型的内部运作机制,就难以确保其不会产生有害、偏颇或不实的输出。Anthropic的可解释性团队长期致力于打开这个黑箱,此次研究代表了该方向迄今最重要的突破。
研究团队采用「字典学习」技术,将神经元激活的规律性模式(称为「特征」)与人类可理解的概念相对应。这一方法的核心逻辑在于:每个概念由多个神经元共同表示,每个神经元又参与表示多个概念,因此需要通过识别跨上下文反复出现的激活模式来还原概念结构。此前,该团队已在小型「玩具」语言模型上验证了这一方法的可行性,而此次将其扩展至生产级大模型,在工程与科学层面均面临数量级上的巨大挑战。
最终,研究人员从Claude 3.0 Sonnet的中间层提取出数百万个特征,构建出模型内部状态的概念地图。与玩具模型中相对表浅的特征不同,Sonnet中发现的特征展现出更深的层次、更广的覆盖面与更高的抽象程度。这些特征不仅能响应英文文本,还能识别日语、中文、希腊语、越南语、俄语等多种语言的表述,以及相关图像内容,体现出真正的多模态与多语言能力。
研究还揭示了模型内部概念之间的空间关系。通过测量特征之间基于神经元激活模式的「距离」,研究人员发现「金门大桥」特征附近聚集着恶魔岛、吉拉德利广场、金州勇士队、加州州长纽森等相关概念;而「内心冲突」特征附近则出现了分手、忠诚冲突、逻辑矛盾以及「第二十二条军规」等概念。这种内部组织结构与人类对概念相似性的直觉判断高度吻合,可能正是Claude擅长类比与隐喻的深层原因。
为验证特征的实际作用,研究人员尝试人为放大或抑制特定特征。当「金门大桥」特征被过度激活后,Claude开始将这座桥带入几乎所有对话,甚至在被问及自身形态时回答「我就是金门大桥……我的物理形态就是这座标志性的桥梁」。此外,研究人员还发现了一个在Claude读取诈骗邮件时激活的特征,这类发现为未来通过特征干预来检测和纠正模型异常行为提供了新的技术路径。
Anthropic表示,这项研究是AI可解释性领域的重要里程碑,但距离全面理解模型行为仍有相当距离。目前的研究仅覆盖模型计算过程的中间层,且特征之间的交互关系尚未得到系统性分析。尽管如此,能够识别、定位并操控模型内部的具体概念表示,已为未来构建更安全、更可信的AI系统提供了切实可行的技术基础,也标志着AI安全研究从行为层面向机制层面的重要转变。
要点
- Anthropic首次从生产级大模型Claude 3.0 Sonnet中提取出数百万个可解释特征,实现对模型内部概念的系统性映射
- 模型内部的概念组织结构与人类对相似性的直觉判断存在对应关系,特征之间的空间距离反映出语义上的关联程度
- 研究人员通过放大或抑制特定特征,验证了对模型输出进行定向干预的可行性,为AI安全机制研究开辟了新方向
- 发现的特征具备多模态与多语言能力,能够跨语言和图像识别同一概念,体现出模型内部表示的高度抽象性
- 该研究代表AI可解释性从小型实验模型向大规模生产模型的关键跨越,但对完整机制的理解仍需进一步深入
原始标题:Mapping the mind of a large language model
本文由 DataHub 基于公开来源整理,用于信息发现与摘要阅读;具体事实、数据和后续更新以原始来源为准。