研究 / 论文
大规模识别大语言模型中的关键交互关系
理解大语言模型的决策过程是当前AI安全研究的核心挑战之一。伯克利人工智能研究团队提出了SPEX(谱解释器)与ProxySPEX两种算法,专门用于在大规模场景下识别模型行为中的关键交互关系。传统可解释性方法通常只能分析单一特征的贡献,而忽略特征之间复杂的协同或冗余关系。SPEX利用稀疏性与低阶性两个结构特征,将指数级增长的交互搜索问题转化为可求解的稀疏恢复问题;ProxySPEX进一步引入层次性假设,在保持同等性能的前提下将所需消融实验次数减少约10倍。这两种算法已在特征归因、数据归因和注意力头归因三个维度上得到验证,并已集成至开源工具库SHAP-IQ中,相关论文分别入选ICML 2025和NeurIPS 2025。
可解释性研究长期面临一个根本性矛盾:模型的输出行为很少由单一组件决定,而是由大量组件之间复杂的依赖关系共同涌现。随着特征数量、训练数据量和模型内部组件数量的增长,潜在交互关系的数量呈指数级膨胀,穷举分析在计算上完全不可行。伯克利团队的核心洞察在于:尽管总交互数量庞大,真正驱动模型输出的关键交互实际上数量很少,且通常只涉及少数几个特征的组合。
SPEX框架的核心方法是消融实验,即通过系统性地移除输入特征、训练数据或内部组件,观察模型输出的变化来衡量各组件的影响力。该框架借鉴信号处理与编码理论中的工具,通过精心设计的消融组合将多个候选交互信号叠加,再利用高效解码算法将其分离,从而以远少于穷举所需的实验次数定位关键交互。ProxySPEX在此基础上引入层次性假设——若高阶交互重要,其低阶子集通常也重要——进一步将计算开销降低约10倍。
在特征归因任务上,研究团队将SPEX应用于情感分析,发现其在长上下文场景(数千个特征)下仍能保持高忠实度,而LIME等边际方法在同等规模下忠实度显著下降。一个典型案例是对电车难题的变体测试:GPT-4o mini在该任务上正确率仅为8%,标准SHAP方法将错误归因于单个词汇,而SPEX识别出「trolley」「pulling」「lever」四个词之间的高阶协同效应才是真正原因,将这四个词替换为同义词后模型失败率接近归零。
在数据归因维度,团队将ProxySPEX应用于在CIFAR-10上训练的ResNet模型,成功区分了训练样本之间的协同交互与冗余交互。协同交互往往涉及语义上不同类别的样本共同定义决策边界,而冗余交互则体现为视觉上高度相似的重复样本强化同一概念。这种细粒度分析为数据集清洗和优化提供了新思路,可在保留必要协同关系的同时安全移除冗余数据。
在机制可解释性层面,ProxySPEX被用于分析Transformer模型中注意力头之间的交互结构。实验在MMLU高中美国历史子集上表明,基于ProxySPEX的注意力头剪枝策略不仅优于现有竞争方法,甚至能在目标任务上提升模型性能。分析还揭示了一个有趣的层次规律:模型浅层注意力头之间的贡献以线性独立为主,而深层注意力头之间的交互作用更为显著,同层头之间的协同贡献尤为突出。
目前,SPEX与ProxySPEX的代码已完整集成至开源库SHAP-IQ,供研究社区使用。研究团队指出,未来的方向包括将特征归因、数据归因与机制可解释性三种视角统一整合,以及将交互发现方法应用于基因组学、材料科学等领域,既可验证模型发现与已有科学知识的一致性,也可生成新的可检验假设,推动AI可解释性研究走向更广泛的科学应用场景。
要点
- SPEX利用稀疏性与低阶性将指数级交互搜索转化为可解的稀疏恢复问题,可将可解释性分析规模从数十扩展至数千组件
- ProxySPEX引入层次性假设,在保持与SPEX同等性能的前提下将所需消融实验次数减少约10倍
- 在电车难题案例中,SPEX识别出四个词的高阶协同效应是GPT-4o mini出错的真实原因,标准SHAP方法未能发现这一交互
- ProxySPEX在注意力头剪枝任务上不仅优于竞争方法,还能实际提升目标任务的模型性能
- 两种算法已开源集成至SHAP-IQ库,论文分别入选ICML 2025和NeurIPS 2025
原始标题:Identifying Interactions at Scale for LLMs
本文由 DataHub 基于公开来源整理,用于信息发现与摘要阅读;具体事实、数据和后续更新以原始来源为准。