研究 / 官方
用深度低秩残差蒸馏锁定预训练权重
随着开源权重语言模型质量的持续提升,模型权重的共享极大促进了技术普及,但也带来了权重被滥用于未授权用途的隐患。苹果机器学习研究团队联合东京大学研究人员提出了DLR-Lock方法,旨在从架构层面为预训练权重加锁。该方法的核心思路是将模型中每个预训练MLP层替换为参数量相当的深度低秩残差网络(DLR-Net),使反向传播过程中的激活内存随网络深度线性增长,从而大幅提高微调的计算成本。DLR-Net通过逐模块蒸馏高效训练,在保持原始模型推理能力的同时,造成架构层面的不匹配,令标准微调的优化过程更加困难。实验表明,即便攻击者完全了解防御策略,DLR-Lock仍能有效抵御自适应攻击,为开源模型的权重保护提供了新思路。
开源权重语言模型近年来质量大幅提升,权重共享使模型能够跨硬件和软件平台广泛部署,也为研究人员提供了检查点、微调和再分发的便利。然而,这种开放性同时带来了权重被用于未授权目的的风险。在某些场景下,模型发布方对权重滥用的顾虑可能超过开放共享带来的收益,如何在开放与安全之间取得平衡成为一大挑战。
防御权重被恶意适配并非易事。由于攻击者可以完整观察模型的所有权重和架构,简单的结构性防御很容易被逆向破解,而最基础的锁定机制也可通过优化手段加以绕过。苹果研究团队在这一背景下提出了全新的防御思路:利用自动微分框架中推理与训练之间固有的不对称性作为防御轴心,从根本上增加攻击者进行微调的难度。
DLR-Lock的核心机制是将模型中每个预训练MLP层替换为深度低秩残差网络(DLR-Net),且两者参数量保持相当。这一替换使得反向传播过程中的激活内存随网络深度线性增长,导致微调所需的显存开销远超正常推理。与此同时,DLR-Net引入的架构不匹配使标准微调的优化景观变得更加复杂,反向传播的计算开销也远高于前向传播,从资源层面形成有效壁垒。
为确保DLR-Net能够忠实还原原始MLP层的功能,研究团队采用逐模块蒸馏的方式对其进行训练。这种方式在保持原始模型推理能力的前提下完成架构替换,使最终模型在正常使用场景下的性能损失极小。蒸馏过程的高效性也保证了该方法在实际部署中的可行性,不会给模型发布方带来过高的额外成本。
研究团队在大型语言模型上进行了系统实验,验证了DLR-Lock在面对具备完整防御知识的自适应攻击者时仍能保持有效性。这意味着即便攻击者清楚地了解DLR-Lock的防御策略,也难以在合理的计算资源约束下完成对模型的微调改造。该研究为开源模型的权重保护提供了一种兼顾实用性与安全性的新范式,相关论文已发表于苹果机器学习研究平台。
要点
- DLR-Lock通过将MLP层替换为深度低秩残差网络,利用推理与训练的不对称性阻止未授权微调,而不依赖简单的结构性混淆
- 反向传播激活内存随DLR-Net深度线性增长,使微调的显存和计算开销大幅提升,从资源层面形成实质性壁垒
- 逐模块蒸馏训练保证了DLR-Net对原始MLP功能的高保真还原,正常推理性能几乎不受影响
- 实验证明该方法能够抵御具备完整防御知识的自适应攻击者,安全性不依赖于防御策略的保密性
- 该研究为开源权重模型的安全分发提供了新思路,有助于在模型开放共享与防止滥用之间寻求平衡
原始标题:Locking Pretrained Weights via Deep Low-Rank Residual Distillation
本文由 DataHub 基于公开来源整理,用于信息发现与摘要阅读;具体事实、数据和后续更新以原始来源为准。