研究 / 官方
训练集中半数数据可被安全略过
苹果机器学习研究团队发表论文《当遗忘是免费的:利用低影响样本降低计算成本》,聚焦机器学习中的数据隐私与模型遗忘问题。主流遗忘方法通常对需移除的数据一视同仁,但在实践中,许多训练样本对模型学习的影响极小,是否值得逐一删除值得商榷。研究者通过分析影响力函数,在语言与视觉任务中识别出对模型输出影响可忽略的子集,并据此提出一套高效遗忘框架:在执行遗忘前先缩减待处理数据集。真实场景测试显示,该方法最高可节省约 50% 的计算成本。
随着机器学习系统越来越多地涉及个人信息,能够在训练好的模型中定向移除特定数据点的「机器遗忘」技术变得愈发关键。学界和业界已经提出多种先进的遗忘方法,但它们普遍默认「待遗忘集合」中的每一条数据都同样值得处理,并以相近的算力投入逐条消除其影响。
苹果机器学习研究团队的论文对这一前提提出质疑:那些对模型学习几乎没有贡献的训练样本,真的有必要花力气移除吗?团队由此重新审视遗忘流水线,发现省略部分样本并不会显著降低模型在遗忘任务上的表现,问题的关键不在于「每个点都要处理」,而在于「是否找到值得处理的那部分」。
为回答这一问题,研究者在多种语言和视觉任务上系统比较了影响力函数,用以定量刻画每一个训练样本对模型输出的边际贡献。分析显示,在典型的训练数据中,的确存在相当比例的样本,其对最终模型表现的影响近乎为零,删除它们既不会损害模型质量,也不会削弱遗忘效果。
基于这一洞察,团队设计了一套「先筛后忘」的遗忘框架:在真正的遗忘算法运行前,先用影响力估计筛除低影响样本,从而把需要进行昂贵计算的遗忘步骤作用在一个显著缩小的数据集上。这种思路与传统的「一视同仁」式遗忘形成鲜明对比。
在真实数据集上的实证结果显示,这一策略最高可减少约 50% 的计算开销,同时仍保持与基线方法相当或更优的模型准确性与隐私保证。换言之,对模型几乎「无感」的那部分训练数据,遗忘它们几乎是「免费」的,可以直接省去相关的算力消耗。
该研究由 Anat Kleiman、Robert Fisher、Ben Deaner、Udi Wieder、Vitaly Feldman 等人合作完成,并已发表于 2026 年 7 月。研究方向横跨数据科学与标注、隐私保护等苹果长期投入的技术领域,与苹果在差分隐私和隐私保护机器学习方面的一贯主张相吻合。
要点
- 机器遗忘不必对所有待移除数据一视同仁,可先按影响力筛选,再处理关键样本
- 影响力函数分析显示,训练集中存在大量对模型输出影响可忽略的样本,删除它们代价极低
- 论文提出的遗忘框架在真实数据上最高可节省约 50% 的计算成本,同时不损害模型表现
- 该方法覆盖语言和视觉等多类任务,验证了「低影响样本无需遗忘」这一思路的通用性
- 研究与苹果长期关注的隐私保护机器学习方向高度契合,为大规模模型合规删除数据提供了工程化路径
原始标题:When Unlearning Is Free: Leveraging Low Influence Points to Reduce Computational Costs
本文由 DataHub 基于公开来源整理,用于信息发现与摘要阅读;具体事实、数据和后续更新以原始来源为准。