AI资讯 / 模型

模型 / 官方

DeepSeek、Moonshot、MiniMax涉嫌非法提取Claude能力

Anthropic News

Anthropic近日披露,已识别出DeepSeek、Moonshot(旗下Kimi模型)和MiniMax三家AI实验室针对Claude发起的大规模非法蒸馏攻击。三家机构合计通过约2.4万个欺诈账户生成逾1600万次交互,系统性提取Claude在推理、代码、工具调用等核心能力方面的输出数据,用于训练自身模型。Anthropic指出,模型蒸馏本身是合法的训练方法,但竞争对手以此非法获取他人能力,不仅绕过了出口管制的战略意图,更可能导致关键安全护栏缺失,使生化武器研发辅助、恶意网络攻击等危险能力在缺乏防护的情况下扩散。Anthropic表示已在MiniMax完成模型发布前检测到其攻击行为,获得了对蒸馏攻击全生命周期的罕见观测窗口,并呼吁行业、政策制定者和全球AI社区采取快速协调行动。

Anthropic于2026年2月23日正式公开一份调查报告,点名DeepSeek、Moonshot AI和MiniMax三家实验室,指控其通过欺诈账户和代理服务大规模访问Claude API,非法提取模型能力。三家机构的攻击规模差异显著:DeepSeek产生超过15万次交互,Moonshot超过340万次,MiniMax则高达1300万次以上,合计逾1600万次。Anthropic表示,通过IP地址关联、请求元数据、基础设施特征以及行业合作伙伴的交叉验证,已以高置信度将各攻击活动归因至具体实验室,部分案例甚至追溯到了具体研究人员。

三场攻击活动遵循相似的操作手册:利用商业代理服务绕过Anthropic对中国地区的访问限制,构建所谓「九头蛇集群」架构——由数万个欺诈账户组成的分布式网络,将蒸馏流量与普通用户请求混合,以规避检测。其中一个代理网络同时管理超过2万个欺诈账户。当某个账户被封禁后,新账户随即补位,整个网络不存在单点失效。DeepSeek还采用了同步流量「负载均衡」技术,多账户协调运作以提升吞吐量并降低被发现的概率。

各实验室的攻击目标高度集中于Claude最具差异化的能力领域。DeepSeek重点提取推理能力和强化学习所需的奖励模型数据,并生成针对政治敏感话题的「审查安全」替代表述,推测用于训练自身模型规避内容审查。Moonshot则着重获取智能体推理、工具调用、代码分析及计算机视觉相关数据,后期还尝试重建Claude的推理链路。MiniMax主要针对智能体编程和工具编排能力,且在Anthropic发布新模型后的24小时内迅速调整策略,将近一半流量转向新模型。

Anthropic特别强调,非法蒸馏攻击对国家安全构成深层威胁。Anthropic等美国AI公司在模型中内置了防止生化武器研发辅助、恶意网络攻击等危险用途的安全护栏,而通过蒸馏获得的模型极可能丢失这些保护机制。若此类能力被整合进军事、情报或大规模监控系统,或以开源形式扩散,其风险将成倍放大,超出任何单一政府的管控范围。Anthropic认为,这一现象也揭示了外界对部分中国AI实验室「技术突破」的误读——其进展在相当程度上依赖从美国模型中提取的能力,而非独立创新。

Anthropic在此次披露中呼吁行业、政策制定者和全球AI社区采取快速、协调的应对行动。公司同时重申对出口管制的支持立场,指出蒸馏攻击本质上是对出口管制战略意图的绕道规避——执行大规模蒸馏同样需要先进芯片,因此限制芯片出口既能约束直接模型训练,也能压缩非法蒸馏的规模上限。Anthropic表示,此次能够在MiniMax模型发布前检测到攻击,为业界提供了观察蒸馏攻击从数据生成到模型上线完整生命周期的前所未有的视角,也证明主动检测机制的价值。

要点

  • Anthropic点名DeepSeek、Moonshot、MiniMax三家实验室,指其通过约2.4万个欺诈账户生成逾1600万次交互,非法提取Claude核心能力用于训练自身模型。
  • 攻击者借助商业代理服务和「九头蛇集群」架构绕过地区访问限制,将蒸馏流量混入正常请求以规避检测,单一代理网络最多同时管理超过2万个欺诈账户。
  • 非法蒸馏模型极可能丢失安全护栏,使生化武器辅助、恶意网络攻击等危险能力在缺乏防护的情况下扩散,并可能被整合进军事与情报系统。
  • Anthropic认为蒸馏攻击实质上绕道规避了出口管制,部分中国AI实验室的「技术突破」在相当程度上依赖从美国模型提取的能力而非独立研发。
  • Anthropic在MiniMax完成模型发布前即检测到其攻击行为,获得对蒸馏攻击全生命周期的罕见观测,并呼吁行业与政策层面展开快速协调应对。
查看原始来源

原始标题:Detecting and preventing distillation attacks

本文由 DataHub 基于公开来源整理,用于信息发现与摘要阅读;具体事实、数据和后续更新以原始来源为准。