AI资讯 / 产业

产业 / 媒体

史上最大规模版权盗窃指控

The Decoder

索尼音乐、华纳音乐等主要音乐出版商已在加利福尼亚州北区联邦法院对Anthropic提起诉讼,指控该公司在未经授权的情况下,非法下载并使用数万首受版权保护的音乐作品——主要为歌词——训练其Claude大语言模型。诉状长达48页,将此案定性为「史上最大规模、最肆无忌惮的持续性知识产权盗窃行为之一」。Anthropic CEO达里奥·阿莫代伊与联合创始人本杰明·曼恩被列为个人被告,原告指控两人直接指挥并监督了通过BT下载盗版文件的行为。原告要求就每部被侵权作品获赔最高15万美元,并就非法删除版权管理信息的每项违规行为获赔最高2.5万美元。这是Anthropic在短短数月内面临的第二场重大版权诉讼——此前该公司刚以15亿美元与书籍作者及出版商达成和解,创下美国版权诉讼史上最高和解纪录。

2026年8月,索尼音乐、华纳音乐及其他多家音乐出版商联合在美国加州北区联邦法院对Anthropic提起诉讼。诉状指控Anthropic通过BT种子网络非法下载了至少700万本书籍,来源包括盗版资源库LibGen和PiLiMi,并将这些内容用于训练Claude模型。与此同时,Anthropic还被指控在未经授权的情况下,从MusixMatch和LyricFind等持有合法授权的歌词平台抓取歌词内容,违反了上述平台的服务条款。

此次诉讼的核心不仅在于版权内容的使用方式,更聚焦于Anthropic获取训练数据的手段本身。原告认为,非法BT下载行为本身即构成独立的版权侵权,无论相关作品最终是否被纳入商业版Claude模型的训练集。诉状还指控Anthropic扫描并销毁了二手歌曲集和乐谱实体书,进一步加重了侵权指控的严重性。Anthropic CEO达里奥·阿莫代伊与联合创始人本杰明·曼恩均以个人身份被列为被告,原告指控两人「明确指示、批准、控制并故意诱导」了上述侵权行为。

面对外界质疑,Anthropic公开否认曾直接使用LibGen和PiLiMi的书籍训练商业版Claude模型。然而,原告在诉状中对这一说法提出了质疑,认为其成立与否取决于Anthropic对「训练」一词的定义。原告指控称,Anthropic曾用一个非商业模型生成合成数据,而该非商业模型本身正是在LibGen和PiLiMi的文本上训练而来;随后,Anthropic又将这些合成数据用于训练至少一个商业版Claude模型,并利用上述非商业模型为商业模型提供强化学习反馈信号。这一「合成数据中转」策略是否构成版权侵权,将成为案件发现阶段的核心争议焦点。

此次诉讼发生在Anthropic刚刚完成一场重大版权和解后不久。2025年9月,Anthropic以15亿美元与书籍作者及出版商达成和解,创下美国版权诉讼史上最高和解纪录。彼时令Anthropic败诉的关键,并非将版权内容用于AI训练本身,而是通过非法BT下载获取这些内容的行为。此次索尼、华纳的诉讼精准打击了同一软肋,表明音乐行业已从书籍版权案中汲取经验,采取了更具针对性的法律策略。

此案在国际层面同样引发关注。2025年11月,德国慕尼黑地区法院裁定,受版权保护的歌词即便存储于模型参数之中,也构成复制行为;聊天机器人输出这些歌词则属于非法公开披露。法院还明确认定,模型运营商须为其模型的输出内容承担责任,而非由触发输出的用户负责——即便相关提示词是专门设计用于生成版权歌词的。这一判决为全球AI版权诉讼树立了重要先例,也预示着Anthropic在欧洲市场可能面临更大的法律压力。

要点

  • 索尼音乐、华纳音乐等出版商以非法BT下载版权音乐作品为由起诉Anthropic,索赔金额最高可达每部作品15万美元,CEO阿莫代伊与联合创始人曼恩被列为个人被告。
  • 原告指控Anthropic通过「合成数据中转」规避版权限制——先用盗版数据训练非商业模型,再以该模型生成的合成数据训练商业版Claude,此举是否构成侵权将成案件核心争议。
  • Anthropic在2025年9月刚以15亿美元就书籍版权问题达成和解,此次音乐版权诉讼再度聚焦同一弱点,即非法获取训练数据的手段本身。
  • 德国慕尼黑法院2025年11月的裁决已确立先例:AI模型参数中存储版权歌词构成复制,模型运营商须为输出内容承担法律责任。
  • 本案将对整个AI行业的训练数据获取方式产生深远影响,合成数据是否可作为版权规避手段这一问题,将在司法层面得到正面检验。
查看原始来源

原始标题:Sony and Warner sue Anthropic over "one of the largest and most blatant ongoing thefts of intellectual property in history"

本文由 DataHub 基于公开来源整理,用于信息发现与摘要阅读;具体事实、数据和后续更新以原始来源为准。