AI资讯 / 产业

产业 / 媒体

为获取「纯净」训练数据,数百万册纸质书遭拆毁

IT之家

据调查媒体404 Media报道,多家AI公司正通过中间商大规模收购二手图书,以获取高质量、未受AI内容污染的训练数据。由于近年来互联网上充斥着大量AI生成的低质量内容,2022年前出版的纸质书籍因其原创性而备受青睐。Anthropic此前已因类似行为陷入版权诉讼,被判赔偿15亿美元;谷歌也面临出版商联盟的集体起诉,指控其未经授权使用受版权保护的图书训练Gemini模型。书商反映,今年4月以来图书销量暴增约五倍,买家不问主题、不计价格,采购规模从千册到百万册不等。更令人忧虑的是,AI公司普遍采用破坏性扫描方式处理图书,导致数百万册纸质书被拆毁销毁,其中可能包括珍贵的绝版书籍,而扫描内容最终仅存入企业私有数据库,公众无从访问。

随着互联网数据质量持续下滑,AI公司正将目光转向一个意想不到的资源:二手书市场。调查媒体404 Media披露,多家AI公司正借助中间商悄然大规模采购旧书,目标是获取由人类创作、尚未受到AI生成内容污染的高质量训练素材。这些公司尤其青睐2022年之前出版的纸质书籍,因为彼时AI生成内容尚未大规模涌入出版领域,书中内容的原创性更有保障。

书商们最先察觉到这股异常需求。据一位不愿具名的职业书商透露,今年4月以来,其每周销量从约20本骤升至数百本,增幅约达五倍。Alibris、Biblio等二手书平台上的其他书商也反映了类似的大宗采购现象。更耐人寻味的是,这些买家几乎没有任何主题或类型偏好,小说、教材、专业书籍一概收购,且对价格毫不敏感,即便标价明显高于市价也照单全收。拥有逾1.11亿条图书目录信息的ISBNdb平台,也已顺势推出专门面向AI企业的大规模图书采购服务,单笔订单规模从1000册到100万册不等。

AI公司利用纸质图书训练模型并非新鲜事。Anthropic曾斥资数百万美元从Better World Books大量采购图书,用于训练Claude模型,完成扫描后将书籍销毁。在随后的版权诉讼中,法院虽认定将正版图书用于AI训练属于「合理使用」,但Anthropic因长期维护一个包含700万本盗版图书的数据库,最终被判赔偿高达15亿美元。谷歌同样深陷类似困境,一个出版商联盟近期对其提起诉讼,指控谷歌未经授权使用数百万本受版权保护的图书训练Gemini模型。

在Anthropic的版权诉讼中,曾主导其「巴拿马计划」数字化项目的汤姆·哈维证实,该公司曾委托多家专业扫描公司处理纸质图书。图书数字化通常分为两种方式:非破坏性扫描在不拆解书籍的前提下完成,而破坏性扫描则直接拆开书本,逐页送入高速工业扫描仪。由于破坏性扫描效率更高、成本更低,AI公司普遍倾向于采用这一方式,由此导致数以百万计的纸质书籍遭到物理拆毁。

这一做法正在引发日益强烈的伦理质疑。批评者指出,目前尚不清楚AI公司在数字化过程中是否会甄别普通图书与珍贵绝版书籍,一旦稀有书籍被拆毁,便可能永久退出流通。更深层的问题在于,这些扫描内容最终全部流入AI公司的私有数据库,仅供内部训练使用,普通公众无从访问。人类数百年积累的文字遗产,正以一种不透明的方式被转化为少数科技公司的商业资产,而这一过程的代价,可能由整个社会共同承担。

要点

  • 多家AI公司正通过中间商大规模收购2022年前出版的二手书,以获取未受AI内容污染的高质量训练数据,书商反映相关销量今年4月以来暴增约五倍。
  • Anthropic因维护含700万本盗版书的数据库被判赔偿15亿美元,谷歌也面临出版商联盟就Gemini训练数据问题提起的集体诉讼,AI公司的图书版权风险持续上升。
  • AI公司普遍采用破坏性扫描方式处理图书,导致数百万册纸质书被物理拆毁,珍贵绝版书籍面临永久消失的风险。
  • 扫描所得内容仅存入企业私有数据库,公众无法访问,人类知识遗产正以不透明方式转化为少数科技公司的私有资产。
查看原始来源

原始标题:AI 公司被曝大量收购旧书,以获取“纯净”训练素材

本文由 DataHub 基于公开来源整理,用于信息发现与摘要阅读;具体事实、数据和后续更新以原始来源为准。