产业 / 媒体
不再请求 AI 爬虫守规矩,直接封禁抓取行为
创作者会员平台 Patreon 宣布与互联网基础设施服务商 Cloudflare 合作,正式启用 AI Crawl Control 能力,主动封禁那些未经授权抓取创作者内容用于 AI 训练的爬虫。这一转变意味着 Patreon 不再仅依赖 robots.txt 礼貌请求,而是直接采取阻断措施。公司表示,过去许多 AI 爬虫在抓取前完全无视 robots.txt 规则,每周尝试次数高达数千次。启用新机制后,单个 AI 训练爬虫的访问骤降至零。同时,Patreon 仍允许用于索引并将流量引导回平台的标准爬虫。此举反映出版者和创作者在 AI 时代对内容数据被无偿吞噬的担忧日益加剧。
创作者会员平台 Patreon 宣布与互联网基础设施服务商 Cloudflare 达成合作,正式引入其 AI Crawl Control 技术,对未经授权抓取平台内容用于训练 AI 模型的爬虫实施主动封禁。这标志着 Patreon 对待 AI 抓取的态度发生重要转折——从过去依靠 robots.txt 文件礼貌请求爬虫守规矩,升级为直接在网络层面拦截违规访问。
Patreon 在官方文章中直言,许多 AI 训练爬虫此前完全无视 robots.txt 的约定。测试数据显示,单个 AI 训练爬虫每周对平台的访问尝试高达数千次,而在启用新机制后骤降至零,充分说明此前大量爬虫以网站规则为无物,一味强行抓取。
Patreon 之所以此时加码防护,一方面源于 AI 抓取手段日趋隐蔽和老练,自 2023 年首次设置防护以来,绕过技术的演进速度超出预期;另一方面则与平台近期的功能改版有关,例如全新改版的 Home Feed(首页信息流)以及类似推文的 Quips(短帖)功能,这些内容展示形式可能让更多创作者作品暴露在爬虫面前,触发了平台的警觉。
此次合作借力 Cloudflare 更广泛的产品矩阵。除 AI Crawl Control 之外,Cloudflare 还提供允许网站对 AI 爬虫收费的 Pay Per Crawl(按抓取付费)市场,以及针对混合用途爬虫的默认拦截策略。Patreon 表示,将基于现有合作把上述工具纳入自家的 AI 政策与执行体系,从而在平台层面统一管控。
Patreon 同时划定了一条边界:服务于索引与信息整理的爬虫依然被允许,以便它们能将用户重新引导回 Patreon。公司产品负责人 Drew Rowny 强调,创作者有权决定自身作品如何被 AI 公司使用,不应以被训练为代价换取受众增长。这一表态把 Patreon 置于 AI 浪潮中鲜明的版权捍卫者位置,也折射出整个内容行业的数据主权之争正在加速升温。
要点
- Patreon 联合 Cloudflare,从被动请求升级为主动封禁 AI 训练爬虫,测试期内单一爬虫周访问量从数千次降至零。
- 平台近期推出的首页信息流改版和 Quips 短帖功能,使更多内容面临被爬虫抓取的风险,直接推动了此次防护升级。
- Cloudflare 提供 AI Crawl Control、Pay Per Crawl 收费市场及混合爬虫默认拦截等多层工具,Patreon 将其整合进自家 AI 治理体系。
- Patreon 仍允许用于索引并导流的合规爬虫,体现出在保护创作者权益与维持内容分发之间的精细平衡。
- Patreon 产品负责人强调,创作者的作品是否被用于 AI 训练应由他们自己决定,而非被迫接受,以凸显数据主权在 AI 时代的核心价值。
原始标题:Patreon stops asking AI bots not to scrape — and starts blocking them
本文由 DataHub 基于公开来源整理,用于信息发现与摘要阅读;具体事实、数据和后续更新以原始来源为准。