Patreon 正在收紧对 AI 抓取的限制。公司表示,过去依靠 robots.txt 向爬虫发出“不允许抓取”的提示已不够,因为部分 AI 训练爬虫并未遵守这些规则。现在,Patreon 开始直接拦截相关访问。
从提示改为直接封禁
Patreon 说,公司已扩大与 Cloudflare 的合作,采用后者的 AI Crawl Control 技术,更新平台的 AI 政策和执行工具。与此前主要通过 robots.txt 约束爬虫不同,这次调整的重点是主动封禁 AI 训练机器人。
公司称,之所以升级措施,是因为 AI 抓取方式比 2023 年更复杂。Patreon 早期的付费墙本就让大量创作者内容难以被爬虫获取,但近来平台上线了新版首页信息流和类似短帖的 Quips 等发现工具,公开可见内容有所增加,也带来了新的抓取风险。
测试中访问尝试降至零
Patreon 在测试中发现,部分 AI 训练爬虫每周对平台的访问尝试,已从数千次降至零。公司据此判断,过去一些抓取工具无视 robots.txt 的限制,仍在继续抓取站内内容。
Patreon 在博客中表示,是否同意内容被用于 AI 训练,不应取决于抓取方是否愿意守规则。这也是公司从“发出请求”转向“直接拦截”的主要原因。
索引机器人仍可访问
不过,Patreon 并未全面封锁所有机器人。公司表示,仍会允许用于页面索引和信息整理、并能把用户导回 Patreon 的机器人继续访问。
这一做法反映出平台试图在内容传播与训练数据控制之间划线:一方面保留搜索和发现能力,另一方面限制内容被直接拿去训练模型。
近期,越来越多网站和内容平台开始处理 AI 公司抓取训练数据的问题。Cloudflare 此前已推出限制 AI 机器人的工具,并上线可向抓取方收费的机制“Pay Per Crawl”。本月早些时候,Cloudflare 还调整政策,对同时承担索引和训练用途的“混合型”爬虫,在广告页面默认予以拦截。
Patreon 产品负责人 Drew Rowny 表示,随着 AI 代理能力增强、使用范围扩大,创作者应当对作品如何被 AI 公司使用拥有更明确的决定权。按他的说法,Patreon 希望让创作者在扩大受众的同时,保留对内容用途的控制。
