多家出版商和作者已在美国纽约南区联邦地区法院对 Google 提起集体诉讼,指控其未经许可使用受版权保护的图书和作品训练 Gemini 模型。这起案件再次把 AI 训练数据的版权问题推到台前,也让科技公司与内容行业的矛盾继续升温。

原告指向图书与商店内容

此次原告包括 Hachette、Cengage、Elsevier,以及作家 Scott Turow 和 S.C.R.I.B.E.。起诉方称,Google 不仅使用了原本为 Google Books 搜索服务提供的图书副本,还使用了上传至 Google Play 商店的图书内容训练 Gemini,而这些用途并未获得授权。

诉状称,Google Books 的合作前提,是让图书可被检索,并向用户展示有限的书目资料和片段内容,而不是开放整本书用于模型训练。原告认为,Google 将这些内容转作 AI 训练用途,超出了最初授权范围。

诉状称版权信息被改动

原告还指控,Google 曾有意删除或修改作品中的版权信息,以掩盖 Gemini 模型使用了“被盗材料”进行训练。诉状同时援引一份据称来自 Google 内部的文件,文件提到,使用受版权保护图书训练 AI 对 Google 来说可能“高度成问题”,并可能带来数百亿美元级别的潜在罚款风险。

截至报道发布时,Google 尚未立即回应置评请求。

AI 训练版权诉讼仍在扩散

这并非 AI 公司首次因训练数据来源遭遇版权诉讼。过去一段时间,Google、Meta、OpenAI 和 Anthropic 都曾被出版商、作者或其他版权持有人起诉。

虽然美国加州已有两项较早的法院裁定倾向支持 AI 公司,并认定使用版权作品训练 AI 可被视为“合理使用”,但相关案件目前仍未形成统一结论。此次 Google 案件提交至纽约联邦法院,意味着另一名法官将对类似争议作出判断。

补充信息:TechCrunch 提到,Anthropic 此前曾因训练材料涉及盗版而被判支付 15 亿美元赔偿,约 50 万名作者有资格获得至少 3000 美元赔付,但部分作者选择退出和解,继续寻求后续诉讼。