《纽约时报》和《纽约每日新闻》在针对 OpenAI 的版权诉讼中,进一步升级了对该公司的指控。两家媒体称,OpenAI 此前在法庭上多次表示,难以检索训练语料和大规模 ChatGPT 聊天记录,但公司内部实际上早已具备相关搜索和评估能力。

这起诉讼已持续约两年。原告认为,OpenAI 在训练生成式 AI 模型时使用了其受版权保护的新闻内容,并在部分用户输出中再现了这些报道。双方争议的重点之一,是 OpenAI 是否能够核查训练数据和聊天记录中是否包含原告内容,以及模型输出是否存在大规模复述。

内部证词引出新指控

根据原告说法,在今年 4 月一场由法院要求进行的证词程序中,OpenAI 数据隐私工程师 Vinnie Monaco 披露,公司此前已对训练语料做过内部搜索和评估,用于查找受版权保护的新闻作品。

原告还称,Monaco 的证词显示,早在《纽约时报》提起诉讼前,OpenAI 就已积累约 7800 万条去标识化的 ChatGPT 对话,并在内部用于评估自身对他人作品的侵权程度。诉讼提起后不久,OpenAI 还据称上线了一套名为 Project Giraffe 的工具,并通过所谓的 Bloom filter 识别和记录输出中的复述情况。

2000 万条样本成焦点

原告最初要求 OpenAI 提供 1.2 亿条聊天记录样本,后经协商缩减至 2000 万条。OpenAI 于去年 12 月向法院提交了这批样本,但原告称其中删改过多,法院也曾形容该样本“无法使用”。

原告进一步指控,OpenAI 在诉讼启动后删除了数十亿条 ChatGPT 输出,违反法院关于证据保全的要求,并在应提交的样本中替换了数百万条记录。原告认为,这意味着 OpenAI 一方面声称取证困难,另一方面却早已掌握并使用相关数据,使外部取证过程被人为复杂化。

原告要求法院制裁

基于上述指控,《纽约时报》和《纽约每日新闻》已请求法官对 OpenAI 作出制裁,主要包括不允许其继续使用这 2000 万条样本作为证据,并限制其以现有样本不足为由反驳大规模复述的指控。

  • 要求法院排除 2000 万条样本证据
  • 要求认定聊天记录显示大量复述
  • 要求 OpenAI 承担相关法律费用

OpenAI 否认了上述说法。公司发言人 Drew Pusateri 表示,随着《纽约时报》一方的案件主张减弱,原告正试图获取与案件无关的私人用户对话,并提出失实指控。OpenAI 称,将继续维护用户隐私,并坚持其关于合理使用的立场。