top of page

Google 因使用 AI 训练数据面临出版商诉讼

7月21日
讀畢需時 5 分鐘

Google 因使用 AI 训练数据面临出版商诉讼

2026 年 7 月 10 日,一群出版商和一名作者在纽约南区联邦地区法院对 Google 提起了一项拟议集体诉讼。该起诉书的案名为 Hachette Book Group, Inc. 等诉 Google LLC,案号为 1:26-cv-05870。然而,一份公开案件目录将该案列为 1:26-cv-05869,这一明显差异应通过 PACER 核实。

具名原告包括 Hachette Book Group、Cengage Learning、Elsevier、小说家兼前律师 Scott Turow,以及 S.C.R.I.B.E., Inc.;起诉书称,该公司拥有 Turow 图书的版权。他们指控 Google 复制了提供给 Google Books 和 Google Play Books 的图书以及来自其他来源的图书,并未经授权将其用于开发或训练 Gemini。

本案的核心在于,这些材料据称如何进入 Google 的训练数据集。原告声称,Google 在使用受保护作品之前删除或更改了版权管理信息,包括作者姓名、所有权信息和出版详情。这些仍只是指控,Google 尚未承认其使用了被指明的副本或删除了其元数据。

起诉书认为,提供给 Google Books 的副本旨在用于建立可搜索索引并展示有限的内容片段,而 Google Play Books 文件则用于销售获得授权的电子书。起诉书主张,将这些文件用于模型训练超出了上述安排的范围。对于读者和出版团队而言,这一区别具有重要的现实意义:如果这些指控得到证实,他们批准用于内容发现或零售的图书,可能在未经另行许可或未支付许可费用的情况下进入了 AI 开发流程。

原告称,Google 内部材料将把出版商通过 Google Play Books 提供的图书用于 AI 描述为“极具问题”,并警告可能面临“数百亿至数千亿美元的潜在罚款”。这一数字是起诉书第 60 段所引用的一项指控,并非法院计算结果、损害赔偿裁决或独立估算。

同一份诉状还指控 Google 已意识到限制性许可和更高的合理使用风险。诉状请求法院批准集体诉讼、发布禁止非法复制的禁令、判处法定赔偿或实际损害赔偿及利润返还、要求核算 Gemini 的训练材料和方法、支付律师费,并给予其他救济。目前上述救济均未获批准。

TechCrunch 资深撰稿人 Amanda Silberling 于 7 月 14 日报道,Google 未立即回应该媒体的置评请求。报道没有说明该请求发出的确切时间,也未引用 Google 针对这些具体指控作出的任何回应。

因此,该诉讼涉及三家面向不同市场的出版商原告:Hachette 从事大众出版,Cengage 从事教育材料出版,Elsevier 则从事科学、医学和专业出版。起诉书称,Turow 既是畅销书作者,也是 S.C.R.I.B.E. 的总裁。

诉状声称,他们的作品是为 Gemini 复制的规模更庞大的受保护材料的一部分。诉状并未确定最终有多少作品进入了任何一次特定的 Gemini 训练。出版商或作者若要评估自身受到的影响,需要获得书名级别的来源记录,其中应显示源文件、适用协议、摄取日期和模型用途,而这些信息目前并未公开。

拟议集体涵盖符合条件的版权所有者,其已登记作品据称被 Google 从其服务、网络抓取的数据集或 Gemini 训练流程中复制。起诉书称拟议集体成员超过 100 人,但集体诉讼资格不会自动获得批准,目前也尚未确定受影响书目的可靠总数。

核心争议可能既包括获取特定副本是否合法,也包括将这些副本另行用于训练是否合法。原告认为,针对搜索或零售分发的授权并不涵盖 AI 开发。Google 可能会对所指控的复制行为、相关协议的适用范围、集体诉讼处理方式、因果关系、损害赔偿或原告对合理使用的解释提出异议。

此案发生之际,AI 训练来源正受到更广泛的审查,围绕图书、新闻及其他受保护材料的许可市场也在逐步发展。不过,该案眼下的重要性在于,据称遭到重复使用的是 Google 已通过自身出版服务持有的文件,而不只是通过公开网络抓取得到的材料。

这一区别可能会影响证据开示。双方可能会要求获得合同、内部数据治理记录、数据集文档,以及能够证明 Google 是否将提供给 Google Books、Google Play Books 和 Google Scholar 的材料与获准用于模型开发的数据分开处理的证据。

目前尚不清楚存在争议的材料有多少仍保留在活跃的训练或评估系统中——如果确实存在的话。起诉书对涉案模型作出了宽泛定义,将 LaMDA、PaLM、Bard、Gemini 及相关迭代版本包括在内,但这些定义是原告在诉讼中的立场,并非对每个系统数据集的确认描述。

元数据相关指控在法律上也不同于普通侵权。原告援引《数字千年版权法》第 1202(b) 条,该条款要求证明版权管理信息遭到删除或更改,以及被告对此知情。仅凭元数据缺失的证据,未必足以满足这些法定要件。

与 Google Books 最相关的先例是 Authors Guild 诉 Google,804 F.3d 202(第二巡回法院,2015 年)。美国第二巡回上诉法院的判决意见认定,扫描图书以创建可搜索索引并展示有限内容片段属于合理使用。

该判决不会自动决定本案结果。Authors Guild 涉及搜索、片段展示和图书馆副本,而新的起诉书指控的是将材料重新用于商业生成式模型训练,并可能生成具有替代作用的输出。因此,事实记录和所主张的后续用途均有所不同。

近期的 AI 案件提供了额外但不具约束力的参考背景。在 Bartz 诉 Anthropic 一案(案号 3:24-cv-05417)中,加利福尼亚北区联邦地区法院的一名法官认为,使用合法取得的图书进行训练属于合理使用,同时将其与盗版图书馆副本区别开来。在 Kadrey 诉 Meta Platforms 一案(案号 3:23-cv-03417)中,另一名法官基于提交的案卷批准了 Meta 的简易判决请求,但强调原告有关市场损害的证据存在不足。两案涉及的被告、获取证据、程序记录和司法辖区均不相同。

仅凭起诉书无法可靠预测未来三个月的时间表。接下来的实质性进展将取决于送达情况、承办法官的排期命令、任何延期,以及 Google 根据《联邦民事诉讼规则》作出的回应。Google 可能提出涉及驳回诉讼或集体诉讼资格认定的动议,但其时间和先后顺序均未确定。

读者应关注案件记录中 Google 提交的正式答辩或动议、法官分派情况、案件管理期限,以及针对明显案号差异的任何更正或解释。这些文件应能进一步明确 Google 对哪些指控提出异议,以及法院将如何界定争议。

本案结果可能会影响科技公司记录数据来源的方式。对于出版商而言,有效的审计追踪应当能够显示,为搜索、零售或学术索引提供的文件是否在技术上与 AI 训练数据集相隔离。如果缺少这些记录,权利管理团队可能无法确定,获准使用的分发渠道是否演变成了未经批准的二次用途。

目前,本案只是一系列尚未得到证实的版权及 DMCA 指控,并不意味着法院已认定 Google 侵犯了任何人的权利,也不意味着 Google 面临金额已经确定的处罚。该案的重要性在于,它直接提出了一个问题:为某项有限服务而持有图书,是否足以支持在未经额外授权的情况下将其重新用于生成式 AI 训练。

 
 

免费开始使用

一款本地优先的AI助手

为了获得更好的人工智能体验,

remio 目前仅支持Windows 10+ (x64)M-Chip Mac

你的 AI 工作伙伴

remio 一起高效工作

规划、创作、交付

一站式完成

bottom of page