Verge 艺术家调查:创作者正将 AI 劣质内容转化为法律筹码
- Ethan Carter

- 9小时前
- 讀畢需時 14 分鐘
The Verge 的艺术家报道记录了与生成式 AI 公司抗争的创作者首次取得的重要成果:一个群体在多年充满不确定性的诉讼后,达成了一项具有里程碑意义的和解。
作者 Andrea Bartz、Charles Graeber 和 Kirk Wallace Johnson 于 2024 年起诉 Anthropic。该案随后发展为涵盖数十万本图书的集体诉讼。一名联邦法官于 2026 年 7 月 20 日批准了其 15 亿美元的和解协议。
这一结果听起来像是对未经授权的 AI 训练取得了决定性胜利。其实并非如此。法院认定模型训练属于合理使用,同时将其与 Anthropic 获取并留存盗版图书的行为区分开来。
这一界定如今成为冲突的核心。创作者找到了法律筹码,但最有力的筹码涉及训练材料的获取方式,而不一定能让他们控制训练本身。
该和解也正值出版商在针对 Meta 和 Google 的诉讼中开辟新战线之际。这些案件将检验 Anthropic 案的结果是否提供了一种可复制的策略,抑或只是与异常不利的证据有关的特定结果。
将证据开示转化为集体诉讼的作者们
Anthropic 一案起初由个别作家发起,他们发现自己的书籍被纳入为 AI 开发而组建的数据集。
Johnson 创作深度报道类非虚构作品,包括 The Feather Thief 和 The Fishermen and the Dragon。他的第三本书 To Be a Friend Is Fatal 也成为诉讼记录的一部分。
这一发现带有个人色彩,但问题却是工业化的。多年来,作者们一直听说大语言模型需要海量文本集合,但几乎没有公司披露完整的训练数据清单。
The Atlantic 于 2023 年开展的 Books3 检索项目,让作家们得以罕见地窥见一个存在争议的文本集合。Books3 是一个未经授权的语料库,包含近 20 万本书,并被收录在名为 the Pile 的更大数据集中。
Johnson 在其中发现了自己的作品。其他作家也有类似发现,使关于机器学习的抽象担忧转化为与可识别版权作品相关联的证据。
Anthropic 使用大量文本开发 Claude。该公司没有公布完整清单,说明每个模型使用了哪些作品。这种不透明性使外部数据集研究显得尤为重要。
Bartz、Graeber 和 Johnson 于 2024 年 8 月提交了最初的起诉书。他们指控 Anthropic 在构建和训练 Claude 时复制了盗版图书。
原告无需证明 Claude 能够按需完整复现一本小说。他们的诉求聚焦于模型训练前 Anthropic 被指下载并保存的副本。
这一选择至关重要。早期 AI 版权诉讼往往强调生成内容、衍生作品或作者的独特风格。这类主张可能面临复杂的相似性和权属问题。
单纯的写作风格通常受到的版权保护有限。当原告无法将特定作品与特定模型或侵权输出联系起来时,也会面临挑战。
Anthropic 案的原告则沿着更具体的线索追踪。他们识别出已登记的图书、未经授权的数字副本、影子图书馆,以及 Anthropic 的内部收集做法。
法院记录后来描述了从 LibGen 和 Pirate Library Mirror 获取的数百万本图书。这些服务属于影子图书馆,即未经常规出版商授权便传播图书的资料库。
该公司还购入数百万本纸质书,拆除装订后扫描,并丢弃实体书。William Alsup 法官对这些购入副本与盗版下载采取了不同看法。
因此,该案将公众讨论中经常混为一谈的三项行为区分开来:Anthropic 获取图书、建立永久数字图书馆,以及使用选定材料进行模型训练。
每项行为都提出了不同的法律问题。这一区分创造了最终促成和解的突破口。
读者可在作者们的集体诉讼起诉书中追溯最初指控。该文件指控 Anthropic 使用未经许可获取的复制图书来构建商业 AI 系统。
起诉书是指控,而非判决。然而,证据开示获得了足够证据,使盗版争议不再只是针对 AI 的笼统不满。
这改变了谈判地位。创作者不再要求法院将所有机器学习一概视为非法,而是在质疑具体副本以及获取这些副本的决定。
为什么 Verge 艺术家的胜利比表面看起来更有限
作者们获得了实质性赔偿,却未确立使用受版权保护图书训练模型始终需要许可。
Alsup 法官于 2025 年 6 月作出一项混合式简易判决。他认定,在其审理的具体情形下,Anthropic 使用图书训练语言模型属于合理使用。
合理使用是一种法律抗辩,允许对受版权保护材料进行某些未经授权的使用。法院会评估使用目的、原作品性质、复制数量及市场影响。
Alsup 认为训练过程具有转换性,因为 Claude 并非只是向读者提供储存的图书副本。模型学习的是用于生成新文本的统计关系。
他的合理使用裁定称训练用途“具有典型的转换性”。该裁定将模型训练比作人们从图书中学习后再进行新的写作。
法官驳回了版权保护作者免受所有新竞争的说法。一个能够生成竞争性文本的系统,并不会自动侵犯其开发过程中使用的每一部作品。
这一结论为 Anthropic 带来了重要法律胜利,也为其他 AI 开发者提供了支持模型训练合理使用抗辩的表述。
不过,该裁定将 Anthropic 的永久图书馆视为独立问题。下载盗版图书以建立该图书馆,并不会仅仅因为其中部分副本后来被用于具有转换性的训练而变得合法。
Anthropic 不能以之后的技术用途为由,追溯性地将非法获取转化为合理使用。副本的来源和处理方式仍然重要。
这一区分构成案件的核心反转。原告输掉了与 AI 训练最相关的广泛主张,却保留了一项可能带来巨大风险敞口的诉求。
针对盗版图书馆的审判原本可能审查个别作品及法定赔偿。版权法可针对已登记作品判赔,而无需证明每一笔销售损失。
Anthropic 在审判前达成和解。根据最终批准令,该协议设立了一个 15 亿美元的基金,涵盖超过 48.2 万件作品。
在扣除获批费用和调整索赔前,每件涵盖作品的预计基础赔付约为 3,000 美元。该数字反映和解结构,并非对训练权利的普遍估值。
2026 年 7 月 20 日,地区法官 Araceli Martínez-Olguín 批准了最终和解。她的批准令称该救济具有实质意义,并作出判决。
截至批准阶段,超过 91% 的涵盖作品已提交有效索赔。只有少量集体成员选择退出。
这些数字显示出异常广泛的参与程度,也说明集体诉讼为何能改变争议的经济格局——任何单一作者都难以独自承担这种诉讼。
该和解并不要求 Anthropic 承认模型训练侵犯版权,也保留了针对后续模型及使用方式的某些未来主张。
Anthropic 一直强调其在合理使用问题上的胜利。副总法律顾问 Aparna Sridhar 表示,该裁定确立了在现行法律下,使用图书训练 AI 属于合理使用。
原告则强调结果的另一部分。他们的律师将该协议称为已知历史上规模最大的版权赔偿。
两种说法都可能成立。训练获得了法律保护,而建立训练图书馆的方式则产生了历史性的责任。
这种张力解释了为什么 The Verge 的艺术家报道不能被简化为创作者击败 AI。该结果确立的是围绕来源的筹码,而不是对学习系统的完全控制。
盗版图书馆成为创作者最有力的筹码
新兴诉讼策略瞄准训练前可证明的复制行为,在这一环节,技术复杂性对 AI 公司提供的保护较少。
模型训练很难在法庭上解释。它涉及分词、优化以及对数值参数的反复调整。这些过程不像公共图书馆向读者交付完整图书副本。
训练数据的获取方式则更容易理解。一家公司要么持有经授权的副本,要么购买副本、获得许可,或从其他来源取得材料。
这种事实轨迹会留下记录。下载日志、内部消息、数据集清单、文件路径和存储决策,都可能证明员工知晓并实施了什么行为。
Anthropic 诉讼揭示了购买纸质书进行扫描与从盗版网站下载书籍之间的差异。法院在其分析中接受前一种做法属于合理使用。
但法院并未将这种保护延伸至影子图书馆副本。为广泛的未来用途保存未经授权的图书馆,仍不同于在具有转换性的训练过程中使用作品。
这为创作者和出版商提供了一条更窄却更清晰的路径。他们可以调查获取、存储和传播行为,而无需先证明聊天机器人在输出中复制了自己的文字。
这一理论也具备规模效应。单个未经授权的数据集可能包含数千名权利人的作品。集体诉讼可围绕共同的收集做法整合这些主张。
登记仍然重要。和解资格取决于涉及版权登记、标识符、所有权以及是否被纳入相关盗版集合的标准。
从未登记作品的作者可能面临较弱的救济。在线发布内容、创作非正式艺术作品,或无法追踪数据集的人,可能拥有较少的实际选择。
视觉艺术家还面临额外困难。图像训练集合可能包含说明文字、缩略图、转换后的文件,或从众多平台收集的链接。
插画师可能发现风格上的相似之处,却无法获得某张特定图像被纳入模型的证据。仅凭识别并不足以在版权法下证明复制。
涉及 Sarah Andersen、Kelly McKernan、Karla Ortiz、Midjourney、Stability AI 和 DeviantArt 的诉讼仍在检验这些边界。相关指控涉及训练数据、模型行为及相关品牌主张。
这些案件在部分驳回动议中得以继续推进,但尚未产生可比的最终结果。其结果将取决于具体模型、数据集、作品和法律理论。
这种差异性至关重要。“艺术家对抗 AI”描述的是一场政治冲突,而不是一宗具有单一决定性答案的诉讼。
图书案件目前能提供更清晰的证据,因为调查人员可以核对书名、ISBN 和数字文件。LibGen 中的一本书比散布在生成图像中的影响更容易识别。
创作者正通过更有组织的方式作出回应。行业团体维护数据集检索工具、诉讼追踪器、模型合同条款和集体许可提案。
更完善的记录管理能强化这项工作。作者可以保存版权登记、草稿、合同、出版日期,以及显示未经授权副本出现地点的证据。
个人知识系统可帮助创作者整理这些记录。它无法认定侵权,但当证据浮现时,可以减少手忙脚乱。
法律代理仍是决定性资源。集体诉讼律师可以资助个人作者通常无力承担的证据开示和专家工作。
Anthropic 的和解使这类投入更容易得到合理化。它提供了一个清晰案例:狭窄的法律理论也能带来巨额赔偿。
它也警示 AI 公司,溯源并非行政事务。训练数据的来源链条可能成为重大的资产负债表和产品风险。
无法说明其语料库来源的公司,面临的不只是声誉批评。它可能失去区分合法来源与未经授权资料集合的能力。
Meta 说明:一次胜诉并不能解决合理使用问题
Meta 在 2025 年的胜诉表明,即使法官对未经许可的 AI 训练持深度怀疑态度,创作者仍可能败诉。
包括 Sarah Silverman、Richard Kadrey 和 Ta-Nehisi Coates 在内的 13 名作者指控 Meta 使用受版权保护的书籍训练其 Llama 模型。
地区法官 Vince Chhabria 于 2025 年 6 月作出有利于 Meta 的简易判决。他认为原告未能建立证明市场损害所需的证据记录。
不过,Chhabria 谨慎限定了判决范围。他的裁决并未宣告 Meta 对受版权保护作品的使用,对每一位作者或每一种模型而言都属合法。
法官写道,原告提出了错误的论点。他表示,更有力的案件可以聚焦于 AI 生成内容充斥市场、降低对人类作品需求的问题。
这一理论不同于直接替代。聊天机器人无需复现某一特定小说,也可能削弱支撑小说作者的经济市场。
它可以生成海量竞争性内容。如果这些输出稀释了关注度、价格或委托机会,创作者可能主张训练损害了其作品的潜在市场。
要证明这种影响仍然困难。原告需要证据,将被质疑的复制行为、模型能力与对法律认可市场造成的可量化损害联系起来。
对 AI 垃圾内容的普遍焦虑并不足够。AI 垃圾内容是指以低成本生成、重复性强、以极少编辑投入进行高量分发的内容。
创作者在出版平台、社交网络和图片交易市场中直接感受到这种规模。法院仍要求的不只是一个可辨识的文化趋势。
Meta 案原告未能为 Chhabria 认为可能具有说服力的理论提供充分证据。因此,Meta 在该案所提出的主张中获胜。
Meta 的裁决给 AI 开发者带来些许安慰,但仅限于一定范围内。不同原告可以针对后续模型提出不同证据。
Meta 还面临五家出版商和作者 Scott Turow 于 2026 年提起的另一宗诉讼。该诉状指控 Meta 复制和传播了数百万本用于 Llama 的图书。
新原告包括拥有庞大目录和详细商业记录的机构。他们可以提出个人作者可能难以整理的市场证据。
他们还指控高层领导直接参与其中。这些指控尚未得到证实,Meta 可以同时质疑相关事实及其法律意义。
与 Anthropic 的对比仍具启示意义。Anthropic 获得了有利于训练行为的裁决,随后就与盗版获取有关的主张达成和解。
Meta 获得判决,是因为原告关于市场的论证不足。法官仍留下了可能性:更充分的证据可能产生不同结果。
尚无全国性上诉法院将这些地区法院裁决转化为适用于生成式 AI 的普遍规则。其他法官可以以不同方式适用合理使用因素。
争议中的使用行为也各不相同。训练模型、保存永久资料库、复制段落,以及分发数据集文件,并不是可以互相替代的行为。
因此,创作者需要将主张与可识别的行为挂钩。AI 公司则需要覆盖从收集到部署每个阶段的溯源控制。
The Verge 的艺术家叙事显示了进展,但并不意味着法律理论已尘埃落定。由于宽泛的道德论证未能带来可预测的结果,诉讼正变得更加精准。
Google 正在测试这套策略的下一版本
最新针对 Google 的诉讼提出了一个问题:为某项服务提供的材料,是否可以在未经再次授权的情况下被重新用于 AI 训练。
Hachette Book Group、Cengage Learning、Elsevier、Scott Turow 和 S.C.R.I.B.E. 于 2026 年 7 月对 Google 提起拟议集体诉讼。
原告指控 Google 复制了数百万本图书和其他文本作品来开发 Gemini。初步报道出现时,Google 尚未提交完整答辩。
该诉状锁定了若干潜在来源,包括 Google Books、Google Play Books、Google Scholar、网页抓取以及存在争议的盗版资料集合。
这带来了不同的溯源问题。出版商为特定的搜索、零售或学术服务向 Google 提供了一些图书,但这并不必然授权其之后的每一种 AI 使用。
原告主张,Google 未经许可便将这些作品重新用于 Gemini。他们还指控版权管理信息被删除或篡改。
这些指控需要证据和司法审查。Google 可以质疑事实叙述、援引合理使用,并主张其协议允许相关处理。
Google 带着一项重要的历史先例进入这场争议。其早期 Google Books 项目在围绕扫描数百万本图书的多年诉讼后得以存续。
法院认为,可检索的片段和文本分析具有转换性目的,且并未将完整图书作为市场替代品提供。最高法院于 2016 年拒绝重新审理该结果。
生成式 AI 改变了事实图景。Gemini 能生成新的段落、解释、摘要和其他材料,而非仅返回有限的搜索片段。
出版商主张,这些输出可能与作者作品及获得许可的参考产品形成竞争。Google 可以回应称,模型对输入进行了转换,且不保存可访问的整部作品副本。
获取问题可能再次成为决定性因素。为 Google Books 提供的图书,其合同历史比从 LibGen 下载的文件更为清晰。
这场争议将检验:对一项数字服务的许可是否会限制后续内部使用。它还将审视合理使用如何与既有商业关系互动。
一份出版商公告称,Google 的内部讨论曾识别出严重法律风险。这些被引用的材料目前反映的是原告的说法。
Google 的抗辩将至关重要,因为该公司可以将其做法与 Anthropic 从影子图书馆下载资料的行为区分开来。它还可以依赖 Google Books 先例。
不过,该案显示 Anthropic 的和解改变了预期。出版商如今拥有一个具体例子:在训练本身获得合理使用保护后,溯源主张仍可存续。
他们可以围绕复制、授权、留存和市场竞争构建诉状。他们也可以协调规模足以支持全体类别分析的图书目录。
Google、Meta 和 Anthropic 面临不同指控。将它们的案件视为对 AI 的一次统一公投,会抹去最可能决定各案结果的差异。
更有力的比较在于运营纪律。每一位开发者都需要知道自己复制了什么、为何复制,以及该复制受哪些权利约束。
模型的技术复杂性并不能回答这些问题。笼统声称更多数据可以提升性能也不能。
三个信号将显示艺术家能否继续胜诉
下一阶段取决于索赔款的支付、更有力的市场证据,以及法院如何处理通过不同渠道取得的数据。
第一个信号是 Anthropic 和解的分配流程。最终批准结束了一个重要诉讼阶段,但创作者将通过实际索赔和付款来评判结果。
截至批准阶段,超过 91% 的涵盖作品已被申领。管理方仍须解决相互竞争的权属主张、文件问题和个人资格问题。
顺畅的分配将强化集体诉讼作为创作者实用策略的地位。长期争议或出乎意料地偏低的净赔偿额,则会削弱这一经验。
结果也将影响评估较小创作者群体案件的律师。如果只有大型出版商能够满足其文件要求,那么引人注目的和解意义将大打折扣。
第二个信号是 Meta 案件中关于市场稀释的证据。Chhabria 法官实际上向未来原告提供了一张地图,指出早期证据记录缺少什么。
作者和出版商必须将模型生成内容的供给,与图书、许可、委托或相关创意工作的公认市场联系起来。
这将需要的不只是 AI 生成图书的数量。原告需要可靠证据,证明存在替代、需求下降、报酬受压或许可机会受损。
如果他们建立起这类证据记录,Meta 早先的胜诉将显得范围狭窄。如果无法做到,合理使用抗辩仍将难以通过市场损害理论被推翻。
第三个信号是法院如何对 Google 的不同数据来源分类。通过合作伙伴项目、公共网站和未经授权的资料库取得的图书,并不具有同一种法律地位。
若裁决将这些来源区分开来,将强化 Anthropic 框架。溯源将变得与后续训练过程同样重要。
若裁决将所有来源视为同一转换性系统的一部分,则有利于开发者。它将降低以获取行为为重点的主张在明显盗版之外的实际价值。
在任何审判开始前,先关注程序性裁决。驳回动议、证据开示争议和集体认证,都可能揭示法官认为哪些理论可行。
也要关注法庭之外的许可行为。开发者一边在其他地方为未经许可的训练辩护,一边越来越多地与出版商、平台和媒体公司签订内容协议。
这些交易并不能证明法律上必须获得许可。它们表明,可靠访问、最新材料和更低的诉讼风险具有商业价值。
对创作者而言,The Verge 艺术家的教训既不是投降,也不是必然胜利。最有力的案件会以已登记作品、可追溯副本和具体的获取证据,取代泛泛的愤怒。
对 AI 公司而言,合理使用不能替代数据治理。一项有利于训练的裁决,无法消除在组建永久资料库时产生的责任。
更大的问题如今已变得具体:法院是否会将获取与训练之间的区分,延伸至 Google、Meta、图像生成器及其他 AI 开发者?
创作者应关注证据,而不只是裁决标题。对所有权、数据集中的出现情况、平台分发及市场影响进行记录,可能决定下一宗投诉能否站得住脚。
首个具有里程碑意义的和解改变了谈判格局。接下来的三个信号将显示,它究竟形成了一套持久的法律操作手册,还是仅仅是一次特殊结果。


