top of page

Anthropic 作者和解协议获批,为 AI 训练与盗版划出明确界线

7月21日
讀畢需時 16 分鐘

2026 年 7 月 20 日,Anthropic 与作者达成的 15 亿美元和解协议获得最终批准,为一起涉及从盗版图书馆获取书籍的重大版权案件画上句号。Anthropic 作者和解协议获批,解决了该公司眼前的财务风险,同时保留了此前一项认定 AI 训练构成合理使用的有利裁决。

这种分野才是事件的真正核心。法院认为,使用书籍训练 Claude 可能是一种合法且具有转换性的活动,但拒绝为利用数百万份未经授权的副本建立永久图书馆的行为开脱。

因此,这项和解并未确立 AI 公司必须为模型训练所使用的每一本书取得许可。它确立的是另一项警示:合法目的无法洗白非法的获取过程。

这一区分迫使 Anthropic、OpenAI、Meta、Google 及其他模型开发商记录其训练材料的来源。它也让作者获得了可观赔偿,却没有解决行业内关于模型训练是否需要取得许可的更大争论。

Anthropic 作者和解协议获批,终结盗版书籍案件

法院批准了一项创纪录规模的和解协议,但仅限于与 Anthropic 获取和保留未经授权书籍副本有关的索赔。

美国联邦地区法官 Araceli Martínez-Olguín 在旧金山联邦法院作出最终批准。这项裁决解决了 Bartz v. Anthropic 案中的集体诉讼请求,并为向符合条件的版权所有者付款扫清了道路。

这起诉讼最初由作者 Andrea Bartz、Charles Graeber 和 Kirk Wallace Johnson 提起。他们指控 Anthropic 在为其 Claude 模型整理数据时,从未经授权的在线资源库中获取受版权保护的书籍。

这些资源库包括通常称为 LibGen 的 Library Genesis,以及 PiLiMi。这类服务常被称为影子图书馆,即未经版权所有者授权便传播受版权保护作品的集合。

根据官方和解条款,Anthropic 必须为一项总额至少 15 亿美元、不可返还的和解基金提供资金。不可返还意味着未使用的资金不会直接退回给被告。

根据初步批准程序中提交的数据,纳入范围的作品约有 46.5 万部。在扣除费用、支出、权属分配和行政调整之前,每部符合条件作品的预计分配总额约为 3,000 美元。

一部作品可能涉及多个利益相关方。作者、合著者、出版商或遗产管理方均可能对同一版权拥有法定或受益权益。

和解协议将一项版权登记视为一部可提出索赔的作品。对于许多商业出版和大学出版社出版的书籍,除非合同或其他证据支持不同的分配方式,否则默认由作者与出版商平分赔付款。

Anthropic 同意分多期为和解基金注资。该公司于 2025 年 10 月支付了首笔 3 亿美元款项,后续付款计划持续至 2027 年 9 月。

该公司还必须为特定的后续分期付款支付利息。这一安排使基金得以开始运作,而无需 Anthropic 一次性转移全部款项。

另一项条款直接涉及源文件。Anthropic 必须销毁从 LibGen 或 PiLiMi 下载的书籍及这些文件的副本,但须遵守法定证据保全义务和法院命令。

这一要求之所以重要,是因为相关争议并不仅仅涉及临时计算。Anthropic 曾建立一个中央研究图书馆,可在单次训练之外支持反复使用。

最终批准经历的审查时间比原当事方预期更长。2025 年 9 月,已退休的法官 William Alsup 对初始提案提出质疑,并要求提供更清晰的通知、权属认定程序以及一份确定的纳入范围作品清单。

Alsup 随后给予初步批准。案件移交 Martínez-Olguín 法官后,有关费用、分配规则、逾期退出以及出版商与作者利益冲突的异议仍在审查中。

据报道,最终裁定分配了约 1.015 亿美元的律师费,低于批准程序早期讨论的申请金额。行政成本、储备金和服务奖励也会影响可供分配的金额。

Anthropic 表示,超过 91% 的纳入范围作者和出版商已经申领份额。独立作者组织报告称,截至 2026 年 4 月,和解清单所列作品的申领率为 91.3%。

在版权集体诉讼中,这一参与水平格外重要。当书籍存在多个版本、权利已经转让、合同年代久远、作者已经去世或出版商已停止运营时,确认权利人可能会变得非常困难。

最终裁决将一项拟议中的妥协转化为可强制执行的判决。然而,它并未将诉状中的每一项指控都转化为司法认定。

Anthropic 并未承认所有模型训练都侵犯版权。作者也没有获得一项要求 AI 开发商在训练前为每一部受保护作品取得许可的上诉裁决。

这项和解终结了一条通往审判的路径,却让更广泛的法律冲突继续悬而未决。

法院将 AI 学习与数据获取区分开来

Anthropic 赢得了广泛的合理使用主张,却因其获取部分图书资料的方式仍存在法律风险而面临巨额责任。

Alsup 法官于 2025 年 6 月作出的合理使用裁定将 Anthropic 的行为划分为不同活动。这一区分塑造了此后的每一次和解谈判。

第一项活动涉及使用书籍训练大型语言模型。大型语言模型是一种统计系统,通过学习海量数据集中发现的模式来预测和生成文本。

Alsup 认定 Anthropic 的训练用途具有高度转换性。这些模型并非只是向用户提供原始书籍的存储副本。

相反,训练将众多作品中的信息转化为支持生成新文本的模型参数。法院将这一过程比作读者先从书籍中学习,再创作出不同的文字作品。

裁定将这种训练形式描述为“典型的转换性使用”。这一结论让 Anthropic 取得了重大胜利,也为其他 AI 开发商提供了具有说服力的合理使用论据。

第二项活动涉及格式转换。Anthropic 购买了数百万本纸质书籍,拆除装订、扫描书页并储存数字版本。

法院认定,当每份数字副本用于替代一份合法取得的实体副本时,这些购买后扫描的副本可以构成合理使用。Anthropic 并未通过这一过程扩大其可用副本的数量。

第三项活动造成了决定性问题。Anthropic 从未经授权的在线集合中下载了超过 700 万本书,并将其保留在一个中央图书馆中。

该公司后来购买了其中部分书籍对应的纸质版本。然而,法院驳回了以事后购买追溯性地使先前下载行为合法化的主张。

Alsup 认为,使用盗版材料建立永久图书馆本身不具备转换性。复制后的书籍仍然是书籍,而且该图书馆可以服务于法院认为更有理由获得保护的特定模型训练之外的其他用途。

因此,该裁定拒绝就这些副本作出有利于 Anthropic 的简易判决,并将与获取行为有关的侵权和潜在损害赔偿问题留待审判。

这一区分避免了案件坍缩成作者利益与 AI 发展之间的简单二选一。Anthropic 可以在训练问题上胜诉,同时仍因复制行为承担风险。

原定审判将审查未经授权的图书馆、故意侵权、具体作品和损害赔偿等问题。当版权侵权被认定为故意行为时,法定赔偿金额可能大幅上升。

涉及数十万部已登记作品的审判给双方都带来了极大的不确定性。作者可能因举证、权属或赔偿问题而败诉,而 Anthropic 则面临远高于普通商业诉讼的潜在赔偿裁决。

因此,双方无需放弃各自的核心立场,也有充分理由达成和解。Anthropic 保留了对其有利的训练裁决,而版权所有者则获得了与盗版获取行为相关的赔偿。

Anthropic 副总法律顾问 Aparna Sridhar 在最终批准后强调了这一区分。她表示,该公司是在法院裁定使用书籍进行训练构成合理使用后达成和解的,而该项裁定仍然有效。

作者一方则以不同方式描述这一结果。作者组织认为,AI 开发商不能仅仅因为受保护的书籍对训练有用,就从盗版资源库中获取这些书籍。

这两种说法都可以成立,因为它们指向同一开发流程中的不同行为。

由此产生了一项实际的合规启示。模型开发商不能只在数据进入训练流程的那一刻评估版权风险。

它们必须将获取、存储、转换、去重、训练、模型输出和后续再利用视为不同的行为进行审查。每一步都可能需要不同的法律依据。

这种区别类似于监管链。最终用途可能符合某项法律抗辩,但链条中较早发生的行为仍可能产生法律责任。

对于 AI 公司而言,法律问题不再只是“我们能用这些内容进行训练吗?”还包括“这份副本由谁提供、依据何种授权,以及我们保留了什么?”

随着数据集在承包商、公共资源库、研究团体和多个企业系统之间流转,第二个问题会变得更加棘手。标注为“公开”的数据集并不必然已经获得许可或具有合法性。

企业买家同样应当予以关注。企业越来越多地询问 AI 供应商的安全性、隐私和模型性能,但训练数据的来源可追溯性如今也应纳入同一套尽职调查流程。

来源记录薄弱的供应商可能面临诉讼、强制删除或影响其模型及服务的限制。合同保证的价值取决于其背后的证据。

评估 AI 系统的团队可以将供应商声明、政策变更和许可记录保存在可搜索的知识库中。当法律条款或模型提供商发生变化时,这些记录会很有用。

和解协议向每一家主要模型开发商施压

尽管该判决没有制定全行业适用的许可规则,但它提高了数据来源不明确所带来的成本。

Anthropic 是具名被告,但这种压力延伸至整个生成式 AI 市场。领先的模型公司使用由网页、书籍、代码、图像及其他材料组成的大规模混合数据集构建早期系统。

许多开发商只披露了宽泛的数据类别。出于竞争顾虑、安全风险、合同限制,或由于难以重建较早时期的数据管线,它们往往不公开具体的数据集清单。

Anthropic 作者和解协议获批,使这种不透明变得更加昂贵。如果原告能够将未经授权的获取行为作为一项独立行为单独提出,公司就不能完全依赖转换性使用的论点。

OpenAI 正面临来自作者、出版商和媒体机构的版权诉讼。这些案件涉及不同的事实记录和法律理论,包括对模型输出、记忆、许可市场和训练副本的指控。

Meta 于 2025 年在 Kadrey v. Meta 案中获得了有利裁决,但该判决存在重要限制。法官认为,原告未能提出足够证据来证明该特定案件中的市场损害。

该裁决并未宣告将受版权保护的材料用于 AI 训练的所有行为均属合法。它也没有为从可疑来源获得的副本设立普遍适用的安全港。

Google 扫描图书的历史提供了另一个参考点。在 Authors Guild v. Google 案中,法院认可为创建可搜索索引而扫描图书,该索引仅显示有限的文本片段。

该项目与生成式模型训练有所不同,但它帮助确立了这样一个原则:如果产生的功能具有转换性,复制完整作品有时也可以构成合理使用。

Anthropic 的案件则增加了另一层含义。它表明,转换性分析并不一定授权开发者从其选择的任意来源获取底层副本。

眼下的压力落在负责数据采购和治理的团队身上。他们必须证明的不仅仅是某个技术上有用的语料库确实存在。

一套具有可辩护性的记录应明确数据集提供方、访问日期、许可或法律依据、涵盖的文件、使用限制、保留期限以及下游副本。它还应记录当来源所有者撤回许可时会发生什么。

对于较早的基础模型而言,这项工作十分困难。早期训练管线往往优先考虑规模、模型质量和实验,而非来源层面的权利记录。

从当前存储中删除数据集并不能消除其对已训练模型的影响。机器遗忘旨在降低模型对特定训练数据的依赖,但在基础模型规模下,验证其效果在技术上仍然十分困难。

这使得预防比补救更加可靠。开发者可以删除源文件,但要证明模型不再反映这些文件则是另一项挑战。

许可是应对方式之一,但不是唯一方式。公司可以使用公有领域集合、直接许可的材料、合成数据、经客户授权的内容,以及依据有记录的例外条款获取的信息来训练模型。

每种选择都有取舍。获得许可的资料库成本高昂,而且可能限制使用。公有领域集合可能无法反映当前语言或专业知识。

合成数据可能会强化模型错误,或缩窄表达的分布范围。客户数据则会带来隐私、安全和保密义务。

这项和解强化了希望通过谈判达成访问协议的出版商的地位。它为获取风险可能导致数十亿美元后果提供了一个具体案例。

但它并不能保证出版商可以针对每一次训练行为收费。Anthropic 仍然有效的合理使用裁决削弱了这一更宽泛的主张,至少作为一项来自联邦地区法院的参考性判例是如此。

这使双方处于一种不同寻常的谈判地位。权利持有人在清洁数据访问方面拥有更大筹码,而 AI 开发者仍保留某些训练无需许可的法律论点。

可能的结果是选择性许可,而非普遍许可。开发者将优先考虑那些难以替代、具有商业价值、时效性强,或通过其他方式获取风险特别高的来源。

普通网络文本可能会与经过编辑的图书、科学档案、优质新闻或专业数据库受到不同对待。法律分析也将因来源和预期用途而异。

开发者可能会回应称,和解不会确立判例。从技术上讲,这是正确的。

和解终结了相关诉求,却不会针对每个争议问题作出审判判决。其他法院不必照搬双方的付款公式或责任假设。

然而,风险管理不会等待具有约束力的上诉判例。保险公司、投资者、企业客户和董事会会评估合理诉求、证据开示成本以及运营中断所带来的风险敞口。

一项 15 亿美元的基金改变了这些计算方式。即使是对合理使用充满信心的公司,如今也有更充分的理由审查其数据是如何获得的。

和解仍未解决的问题

最终批准确定了赔偿和权利释放条款,但仍未解答有关许可、所有权、公平性和未来模型训练的核心问题。

最大的不确定性涉及合理使用的范围。Alsup 法官的裁决属于参考性判例,并非对全美所有地区法院均具有约束力的规则。

其他法官可以审查不同事实并得出不同结论。上诉裁决将更具影响力,但此次和解使本案无法就尚未解决的盗版诉求产生此类裁决。

有关训练的裁决还取决于 Anthropic 的模型具有转换性,而非原告图书的替代品。未来案件可能涉及更有力的证据,以证明记忆、市场替代或与受保护段落相似的输出。

法院通过针对具体事实的权衡测试来评估合理使用。模型设计、输出控制、来源选择或商业市场的变化,都可能改变这种平衡。

该和解并未许可 Anthropic 使用未来出版的图书。正式条款释放的是涉及受涵盖作品和行为的特定诉求,而不是该公司日后可能面临的所有版权争议。

它也没有迫使整个 AI 行业采用此次和解的单部作品付款标准。没有法院裁定约 3,000 美元代表训练访问权的正确市场价值。

这一数字源自对诉讼风险的协商。它反映了基金规模、受涵盖作品、法律费用、所有权分配以及双方的不确定性。

款项分配仍是另一个争议来源。默认的作者与出版商分配比例可能与每份出版合同或复制权的实际所有权并不一致。

一些作者转让了广泛的权利。另一些作者则保留了电子权利、复制权或旧版协议从未明确描述的新兴技术权利。

遗产管理方可能缺乏记录。出版商可能已经合并、解散或转让书目版权。多个版本可能拥有不同的注册和所有权历史。

Authors Alliance 表示担忧,认为分配流程的某些方面可能会在共享款项争议中偏向出版商。其公平性听证分析还提到了涉及特别负责人、无人认领资金,以及为质疑出版商分成的作者提供协助等方面的异议。

这些异议并不能抹去较高的申领率或和解的规模。它们说明了为什么不应将最终批准误认为所有人都感到满意。

法律费用也招致了更多批评。早先申请的金额超过了最终裁定的数额,异议者主张,律师报酬不应消耗原本应支付给创作者的资金。

法院必须在这一担忧与诉讼的风险和复杂性之间取得平衡。集体诉讼律师向资金雄厚的被告提起了一宗新颖案件,并在完成审判前谈判达成了一项基金安排。

最终费用裁定是否实现了恰当平衡,仍将存在争议。最终批准意味着法院认为整体安排按照集体诉讼规则足够公平,并不意味着每位集体成员都倾向于该安排。

销毁要求也存在限制。Anthropic 必须删除指定的 LibGen 和 PiLiMi 文件,但法律上的证据保全义务可能要求暂时保留证据。

该要求也无法逆转已经完成的训练。和解并未声称 Claude 模型已完全消除从每一部受涵盖作品中进行的训练。

Anthropic 可以准确地表示,法院支持了其训练用途。作者也可以准确地表示,该公司为解决涉及未经授权副本的诉求支付了一笔创纪录的金额。

当任何一种说法被扩大到超出事实记录时,问题就会出现。本案既未确立所有 AI 训练都属于合理使用,也未确立所有使用受版权保护图书的训练都构成侵权。

Anthropic 作者和解的批准也基本未触及国际法。版权例外、文本与数据挖掘规则以及许可要求因司法管辖区而异。

某个数据集在美国用于某一目的可能合法,但在欧盟、英国、日本或其他市场可能面临限制。全球模型提供商必须梳理这些法律体系中的权利。

数据来源追溯也尚无既定的技术标准。记录质量参差不齐,独立审计人员也缺乏一种普遍认可的方法,用来确认模型仅使用了获授权材料。

模型卡和透明度报告通常只从较高层面描述数据。它们很少提供外部研究人员可以验证的完整作品级清单。

完全披露也存在自身风险。公开精确清单可能泄露商业秘密、暴露个人信息或造成安全问题。

因此,该行业需要一个可信的中间方案。保密审计、标准化来源类别、机器可读许可和监管机构可访问的记录,都是可能的路径。

目前没有一种方式能够提供完整答案。此次和解增加了对这类系统的需求,却没有明确它们应当如何运作。

三个信号将表明本案是否会改变 AI 训练

下一阶段将通过款项支付、新诉讼和训练数据披露的变化来衡量,而不会由这宗已和解案件的又一个新闻标题来定义。

第一个信号是和解款的分配流程。最终批准并不能保证每位符合资格的创作者都能迅速且毫无争议地收到预期款项。

管理方必须验证申领、解决重叠的所有权权益、处理合同证据,并应用法院批准的分配规则。上诉或个别争议可能会影响时间安排。

官方和解网站将提供最清晰的执行进展。读者应关注分配通知、修订后的单部作品计算方式,以及涉及争议所有权的决定。

顺利分配将强化这样一种观点:大型版权集体诉讼可以通过作品级记录向分散的创作者提供赔偿。旷日持久的争议则会暴露利用集体诉讼解决复杂出版权利问题的局限性。

第二个信号是法院在其他 AI 版权案件中如何看待数据获取与训练。即使诉讼涉及不同公司,原告也很可能援引 Bartz 案中认可的事实区分。

开发者则会援引有利的合理使用分析。他们还会强调,协商达成的付款并不等于认定模型训练必须获得许可。

具有决定性意义的案件将同时提供有关数据来源和市场影响的证据。能够证明未经授权获取、可获赔偿的作品以及具体商业损害的原告,将比仅仅提出对 AI 的一般性反对意见者构成更大威胁。

上诉法院最终可能确立一项更具影响力的规则。在此之前,各地区法院可能会根据不同的数据集、输出和商业模式,形成彼此不一的裁决格局。

第三个信号是主要开发者是否会公布更有力的数据来源承诺。关于使用公开信息的泛泛声明,将不再能够回答最重要的问题。

企业需要区分可公开访问的数据、公共领域数据、许可数据、用户授权数据,以及依据法律例外使用的受版权保护数据。这些类别不能互换。

采购公告将与透明度报告同等重要。与出版商、档案机构、数据经纪商和专业数据库签订的新协议,可以揭示开发者认为哪些内容既有价值,又在法律层面较为敏感。

投资者还应考察企业是否为内容访问和诉讼预留了更多资金。不断上升的数据成本可能有利于拥有雄厚资本、成熟合作伙伴关系和完善合规团队的企业。

规模较小的开发者面临不同的挑战。他们可以使用开放模型和精选数据集,但也可能继承上游提供商来源不明的问题。

开放模型许可证约束的是模型产物。它并不能自动证明训练过程中使用的每一份副本都是通过合法方式获取的。

企业客户在将敏感工作流部署到某个模型上之前,应要求获得明确答复。值得询问的问题包括:训练数据由谁提供、删除请求如何处理,以及哪些赔偿条款适用于版权索赔。

知识工作者应注意模型训练与模型输出之间的区别。即使训练符合合理使用原则,用户仍可能因提示系统复制或高度模仿受保护材料而产生侵权风险。

最稳妥的做法是,不要想当然地认为模型可用就意味着它在所有情境下都能被合法使用。用户应评估自己发布、传播或销售的输出内容。

Authors Guild 的立场认为,此案将推动更多许可活动,并赋予创作者更大的控制权。这一结果有可能出现,但判决并未对此作出保证。

Anthropic 和其他开发者仍可主张,具有转换性的训练无需获得许可。他们是否有动力取得许可,将取决于来源质量、法律风险、公众压力,以及替换争议材料的成本。

因此,此案首先确立的是一条采购规则,而非一项普遍适用的版权规则。清晰的获取记录如今具有可衡量的战略价值。

对于关注 Anthropic 作者和解案获批情况的读者来说,核心问题已不再是某家公司是否需要赔偿。最终批准已经给出了答案。

真正的问题是:AI 开发者会围绕可验证的来源信息重建数据管线,还是会在获取环节出现问题后继续依赖法律抗辩。请关注赔款分配、后续法院裁决,以及首批详细的数据来源承诺。这些信号将共同表明,此次和解究竟会成为运营方式的转折点,还是仅仅作为针对某家公司以往数据实践的一次特殊解决方案而存在。

 
 

免费开始使用

一款本地优先的AI助手

为了获得更好的人工智能体验,

remio 目前仅支持Windows 10+ (x64)和M-Chip Mac 。

你的 AI 工作伙伴

和 remio 一起高效工作

规划、创作、交付

一站式完成

bottom of page