Anthropic 15 亿美元版权和解创下纪录,但 AI 训练仍是赢家
Anthropic 将支付 15 亿美元,就涉及盗版书籍的索赔达成和解,这是美国版权案件中已知金额最高的赔偿。然而,Anthropic 15 亿美元版权和解仍让这家 AI 公司保住了对模型开发者而言最重要的法律成果。
一名联邦法官此前裁定,使用合法获得的书籍训练 Anthropic 的大语言模型属于合理使用。此次和解处理的是另一种行为:在建立中央研究资料库的过程中,从盗版图书馆下载并保留书籍。
这一区别使一场表面上的失败变成了各有得失的结果。作者获得了一笔史无前例的赔偿基金,而 AI 实验室则获得了法院支持的论据:只要以适当方式取得源材料,具有转换性的模型训练仍可保持合法。
Anthropic 的 15 亿美元版权和解涵盖 482,460 本书
此次和解解决了 Anthropic 因盗版行为面临的法律风险,但并未推翻其在 AI 训练合法性问题上的胜利。
2026 年 7 月 20 日,美国地区法官 Araceli Martínez-Olguín 最终批准了 Bartz v. Anthropic 一案的集体诉讼和解。该案由加利福尼亚北区联邦地区法院审理。
该协议设立了一项不返还基金,即未使用的资金不会退还给 Anthropic。基金涵盖和解过程中认定的 482,460 部作品。
根据提交给法院的报告,作者和出版商就 440,490 部作品提出了索赔,约占符合条件作品的 91.3%。
符合条件的权利人预计每部申报作品可获得约 3,000 美元,之后再由作者、出版商或其他权益持有人分配。每位作者实际获得的款项取决于权属协议和获批的索赔。
法院称此次和解为集体成员提供了实质性救济。其最终批准令还裁定向集体诉讼律师支付约 1.016 亿美元律师费,约占基金总额的 6.8%。
获批的费用补偿总额约为 260 万美元。法院还批准预留 1,820 万美元,用于预计产生的管理成本以及支付给集体代表的服务奖励。
在理解经常被提及的 3,000 美元数字时,这些扣除项十分重要。该数字表示每部作品的大致分配金额,并不意味着每位作者都必然获得一张 3,000 美元的支票。
原告方由作家 Andrea Bartz、Charles Graeber 和 Kirk Wallace Johnson 以及相关企业实体牵头。他们于 2024 年 8 月起诉 Anthropic,指控 Claude 的开发商未经许可复制受版权保护的书籍。
他们的诉状针对的是从所谓的影子图书馆获得的书籍。这些在线资源库传播未经授权的书籍及其他受版权保护材料的副本。
该集体诉讼最终聚焦于与 Anthropic 从 Library Genesis 和 Pirate Library Mirror 下载内容相关的作品。法院记录还提到,此前一次从 Books3 下载的行为涉及 196,640 份未经授权的书籍副本。
Anthropic 于 2025 年同意和解,当时针对其获取和保留盗版文件行为的审判已排定日期。最终批准使这项协商达成的协议转化为可执行的判决。
该基金将通过分期付款筹措。官方付款时间表包括 2025 年已支付的款项,以及在最终批准后、2026 年 9 月和 2027 年 9 月到期的额外款项。
和解协议还要求 Anthropic 按照协议条款处理所涵盖的盗版图书馆文件。不过,它并未为 Claude 开发过程中使用的每一本书建立通用许可制度。
最重要的是,该和解并未认定使用受版权保护的书籍训练生成式 AI 模型必然构成侵权。在同一案件中,这一问题此前已经得出了对 Anthropic 有利的裁决。
创纪录的赔偿只是法律结果的一半
Anthropic 在资料库的建立方式上败诉,但在其模型训练期间如何使用书籍的问题上胜诉。
法官 William Alsup 在 2025 年 6 月的一项简易判决中划定了这条界线。他将 Anthropic 用于训练的副本与其永久保存的盗版资料库视为法律上不同的用途。
大语言模型从训练数据中学习统计关系,从而预测并生成语言。它的运作方式不同于让用户检索完整存储书籍的传统数字图书馆。
Alsup 认定,训练 Anthropic 模型的行为“具有典型的转换性”。在版权法中,转换性使用是指赋予源材料不同的目的或性质,而非仅仅取代源材料。
该裁决将 AI 训练比作读者从书籍中学习后创作出不同的文字。法院认定,Anthropic 的模型接受训练是为了生成新文本,而非向客户提供原告书籍的副本。
Anthropic 还购买了纸质书籍,拆除装订,扫描书页,并丢弃实体副本。法院认定,这种格式转换服务于相同的内部研究目的,并未创建用于公开传播的额外副本。
合理使用裁决的这一部分给了 AI 开发者他们长期以来一直寻求的成果:一项支持将受版权保护材料用于生成式模型训练的明确司法判决。
法院对 Anthropic 的中央资料库得出了不同结论。Anthropic 从盗版资源库下载了数百万本书,即使其中一些文件并未被选用于模型训练,也仍然保留了副本。
这种建立资料库的活动不会仅仅因为 Anthropic 希望日后开展研究,就自动具有转换性。法院表示,在存在合法购买渠道的情况下,Anthropic 不能以研究为由为通过盗版手段获取永久副本的行为辩护。
因此,该案区分了公共讨论中经常混为一谈的三种活动。
第一,实验室可以获得一本合法书籍,并将其转换为适合内部分析的格式。第二,实验室可以在具有转换性的训练过程中使用这些材料。第三,实验室可以从盗版来源获取并保留未经授权的副本。
Anthropic 在前两种活动上获得了有利认定。第三种活动则带来了巨大的财务风险,最终促成和解。
这解释了为什么 Anthropic 在获得最终批准后强调合理使用。副总法律顾问 Aparna Sridhar 表示,公司是在法院作出具有里程碑意义的裁决、认定使用书籍训练 AI 属于合理使用后达成该协议的。
作者方律师则强调了另一项结果。律师 Justin Nelson 称此次和解是历史上已知金额最高的版权赔偿,并将重点放在向集体成员支付款项上。
在各自限定的范围内,这两种说法都是准确的。作者因未经授权的获取行为赢得了创纪录的赔偿基金,而 Anthropic 则保住了对训练行为有利的裁决。
如果只将这一结果称为 15 亿美元的处罚,就忽略了这种法律上的分野。如果将其称为 AI 实验室毫无保留的胜利,则忽视了一项造成十亿美元级后果的合规失误。
Anthropic 15 亿美元版权和解之所以意义重大,恰恰是因为这两种结果同时成立。它为创作者提供了救济,但并未认定在模型训练中使用其作品一律需要获得许可。
合法训练与盗版获取如今成为两条截然不同的路径
该案将数据来源,而非模型能力,置于 AI 版权风险的核心。
数据来源是指以文件化方式记录信息来自何处、如何获得,以及哪些权利约束其使用。对于许多 AI 团队而言,这曾经只是一个运营细节。
Bartz 案之后,数据来源看起来更像是核心法律基础设施。开发者可能拥有站得住脚的训练目的,却仍会因为文件来自非法渠道而面临重大责任。
这改变了 AI 实验室在实践中面临的比较。核心选择不再只是已获许可的数据与未获许可的数据。
相反,公司必须区分在合理使用理论下使用的合法获得材料与通过盗版复制的材料。即使由此获得的文件进入相同的技术流程,这两条路径也可能产生截然不同的结果。
依赖合理使用的实验室仍需提供证据,证明其使用具有转换性。它还必须考虑模型输出是否会取代受保护作品,或再现其中具有实质意义的部分。
不过,Bartz 案表明,站得住脚的训练流程并不能消除独立存在的非法复制行为。创建数据集的理由并不能自动使其获取方式合法化。
这给多个团队带来了压力。数据工程师需要可靠的来源记录。法律团队需要在训练开始前评估数据集。模型开发者需要建立排除可疑数据集合的流程。
高管还需要判断,更便宜或更快的数据获取方式是否值得承担或有法律责任。Anthropic 的和解表明,滞后的法律成本可能远远超过使用非法档案所节省的任何短期费用。
这种负担也波及从外部供应商处购买数据集的公司。如果供应商无法展示可信的保管链,即使合同承诺数据已经过权利清理,能提供的实际保障也十分有限。
开发者可能会选择购买实体或数字作品、协商许可、使用公版作品集合,或依赖以适当开放条款发布的材料。每条路径都有不同的局限。
许可提供了更明确的授权,但可能涉及分散的权属和艰难的谈判。购买副本可以证明合法持有,但并不会自动回答有关后续使用的所有版权问题。
公版材料可以降低版权风险,但可能缺乏近期语言、专业知识或当代文化内容。开放许可可以发挥作用,但其条件需要谨慎解读并妥善记录。
合成数据是生成而非直接从人类创作来源收集的数据,它提供了另一种选择。然而,合成数据集可能会复制生成它们的模型中存在的偏见或错误。
没有任何一种获取方法能够消除所有风险。Bartz 案确立的是一种层级关系:有记录的合法获取方式,能让 AI 公司处于比来源不明、从盗版资源库获取文件更有利的位置。
这种层级关系也会影响企业买家。评估 AI 供应商的客户可能关注模型质量、隐私和安全,但训练数据治理如今也值得同等重视。
采购团队可以询问供应商是否追踪数据集来源、移除有争议的材料、履行删除承诺,以及是否将训练权利与单纯的文件访问权区分开来。仅仅含糊地保证使用了“公开可用”的数据,并不能回答这些问题。
公开可用并不等同于获得合法授权。盗版书籍可能很容易在网上找到,但仍受版权保护。
同样的原则也适用于书籍之外的领域。音乐、照片、视频、新闻报道、软件和专业数据库各自都有其独特的权属结构和潜在市场。
对于 AI 实验室而言,运营层面的教训非常直接。合理使用策略不仅需要围绕训练模型产出内容的论据,还需要来源清白的输入数据和经得起辩护的记录。
这项和解为 AI 实验室保住了最宝贵的胜利
创纪录的赔付为一项已解决争议设定了上限,同时保留了一项能够惠及整个生成式 AI 行业的更广泛主张。
和解并不像经过诉讼程序作出的上诉法院裁决那样构成具有约束力的先例。其他法院无须采用其赔付结构或处理索赔的方式。
基础性的简易判决对该行业的法律策略影响更为深远。它提供了一个其他 AI 被告可以援引的案例,以主张模型训练是对书籍的转换性使用,而非对书籍的替代。
这解释了其中的核心反转。Anthropic 支付了已知金额最高的版权和解金,同时保留了对其长期业务最有利的裁决。
该公司避免了就盗版索赔进行审判,而此类索赔在理论上可能带来远高得多的风险敞口。根据美国版权法,故意侵权的法定赔偿金可高达每部作品 $150,000,但实际赔偿金额取决于具体事实和司法认定。
将这一最高金额乘以数十万部作品,便可直观展现影响和解谈判的风险。但这并不意味着法院一定会判处最高金额。
作为交换,该集体获得了确定性。成员不必再花费数年继续诉讼,逐一证明责任、所有权、故意性或损失。
较高的参与率强化了法院对该协议公平性的判断。只有少数作者选择退出,而索赔覆盖了所列作品中的九成以上。
一些创作者仍然提出异议,认为和解低估了他们的索赔价值。他们主张,与可获得的法定赔偿相比,每部作品约 $3,000 的赔付金额过低。
这一批评指出了一个真实的权衡。集体和解以放弃获得更高个别赔偿的可能性为代价,换取在广泛群体中分配的一笔确定资金。
根据协议,作者还会放弃协议所涵盖的索赔。参与和解的权利人通常不能在接受和解分配款后,再针对同一已豁免行为单独起诉 Anthropic。
与此同时,Anthropic 得以终结一组明确界定的既往索赔。但它不会因此获得针对未来数据集、未来行为或无关作品的全面豁免。
尽管如此,这项和解的规模仍可能影响其他案件的谈判。权利人在评估涉及未经授权 AI 训练数据集的诉讼时,如今有了一个具体基准。
AI 公司同样有了基准。它们可以估算不充分的来源控制会如何转化为诉讼成本、行政义务和声誉损失。
这会形成一种庭审前解决争议的激励,尤其是当法院已将可能合法的训练行为与本身存在疑问的数据获取行为区分开来时。
这种结构也可能促进直接许可。开发者无须承认训练必须获得许可,也可以认定通过协商取得许可能够提供可预测的访问权并降低诉讼风险。
出版商也可以从相反方向作出同样的计算。许可可以带来持续性报酬,而无须证明某个特定模型侵犯了特定作品。
然而,Anthropic 的 $1.5 billion 版权和解并未为训练数据确立统一的市场价格。其金额反映的是一个特定集体、一份明确界定的作品清单、从已识别盗版来源下载内容的指控,以及双方各自面临的风险。
将 $3,000 视为标准许可费同样是错误的。它只是一个近似的诉讼和解分配金额,受到索赔、律师费、费用支出和已豁免责任的共同影响。
因此,该协议提供的是警示,而非价目表。它告诉实验室,数据来源管理失误可能造成极其高昂的代价,同时也为基于合法来源材料提出合理使用抗辩保留了空间。
Anthropic 裁决未解决的问题
一项地区法院裁决无法一锤定音地解决受生成式 AI 影响的所有数据集、模型、输出内容或竞争市场的合法性问题。
合理使用需要结合具体情境进行分析。法院会审查使用目的、原作品的性质、复制内容的数量,以及对相关市场的影响。
Bartz 案的裁决有利于 Anthropic,因为法院认为其训练过程具有高度转换性。原告并未主张 Claude 经常向用户提供其书籍的副本。
不同的事实记录可能产生不同结果。如果某个模型会输出大段受保护内容,或直接取代对专业数据库的访问,其抗辩理由可能会较为薄弱。
市场损害问题尤其存在争议。作者主张,AI 生成的文字可能让市场充斥竞争性内容,同时降低对人类作品和许可的需求。
AI 公司则回应称,版权并未赋予作者控制一般风格、思想、事实或从作品中学习这一行为的权利。它们还主张,许多训练用途并不会替代原作品。
美国版权局拒绝给出简单答案。其生成式 AI 报告指出,合理使用的认定结果取决于所涉及的作品、来源、目的和控制措施。
该报告还区分了支持研究或分析的使用方式与在既有创意市场中生成竞争性材料的系统。这一区分可能改变法律上的利益平衡。
其他案件已经表明,将 Bartz 视为普遍规则十分危险。在涉及 Thomson Reuters 与 Ross Intelligence 的诉讼中,特拉华州一家法院驳回了将 Westlaw 要点复制到竞争性法律研究系统中的合理使用抗辩。
Ross 使用这些材料构建了一款面向同一法律研究市场的产品。Westlaw 裁决认定,其使用目的和潜在市场损害均有利于 Thomson Reuters。
该系统并非 Claude 这类通用生成式模型。尽管如此,这一结果仍表明,与来源产品形成竞争会如何改变分析结果。
Meta 也在一宗涉及使用书籍训练 Llama 的案件中取得了部分合理使用胜诉。然而,法官警告称,生成式 AI 有时可能损害原作品市场,尽管该案原告并未提供足够证据。
这些裁决只是早期的地区法院判决,并非最终的全国性标准。上诉可能会修正其推理,而其他司法辖区也可能以不同方式适用合理使用的四项因素。
在 Anthropic 的特定事实之外,数据来源获取问题仍未得到解决。法院可能需要裁定,通过盗版网络下载材料是否会影响对训练行为本身的分析,而不仅仅是构成独立的资料库索赔。
Bartz 案将 Anthropic 永久保存的盗版资料库与训练行为分开处理。未来的原告很可能会尝试更直接地将非法获取与模型开发联系起来。
他们还可能就许可市场提出更有力的证据。如果权利人能够证明 AI 训练许可市场确实有效运作,法院可能会更加重视许可收入损失。
AI 开发者则会反驳,版权所有者不能仅凭提供许可,就获得否决转换性使用的权力。这场争议触及合理使用原则的核心。
因此,Anthropic 的 $1.5 billion 版权和解终结了一宗案件,却没有终结争论。它提供了有用的法律推理,但这些推理的适用范围还将在不同技术和事实记录中经受检验。
三个信号将表明这是否会成为行业标准
下一阶段将由赔付款执行情况、上诉法院的处理方式,以及实验室获取训练数据方式中可衡量的变化所定义。
第一个信号是和解款的分配流程。获批索赔必须经过核验,所有权冲突必须得到解决,而同一作品中共享权利的各方之间也必须完成款项分配。
根据目前的时间表,Anthropic 的出资义务将持续至 2027 年 9 月。作者应关注管理机构的通知,而不应认为最终批准后就会立即收到款项。
实际分配情况将表明,个人获赔金额与被广泛引用的 $3,000 估算有多接近。大额扣除或所有权争议会削弱这项和解作为简单赔偿基准的价值。
顺利分配则会强化原告关于该协议以前所未有的规模提供了实际救济的主张。这也会让大型集体和解在相关诉讼中更具吸引力。
第二个信号是上诉法院将如何处理正在形成的合理使用判决。地区法院已经作出了一些具有影响力的裁决,但其推理能否成为持久有效的法律,将由更高级别法院决定。
如果上诉法院认可使用合法取得的书籍进行转换性训练,就会进一步巩固 Anthropic 更广泛的胜利。如果裁决范围较窄且聚焦于具体事实,其对其他实验室的价值就会受到限制。
如果裁决被推翻,行业的风险计算将发生更明显的变化。这可能推动公司扩大许可范围、缩小数据集,或采用旨在防止输出受保护内容的新技术控制措施。
第三个信号是 AI 公司是否披露更清白的数据来源,并签署更多许可协议。仅有公开声明并不足够。
真正有意义的证据将包括可识别的数据集合、有记录的授权、可审计的排除机制,以及覆盖数据集供应商的采购要求。这些做法能够表明,和解改变的是运营方式,而不仅仅是对外话术。
更多许可协议并不一定证明合理使用已经失败。它们可能只是表明,当涉及有价值的最新内容时,公司更倾向于选择合同所提供的确定性。
相反,如果继续依赖不透明的网络规模数据集合,就说明法律上的不确定性尚未改变开发激励。这条路径将引发更多围绕来源、所有权和输出替代效应的争议。
开发者和企业买家还应关注产品行为。加强防止逐字复制的保护措施,将有助于支持模型转换其输入内容、而非分发输入内容的主张。
创作者应关注法院是否承认真实存在的训练许可市场。当法官在未来案件中评估经济损害时,这类证据可能成为核心。
最明确的教训已经显现。Anthropic 的 $1.5 billion 版权和解并未让受版权保护的书籍无法用于 AI 训练。它让缺乏记录的非法获取行为更难再被视作无足轻重的技术捷径。
对于知识工作者而言,这一区别应当影响其评估 AI 供应商的方式。应当询问数据来自何处、访问受到哪些权利约束,以及系统能否复现受保护内容。
对于开发者而言,问题同样具体:每一个重要数据集能否脱离基于其构建的模型,独立经受法律审查?
下一宗具有决定意义的版权案件很可能取决于这些记录。应密切关注赔付流程、上诉裁决和数据来源披露,因为它们将揭示 Anthropic 这种胜负并存的结果是否会成为行业的运营规则。



