top of page

Meta 刚刚被五家出版商起诉。扎克伯格被亲自点名。

2025 年 5 月 5 日,全球五大出版商 Elsevier、Cengage、Hachette、Macmillan 和 McGraw Hill 走进曼哈顿联邦法院,对 Meta 提起集体诉讼。加入他们的还有畅销书作家、《Presumed Innocent》的作者、前联邦检察官 Scott Turow。起诉书并未止步于公司实体,还将 Mark Zuckerberg 作为个人被告,指控他 knowingly 指示使用数百万盗版书籍来训练公司的 Llama AI models

出版商的指控并非 Meta 从开放网络抓取书籍,或基于合理使用理论训练公开可用文本,而是 Meta 从已知的盗版网站——多年来一直是执法行动目标的影子图书馆——获取数据集,并故意使用这些数据。起诉书称这是“历史上最大规模的版权材料侵权之一”。Meta 尚未提交正式回应。

对于一家过去两年一直将自家 AI 定位为 OpenAI 和 Google 专有模型开源替代方案的公司而言,这起诉讼的精准程度非同寻常。Zuckerberg 关于 Llama 的公开叙事一直围绕民主化、透明度和开源权重模型的道德优越性展开。而出版商的起诉书提出了一个不同的问题:当一个模型建立在被盗书籍之上时,它究竟有多“开放”?

发生了什么,五家出版商,一起诉讼,一位被点名 CEO

该起诉书于 2026 年 5 月 5 日在纽约南区法院由美国出版商协会(AAP)代表其五家成员出版商及 Turow 提起,Turow 既以个人版权持有人身份,也通过其公司 S.C.R.I.B.E. 参与诉讼。法律机制为拟议集体诉讼,即原告不仅代表自己,还试图代表所有据称其版权作品被用于训练 Meta LLM 家族的作者和出版商。

具体指控是 Meta “knowingly sourced” 来自非法盗版网站的训练数据。这一措辞经过深思熟虑。在之前的 AI 版权案件中,尤其是《纽约时报》诉 OpenAI 一案,焦点在于训练使用版权材料是否构成合理使用。Meta 的案件引入了不同变量:故意性。出版商并未主张 Meta 在抓取公开网络时偶然摄入版权作品,而是主张 Meta 前往明知非法的网站,从这些网站获取版权内容,并用其构建商业产品。若指控成立,这将把法律框架从合理使用转向故意侵权,后者可处以每件作品最高 15 万美元的法定赔偿。

将 Zuckerberg 作为个人被告增加了第二层法律压力。在公司诉讼中,将 CEO 列为个人被告相对罕见,这表明原告认为他们掌握了直接知情和指示的证据。起诉书并未将 Zuckerberg 描述为监督了一个碰巧训练 AI 的组织的高管,而是描述为亲自推动使用任何可用数据、不论其合法性的决策。AAP 的 press release 明确强调了这一选择:诉讼针对的是“Meta 及其创始人兼 CEO Mark Zuckerberg”。

Scott Turow 的参与为案件增添了另一维度。Turow 不仅仅是名人原告。他是哈佛法学院毕业生、前助理美国检察官,其法律惊悚小说销量超过 3000 万册。他的名字出现在起诉书中,表明原告打算将此案定性为法治问题,而非单纯商业损害。Turow 的声明(据 NPR 报道)明确表达了这一论点:“本案核心原则并不新鲜。未经许可使用他人作品是错误的,无论你是用印刷机还是神经网络。”

为什么重要,开源叙事存在供应链问题

Meta 投入巨资将 Llama 定位为 AI 领域的道德替代方案。在 Meta Connect 2025 上,Zuckerberg 辩称开源权重模型比封闭模型更安全,因为其训练数据和权重可以被检查。在 Llama 5 于 2026 年 4 月发布前,公司的宣传进一步强化了这一主题:Meta 是将 AI 带给无力负担专有 API 的开发者、研究人员和初创公司的公司。在这一叙事中,开源不仅是一种技术策略,更是一种道德选择。

这起诉讼暴露了一个显而易见的张力。开源权重模型公开了权重,但未公开其数据。开发者可以下载 Llama 的模型文件并检查每个参数,但无法确定哪些书籍、文章或数据集被用于生成这些参数。权重是开放的;训练数据则不是。这种不对称性使 Meta 能够宣称透明,却并未真正透明地披露版权最关心的内容:这些权重中编码的知识来自何处。

如果出版商的指控属实——起诉书中“knowingly sourced from illegal pirate sites”的表述表明他们相信可以证明这一点——那么开源叙事将在其根基上崩塌。一个权重可公开下载但训练数据非法获取的模型,并非开源成功案例,而是工业规模的 AI copyright infringement

起诉 Meta 的五家出版商并非边缘玩家。仅 Elsevier 每年就出版 2500 多种期刊和 4 万余种书籍。McGraw Hill 是全球最大的教育出版商之一。Hachette、Macmillan 和 Cengage 每年共同出版数千种贸易和学术著作。它们共同控制着英语图书市场的很大一部分——正是这些内容使大型语言模型流畅、信息丰富且具有商业价值。如果这些出版商拒绝向 AI 训练提供未来内容,下一代模型将明显变得更“笨”。

真正的问题,“Knowingly Sourced From Pirate Sites”究竟意味着什么

要理解为何此案不同于之前的 AI 版权诉讼,有助于审视出版商 not 主张的内容。他们并未主张 Meta 抓取了他们的网站。他们并未主张 Llama 训练使用了公开发布的摘要、评论或摘录。他们主张 Meta 从影子图书馆——具体而言,是托管完整图书文件和期刊文章、违反版权法的盗版网站——获取了其版权作品的全文副本。

这一区别在法律上意义重大,因为它剥夺了 Meta 最有力的抗辩:合理使用。在 Authors Guild v. Google(2015)案中,第二巡回法院裁定 Google 为 Google Books 扫描数百万本书籍属于合理使用,因为该服务仅显示“片段”,因此并未替代原作。在 NYT v. OpenAI 案中,合理使用抗辩取决于训练 AI 是否构成对底层内容的“转换性使用”。但合理使用原则从未保护从非法来源 knowingly 获取内容。你不能对你一开始就偷来的东西主张合理使用。出版商并未要求法院裁决 AI 训练是否属于合理使用,而是要求法院裁决 Meta 在训练开始前是否已违法。

被指控侵权的规模加剧了 Meta 的问题。起诉书描述了“数百万”未经授权使用的版权作品。根据《版权法》,故意侵权的法定赔偿范围为每件作品 750 至 15 万美元。即使按最低标准计算,一百万本书籍的赔偿额也达 7.5 亿美元。按最高标准计算,则达数百亿美元,这一数字即使以 Meta 的市值,也足以让任何投资者驻足。

先前的 AI 版权案件提供了背景,但未为此案提供先例。NYT v. OpenAI 案涉及训练使用公开可访问文章是否属于合理使用。Getty v. Stability AI 案涉及训练图像模型使用公开可见图像是否侵权。Universal Music v. Anthropic 案涉及训练数据中的歌词是否侵犯音乐出版商权利。这些案件均未指控被告从非法来源获取训练数据。Meta 的案件是首例,此类案件,“pirate sites”指控将其从合理使用辩论转变为 Meta 是否 knowingly 处理赃物这一直接问题。

比较,AI 版权战场,2023-2026

针对 Meta 的诉讼是自 ChatGPT 发布以来不断升级的冲突中的最新进展。每起案件都为围绕 AI 训练数据缓慢构建的法律框架增添了新层面。

The New York Times v. OpenAI and Microsoft(2023 年 12 月)确立了模板。《纽约时报》主张 ChatGPT 几乎逐字复制其文章,实质上替代了原作。OpenAI 以合理使用反驳,主张训练使用公开可用文本具有转换性。该案现已进入第三年证据开示,已就 AI 语境中构成充分复制证据的问题作出重大裁决,并很可能为美国 AI 训练是否受合理使用保护设定最广泛的先例。关注该案的法律观察人士指出,其结果(预计 2026 年底或 2027 年初)将塑造整个领域。

Getty Images v. Stability AI(2024 年)将同一问题带入图像生成领域。Getty 主张 Stable Diffusion 训练使用了数百万张 Getty 图像而未获得许可,并可生成带水印内容的近似复制品。Stability AI 的抗辩侧重于模型在美国境外根据不同法律框架训练,但该案对任何训练视觉媒体的公司都有影响。

Universal Music Group et al. v. Anthropic(2024 年)聚焦歌词。音乐出版商指控 Claude 训练使用了版权歌曲歌词,并在提示时可逐字复制。案件提出了具体问题:训练使用歌词(其长度更短、更易记忆)是否构成侵权,即使模型的主要目的并非歌词复制。

这些案件的法律策略随着每次起诉而演进。NYT 案精心构建于合理使用之上。Getty 案提出了国际管辖权问题。Universal Music 案聚焦逐字复制能力。Meta 案背后的出版商联盟从所有这些案件中吸取教训,并选择了不同路径。通过将投诉重点放在数据来源而非使用上,他们完全绕过了合理使用辩论。

Meta 案在性质上而非程度上有别。先前每起案件都要求法院裁决 AI 训练是否属于合理使用。Meta 案则询问被告是否在训练开始前就犯下了罪行。出版商的法律团队选择了一种完全回避合理使用问题、转而聚焦获取方式的策略。如果他们能证明 Meta 使用了来自盗版网站的数据——起诉书中的“knowingly”措辞表明他们相信有证据证明这一点——那么无论合理使用问题最终如何解决,Meta 的法律地位都将大幅削弱。

接下来,AI 训练数据的未来正在接受审判

当务之急是 Meta 如何回应。该公司尚未对起诉书作出答复,其策略将揭示其对指控的重视程度。Meta 有两种基本选择:它可以基于合理使用理由抗辩,主张即使数据来源可疑,训练 AI 仍具有足够的转换性而受保护。鉴于起诉书中的“knowingly sourced”措辞,这是一个渺茫的论点。或者它可以寻求和解,这可能涉及与出版商签订许可协议,实质上追溯支付所用数据的费用。

和解的意义将超越这一单一案件。如果 Meta 支付,这将为 AI 训练数据设定价格:五家最大出版商为每位其他权利人要求付款打开大门。训练大型模型的经济学将从基于抓取的数据获取模式转向基于许可的模式。对于 AI 行业而言,这将是从 Napster 到 Spotify 的时刻,即免费获取内容的终点和付费许可的起点。

如果 Meta 抗辩并败诉,后果将更严重。故意侵权认定将开启可能达数十亿美元的法定赔偿大门。更重要的是,它可能要求 Meta 销毁基于侵权内容训练的模型权重——这一救济措施虽然极端,但在其他知识产权法领域已有先例。法院命令删除全球最有价值的 AI 模型之一的前景前所未有,但在《版权法》下并非不可能。

对于更广泛的 AI 生态系统而言,Meta 案将加速已经 underway 的趋势:AI 训练数据分为“干净”和“不干净”两类。能够证明其模型训练使用经适当许可数据(通过直接出版商协议、公共领域语料库或选择加入数据集)的公司,在法律环境收紧时将获得竞争优势。无法作出此证明的公司将日益面临诉讼风险、声誉损害以及其模型可能成为法律上有毒资产的前景。

出版商的诉讼也向立法者发出了信号。美国尚未通过全面的 AI 立法,训练数据合法性问题目前正逐案诉讼。如果法院一致裁定未经许可训练使用版权材料构成侵权,国会可能面临将这些裁决编纂为成文法的压力。如果法院支持 AI 公司,出版商将推动明确保护其权利的立法。无论哪种方式,Meta 案都在加速决定未来数年 AI 如何构建和付费的政治进程。

Meta 案不仅将决定一家公司是否使用了被盗书籍。它将决定 AI 行业原罪——无论数据法律地位如何,训练使用任何可用数据——能否经受法庭考验。出版商并未要求新法。他们询问的是旧法是否仍然适用。在 AI knowledge management 工具重新定义个人和公司处理信息方式的时刻,一个并行问题是不可避免的:如果我们正在构建从一切中学习的 AI,谁来决定“一切”包含什么?

 
 

免费开始

一款本地优先的AI助手,具备个人知识管理功能

为了获得更好的人工智能体验,

remio 目前仅支持Windows 10+ (x64)M-Chip Mac

在你的大脑里添加一个搜索栏

Ask remio

记住一切

​无需整理

bottom of page