top of page

Nvidia AI 训练数据诉讼:Anna’s Archive 与版权之战

The Nvidia AI Training Data Lawsuit: Anna’s Archive and the Copyright Battle

世界最有价值的芯片制造商如何为其算法提供数据,这一幕已经揭开。最近在集体诉讼 Abdi Nazemian v. Nvidia 的法庭文件中披露,Nvidia 员工明确联系了影子图书馆 "Anna’s Archive" 的运营者,以获取数百万本受版权保护书籍的高速访问权限。

虽然这场法律战正在加州北区美国地方法院展开,但技术社区已经开始做出反应。开发者和工程师们正在审视一个建立在法律灰色地带数据和限制性硬件许可之上的生态系统的脆弱性。在深入探讨诉讼细节之前,值得先了解一下 how users are currently navigating the technical constraints imposed by Nvidia’s dominance.

Nvidia AI 训练数据系统的技术现实与用户变通方案

Technical Realities and User Workarounds for Nvidia AI Training Data Systems

围绕 Nvidia AI training data 的争议不仅仅关乎版权,更关乎控制。Nvidia 已收紧对其硬件和软件使用方式的掌控,这促使高级用户寻找逃生通道。

社区讨论显示,用户对“围墙花园”的不满日益增长。Nvidia 的 CUDA 最终用户许可协议(EULA)明确禁止使用翻译层在非 Nvidia 硬件上运行 CUDA 软件。这一点在 ZLUDA(一个旨在让 CUDA 运行在 AMD GPU 上的开源项目)因法律担忧而下线后变得明显,尽管 AMD 声称并未强制下架。

这种敌对环境促使用户尝试不依赖标准 Nvidia AI training data 基础设施的硬件替代方案。

Mac Studio 集群实验

网络安全领域的工程师正在摆脱对 Nvidia H100 的依赖。用户报告中出现的一种值得注意的替代方案是集群 Apple Mac Studio。通过使用 exo labs 等应用,团队有效地将消费级 Mac 硬件联网以运行大型语言模型(LLM)。虽然这无法匹敌专用 H100 集群的原始吞吐量,但它为推理任务提供了一种符合版权、所有权友好的替代方案,避免了 Nvidia 限制性许可的迷宫。

Linux 内存模拟

在较低端,爱好者们正在测试极端软件变通方案以绕过硬件内存限制。一些 Linux 用户将 Google Drive 或 S3 存储桶挂载为 tmpfs 来模拟 RAM。虽然延迟使其不适合训练——导致速度极慢——但这凸显了对无需签署权利或支付 Nvidia 溢价即可访问的硬件的迫切需求。

这些技术 skirmish 为主要事件铺平了道路:Nvidia 的基础模型可能是建立在被盗内容的库之上。

Nvidia AI 训练数据如何从影子图书馆获取

集体诉讼的核心指控是,Nvidia 并非只是被动地抓取互联网;他们主动寻找盗版内容。根据诉状,Nvidia 的数据策略团队发现,通过种子下载“Books3”数据集(The Pile 的组成部分)和其他集合速度太慢。

为了加快进程,据报道 Nvidia 人员向 Anna’s Archive 的管理员发送了电子邮件。他们的目标是协商一个直接的高带宽管道,以下载该图书馆的海量目录,估计超过 500TB 数据。

“绿灯”来自管理层

原告提供的最具破坏性的证据是内部电子邮件线程。当一名初级工程师提出 Anna’s Archive 的数据可能侵犯版权的担忧时,据称 Nvidia 管理层驳回了警告。文件称,一名经理在一周内给予了“绿灯”,指示团队继续摄取。

这些数据随后用于训练 NeMo、Retro-48B 和 InstructRetro 等模型。通过整合 Books3、Sci-Hub 和 Library Genesis (LibGen) 等数据集,Nvidia AI training data 与世界上最臭名昭著的盗版中心 inextricably 联系在一起。

“合理使用”辩护与统计论点

The "Fair Use" Defense and the Statistical Argument

Nvidia 的辩护策略依赖于对“合理使用”的特定解释。他们辩称,their AI models do not "copy" books 以传统意义。相反,他们声称 AI extracts statistical correlations between words.

该公司认为,由于模型不存储书籍的文本文件,而是语言模式的数学表示,因此没有发生版权侵权。他们将其比作学生阅读图书馆书籍来学习写作;学生不拥有这本书,但他们拥有从中学习到的技能。

“废料场波音”反驳

批评者和在线用户攻击了这一逻辑。一个流行的反驳论点将 Nvidia 的“统计相关性”辩护比作飓风吹过废料场并组装出一架波音 747。仅仅因为输出是新的,或者过程是自动化的,并不能否定零件的来源。

如果“统计”论点在法庭上成立,它将确立一个先例,即版权仅适用于人类消费,从而 effectively 剥夺作者对其作品机器可读版本的权利。

审视 Nvidia AI 训练数据实践的伦理

技术社区的反应超越了法律定义;对于法律如何对个人与公司区别适用,存在着明显的 injustice 感。

Aaron Swartz 对比

围绕诉讼的讨论经常提及 Aaron Swartz 的记忆。Swartz,Reddit 联合创始人,因从 JSTOR 大量下载学术文章而面临 35 年监禁和数百万美元罚款。他受到联邦检察官 relentless 追捕,这一斗争导致了他的自杀。

对比 stark。Swartz 下载学术论文是为了公共访问;据称 Nvidia 下载数百万本盗版书籍是为了商业利润。然而,当 Swartz 面临重罪指控时,Nvidia 将潜在罚款视为做生意的成本。这种双重标准加剧了公众对 how Nvidia AI training data is acquired.

的反对。

“开源”误称

进一步 complicating 伦理景观的是 Nvidia 的术语。他们以“Open Model License”发布 NeMo 等模型,许多人将其与“Open Source”混淆。

开源促进会(OSI)对什么是开源有严格定义。Nvidia 的许可通常限制商业使用或修改再分发权,这意味着它们是具有公共权重的专有模型。通过使用“Open”这一称谓,Nvidia 从与开源软件相关的社区善意中受益,同时保留公司控制并减轻责任。

The Future of Copyright in the Age of AI

AI 时代版权的未来Nazemian v. Nvidia 案不仅仅是关于版税的纠纷;它是对自动化经济中人类创造价值的公投。

作者和创作者正在要求 AI 训练的“拒绝权”或标准化版税模型。当前的“选择退出”系统往往复杂或无效,让创作者与数十亿美元的公司玩打地鼠游戏。如果 Nvidia 被判有责任,它可能会迫使 AI 行业从系统中清除 petabytes 的 Nvidia AI training data, effectively 使当前一代模型脑残。

相反,如果 Nvidia 获胜,它将巩固这样一个概念:人类知识一旦数字化,就是可供公司提取的原始资源。结果很可能不是由谁在道德上正确决定,而是由法院是否将一份新颖的盗版 PDF 视为要阅读的书还是要分析的统计数据决定。

FAQ:Nvidia AI 训练数据与法律风险

Q: Nvidia 为什么专门联系 Anna’s Archive?

A: Nvidia 寻求对该网站数据库的“高速访问”。通过标准公共种子下载数百万本书 incredibly 缓慢,因此 Nvidia 试图协商直接数据传输以加快其模型训练。

Q: 使用 NeMo 模型会让开发者面临法律风险吗?

A: 可能。如果法院裁定用于 NeMo 的 Nvidia AI training data 是非法获取的,衍生模型可能面临“毒树之果”法律挑战,尽管对个人开发者的执行很少。

Q: Nvidia 如何为其使用盗版书籍辩护?

A: Nvidia argues "Fair Use," claiming that their AI doesn't "copy" the expressive content of books 而是分析它们以获取统计相关性来理解语言模式,他们认为这是 non-infringing。

Q: Nvidia 的许可与真正的开源有什么区别?

A: Nvidia 使用自定义“Open Model”许可,通常禁止商业使用或施加特定限制。OSI 定义的真正开源软件允许自由使用、修改和再分发,而不歧视任何领域。

Q: 除了 Anna’s Archive,诉讼中还涉及哪些数据集?

A: 诉讼提到了 The Pile、Books3、Sci-Hub、Library Genesis (LibGen) 和 Z-Library 的使用。这些都是包含版权材料的海量存储库,已被摄取到 Nvidia 的训练管道中。

 
 

免费开始

一款本地优先的AI助手,具备个人知识管理功能

为了获得更好的人工智能体验,

remio 目前仅支持Windows 10+ (x64)M-Chip Mac

在你的大脑里添加一个搜索栏

Ask remio

记住一切

​无需整理

bottom of page