Nvidia AI トレーニングデータ訴訟: Anna’s Archive と著作権をめぐる戦い
- Aisha Washington

- 6月6日
- 読了時間: 9分
更新日:6月17日

世界の最も価値ある半導体メーカーがどのようにアルゴリズムにデータを供給しているかが明らかになりました。最近の集団訴訟「Abdi Nazemian v. Nvidia」の裁判書類開示により、Nvidiaの従業員がシャドーライブラリ「"Anna’s Archive"」の運営者に連絡を取り、数百万冊の著作権で保護された書籍への高速アクセスを確保していたことが明らかになりました。
米カリフォルニア州北部地区連邦地方裁判所で法廷闘争が繰り広げられる中、技術コミュニティはすでに反応しています。開発者やエンジニアは、法的にグレーなデータと制限的なハードウェアライセンスに基づいて構築されたエコシステムの脆弱性を見ています。訴訟の詳細に入る前に、まず見ておく価値があるのは、Nvidiaの支配によって課せられた技術的制約をユーザーが現在どのように回避しているかということです。
Nvidia AIトレーニングデータシステムにおける技術的現実とユーザーの回避策

をめぐる論争Nvidia AIトレーニングデータは、著作権だけでなく、管理についてもです。Nvidiaは、ハードウェアとソフトウェアの使用方法に対する管理を強化しており、高度なユーザーは回避策を模索しています。
コミュニティの議論では、「囲い込み」に対する不満が高まっていることが明らかになっています。NvidiaのCUDAのエンドユーザーライセンス契約(EULA)では、CUDAソフトウェアをNvidia以外のハードウェアで実行するために、翻訳レイヤーを使用することを具体的に禁止しています。これは、AMD GPUでCUDAを実行できるように設計されたオープンソースプロジェクトであるZLUDAが、AMDがテイクダウンを強制しなかったと主張しているにもかかわらず、法的懸念からオフラインになったことで明らかになりました。
この敵対的な環境により、ユーザーは標準の remio Nvidia AIトレーニングデータインフラストラクチャに依存しないハードウェアの代替品を実験するようになりました。
Mac Studioクラスター実験
サイバーセキュリティ分野のエンジニアは、Nvidia H100への依存から離れています。ユーザーレポートから浮上している注目すべき代替手段の1つは、Apple Mac Studioのクラスター化です。exo labsのようなアプリケーションを利用することで、チームはコンシューマーグレードのMacハードウェアを効果的にネットワーク化して、大規模言語モデル(LLM)を実行しています。これは、専用のH100クラスターの生の処理能力には及びませんが、著作権に準拠し、所有権に優しい推論タスクの代替手段を提供し、Nvidiaの制限的なライセンスの迷宮を回避します。
Linuxメモリエミュレーション
スペクトルの下限では、ホビイストはハードウェアメモリ制限をバイパスするための極端なソフトウェア回避策をテストしています。一部のLinuxユーザーは、RAMをシミュレートするためにGoogle DriveまたはS3バケットをtmpfsとしてマウントしています。レイテンシによりトレーニングには実用的ではなく、苦痛なほど遅い速度になりますが、これは権利の放棄やNvidiaプレミアムの支払いを必要としない、アクセス可能なハードウェアへの絶望的な需要を浮き彫りにしています。
これらの技術的な小競り合いは、メインイベントの舞台を設定します。それは、Nvidiaの基盤モデルが盗まれたコンテンツのライブラリに基づいて構築された可能性があるという暴露です。
NvidiaのAI学習データはどのようにしてシャドーライブラリから調達されたか
集団訴訟の核心は、Nvidiaが単にインターネットをパッシブにスクレイピングしただけではないと主張している点です。彼らは積極的に海賊版コンテンツを探し出したのです。訴状によると、Nvidiaのデータ戦略チームは、「The Pile」の一部である「Books3」データセットやその他のコレクションをトレント経由でダウンロードするのは遅すぎると判断しました。
プロセスを迅速化するため、Nvidiaの担当者はAnna's Archiveの管理者に電子メールを送ったと報じられています。彼らの目標は、推定500テラバイトを超えるデータライブラリの巨大なカタログをダウンロードするための、直接的で高帯域幅のパイプを交渉することでした。
経営陣からの「ゴーサイン」
原告が提示した最も損害の大きい証拠は、社内メールのスレッドです。ジュニアエンジニアがAnna's Archiveからのデータが著作権侵害の可能性が高いという懸念を表明した際、Nvidiaの経営陣は警告を却下したとされています。提出書類によると、マネージャーは1週間以内に「ゴーサイン」を出し、チームにインジェストを進めるよう指示したとのことです。
このデータはその後、NeMo、Retro-48B、InstructRetroなどのモデルをトレーニングするために使用されました。「Books3」、「Sci-Hub」、「Library Genesis (LibGen)」などのデータセットを組み込むことで、NvidiaのAI学習データは、世界で最も悪名高い海賊版ハブと切り離せないものとなりました。
「フェアユース」の弁護と統計的議論

Nvidiaの防御戦略は、「フェアユース」の特定の解釈にかかっています。彼らは、AIモデルは、伝統的な意味で本を「コピー」していないと主張しています。むしろ、AIは単語間の統計的相関関係を抽出すると主張しています。
同社は、モデルが本のテキストファイルを保存するのではなく、言語パターンの数学的表現を保存しているため、著作権侵害は発生していないと提唱しています。彼らはこれを、学生が書き方を学ぶために図書館の本を読むことに例えています。学生はその本を所有していませんが、そこから学んだスキルは所有しています。
「スクラップヤード・ボーイング」の反論
批評家やオンラインユーザーは、この論理を攻撃しています。Nvidiaの「統計的相関」の防御を、スクラップヤードを吹き抜けるハリケーンがボーイング747を組み立てることに例える、一般的な反論があります。出力が新しいからといって、あるいはプロセスが自動化されているからといって、部品の由来を否定するものではありません。
もし「統計的」な議論が法廷で認められれば、著作権は人間の消費にのみ適用されるという前例が確立され、事実上、著者は自分の作品の機械可読版に対する権利を剥奪されることになります。
NvidiaのAIトレーニングデータ慣行の倫理を検証する
テクノロジーコミュニティの反応は、法的定義を超えています。個人と企業の間で法律の適用方法が異なることに対して、明白な不公平感が存在します。
アーロン・シュワルツの並行
訴訟をめぐる議論では、アーロン・シュワルツの記憶が頻繁に呼び起こされます。Redditの共同創設者であるシュワルツは、JSTORから学術論文を大量にダウンロードした罪で、懲役35年と数百万ドルの罰金に直面しました。彼は連邦検察官に執拗に追われ、その闘いが彼の自殺の一因となりました。
その対比は鮮明です。シュワルツは学術論文を公開アクセス目的でダウンロードしましたが、Nvidiaは商業的利益のために数百万冊の海賊版書籍をダウンロードしたとされています。しかし、シュワルツが重罪で起訴されたのに対し、Nvidiaは潜在的な罰金を事業運営コストと見なしています。このダブルスタンダードが、に対する世間の反発を煽っています。どのようにNvidia AI学習データが買収されました。
「オープンソース」という誤称
さらに倫理的な状況を複雑にしているのは、Nvidiaの用語です。同社はNeMoのようなモデルを「オープンモデルライセンス」の下でリリースしていますが、これは多くの人が「オープンソース」と混同しています。
オープンソースイニシアチブ(OSI)は、オープンソースを構成するものについて厳格な定義を持っています。Nvidiaのライセンスは、商用利用や再配布権の変更を制限することが多く、これは公開された重みを持つプロプライエタリモデルを意味します。「オープン」という名称を使用することで、Nvidiaはオープンソースソフトウェアに関連付けられたコミュニティの好意から利益を得る一方で、企業管理を維持し、責任を軽減しています。
AI時代の著作権の未来

Nazemian v. Nvidia の訴訟は、ロイヤリティをめぐる紛争以上のものです。それは、自動化された経済における人間の創造の価値に対する信任投票です。
著者やクリエイターは、「拒否権」またはAIトレーニングのための標準化されたロイヤリティモデルを要求しています。現在の「オプトアウト」システムは、しばしば複雑または非効果的であり、クリエイターは数十億ドル規模の企業といたちごっこをしなければなりません。Nvidiaが責任を問われる場合、AI業界はシステムからペタバイト級のNvidia AI training data を削除することを余儀なくされ、現在の世代のモデルを事実上無力化する可能性があります。
逆に、Nvidiaが勝訴した場合、デジタル化された人間の知識は、企業による抽出のために自由に利用できる原材料であるという概念が確立されます。その結果は、道徳的に正しい方が決定されるのではなく、裁判所が小説や海賊版PDFを「読むべき本」と見なすか、「分析すべき統計」と見なすかによって決まるでしょう。
FAQ: Nvidia AI Training Data and Legal Risks
Q: なぜNvidiaは特にAnna’s Archiveに連絡したのですか?
A: Nvidiaは、サイトのデータベースへの「高速アクセス」を求めていました。標準的な公開トレント経由で数百万冊の本をダウンロードするのは非常に遅いため、Nvidiaはモデルトレーニングを迅速化するために直接データ転送を交渉しようとしました。
Q: NeMoモデルを使用すると、開発者は法的なリスクを負うことになりますか?
A: 可能性はあります。もし裁判所が、NeMoに使用された「Nvidia AIトレーニングデータ」が違法に入手されたと判断した場合、そこから派生したモデルは「毒樹の果実」法理に基づく異議申し立ての対象となる可能性がありますが、個々の開発者に対する執行は稀です。Nvidia AIトレーニングデータA: 可能性はあります。もし裁判所が、Nvidia AIトレーニングデータに使用された「Nvidia AIトレーニングデータ」が違法に入手されたと判断した場合、そこから派生したモデルは「毒樹の果実」法理に基づく異議申し立ての対象となる可能性がありますが、個々の開発者に対する執行は稀です。
Q: Nvidiaは海賊版書籍の使用についてどのように弁護していますか?
A: Nvidiaは「フェアユース」を主張しており、自社のAIは書籍の表現内容を「コピー」するのではなく、言語パターンを理解するための統計的相関関係を分析しているだけであり、これは侵害ではないと主張しています。Nvidiaは「フェアユース」を主張しており、自社のAIは書籍の表現内容を「コピー」するのではなく、言語パターンを理解するための統計的相関関係を分析しているだけであり、これは侵害ではないと主張しています。
Q: Nvidiaのライセンスと真のオープンソースの違いは何ですか?
A: Nvidiaはカスタムの「オープンモデル」ライセンスを使用しており、多くの場合、商用利用を禁止したり、特定の制限を課したりしています。OSIによって定義される真のオープンソースソフトウェアは、あらゆる分野に対する差別なしに、自由な使用、変更、再配布を許可します。
Q: アンナのアーカイブ以外に、訴訟に関与しているデータセットは何ですか?
A: 訴訟では、The Pile、Books3、Sci-Hub、Library Genesis (LibGen)、Z-Libraryの使用が引用されています。これらはすべて、Nvidiaのトレーニングパイプラインに取り込まれた著作権で保護された素材を含む大規模なリポジトリです。


