Metaが5つの出版社から訴えられた。Zuckerbergが個人として名指しされた。
更新日:6月16日
5月5日、世界最大級の出版社5社であるElsevier、Cengage、Hachette、Macmillan、McGraw Hillが、マンハッタンの連邦裁判所に出廷し、Metaに対して集団訴訟を提起した。彼らは、ベストセラー作家で元連邦検事のScott Turowとともにこれに加わった。訴状は法人である同社だけでなく、Presumed Innocentの著者である同氏を個人としても被告に名指しし、Mark Zuckerbergが数百万冊の海賊版書籍を同社のLlama AI modelsの訓練に意図的に使用するよう指示したと非難している。
出版社側の主張は、Metaが公開ウェブから書籍をスクレイピングしたり、フェアユース理論に基づいて公開テキストで訓練したりしたというものではない。長年法執行機関の標的となってきた海賊版サイトやシャドーライブラリから既知の違法データセットを意図的に取得し、使用したという点にある。訴状ではこれを「著作権侵害史上最大級のものの一つ」と表現している。Metaはまだ正式な回答を提出していない。
ここ2年間、自社AIをOpenAIやGoogleのプロプライエタリモデルに対するオープンソースの代替として位置づけてきた同社にとって、この訴訟は極めて的確に核心を突くものとなった。ZuckerbergがLlamaについて公に語ってきたのは、民主化、透明性、オープンウェイトモデルの道徳的優位性だった。しかし出版社側の訴状は別の問いを投げかけている。盗まれた書籍の上に構築されたモデルは、どれほどオープンと言えるのか、と。
What Happened:5つの出版社、1つの訴訟、CEO個人の被告指名
この訴状は2026年5月5日、Association of American Publishers (AAP)が5社の加盟出版社およびTurow(個人著作権者として、また自社S.C.R.I.B.E.を通じて参加)を代表して、ニューヨーク南部地区裁判所に提出した。法的手段は集団訴訟の申し立てであり、原告らは自分たちだけでなく、MetaのLLMファミリーの訓練に無許可で使用されたと主張するすべての著者・出版社を代表しようとしている。
具体的な主張は、Metaが「違法な海賊版サイトから意図的に訓練データを調達した」というものだ。この表現は意図的である。The New York Times対OpenAI訴訟など、過去のAI著作権訴訟では、著作権保護された資料での訓練がフェアユースに該当するかどうかが焦点だった。Metaのケースでは「故意性」という異なる要素が導入されている。出版社側は、Metaが公開ウェブをスクレイピングする過程で偶発的に著作権物を摂取したと主張しているのではなく、違法であると知りながらそのサイトに赴き、著作権物を入手して商業製品の構築に使用したと主張している。これが立証されれば、法的枠組みはフェアユースから故意侵害へ移行し、侵害作品1件あたり最大15万ドルの法定損害賠償の対象となり得る。
Zuckerbergを個人として名指ししたことは、さらなる法的圧力を加える。企業訴訟でCEOを個人被告とするのは比較的珍しく、原告側が直接的な関与と指示の証拠を有していると信じていることを示している。訴状はZuckerbergを、AIを訓練する組織をたまたま監督していた経営者ではなく、合法性に関わらず入手可能なあらゆるデータを使用する決定を自ら主導した人物として描いている。AAPのpress releaseはこの選択を明示的に強調し、「Metaおよびその創業者兼CEOであるMark Zuckerberg」を被告として提訴したと述べている。
Scott Turowの関与は、この訴訟にさらなる次元を与えている。Turowは単なる著名原告ではない。ハーバード・ロースクール卒の元連邦検事補で、3000万部以上を売り上げたリーガルサスペンスの著者である。彼の名が訴状に記載されていることは、原告側がこれを単なる商業的損害ではなく、法の支配に関する訴訟として位置づける意図を示している。NPRが報じたTurowの発言は、その主張を明確にしている。「この訴訟の中心にある原則は新しいものではない。他人の作品を許可なく利用することは、印刷機であれニューラルネットワークであれ、間違っている。」
Why It Matters:オープンソースの物語が抱えるサプライチェーンの問題
MetaはLlamaをAI分野における倫理的代替として位置づけることに多額の投資をしてきた。Meta Connect 2025でZuckerbergは、オープンウェイトモデルは訓練データと重みが検査可能であるため、クローズドモデルよりも安全だと主張した。Llama 5の2026年4月リリースに向けた同社のメッセージは、このテーマをさらに強調した。Metaは、プロプライエタリAPIを購入できない開発者、研究者、スタートアップにAIをもたらす企業だというものだ。この物語においてオープンソースは、単なる技術戦略ではなく道徳的選択でもあった。
この訴訟は、明白でありながら見過ごされてきた緊張を露呈している。オープンウェイトモデルは重みを公開するが、データは公開しない。開発者はLlamaのモデルファイルをダウンロードしてすべてのパラメータを検査できるが、それらのパラメータを生成するためにどの書籍・記事・データセットが使用されたかを知ることはできない。重みはオープンだが、訓練データはオープンではない。この非対称性により、Metaは著作権にとって最も重要な点、すなわちそれらの重みにエンコードされた知識がどこから来たのかについて透明性を欠いたまま、透明性を主張することが可能になっていた。
出版社側の主張が正確であり、訴状の「違法な海賊版サイトから意図的に調達した」という表現が立証可能である場合、オープンソースの物語はその基盤から崩壊する。重みは誰でもダウンロードできるが訓練データが違法に取得されたモデルは、オープンソースの成功例ではなく、産業規模のAI copyright infringementである。
Metaを提訴している5社は、決して小規模なプレーヤーではない。Elsevier alone publishes over 2,500 journals and 40,000 books annually. McGraw Hillは世界最大級の教育出版社の一つである。Hachette、Macmillan、Cengageは合わせて毎年数千の商業・学術書を出版している。総じて彼らは、英語圏の書籍市場のかなりの部分を支配しており、大規模言語モデルを流暢で情報豊富かつ商業的に有用にするコンテンツそのものを握っている。もしこれらの出版社が今後AI訓練向けのコンテンツ提供を拒否すれば、次世代モデルの性能は明らかに低下するだろう。
本当の問題、「海賊版サイトから故意に調達された」とは実際何を意味するのか
この訴訟がこれまでのAI著作権訴訟と異なる理由を理解するには、出版社が主張していない点を調べることが役立つ。not主張しているわけではない。彼らはMetaが自社のウェブサイトをスクレイピングしたと主張しているわけではない。Llamaが公開された要約、レビュー、抜粋で学習されたと主張しているわけでもない。彼らが主張しているのは、Metaが著作権侵害の完全な書籍ファイルや論文記事をホストする海賊版サイト、いわゆるシャドウライブラリから、著作物の全文コピーを入手したという点だ。
この区別は法的に重要で、Metaの最も強力な防御であるフェアユースを排除する。In Authors Guild v. Google (2015)において、第二巡回区控訴裁判所は、Google Books向けに数百万冊の書籍をスキャンした行為をフェアユースと判断した。サービスが「スニペット」のみを表示し、原著作物の代替とならなかったためである。NYT v. OpenAI事件では、AIの学習が基礎となるコンテンツの「変容的利用」に該当するかどうかがフェアユースの争点となる。しかし、フェアユースの法理は違法な出所から故意に取得したコンテンツを保護したことはない。最初に盗んだものについてフェアユースを主張することはできない。出版社はAI学習がフェアユースかどうかの判断を裁判所に求めているのではなく、学習が始まる前にMetaが法を破ったかどうかの判断を求めている。
主張される侵害の規模はMetaにとって問題をさらに深刻にする。訴状では「数百万」点の著作物が無許可で使用されたと記述されている。著作権法の下、故意の侵害に対する法定損害賠償は1作品あたり750ドルから15万ドルに及ぶ。仮に100万冊の書籍で最低額の750ドルを適用しても、7億5千万ドルという巨額になる。最高額では数百億ドル規模となり、Metaの時価総額でも投資家が躊躇する数字だ。
これまでのAI著作権訴訟は文脈を提供するが、本件の先例とはならない。NYT v. OpenAIは公開記事の学習がフェアユースかどうかを問う。Getty v. Stability AIは公開画像での画像モデル学習が侵害かどうかを問う。Universal Music v. Anthropicは歌詞の学習が音楽出版社の権利を侵害するかを問う。これらの訴訟はいずれも、被告が違法な出所から学習データを取得したとは主張していない。Metaの事件は初の事例であり、「海賊版サイト」の主張により、フェアユース論争から「Metaが故意に盗品を扱ったかどうか」という単純な問題へと変質した。
Comparison, The AI Copyright Battlefield, 2023-2026
Metaに対する訴訟は、ChatGPT公開以来積み重なってきた紛争の最新のエスカレーションだ。各訴訟はAI学習データをめぐる法的枠組みに新たな層を加えてきた。
The New York Times v. OpenAI and Microsoft (December 2023)がテンプレートを確立した。The TimesはChatGPTが自社記事をほぼそのまま再現し、原著作物の代替となり得ると主張した。OpenAIは公開テキストでの学習は変容的利用であるとしてフェアユースを主張した。発見手続3年目に入った本件は、AI文脈における複製の十分な証拠とは何かをめぐる重要な判断をすでに生んでおり、米国におけるAI学習がフェアユースの対象となるかどうかの最も広範な先例になると見込まれている。法曹関係者は、2026年末から2027年初頭と予想される判決が業界全体を形作ると指摘している。
Getty Images v. Stability AI (2024)は同じ問題を画像生成分野に持ち込んだ。GettyはStable Diffusionが数百万点のGetty画像をライセンスなしで学習し、透かし付きコンテンツのほぼ複製を生成可能であると主張した。Stability AIはモデルが米国外で異なる法的枠組みの下で学習されたと主張したが、本件は視覚メディアを学習する企業すべてに影響を及ぼす。
Universal Music Group et al. v. Anthropic (2024)は歌詞に焦点を当てた。音楽出版社はClaudeが著作権付きの歌詞で学習され、プロンプト次第でそのまま再現可能であると主張した。本件は、歌詞のような短く記憶されやすいコンテンツの学習が、モデルの主目的が歌詞再現でなくとも侵害に該当するかどうかという具体的な問題を提起した。
これらの訴訟を通じた法的戦略は、提起のたびに進化してきた。NYT事件はフェアユースを中心に慎重に構成された。Getty事件は国際的管轄の問題を提起した。Universal Music事件は逐語的再現能力に焦点を当てた。Meta事件の背後にある出版社連合はこれらすべてから学び、異なる道を選んだ。データの使用ではなく取得元に訴状の中心を置くことで、フェアユース論争を完全に回避した。
The Meta case is different in kind, not just degree.これまでの各訴訟は「AI学習がフェアユースか」を裁判所に問う。Meta事件は「被告が学習開始前に犯罪を犯したか」を問う。出版社の法務チームはフェアユースの問題を避け、取得方法に焦点を当てる戦略を選んだ。Metaが海賊版サイトのデータを使用したことを証明でき、訴状の「knowingly」という文言がその証拠を有していることを示唆するなら、フェアユースの結論如何にかかわらずMetaの法的立場は著しく弱まる。
What's Next, The Future of AI Training Data Is on Trial
当面の焦点はMetaの対応だ。同社はまだ答弁書を提出しておらず、その戦略が主張の深刻さを示すことになる。Metaには2つの基本的な選択肢がある。1つは、たとえデータの出所が疑わしくとも、AI学習は十分に変容的で保護されるべきだとフェアユースを主張して争うことだ。ただし訴状の「knowingly sourced」という文言を踏まえると、これは苦しい主張となる。もう1つは和解を目指すことで、出版社とのライセンス契約により、使用したデータに対して遡及的に支払う形になる可能性が高い。
和解は本件を超えて大きな意味を持つ。Metaが支払えば、AI学習データの価格が設定されることになり、5大出版社が他の権利者すべてに支払いを要求する扉を開く。大型モデルの学習におけるデータ取得の経済モデルは、スクレイピングからライセンス中心へと移行する。AI業界にとって、これはNapsterからSpotifyへの転換点、すなわちコンテンツへの無料アクセスが終わり、有料ライセンスが始まる瞬間となる。
Metaが争って敗訴した場合、結果はより深刻だ。故意侵害の認定により、数十億ドル規模の法定損害賠償の道が開かれる。さらに重要なのは、侵害コンテンツで学習されたモデル重みの破棄を命じられる可能性がある。この救済は極端ではあるが、他の知的財産法分野では前例がある。世界で最も価値のあるAIモデルの1つを裁判所が削除するよう命じる事態は前例がないが、著作権法の下では不可能ではない。
より広いAIエコシステムにとって、Meta事件はすでに進行中のトレンドを加速させる。それはAI学習データを「クリーン」と「アン clean」に二分する動きだ。出版社との直接契約、パブリックドメインのコーパス、オプトイン データセットなどにより、適切にライセンスされたデータで学習されたことを証明できる企業は、法的環境の厳格化に伴い競争優位に立つ。一方、それを証明できない企業は、訴訟リスク、風評被害、モデルが法的に有害資産となる可能性に直面することになる。
出版社の訴訟は立法者へのシグナルにもなる。米国はまだ包括的なAI法を制定しておらず、学習データの合法性は個別訴訟で判断されている。裁判所がライセンスなしの著作物学習を侵害と一貫して判断すれば、議会はそれを成文法に落とし込む圧力にさらされる可能性がある。逆にAI企業側が勝訴すれば、出版社は権利を明示的に保護する立法を求めるだろう。いずれにせよMeta事件は、AIが今後どのように構築され、どのように資金提供されるかを決める政治プロセスを加速させている。
Meta訴訟は、ある企業が盗まれた本を使ったかどうかを決定するだけではない。AI業界の原罪、すなわち法的地位に関わらず入手可能なあらゆるデータで訓練するという行為が、法廷との接触に耐えられるかどうかを決定するだろう。出版社は新しい法律を求めているのではない。彼らは既存の法律がまだ適用されるかどうかを問うている。まさにAI knowledge managementツールは、個人や企業が情報を扱う方法を再定義しているが、並行する問いが避けられない。もし私たちがすべてから学ぶAIを構築しているなら、「すべて」に何を含めるかを誰が決めるのか?



