OpenAIのウェブスクレイピングが露呈させた、Microsoftが隠しきれなかった対立
OpenAIのウェブスクレイピングは、最も近しい企業パートナーの内部から、深刻な矛盾を突きつけられている。Microsoftのある幹部は、この慣行を「人類史上最大の労働の窃盗」と呼んだと報じられている。
この発言は、AI業界の外部から抗議する批判者によるものではなかった。Microsoftの応用科学担当ディレクターであるBrent Hechtが、2023年1月の社内メモにそう記したと報じられている。MicrosoftはOpenAIに投資し、Copilotを含む製品群に同社のモデルを統合している。
著作権訴訟で開示された資料により、この非公開の警告が公の場に持ち出された。文書は、MicrosoftとOpenAIの従業員が、AI製品が学習素材を提供する出版社を弱体化させ得ることを理解していた可能性を示している。
この証拠は、モデル学習が米国著作権法におけるフェアユースに該当するかどうかを決着させるものではない。しかし、OpenAIとMicrosoftが直面する核心的な対立をより鮮明にしている。両社は学習を変形的利用だと説明する一方、従業員らは、その結果として生まれる製品がジャーナリズムを代替し、その経済基盤を損なうと懸念していたとされる。
開示資料が示す出来事
今回の展開は、OpenAIが記事をコピーしたという新たな申し立てにとどまらない。両社の内部関係者が、その結果生じる対立を認識していたことを示す証拠でもある。
この資料は、The New York Timesなどの出版社が関わる統合著作権訴訟から明らかになった。Timesは2023年12月、MicrosoftとOpenAIを連邦裁判所に提訴した。
出版社側は、両社が著作権で保護された記事をコピーし、学習用データセットと商用AI製品を作成したと主張している。OpenAIとMicrosoftは、自らの利用は変形的であり、フェアユースによって保護されると主張している。
今回明らかになった文書は、この対立に社内コミュニケーション、証言録取の証言、報じられたデータセットの数値を加えるものだ。ただし重要な制約も残る。情報の多くは出版社側の略式判決申立書を通じて示されており、元となる証拠の一部は封印されたままであるようだ。
つまり、読者が目にしているのは、進行中の訴訟において一方の当事者が選択し提示した引用である。発言は重大だが、その前後を含む議論の全体像が常に利用可能とは限らない。
OpenAI scraping reportによると、Hechtは、大規模モデルが並外れた規模で人間の仕事を取り込んでいると警告した。他の報道では、彼の表現を「前例のない規模の驚くべき窃盗」として伝えている。
Hechtは、何百万人もの人々が、モデルが自分たちの仕事を「吸い上げている」ことを窃盗と見なすだろうと書いたとされる。さらに、この慣行を「人類史上最大の労働の窃盗」となる可能性があるものと表現したという。
この表現は意図的に大仰であり、歴史的な比較としては議論の余地がある。ここで重要なのは、この比較を慎重な歴史的判断として受け入れることではなく、誰が用いたとされる表現なのかという点だ。
Hechtは、OpenAIにとって最も重要な技術・商業パートナーであるMicrosoftの内部で働いていた。彼の警告は、倫理的・経済的な反論が出版社、著者、外部研究者だけに限られていなかったことを示唆する。
Microsoftは、この結論から距離を置こうとしている。広報担当者はAFPに対し、HechtのコメントはMicrosoftの立場ではなく、1人の従業員の個人的な見解を表したものだと述べた。
提出書類では、スクレイピングされたニュース記事が1,000万件を超えるとされる。その約3分の1はThe New York Times由来だったと、AFP報道に基づくarticle-copying accountは伝えている。
別の数値は、中間学習用データセットに関するものだ。これは、初期開発後もモデルの学習を継続するために使われるコレクションを指す。これらのデータセットには、Times、Daily News、Center for Investigative Reportingの作品が91,692件含まれていたとされる。
Common Crawl由来のデータセットには、nytimes.comの文書が200万件以上含まれていたとされる。Common Crawlは、公開ウェブの大部分を定期的に収集する非営利アーカイブだ。
出版社側は、MicrosoftがProject TaxiおよびProject Mangoと呼ばれる取り組みを通じてOpenAIに素材を提供したとも主張している。Project Mangoは、訴訟に関わるニュース組織が所有する少なくとも160,903件のユニークな作品を含むデータセットを生成したとされる。
主張は、公開アクセス可能なページの収集にとどまらない。提出書類は、Timesのペイウォールを回避する方法を説明したOpenAI従業員の発言を引用しているとされる。OpenAI社長のGreg Brockmanは、それに「ah nice」と答えたとされる。
アクセス制限は法的分析と事実認定の双方に影響し得るため、このやり取りは厳しく精査されるだろう。誰でも閲覧可能なページをコピーすることと、ペイウォールを回避することは、同一の問題を生じさせるわけではない。
提出書類はまた、一部のデータセット準備の過程で、情報がモデルに届く前に著作権表示が削除されたと主張している。OpenAIは、これらの慣行が侵害を立証することを認めておらず、引用されたやり取りには完全な文脈が必要だ。
それでも、これらの詳細は論争の性質を変える。この事件はもはや、出版社が自社の作品がChatGPTにどのように到達したかを推測する構図だけではない。
提出書類は、内部知識、技術的な取得手法、商業上の懸念について報じられた見解を提示している。これらの論点は、裁判所が目的、市場への影響、双方の主張の信頼性を評価する際に影響し得る。
OpenAIのウェブスクレイピングがフェアユースの試金石となった理由
OpenAIのウェブスクレイピングが法的に重要なのは、同じコンテンツが、ユーザーを出版社へ戻すことなく回答できる製品の構築に利用されたとされるためだ。
フェアユースは、著作権で保護された作品の無許諾利用の一部を認める。裁判所は一般に、利用目的、原作品の性質、コピーされた量、潜在的市場への影響を検討する。
どの事件でも、単一の要素が結論を決めるわけではない。分析は、具体的な作品、コピー方法、出力、市場に左右される。
OpenAIは、モデル学習がソース素材を、新たな応答を生成するための統計的表現へと変換すると主張している。また、ニュース報道に含まれる事実そのものは著作権で保護されないとも主張している。
出版社側は、訴訟が対象としているのは事実の所有権ではなく、保護された表現だと反論する。OpenAIが完全な記事を大規模にコピーし、同じ読者をめぐって競合する製品を構築したと主張している。
近年のAI著作権判決は、開発者側に一定の有力な根拠を与えている。カリフォルニア州の裁判所は、書籍をモデル学習に利用する一部のケースを変形的利用と扱ってきたが、事案の事実関係や残る請求は異なっていた。
OpenAIは防御において、こうした判断を引用している。Timesは、ChatGPTとCopilotが出版社の出力に似た最新情報を提供できるため、この争いでは市場代替を示す記録がより強いと主張している。
この違いが、社内発言をとりわけ重要なものにしている。OpenAIでChatGPT部門を率いるNick Turleyは、同社製品が「大部分において代替的」だと書いたとされる。
品質が向上するにつれ、製品はより代替的になると予測したという。Turleyはまた、AI製品を出版社に対する「存在論的脅威」と表現したとされる。
Microsoft CEOのSatya Nadellaは、証言録取の際、チャットボットとの会話が元のウェブサイトへの訪問の一部を置き換えたことを認めたと報じられている。これだけで法的に認められる市場被害が自動的に立証されるわけではないが、出版社側の事実上の理論を支えるものではある。
Microsoftの内部測定は、さらに重要になる可能性がある。提出書類によれば、Copilotの回答エンジンは、従来のBing検索と比べてTimesドメインへのクリック率を最大93%低下させたとされる。
クリック率は、ユーザーが表示されたリンクをたどる頻度を測る指標だ。その低下は、広告表示、購読、ブランド認知、読者との直接的な関係構築の能力を弱める可能性がある。
この数値は慎重に扱う必要がある。訴訟資料に基づくものであり、その方法論は公の場で十分に検証されていない。すべてのCopilotトラフィックではなく、特定の検索クエリ、インターフェース設計、測定期間を反映している可能性がある。
それでも、この事件の核心にある問いを示している。AIによる回答は新しいツールを生み出すのか、それとも、その回答を生み出すために利用された報道の市場を置き換えるのか。
Microsoftの社内プレゼンテーションは、この状況を「doom loop」と表現したとされる。AIの回答が出版社へのトラフィックを減らせば、出版社の収益は減少する。収益の低下は、記者数の減少と独自記事の減少につながる。
その結果、将来のモデルが吸収できる信頼性の高い素材も減る。AIサービスは、その品質が依存する情報供給を弱体化させ得る。
この懸念は、多額の人的コストを必要とする報道において特に深刻だ。調査報道、裁判報道、海外報道、地方行政を扱うジャーナリズムは、既存テキストだけから生成できるものではない。
誰かが審理に出席し、文書を検証し、情報源に取材し、掲載の責任を負わなければならない。モデルは、そうした仕事が公開された後に圧縮できるが、圧縮がその創出に資金を提供するわけではない。
両当事者が略式判決による争点解決をSidney Stein連邦地方裁判所判事に求めたことで、事件は決定的な局面に入った。略式判決は、陪審を必要とする重要な事実上の争いがない場合、裁判を経ずに請求を判断できる制度だ。
AI copyright case reviewは、Stein判事が主要な部分を裁判へ進めるべきか判断すると見込まれていると報じた。最終判断がすぐに出るとは見込まれていない。
米司法省は、科学技術の進歩、経済成長、国家安全保障を強調し、学習に関するOpenAIの立場を支持している。この介入は、論争が1社の出版社をはるかに超える範囲に及んでいることを示している。
モデル開発者に不利な広範な判断は、学習コーパスの構築コストを引き上げる可能性がある。開発者に有利な広範な判断は、商用モデルがアーカイブを利用する方法に対する出版社の統制を大きく弱める可能性がある。
MicrosoftとOpenAIは自らの言葉に直面している
主な対立は、公の場でのフェアユース擁護と、AIシステムが不可欠なコンテンツ供給者を代替し得るという非公開の警告との間にある。
OpenAIとMicrosoftは、自社技術が既存のあらゆる市場に一切影響を与えないことを証明する必要はない。変形的な製品はしばしば産業を変え、市場の混乱だけで著作権侵害が成立するわけではない。
両社にとってより困難なのは、より限定的な問題だ。社内発言は、代替、紹介トラフィックの減少、出版社経済の悪化、将来的なコンテンツ品質の低下を予見していたとされる。
こうした懸念は、出版社側の主張の要素に似ている。また、有害な市場影響を推測的または遠いものとして描こうとする両社の試みを複雑にする。
Microsoftのある文書は、最終製品が不可欠な供給者の経済的基盤を脅かすことはめったにないと指摘したとされる。そのうえでMicrosoftは、大規模言語モデルを支えるコンテンツ供給網に対し、まさにその状況を生み出したと述べたという。
大規模言語モデル、すなわちLLMは、学習中に得たパターンからテキストを予測・生成する。「コンテンツ供給網」には、データセットや検索システムに組み込まれる素材を作り出す人々や組織が含まれる。
この枠組みは、ジャーナリズムをAI開発への入力として扱う。同時に、その入力が自動的に生まれるものではないことも認識している。
出版社は記者、写真家、編集者、デザイナー、弁護士、技術チームを雇用している。情報公開請求、取材旅行、情報源の開拓、ファクトチェック、訂正に資金を投じている。
ChatGPTは、情報をそれを取り巻く出版体験から切り離すことができる。ユーザーは、取材のプロセス、広告、購読の案内、情報源との関係を必ずしも目にすることなく、統合された回答を受け取る。
読者にとって、その利便性こそが製品である。出版社にとっては、同じ利便性が、取材が経済的価値を生む瞬間を奪いかねない。
有料記事が学習に取り込まれると、緊張関係はいっそう先鋭化する。報道によれば、Nadellaは、グラウンディングや学習に有料情報を使う者はライセンスを取得すべきだと証言した。
グラウンディングとは、回答を裏付けるために外部情報をモデルへ提供することを指す。ユーザーが質問した際に情報を取得できるため、学習とは異なる。
報道によれば、Nadellaは、OpenAIがペイウォールの背後にある素材で学習していたと知っていれば、再学習を求めるMicrosoftの権利を行使していただろうと述べた。この発言は、彼がそうした複製が行われたと認識していたことを証明するものではない。
ただし、Microsoftの最高経営責任者が重要と考えていた区別を示している。支払いとアクセス制御によって保護される素材には、商業利用にはライセンスが必要だという、より明確な期待が伴う。
ChatGPTの公開以降、OpenAIは多数の出版社とライセンス契約を進めてきた。The Associated Press、Axel Springer、News Corpなどの組織は、さまざまなコンテンツ契約を発表している。
これらの契約は、相反する二つの解釈を支える。OpenAIは、ライセンス取得は過去の行為を認めたものではなく、持続可能な提携を構築するための将来志向の取り組みだと主張できる。
出版社側は、これらの契約が機能するライセンス市場を示していると主張できる。同等のコンテンツにライセンス可能な価値があるなら、無断複製は抽象的な技術プロセスとは見えにくくなる。
業界は一つのアプローチに収束していない。アーカイブをライセンスする出版社もあれば、AIクローラーを遮断する出版社、提訴する出版社もある。製品や時期に応じて、三つすべての戦略を用いる企業も少なくない。
こうして生まれた市場は、交渉力のある企業に有利に働く。大手国際出版社は、報酬、製品内での扱い、帰属表示の条件を交渉できる。
小規模な地域ニュースルームには、それほどの交渉力はない。それでも、その報道には、特に緊急事態や地域政治をめぐる対立の際、回答エンジンにとって価値ある独自の事実が含まれうる。
この不均衡は、訴訟がTimesを超えて拡大した理由の一端を説明する。より広い原告グループには、全国紙、専門誌、調査報道機関、地域ニュース組織が含まれる。
連邦判事は2025年、中心的な著作権請求の継続を認めた。以前の裁判所判断は一部の請求を退けたが、複製とモデル開発をめぐる主要な争点は維持した。
OpenAIは退けられた請求を歓迎し、公に利用可能なデータをフェアユースに基づく形で用いてモデルを構築していると述べた。Microsoftはその判断へのコメントを控えた。
公に利用できることと、許可があることの区別は未解決のままだ。作品をオンラインで読めるからといって、あらゆる形態の複製が合法になるとは限らない。
同時に、著作権は出版社に事実や通常の学習を支配する権利を与えるものでもない。裁判所は、計算機による学習がこれらの確立した原則のどこに位置するかを判断しなければならない。
提出書面はダメージを与えるが、評決ではない
内部文書の表現は出版社側の主張を強めるが、それだけで侵害、損害、フェアユースを決定するものではない。
最も劇的な引用は、司法判断ではなくMicrosoft従業員の発言に由来する。社内メモである活動を「窃盗」と呼んだからといって、それが著作権侵害の法的要件を満たすかどうかは決まらない。
従業員はしばしば、法的分析とは異なる道徳的、戦略的、あるいは修辞的な表現を用いる。裁判所は、ある一人の語彙を支配的な法として扱うのではなく、行為と証拠を検討する。
Microsoftはすでに、Hechtのコメントを個人的見解と表現することで、この点を強調している。同社はまた、社内での議論は不正行為の認識ではなく、責任あるリスク分析を示すものだと主張できる。
企業は日常的に、従業員に最悪の結果を特定するよう求める。リスクに関するメモに率直な警告が含まれるのは、意思決定者が潜在的な害を明確に述べることを望むからこそである。
そのため、証拠資料全体が重要になる。前後のメッセージ、受信者、回答がなければ、経営陣が各警告を受け入れたのか、退けたのか、調査したのかを読者は知ることができない。
出版社側の準備書面には、主張を訴える機能もある。その弁護士は申し立てを前進させる証拠を選び、その法理論に沿って証拠を整理した。
OpenAIとMicrosoftは、同じ記録を異なる形で解釈するだろう。両社は引用の意味、トラフィック数値の代表性、AIの回答と出版社の損失との因果関係に異議を唱えられる。
また、学習と製品出力を一つの行為として扱うべきではないとも主張できる。モデルは作品をユーザー向けに再現することなく、その作品で学習できる。
逆に、製品はライセンス済み、パブリックドメイン、または別途取得した情報を使い、代替となる回答を生成できる。裁判所は、異なるデータセット、モデル、機能をそれぞれ独立して評価する必要があるかもしれない。
報じられた1,000万本の記事という数字にも、正確な理解が必要だ。データセットに記事が存在することは、その記事がモデルの振る舞いにどれほど影響したかを示さない。
また、複製された文書が保存された記事として必ず復元できるわけでもない。モデルは通常、一般的な検索可能アーカイブのように機能するのではなく、学習した統計的関係を符号化している。
それでも、記憶化は起こりうる。特に素材が学習データ内に繰り返し現れた場合や、プロンプトがその抽出を意図して設計された場合、モデルが識別可能な文章を再現した例はある。
出版社側は、こうした出力が複製を露呈させ、原作品と競合すると主張する。OpenAIは、非典型的なプロンプトや孤立した例は通常の製品利用を代表するものではないと主張する。
この事実認定上の対立は重要だ。市場代替は、単に誰かがChatGPTを好むかという問題ではない。裁判所は、争われている利用が、著作権で保護される既存または合理的に見込まれる潜在的市場を害するかどうかを検討する。
報じられたクリック率の93%低下は関連性がありそうだが、その数字だけでは答えにならない。比較では、検索クエリの種類、結果の表示方法、引用、ユーザーの意図を考慮しなければならない。
特定のTimes記事を探すナビゲーショナル検索は、天気の概要を求める一般的な依頼とは異なる。前者は出版社を探しているが、後者は多くの情報源が提供できる情報を求めている。
「労働の最大の窃盗」という表現も、法的争点から注意をそらしかねない。その歴史的規模は、どちらの側も勝訴に必要としない感情的な議論を招く。
より有用な問いは、何が、どのようなアクセス条件のもとで、どのような商業目的のために複製され、どのような測定可能な影響をもたらしたかである。これらの問いは、技術的プロセスを著作権法理へと結び付ける。
読者は、OpenAIによるウェブスクレイピングを、AI支援検索のあらゆる形態と混同しないようにすべきだ。学習、ライブ取得、インデックス化、キャッシュ、要約、逐語的再現は、それぞれ異なる操作である。
それぞれに異なる許可や製品上の選択が関わりうる。これらを一つの区別されない慣行として扱うと、実行可能なルールを特定しにくくなる。
ナレッジワーカーにとって、この論争は実務的な警告を含む。オンラインに置かれた素材は、後から監査することが難しいデータセット、インデックス、回答システムを通じて流通しうる。
追跡可能なパーソナルナレッジベースを維持しても、外部からのスクレイピングは防げない。しかし、AI生成の要約が情報の出所を曖昧にする際、情報源、著者性、文脈を保全できる。
同じ規律は企業内でも重要である。AIツールを導入するチームは、生成された主張を裏付ける情報源と、それらの情報源に適用されるライセンスを文書化すべきだ。
この要件は、訴訟回避だけを目的とするものではない。プロヴナンスは、ユーザーが原証拠とモデル生成の統合物を区別する助けとなる。
OpenAIスクレイピング訴訟で次に起きること
これらの開示が法的結果、ライセンス市場、AI回答製品の設計を変えるかどうかは、三つの兆候によって示される。
第一の兆候は、Stein判事による略式判決の判断だ。この判断は、現時点で決定できる争点と、裁判を必要とする争点を定める。
裁判所が出版社側の主張の主要部分を受け入れれば、代替性とペイウォールに関する内部証拠はより重要になる。裁判では、追加の証拠資料や証言が公の精査にさらされる可能性がある。
裁判所がOpenAIとMicrosoftに広範な保護を認めれば、これらの開示は出版社が望む法的転換をもたらさないまま、評判上のダメージとして残る。その結果は、他のモデル開発者のフェアユースの立場を強めるだろう。
分割的な判断もありうる。判事は、アクセス可能なページでの学習と、ペイウォールの回避、特定の出力、特定のMicrosoftデータプログラムを区別する可能性がある。
そうした区別は、単純な勝者ラベルよりも重要だ。収集、学習、取得、生成回答にそれぞれ異なるルールを定める可能性がある。
第二の兆候は、最終判決前にライセンス慣行がどのように変化するかだ。OpenAIはすでに、一定の状況では出版社と交渉する意向を示している。
契約が過去の学習、ライブ取得、モデルの引用、収益分配、あるいはその四つすべてを対象とし始めるか注目すべきだ。各条件は、この対立の異なる部分に対応する。
過去の学習に関するライセンスは、過去のデータセット利用に価値を割り当てる。取得に関する契約は、回答に最新情報が必要な場合の現在のアクセスを規律する。
引用条項は、ユーザーが原情報源をどれほど明確に見るかを定める。収益の取り決めは、出版社の報道が商業的な回答を支える場合に、出版社が参加するかどうかを扱う。
決定的な問いは、小規模な媒体が同様の市場へアクセスできるかどうかだ。最大手の出版社だけを対象とするライセンス制度では、根本的な供給問題は解決されない。
包括ライセンスや標準化された機械可読の条件は、参加の裾野を広げうる。ただし、その制度には依然として透明な会計と、どのコンテンツがどのサービスに影響したかを特定する方法が必要となる。
第三の兆候は製品の振る舞いだ。MicrosoftとOpenAIは、裁判所を待たずとも、回答システムが注意をどこへ向けるかを変えることで対応できる。
目立つリンクだけでは問題を解決できないかもしれない。報道によれば、OpenAIのエンジニアの一人は、配置にかかわらずユーザーがリンクをたどらない可能性を認めた。
より適切な試金石は、測定可能な紹介の質である。出版社に必要なのは、完全な代替回答の下に置かれた引用だけではなく、関与し、購読し、情報源を認識する読者だ。
AI企業は、クエリが特定の保護対象記事を求める場合、要約を制限できる。また、インターフェース上で、ライセンス済みの取得と一般的なモデル知識を区別することもできる。
一方で出版社は、技術的障壁と法的請求の検証を続けるだろう。クローラー制御、ペイウォール、キャッシュされたページ、検索インデックスを通じて提供されるコンテンツをめぐる紛争の増加が予想される。
より広い業界は、独自報道を単なる原材料の一つとして扱うのか、それとも継続的な投資を必要とするサービスとして扱うのかを決めなければならない。Microsoft内部の「doom loop」警告は、その選択を無視しにくくしている。
開発者にとって、この訴訟は今すぐデータガバナンスに影響を与えるべきだ。技術的にアクセス可能な文書が、契約、著作権、評判上のリスクから自動的に解放されるわけではない。
企業の購入担当者にとって、データの来歴は製品要件とすべきだ。回答が学習時の記憶、ライブ検索、ライセンス取得済みデータベース、あるいは顧客が管理する文書のどれに基づくのかをベンダーに尋ねるべきである。
出版社にとって、最終判断を待つことにもコストが伴う。AIインターフェースが流入、購読、読者行動をどう変えるのかを示す証拠が必要だ。
ユーザーにとって、利便性は依然として現実のものだ。チャットボットは情報を素早く統合し、難しいテーマへの入り口をわかりやすくできる。
責任ある対応とは、統合がそれ自体で証拠を生み出すかのように装うことではない。正確さ、支払い、説明責任が重要な場面では、読者は一次情報源を開くべきだ。
OpenAIによるウェブスクレイピングは、もはや単一のモデルがどのようにテキストを取得したかをめぐる争いにとどまらない。AI企業が報道に依存しながら、その資金源となる注目を奪うことができるのかを問う試金石となっている。
裁判所が法的な主張を判断する。出版社、開発者、ユーザーは、それらのシステムを支える情報経済が、その成功を経ても存続できるかを決めることになる。
次にAIの回答が情報源への訪問に取って代わるとき、実務的な問いを一つ投げかけてほしい。元の報道に資金を提供したのは誰であり、その組織は次の物語にも資金を出し続けられるのだろうか。



