AIスクレイピングがWikipediaのインフラを破壊している:ペイウォール裏の危機
- Aisha Washington

- 6月6日
- 読了時間: 15分
更新日:6月17日

危機の理解:AIスクレイピングとその影響
Wikipediaに何が起きているのか? AIボットがプラットフォームを圧倒
Wikipediaは前例のない危機に直面しています。世界最大の無料知識リポジトリが、これまで予測されていなかった規模でサーバーリソースを消費する自動システムによって枯渇させられています。2025年11月、Wikimedia FoundationはAI企業に対し、プラットフォームを無料データとして扱うのをやめ、公式の「Wikimedia Enterprise API」を通じて支払うよう要求しました。
その数字は衝撃的です。2025年5月から6月にかけて、「Wikipedia上で検出を回避するAIボット」は、人間のように見せかけながら膨大な帯域幅を消費しました。検出システムをアップグレードした後、Wikimedia Foundationは、AIクローラーが最もリソースを大量に消費するトラフィックの65%を占めているにもかかわらず、実際のページビューの35%しか占めていないことを発見しました。一方、人間のトラフィックは「前年比8%減少」しました。
AI企業がWikipediaをスクレイピングする理由
大規模言語モデルには、膨大な量の高品質なトレーニングデータが必要です。Wikipediaのコンテンツは非常に価値があります。すべての記事は正確性を期して編集され、すべての主張には出典があり、すべての項目は厳格な中立性の原則に従っています。対照的に、インターネット上のコンテンツのほとんどは、ゴミ、偏見、誤情報を含んでいます。
OpenAI、Google、Metaなどの企業は、モデルをトレーニングするために体系的にWikipediaをスクレイピングしてきました。その論理は単純です。世界最大の百科事典から無料で抽出できるのに、キュレーションされたデータにお金を払う理由があるでしょうか?
これは、インターネットインフラへのAIの影響を明らかにしています。Wikipediaは、人間が読むために設計されたものであり、人工知能システムによる産業規模のデータハーベスティングのためではありません。
技術的危機:AIボットはどのように検出を回避するか

人間になりすますAIボット
2025年5月と6月、Wikimedia Foundationは衝撃的な事実を発見しました。通常のトラフィックパターンを超えて、異常なデータリクエストの急増がありました。調査により、その真実が明らかになりました:Wikipediaで検出を回避するAIボット人間ユーザーを装うことによって。
これらのボットはIPアドレスを変更し、ユーザーエージェント文字列をローテーションし、セキュリティシステムを回避するために偽装技術を使用します。Wikimedia Foundationは、偽装されたクローラーを特定し、新しい検出アルゴリズムを実装するためだけに、多大なエンジニアリングリソースを投資しました。
WikipediaをスクレイピングするAI公然と行われているだけでなく、欺瞞的に行われています。企業はデータ収集活動を積極的に隠蔽しています。
帯域幅の問題:50%の成長
2024年1月以降、Wikipediaのマルチメディアコンテンツの帯域幅は50%増加しました。この増加のすべては、人間ではなくAIクローラーのトラフィックによるものです。
なぜか? Wikipediaのインフラストラクチャは、異なるコストモデルで運用されています。人気のコンテンツは、世界中の地域のデータセンターにキャッシュされています。キャッシュされたコンテンツへのアクセスは安価です。まれなコンテンツは、高価なコアデータセンターにあります。
人間は選択的に記事を読みます。人気の記事を訪れます。AIクローラーは無差別に、数百万ものページ、ほとんど人間が訪れないようなマイナーなエントリも含めて「一括読み取り」を実行します。これにより、サーバーは高価なコアインフラストラクチャから常にデータを取得しなければならなくなります。ウィキメディア財団は次のように説明しています。「人間の読者は通常特定のトピックに焦点を当てますが、ボットは一括読み取りを実行し、人間がめったに訪れないページを含む大量のページにアクセスすることがよくあります。これは、これらのリクエストがコアデータセンターにルーティングされる可能性が高くなり、リソース消費が大幅に増加することを意味します。」
一部のクローラーは、Wikipediaの内部システム(コードレビュープラットフォームやバグ追跡データベース)にアクセスしようとさえします。これは帯域幅の無駄遣いと潜在的なセキュリティリスクを生み出します。
人間のコスト:ページビューの減少と持続可能性への脅威

Wikipediaのトラフィック危機
ここに不快な現実があります:Wikipediaの人間によるページビューの減少は加速しています。2025年には人間による訪問が前年比8%減少しました。
なぜでしょうか?ウィキメディア財団の最高経営責任者は次のように説明しました。「これは、生成AIやソーシャルメディアが人々の情報検索の方法に影響を与えていることを反映していると考えています。特に、検索エンジンが生成AIを利用して検索者に直接回答を提供するようになるにつれて。」
GoogleのAIサマリーは、検索結果で直接質問に答えます。ユーザーはもはやWikipediaをクリックする必要がなくなりました。若いユーザーは情報源としてソーシャルメディアに移行しています。
資金調達危機
Wikipediaは寄付によって運営され、ボランティア編集者に依存しています。Wikimedia Foundationは次のように警告しました:「Wikipediaへの訪問者数が減少すると、ボランティアが増え、コンテンツを充実させることが少なくなり、個人寄付者がこの活動を支援することが少なくなる可能性があります。」
これは具体的な脅威です。トラフィックが減少すると、潜在的な寄付者はWikipediaの存在を認識しにくくなります。ボランティア編集者は、エンゲージメントの低下を見るとモチベーションを失います。コンテンツの質が低下します。低下は加速します。死のスパイラルが形成されています。
ケーススタディ:チャーリー・カーク銃撃事件がシステムの脆弱性を露呈
速報がインフラを圧倒するとき
2025年9月10日、保守派活動家の チャーリー・カークがユタバレー大学で銃撃され死亡しました。この突然の世界的なニュースは、まさに AIのスクレイピングがウィキペディアのサーバーに与える影響を、危機的な瞬間に示しています。
何百万人もの人々がカーク氏、ターニング・ポイントUSA、そして事件について知るためにウィキペディアに殺到しました。これはウィキペディアのインフラが設計された目的です。システムはこの急増に対応できたはずです。
しかし、実際にはこうなりました。人間がカーク氏の記事にアクセスしている間、AIクローラーは同時に数百の関連記事をスクレイピングしていました。継続的なAIスクレイピングによって生じたベースラインの帯域幅需要は、システムがこの突然の正当なトラフィック急増を吸収する余力をほとんど残さない状態にしていました。
ウィキメディア財団の分析は明らかです。「ベースラインの帯域幅要件は2024年1月から着実に増加しており、減速の兆候は見られません。このベースライン使用量の増加は、例外的なイベントに対応するためのヘッドルームが少なくなっていることを意味します。」
ウィキペディアは通常、速報時にこの人間のトラフィックを管理できましたが、AIボットの負荷が安全マージンを奪い去りました。人間とボットのトラフィックが組み合わさってシステムを圧倒しました。
これは証明しました。AIスクレイピングは単なる金銭的な問題ではなく、サービスの信頼性に関する問題です。プラットフォームは、情報が最も重要となる瞬間に、実際のユーザーにサービスを提供する能力を保証できません。
法的問題:AIによるスクレイピングは合法か?

AIトレーニングにおける著作権とフェアユース
AIが任意のウェブサイトをスクレイピングすることは合法か?その答えは、ますます「許可または支払いなしでは、おそらく違法」となっています。
最近の裁判所の判決は状況を変えています。2025年2月、連邦判事は、AIシステムが元のコンテンツ所有者と競合する場合、許可なく著作物をAIでトレーニングすることはフェアユースではないと判決しました。 Thomson Reuters Enterprise Centre GMBH v. Ross Intelligence Inc.において、裁判所は、フェアユースの主張にもかかわらず、競合するAI製品をトレーニングするために著作物をコピーすることは著作権法に違反すると判断しました。
裁判官の理由は直接的でした。目的は商業的であり、元の作品の市場に損害を与えたのです。Rossはコンテンツを再配布ではなくトレーニングに使用していましたが、裁判所はこれを変容的利用ではないと結論付けました。
Wikipediaのコンテンツは、クリエイティブ・コモンズ(CC-BY-SA)の下で自由にライセンスされていますが、依然として 表示要件 があります。多くのAI企業は、適切な出典表示を行わずにWikipediaをスクレイピングしてきました。これはライセンス条件に違反します。
解決策:Wikimedia Enterprise APIと有料アクセス
AI企業向けのWikipedia有料API
Wikimedia Foundationは、AI企業を outright に禁止するのではなく、公式の Wikimedia Enterprise API を通じた収益化を追求しました。Wikipediaは人間が読む分には完全に無料のままです。
代わりに、大規模アクセス向けのWikimedia Enterpriseプラットフォームremioは、AI企業に高ボリュームのデータアクセスを提供します:
月間リクエスト数制限あり
月2回の更新
基本サポート
無制限のデイリーリクエスト
リアルタイムまたは毎時更新
99%SLA付き優先サポート
隠れた料金はありません
この構造は実用的です。小規模なプロジェクトや学術研究者は引き続きWikipediaのデータを無料で利用できます。商用AI企業や大規模な運用を行う企業は有料アクセスにアップグレードする必要があります。有料プランは以下を保証します:
信頼性の高いアクセス: 有料顧客は優先アクセスと稼働時間の保証を受けられます
安定したサービス: クラッシュなしで予測可能な大量アクセス
法的明確性: 公式な契約により訴訟リスクが軽減されます
帰属サポート: 機械可読なライセンス情報により適切な帰属表示が可能になります
最新のデータ毎日の更新またはリアルタイム更新により、独自のクローラーが不要になります
AI企業にとって、計算は成り立ちます。公式アクセスは、スクレイピングインフラストラクチャを維持するよりもコストがかかりません。彼らは法的リスクを排除します。コストは、信頼性と効率の向上によって正当化されます。
根本的な問い
AI企業はトレーニングデータに料金を支払うべきか?
実践的な答えは、ますます「はい」になっています。法的観点からは、裁判所は、不正なスクレイピングは価値あるコンテンツの著作権法に違反すると判決を下しています。ビジネスの観点からは、データアクセスに料金を支払うことは、スクレイピングインフラストラクチャを維持するよりも安価です。
倫理的な側面もあります。Wikipediaの800万人のボランティア編集者は、検証済みのコンテンツを作成するために数百万時間を投資しました。AI企業は、この労働力を補償なしに数十億ドル規模のモデルのトレーニングに使用しています。
これは持続可能ではありません。ボランティアは搾取されると意欲を失います。品質が低下します。AI企業が依存するリソースが悪化します。
WikipediaはAI開発者にAPIの使用を求めているのはなぜですか?
答えはサバイバルです。ウィキメディア財団は多次元的な危機に直面しています:
インフラ危機: AIによるスクレイピングがサーバーを過負荷にし、サービスの信頼性に問題を引き起こしています
財政危機: 人間のトラフィックの減少は寄付の減少を意味します
コミュニティ危機: 訪問者の減少は潜在的なボランティアの減少を意味します
競争危機: 代替となるAI百科事典が登場しています
公式APIへのアクセスを義務付けることで、財団は以下を実現します:
予測可能な収益: 有料サブスクリプションは持続可能な資金調達を提供します
インフラストラクチャ保護: 公式APIは、管理されていないスクレイピングよりも効率的です
帰属の強制: API応答には機械可読のライセンス情報が含まれます
コミュニティの維持: 持続可能な資金調達は、ボランティアのインフラストラクチャをサポートします
法的位置づけ: 公式な合意は将来の訴訟を減らします
FAQ: AIスクレイピング、Wikipedia、エンタープライズAPIの理解

Q: AIスクレイピングとは具体的に何ですか?通常のウェブサイトへのアクセスとどう違いますか?
A: 通常のウェブサイトへのアクセスは人間が行い、選択的です。人が記事を読み、いくつかのリンクをクリックして離れます。AIスクレイピングは自動化されており、無差別です。クローラーは、人間が決して行わないパターンでアクセスし、マイナーな記事も含めて数百万の記事をダウンロードします。キャッシュされたコンテンツではなく、コールドストレージサーバーに繰り返しアクセスします。これは24時間年中無休で継続的に行われ、人間が決して近づかない規模でリソースを消費します。
Q: ウィキメディア財団はAIスクレイピングについてどのような懸念を表明しましたか?
A: 財団は複数の懸念を表明しました:
リソース消費: 帯域幅のコストの65%は、トラフィックのわずか35%を占めるボットに由来します
インフラストラクチャの脅威: システムは、主要なニュースイベント中の信頼性を保証できません
詐欺的な慣行: ボットは人間を装って身元を隠そうとします
財政的持続可能性: トラフィックの減少は寄付の減少を意味します
コミュニティへの影響: 訪問者の減少は、ボランティアの減少とコンテンツの質の低下を意味します
帰属: AI企業が人間の編集者をクレジットせずにウィキペディアのコンテンツを使用している
Q: ウィキメディア・エンタープライズAPIはどのように機能し、誰が使用する必要がありますか?
A: ウィキメディア・エンタープライズAPIは、異なるアクセスレベルを提供します:
無料ティア(小規模プロジェクト、研究者、非営利団体に適しています):
月間リクエスト数制限あり
隔週更新
テクニカルサポートなし
有料ティア(商用AI企業および大規模ユーザー向け):
無制限のリクエスト
毎日更新(またはリアルタイムストリーミング)
稼働率99%保証付きの優先サポート
標準化された形式の構造化された検証済みデータ
商用AIモデルのために大規模なデータ抽出を行う企業は、有料プランを使用する必要があります。これには、OpenAI、Google、Meta、および類似の企業が含まれます。
Q: AI企業は許可なくWikipediaを合法的にスクレイピングできますか?
A: ますます、答えは「いいえ」です。いくつかの要因が適用されます:
著作権: WikipediaのコンテンツはCC-BY-SAライセンスの下で提供されており、帰属表示が必要です。適切な帰属表示なしでのスクレイピングは、ライセンス条件に違反します。
フェアユース: 最近の裁判所の判決は、著作権で保護されたコンテンツを競合するAI製品のトレーニングのためにスクレイピングすることはフェアユースではないことを示唆しています。
利用規約: Wikipediaの利用規約は、ポリシーに違反するスクレイピングやサーバーに負荷をかけるスクレイピングを禁止しています。
商業的損害: AIによるスクレイピングがWikipediaの持続可能性を損なう場合、それは事業運営に対する不法行為の干渉とみなされる可能性があります。
法的な状況は進化しています。AI企業は、無制限のスクレイピングを続けると、法的リスクが高まります。
Q: AI企業は、無料でスクレイピングできるのに、なぜトレーニングデータにお金を払う必要があるのですか?
A: いくつかの理由があります:
実用的:
公式APIへのアクセスは、スクレイピングインフラストラクチャを維持するよりも信頼性が高く効率的です
法的確実性により訴訟リスクがなくなります
規制遵守が容易になります
財務:
トレーニングデータとモデルパフォーマンスの価値と比較してコストは小さい
法的紛争やインフラストラクチャメンテナンスを回避することによる長期的な節約
税控除対象の事業経費
倫理:
Wikipediaのボランティアは、数百万時間にも及ぶ労働を通じてこのコンテンツを作成しました
AI企業は、このコンテンツでトレーニングされたモデルから利益を得ています
データアクセスに料金を支払うことは、この価値を認め、ソースに還元することになります
Systemic:
企業がコンテンツに料金を支払わない場合、プラットフォームは崩壊し、データソースは消滅します
持続可能な資金調達は、すべての人に利益をもたらす知識の共有財産を維持します
Q: AIスクレイピングは、より広範なインターネットインフラストラクチャをどのように脅かしますか?
A: AIスクレイピングは、インターネットの元の経済モデルにおける根本的な欠陥を明らかにします。インターネットは、インフラストラクチャは無料かつオープンであるべきだと想定していました。これは、ユーザーが人間であった時には機能しました。
産業規模のAIスクレイピングは異なります。リソース消費は、人間のクエリではなく、テラバイトおよびペタバイトで測定されます。経済的に成り立ちません。
Wikipediaが補償なしでAI企業にリソースを搾取される中で自立できなければ、そのモデルは失敗する。他のプラットフォームも同じ脅威に直面する。無料で協力的な知識システムがAI主導の世界で生き残れない場合、信頼できる情報へのグローバルアクセスはどうなるのか?
結論:清算
Wikipediaが直面する危機は、AI主導の世界における知識経済に関するより広範な清算を反映している。
数十年にわたり、インターネットは情報は無料であるべきという前提で運営されてきた。これは人間の消費には機能した。しかし、産業規模のAI抽出には失敗する。
AI企業はWikipedia、Googleの検索結果、Redditの議論、そして数え切れない無料のソースでモデルを訓練した。彼らは支払わなかったコンテンツで数十億ドル規模のビジネスを構築した。
The Wikimedia Foundation's response—demanding payment through the Wikimedia Enterprise API—は反AIではない。それは持続可能性に補償が必要であるという認識である。コンテンツ作成には価値がある。インフラにはコストがかかる。ボランティアは支援を必要とする。
AI企業が支払うかどうかは未解決のままだ。一部は公式APIを受け入れるだろう。他は回避策を試みるかもしれない。最終的に何が許容されるかは法制度が決定する。
しかし、これは明らかだ。Wikipediaからの無料で無制限のデータ抽出の時代は終わりに向かっている。世界がどう適応するかが、Wikipediaのようなプラットフォームが生き残り繁栄するか、補償のない搾取の下で崩壊するかを決定する。
オープンな知識の未来は、開放性と持続可能性のバランスを見つけることにかかっている。The Wikimedia Foundationの2025年11月の声明は、そのバランスを打ち出す最初の主要な機関の試みを表している。
その結果はWikipediaにとって、そしてAIシステムが依存する知識インフラを提供するすべてのプラットフォームにとって重要である。


