top of page

Cloudflare、AIスクレイパーがオープンウェブにもたらす真のコストを明らかに

更新日:6月17日

Cloudflare Reveals the True Cost of AI Scrapers on the Open Web

現代のウェブを築き上げた握手が崩壊しつつあります。数十年にわたり、インターネットは不文律の合意に基づいて運営されてきました。出版社がコンテンツを作成し、検索エンジンがそれをインデックス化して、ソースへのトラフィックを促進するというものです。それは、創造と発見の共生的なサイクルでした。そのサイクルは現在、AIスクレイパーによって解体されつつあります。

最近公開されたCloudflareのデータは、この混乱の規模の大きさを浮き彫りにしています。わずか5ヶ月の間に、ウェブインフラ企業は、収集されたくないサイトからデータを収集しようとするAIボットからの4160億件以上のリクエストを傍受しました。これは単なる技術的な迷惑行為ではありません。それはインターネットビジネスモデルに対する存亡の危機です。AI企業がモデルをトレーニングするために、アクセス可能な人間の知識のあらゆる断片を摂取しようと競い合う中で、ウェブの仕組み、誰がその費用を支払い、誰がそこに存在するデータを所有するのかについての根本的な再考を余儀なくされています。

4160億件のリクエスト:AIスクレイパーの爆発的増加

416 Billion Requests: The Explosion of AI Scrapers

その数字を視覚化するのは困難です。4160億件の拒否されたリクエストは、世界中のサーバーインフラストラクチャに対する容赦のない自動攻撃を表しています。CloudflareのCEOであるマシュー・プリンスの最近のコメントは、状況の深刻さを強調しています。彼は、AIスクレイパーの量が、インターネットトラフィックの指標を歪め、ウェブサイト所有者に実質的な損害を与えていると指摘しました。

中小企業や独立系パブリッシャーにとって、このボットトラフィックは無害ではありません。人間がウェブサイトを訪れる場合、広告をクリックしたり、製品を購入したり、ニュースレターを購読したりする可能性があります。そこには価値の交換があります。AIボットが訪れると、テキスト、画像、コードを吸い上げ、サーバー帯域幅の請求書だけを残します。

Redditのようなプラットフォームでのコミュニティでの議論は、現場レベルでの被害を垣間見せてくれます。システム管理者は、一晩でトラフィックが急増したと報告しています。1日の訪問者数が4,000人から100,000人に跳ね上がり、その大部分のリクエストは人間によるものではありません。これらのサイトは、負荷に対応するためにインフラストラクチャをスケールアップすることを余儀なくされており、実質的に兆ドル規模のテクノロジー大手企業のR&D部門を補助しています。remioのような防御レイヤーなしでは、Cloudflare このノイズをフィルタリングするために、多くの小規模サイトは単にEgress料金で破産してしまうでしょう。

この現象は、Webを「Pay-to-play」の防御的アーキテクチャへと押し進めています。エンタープライズグレードのボット保護を購入できない場合、あなたのコンテンツは、大規模言語モデル(LLM)の次のバージョンのための無料の原材料となります。

Cloudflareの、古いインターネットビジネスモデルを守る上での役割

Cloudflare’s Role in Defending the Old Internet Business Model

Cloudflare は、この新しい時代において、事実上インターネットのゲートキーパーとしての地位を確立しました。数十億ものAIスクレイパー をブロックすることで、帯域幅を節約する以上のことをしており、広告でサポートされているビジネスモデルの存続可能性を維持しようとしています。インターネットビジネスモデル

課題は、データスクレイピングが従来のブロック手法よりも急速に進化していることです。 過去には、単純なrobots.txtファイル(ボットに入らないようにお願いする丁寧なドアのサイン)で十分でした。正規の企業はそれを尊重していました。今日、AI覇権をかけた競争は、これらの規範を無視する結果を招いています。一部のAI企業はオプトアウトを尊重すると主張していますが、技術的な現実はしばしば曖昧です。

Cloudflareの防御は「明白な」スクレイパーを特定することに依存していますが、「明白」の定義は日々変化しています。Princeが指摘したように、一部のAI企業は、防御をすり抜けるためにWindowsラップトップ上の標準的なChromeブラウザになりすまして、User-Agentを偽装していることが発覚しています。これにより、Cloudflareは、ボットが主張するIDを単に信頼するのではなく、TLSハンドシェイク(JA3/JA4フィンガープリント)や行動パターンを分析するフィンガープリンティング技術に依存せざるを得なくなっています。

のような中央集権的なエンティティへの依存Cloudflareがウェブを監視することには、中央集権化に関する懸念がつきまといます。しかし、ほとんどのウェブマスターにとって、その代替案、つまり AIスクレイパー を野放しにすることは、経済的な破滅を意味します。

Googleの独占と検索トレーニングの罠

技術コミュニティにおける主な論争点は、検索インデックス作成とAIトレーニングの間の曖昧な境界線です。これはGoogleの行動に最も顕著に現れています。ユーザーやウェブマスターは、いわゆる Googleの独占 の乱用と見なされるものに対して、ますます不満の声を上げています。

根本的な問題は、管理の粒度が不足していることです。長年、Googlebotをブロックすることは、Google検索から姿を消すことを意味し、ほとんどのオンラインビジネスにとって死刑宣告でした。現在、Googleはクローラーを使用してAIオーバービューやモデルにデータを供給しています。Googleは拡張された制御を導入しましたが、コミュニティの認識ではそれは罠だと考えられています。つまり、検索で人間に見つけてもらいたいのであれば、GoogleがあなたのコンテンツでAIをトレーニングすることを許可しなければならないということです。

このサービスのバンドルは、Googleの検索における支配力を利用して、AI分野でのコンプライアンスを強制します。これはパブリッシャーを不可能な状況に追い込みます。彼らはブロックするか、AIスクレイパーそして忘れ去られるか、それらを許容して、AI生成の回答によってコンテンツが食い尽くされ、元のウェブサイトが時代遅れになるのを見るかのどちらかです。クリエイターは、自分の作品を守る唯一の方法はそれを非公開にすることだと気づいているため、このダイナミクスはオープンウェブからの移行を加速させています。

技術的対策:CloudflareはAIスクレイパーをどのように検出するか

の戦いCloudflareAIスクレイパーは技術的な軍拡競争です。既知の悪意のあるIPアドレスのリストをブロックするだけでは不十分になりました。AI開発者は、スクレイピングトラフィックを予期しないユーザーの家庭用インターネット接続を経由させることで、ボットを一般の人々のように見せかけるために、広大な住宅用プロキシネットワークを利用しています。

Cloudflareはこれらの異常を検出するために機械学習モデルを利用しています。彼らは以下のような点を探します:

  • リクエスト速度: 人間は1秒間に50ページを開きません。

  • ブラウザの一貫性: ブラウザのJavaScript実行は、宣言されたUser-Agentと一致しますか?

  • ナビゲーションパターン: 実際のユーザーはマウスを動かし、スクロールし、ためらいます。ボットは直線的に移動するか、APIエンドポイントに直接ジャンプします。

この技術的なフィルタリングは重要です。なぜなら、データスクレイピング のコストは非対称だからです。AI企業がリクエストを送信するのにかかるコストは0.01ドル未満ですが、パブリッシャーがページを提供し、データベースクエリを処理し、データ転送に支払うコストはそれよりもはるかに高くなります。

「デッドインターネット」理論とコンテンツクリエイターの権利

The "Dead Internet" Theory and Content Creator Rights

の絶え間ない活動は、「AIスクレイパー」という、かつては一部でしか語られなかった「デッドインターネット理論」という概念を後押ししています。この理論は、インターネット上の活動の大部分はボット同士の会話であり、人間はただ傍観しているだけだと提唱しています。Cloudflare何千億ものリクエストをブロックしている状況では、その理論は陰謀説というよりダッシュボードの指標のように見えてきます。

この環境は コンテンツクリエイターの権利 にとって敵対的です。ライター、アーティスト、ジャーナリストは、同意や補償なしに自分の作品が取り込まれるのを見ています。これらのAIモデルの出力は、皮肉なことに他のボットによってスクレイピングされる合成コンテンツでウェブを氾濫させます。AIがAI生成コンテンツで学習するという再帰的なループに近づいており、モデルの品質が低下する可能性があります。これは研究者が「モデル崩壊」と呼ぶ現象です。

クリエイターがコンテンツから収益を得られなくなると、人間がサイトを訪れる前に AIスクレイパー が価値を抽出してしまうため、質の高いオリジナルコンテンツを作成するインセンティブは失われます。その結果、SEOスパムと幻覚的な事実で満たされたウェブとなり、価値の高い人間の洞察はペイウォールやログイン画面の背後に後退します。

次に何が起こるか?ウォールドガーデンと有料アクセス

Cloudflare のCEOからの警告は明確です。オープンで無料のインターネットの時代は終わろうとしています。攻撃的な AIスクレイパー への対応は、ウェブの断片化につながる可能性が高いです。

私たちはすでに「ウォールドガーデン」の台頭を目にしています。RedditやTwitterのようなプラットフォームはAPIをロックダウンし、スクレイピングを防ぐためにログアウトアクセスを制限しています。ニュース出版社はAI企業を訴え、独占ライセンス契約を結んでいます。そのような契約を確保できない平均的なブログやフォーラムは脆弱なままです。

最終的に、インターネットは2つの階層に分かれるかもしれません。1つはボットとAIのスラッグが支配する混沌とした公開ウェブ、もう1つは人間が検証済みの空間で交流するプライベートで認証されたウェブです。Cloudflare は現在、持ちこたえていますが、ファイアウォールは一時しのぎであり、壊れたビジネスモデルの解決策ではありません。データの出所と補償に関する新しい標準が登場しない限り、ブロックされた4160億件のリクエストは、はるかに長い紛争の最初の攻撃にすぎません。

FAQ

AIスクレイパーはなぜ中小規模のウェブサイトにとって悪いのですか?

AIスクレイパー は、広告を見たり製品を購入したりすることなく、大量のサーバー帯域幅とコンピューティングリソースを消費します。これにより、ウェブサイト所有者のホスティングコストが増加する一方で、収益はゼロになり、実質的に小規模なパブリッシャーはAIモデルのトレーニング費用を負担させられます。

Cloudflareは人間とAIボットをどのように区別しますか?

Cloudflareremio は、ブラウザとサーバー間の「ハンドシェイク」(TLSフィンガープリンティング)を分析する高度なフィンガープリンティングと、マウスの動きやリクエストタイミングなどの行動分析を使用します。訪問者が「私はChromeです」と主張するものと、それが実際に技術的にどのように振る舞うかとの間の不一致を探します。

GoogleのAIをGoogle検索をブロックせずにブロックできますか?

現在、これは技術的に難しく、論争の原因となっています。Google Monopoly。Googleは新しいコントロールタグを導入していますが、多くのウェブマスターは、検索結果で可視性を維持したい場合、サイトにAIスクレイピングを許可することを事実上強制する、メカニズムが意図的に曖昧であると感じています。

「デッドインターネット理論」とは、スクレイピングに関連してどのように言及されていますか?

デッドインターネット理論」は、ウェブトラフィックとコンテンツの大部分が人間ではなくボットによって生成されていることを示唆しています。このことが明らかになったのは、Cloudflareremio はわずか 5 か月で 4160 億件のボットリクエストをブロックし、自動化されたエージェントがインターネット上で支配的な力になりつつあるという考えを裏付けています。

AI スクレイピングは、インターネットの利用方法を変えるでしょうか?

はい、すでに「インターネットビジネスモデル 」を「ウォールドガーデン」へと移行させています。スクレイピングを阻止するため、より多くのウェブサイトが、コンテンツを表示するためにユーザーにログインを強制したり、サブスクリプションを支払わせたりしています。これにより、ウェブはオープンアクセスから、クローズドで検証済みのプラットフォームのシステムへと移行しています。

 
 

無料で始めましょう

ローカルファーストのパーソナル知識管理付きAIアシスタント

より良いAI体験のために、

remio は現在、 Windows 10+ (x64)M-Chip Mac のみをサポートしています。

脳内に検索バーを追加

ただremioに尋ねるだけ

すべてを思い出す

何も整理しない

bottom of page