top of page

Wikipedia Enterprise Data Deals: MetaとMicrosoftが「無料」情報にお金を払う理由

6月6日
読了時間: 8分

更新日:6月17日

Wikipedia Enterprise Data Deals: Why Meta and Microsoft Are Paying for "Free" Information

長年、シリコンバレーはウィキペディアを無限の無料ビュッフェのように扱ってきた。Google、Siri、Alexaは、百科事典を一切費用を払わずにスクレイピングして、広大なナレッジグラフを構築してきた。その時代は終わりを迎えつつある。ウィキメディア財団は、Meta、Microsoft、Amazon、Perplexityを含むテックジャイアントと正式な契約を結び、大量のコンテンツアクセスに対して料金を課している。

これらの Wikipedia Enterprise data deals は、オープンウェブが商用AIとどのように相互作用するかという点で転換点を示している。見出しは金銭面に焦点を当てているが、真の話は、技術インフラ、ボランティアコミュニティからの反発、そして大規模言語モデル(LLM)のトレーニングにおける具体的な要求事項にある。

Wikipedia Enterprise データディールを支える技術的論理

The Technical Logic Behind Wikipedia Enterprise Data Deals

多くのユーザーからの即時の反応は混乱です。なぜMicrosoftやMetaは、クリエイティブ・コモンズ・ライセンスの下で無料で利用できるコンテンツにお金を払うのでしょうか?さらに技術に精通した観察者でさえ、Wikipediaがその全データベースの無料オフラインダンプ(トレント)を提供していると指摘しています。

答えはデータそのものではなく、配信メカニズムにあります。

Wikipedia Enterpriseのデータディールがウェブスクレイピングより優れている理由

これらの技術的な必要性の理解Wikipedia Enterpriseのデータディール を確認する必要があります。AI企業がどのように情報を消費するか。

歴史的に、企業はウェブスクレイパーを使用してWikipediaのページをクロールしていました。これは非効率的です。HTML構造が変更されると壊れ、意味論的なコンテキストが欠け、Wikimediaのサーバーに多大な負荷がかかります。事実を確認するユーザーにとっては、ミリ秒単位の遅延は問題ありません。しかし、数百万件のクエリを処理するAIエージェントにとっては、高いレイテンシと構造化されていないHTMLは許容できません。

技術コミュニティからのコメントは、重要な区別を強調しています。AI企業はテキストにお金を払っているのではありません。彼らは、高並列、高速、構造化されたエンタープライズAPIにお金を払っているのです。

これらの契約にはサービスレベルアグリーメント(SLA)が付属しています。PerplexityやMistral AIがモデルを更新したり、リアルタイムの回答(RAG)を提供したりする必要がある場合、2週間前にダウンロードした静的なトーレントファイルに頼ることはできません。機械が取り込めるように特別にフォーマットされた、変更のライブフィードが必要です。エンタープライズAPIは、この重い商用トラフィックを、人間の読者がホストされている公開サーバーから分離し、GPT-4のトレーニング実行の負荷でサイトがクラッシュしないようにします。

Wikipediaエンタープライズデータ契約を推進する財務的現実

Financial Realities Driving Wikipedia Enterprise Data Deals

大手テクノロジー企業から非営利団体への資金の流れは、当然ながら精査を招きます。これらの契約の正確な金額は公開されていませんが、Wikimediaの透明性レポートで財務的な文脈を確認できます。

Wikipediaエンタープライズデータ契約がWikimediaの財政に与える影響


Wikipedia Enterprise data dealsは、財団がすでに財政的に健全な時期に到来しました。最近の公開情報によると、Wikimediaは数億ドルの純資産と約1億ドルの現金準備金を保有しており、これは約2年間の運営資金に相当します。

この財政的な余裕は、長年の寄付者との間に摩擦を生んでいます。これらの新しい収益源に関する議論の中で、多くの元支援者は、財団の財務状況を確認した後に寄付を停止したと述べています。繰り返し寄せられる苦情には、直接的なサーバーメンテナンスではなく、管理費や旅費(特に2020年に高額だった)の拡大が含まれています。

財団側の主張は、Wikipedia Enterprise data dealsにより、攻撃的な募金バナーにのみ依存することなく、プロジェクトの持続可能性を確保できるというものです。データから最も利益を得ている企業(GoogleやFacebookなど)に料金を請求することで、理論的には個人ユーザーへの圧力を軽減します。しかし、あらゆるドルをサーバーの稼働時間に使ってほしいと要求するユーザーにとっては、企業の資金流入は「ミッションドリフト」の懸念を引き起こします。これは、非営利団体が、APIクライアントである企業に役立つ機能よりも、人間が読む体験を優先し始めることを意味します。

AIの文脈:モデルのトレーニングにキュレーションされた事実が必要な理由

The AI Context: Why Training Models Need Curated Facts

人工知能をめぐる競争により、Wikipediaの価値は「有用な参考資料」から「重要なインフラストラクチャ」へとシフトしました。 AIモデル幻覚(誤った情報を自信を持って述べること)に悩む開発者は、「グラウンドトゥルース」データを切望しています。

Wikipedia Enterprise Data Deals and the Fight Against Hallucination

Wikipediaの創設者であるジミー・ウェールズは、Wikipedia Enterprise data dealsを訴訟に対する現実的な代替策と見なしています。一方、のような出版社であるThe New York Timesは著作権侵害でOpenAIを訴えており、Wikimediaはエコシステムに注力しています。

Wales氏は、AIモデルは人間がキュレーションしたデータから恩恵を受けると主張しています。生の、乱雑なインターネット(Redditのスレッド、陰謀論ブログ、スパムなど)とは異なり)、Wikipediaは、引用と中立性を強制する人間によって監視されています。これにより、大規模言語モデルのトレーニングに利用できる最もクリーンなデータセットとなっています。

これらのWikipedia Enterprise data dealsを正式にすることで、企業はこの「クリーン」なデータに合法的にアクセスできるようになります。これは、「Retrieval Augmented Generation」(RAG)にとって特に重要です。AIに時事問題に関する質問をすると、AIはライブソースに問い合わせて回答を生成することがよくあります。Enterprise APIを使用すると、Bing CopilotやPerplexityのようなツールは、正確で最新のWikipediaの段落を取得して引用することができ、AIが嘘をつく可能性を減らすことができます。

AI企業にとって、支払いはリスク軽減戦略でもあります。これにより、公正使用に関する潜在的な法的紛争を防ぎ、最も重要なリソースである事実の安定したサプライチェーンを確保できます。

オープンウェブとボランティアへの将来的な影響

Future Implications for Open Web and Volunteers

これらの取引の中心にある緊張は、人間的な要素です。Wikipediaは、報酬を受け取らないボランティアによって構築されています。

ボランティアの労働力が、数兆ドル規模の評価額を支えるためにパッケージ化されて販売されているという正当な懸念があります。ユーザーがニッチな歴史記事の編集に10時間費やし、その記事がAPIを通じてサブスクリプション料金を請求するチャットボットのトレーニングのために販売された場合、「非営利」という境界線が曖昧になります。コミュニティからのフィードバックは、厳格なファイアウォールへの需要を示唆しています。つまり、Wikipedia Enterprise data dealsからの収益は、技術的なメンテナンスと法的防御のために確保されるべきであり、役員報酬や無関係なプロジェクトへの拡大のためではありません。

財団は、この関係が双方向であることを示唆しました。彼らは、これらの同じパートナーによって開発された可能性のあるAIツールを使用して、人間の編集者を支援するつもりです。これは、ポリシー違反のままである、AIによる記事作成を意味するものではありません。むしろ、リンク切れの特定、現在のボットよりも迅速な荒らしのフラグ付け、引用元の提案を自動化するツールに向けられています。

この変化は否定できません。Wikipediaはもはや人間のためだけの百科事典ではなく、AI産業の中枢神経系となっています。これらの有償契約は、その現実を認識したものです。これらは、大手テクノロジー企業に、彼らが搾取するインフラに貢献することを強制しますが、財団には、この企業の資金が無料かつオープンな知識という使命を腐敗させないことを証明するという重い負担も課します。

よくある質問

1. AI企業は、無料のWikipediaデータダンプをそのまま利用しないのはなぜですか?

データダンプは静的であり、すぐに古くなります。AI企業や検索エンジンは、大規模なオフラインデータベースを管理することなく、最新の情報がすぐに反映されるようにするために、Enterprise APIによって提供されるリアルタイムの高速アクセスを必要とします。

2. これは、Wikipediaが一般ユーザーに料金を請求し始めることを意味しますか?

いいえ。 Wikipedia Enterpriseデータ契約は、Google、Microsoft、OpenAIのような大口の商用再利用者専用です。ウェブサイトは個人読者や編集者にとって無料かつオープンなままであり、標準APIは研究者や小規模プロジェクトにとって引き続き無料です。

3. これはWikipediaのコンテンツの中立性にどのように影響しますか?

コンテンツ作成プロセスは、これらの商取引から分離されたままです。有料APIクライアントは、記事コンテンツに関して編集上の管理権や特別な扱いを受けることはありません。しかし、コミュニティは、企業パートナーがどのトピックが取り上げられるかに影響を与えられないように、常に警戒を続けています。

4. これらのデータ取引からの収益はどこに行きますか?

収益はWikimedia Foundationの一般基金に入ります。法務費用、サーバー費用、ソフトウェア開発を支援することを目的としていますが、批評家は、管理職の給与や基金の増大に費やされるだけでないように、より透明性を求めています。

5. ユーザーデータはWikipedia Enterprise APIに含まれますか?

いいえ。Enterprise APIは、公開コンテンツ(記事、メディア、メタデータ)をより効率的に配信します。ユーザーの閲覧習慣、アカウントの詳細、またはプライベートな閲覧履歴をテクノロジー企業に販売することはありません。

 
 

無料で始めましょう

ローカルファーストのパーソナル知識管理付きAIアシスタント

より良いAI体験のために、

remio は現在、 Windows 10+ (x64)M-Chip Mac のみをサポートしています。

仕事のAIパートナー
remioでもっと仕事が進む

計画・作成・仕上げまで
すべてをひとつに

bottom of page