top of page

従量課金がAIクラウド市場を再編する

Google Newsは、Cloud Warsによる明確な主張を取り上げた。従量課金が、AIベンダーによる企業のIT支出獲得競争のあり方を変えつつあるというものだ。

この変化は、予測可能だったソフトウェア料金モデルを、トークン数、リクエスト数、コンピューティング時間、完了した作業量に連動する変動型モデルへと置き換える。ベンダーにとっては、負荷の高いAIワークロードを提供するコストを回収する手段となる。一方で、予測のリスクはより多く顧客側に移る。

この緊張関係が重要なのは、AIエージェントが通常のソフトウェア利用者のようには振る舞わないためだ。継続的に稼働し、複数のモデルを呼び出し、文書を取得し、ツールを利用し、失敗したタスクを再試行できる。企業は従業員数を減らしても、ソフトウェア消費量を減らさない可能性がある。

クラウド業界は以前にもこのパターンを経験している。Amazon Web Services、Microsoft Azure、Google Cloudは、従量計測されるインフラストラクチャを軸に事業を築いてきた。AIベンダーは現在、その論理をサーバーやストレージから日常的なソフトウェアへと拡張している。

結果は、従量課金が単純に勝利するという話ではない。ベンダーの採算性と顧客の予測可能性の競争である。最も多くの活動を計測する企業が、必ずしも最大の価値を提供するわけではない。

Google Newsの見出しが実際に示すもの

重要な変化は単一の料金発表ではない。AIプラットフォーム、ソフトウェアベンダー、クラウドプロバイダーが、従量計測型の利用へと集約しつつあることだ。

Google Newsの見出しは、個別の製品発表ではなく、業界全体の移行を示している。AI企業は、顧客が消費するリソースに応じた課金をますます採用している。対象となるリソースには、入力トークン、生成トークン、モデル呼び出し、画像、処理時間、予約済み推論容量などが含まれる。

トークンは、言語モデルが処理または生成するデータの小さな単位だ。したがってトークン課金は、収益をモデル活動の量と複雑さに結び付ける。

この結び付きは、ベンダーにとって現実的な問題を解決する。従来のソフトウェアサブスクリプションでは、追加ユーザーを提供する増分コストは比較的低いと想定される。生成AIでは、プロンプト、応答、検索、エージェントの操作のたびにコンピューティングリソースを消費し得るため、その計算が変わる。

Anthropicのエンタープライズ向けドキュメントは、新たに登場しているハイブリッドモデルを示している。同社の利用量ベースのエンタープライズ契約では、ユーザーアクセスと、実際のトークン消費量に基づく別途料金が組み合わされる。同社によれば、この消費量は通常、標準のアプリケーションプログラミングインターフェース料金を用いて計測される。

この構造は、使い慣れたアカウント関係を維持しながら、無制限のモデル活動がベンダーにとって無制限の費用となることを防ぐ。同時に、顧客は従業員を増やさずにコスト増に直面する可能性がある。

クラウドプラットフォームは、すでに同じトレードオフの複数の形態を提示している。需要が不確実な場合には従量制推論を利用でき、安定したワークロードには容量を予約できる。また、両方のアプローチを組み合わせることも可能だ。

Microsoftは、トークンベースのデプロイメントとプロビジョニング済みスループットを通じて、この違いを説明している。プロビジョニング済みスループットはモデル処理能力を予約し、顧客がその能力を完全に利用しない場合でも、デプロイされた容量に対して課金する。同社のbilling guidanceは、このモデルを純粋なトークン消費の代替手段として位置付けている。

Amazon Bedrockも、オンデマンド推論と専用スループットの間で同様の選択肢を提供する。throughput documentationでは、顧客がリクエスト主導のアクセスだけに依存する代わりに、一定期間モデル容量を予約できると説明している。

これらの選択肢は、市場の実像を明らかにする。従量課金は標準的な入り口になりつつあるが、大規模なワークロードはしばしばコミットメントや予約容量へと移行する。

この進展は、かつてのクラウドのサイクルに似ている。顧客は当初、使った分だけ支払う自由を重視した。ワークロードが不可欠になると、一部の柔軟性を、容量保証とより予測可能な経済性のために交換した。

AIではさらに、消費単位の解釈が難しいという層が加わる。仮想マシン時間はインフラストラクチャリソースを表す。一方で、処理済みトークン100万件という数字だけでは、従業員が有用な回答を得たかどうかはほとんど分からない。

エージェント型システムでは、この不一致がさらに大きくなる。エージェントは、計画、検索、作業の確認、エラーからの復旧の過程でトークンを消費できる。最終結果は、解決済みのサポートケース1件、あるいは更新済みのソフトウェアコンポーネント1件かもしれない。

したがって顧客には、2種類の記録が必要となる。1つ目は技術的な消費量を測定する。2つ目は、その活動を事業上の成果に結び付ける。

両方がなければ、詳細な請求書であっても説明責任は弱いままだ。組織が何を消費したかを正確に示せても、その消費に価値があったかどうかは示せない。

AIベンダーがユーザー単位ソフトウェアを超えようとする理由

ソフトウェアがログインする人数とは独立して作業を行うようになると、ユーザー単位の価格設定は弱まる。

サブスクリプション型ソフトウェアは伝統的に、人員数に合わせて拡大してきた。企業が従業員を採用し、より多くのアカウントを用意し、より多くの席数に料金を支払う。収益は顧客の従業員数とともに増える。

AIエージェントはこの関係を崩す。1人の従業員が数百件の自動タスクを開始できる一方、無人のワークフローは全員が退勤した後も稼働を続けられる。小規模なチームが、従来型ソフトウェアを使うはるかに大きなチーム以上のモデル活動を生み出すこともある。

これはベンダーにとって難しい方程式を生む。固定サブスクリプションでは、コンピューティング需要が大きく異なる2社から同程度の収益しか得られない可能性がある。ベンダーがアクセスを制限するか、サブスクリプション価格を上げるか、従量課金を導入しない限り、ヘビーユーザーの収益性は低下する。

利用量ベースの課金は直接的な対応策を提供する。ベンダーはモデル活動を記録し、消費された量に応じて課金する。これにより、収益は顧客が生み出すインフラストラクチャ負荷に連動して増加する。

業界調査によれば、このモデルは現在のAIエージェントの波が到来する前から拡大していた。McKinseyは、従量課金型ソフトウェア企業の数が2015年から2024年の間に2倍以上に増えたと報告している。同社のAI software analysisは、Salesforce、Zendesk、Intercom、LexisNexisを、消費志向の構造を通じてAIを収益化している企業として挙げている。

この変化は、席数をトークンに置き換えるだけではない。あらゆるアプリケーションで価値を表す単一の技術単位は存在しないため、ベンダーは複数の計測単位を試している。

文章作成アシスタントは生成したテキストを数えられる。カスタマーサービスプラットフォームは自動解決数を数えられる。開発者向けツールはモデルリクエストや完了タスクを測定できる。画像プラットフォームは生成回数、処理時間、クレジットを計測できる。

成果ベースの課金は、消費と価値の距離を縮めようとする。こうしたモデルでは、システムが合意済みの成果を生み出した時点で顧客が支払う。解決済みのサポート対応は、複数種類のトークンを記載した請求書よりも、事業の買い手にとって評価しやすい。

ただし、成果課金には独自の争点もある。買い手とベンダーは、何を完了済みの成果と見なすかで合意しなければならない。再開されたケース、低品質な出力、顧客側のエラー、人による修正が必要なタスクに関するルールも必要になる。

トークン課金は、モデルサービスがすでにトークンを数えているため、技術的にはより単純だ。双方が作業に価値があったと合意する必要もない。

この単純さは、インフラストラクチャプロバイダーにとってトークン課金を魅力的なものにする。顧客が技術的な複雑さをベンダーが管理することを期待する完成済みの業務アプリケーションでは、説得力が低くなる。

生のモデルコストをすべての顧客に公開するソフトウェア企業は、実質的に自社のインフラストラクチャアーキテクチャを商業的な指標に変える。非効率なプロンプト、不必要なコンテキスト、繰り返されるモデル呼び出しが、顧客の請求書に現れ得る。

この仕組みは、ベンダーが利用量を減らすインセンティブを弱める可能性がある。計算量の増加が収益増につながる場合、効率性と収益はもはや同じ方向に進まない。

競争はその圧力を相殺し得る。より少ないリソースで同じタスクを完了できるベンダーは、より高い予測可能性を提供するか、より高い利益率を維持できる。買い手も、トークン料金を比較するのではなく、ワークフローを完了する総コストを比較できる。

最も持続力のある価格体系は、おそらくハイブリッド型であり続ける。基本コミットメントは、アクセス、管理、セキュリティ、予測可能なサービス容量を支えられる。従量課金は、例外的に負荷の高いワークロードをカバーできる。

DeloitteのAI software economicsに関する分析は、従量課金が一般化しつつある一方で、予測可能性は低いと述べている。また、エージェント利用の拡大に伴い、計測、請求、オブザーバビリティ、財務コンプライアンスをより即時的なものにする必要があるとも指摘している。

この運用負荷は過小評価されがちだ。利用データは、アプリケーションからメーター、価格設定エンジン、請求書、会計システム、顧客ダッシュボードへと流れなければならない。変換の各段階で紛争が生じ得る。

ベンダーは、いつ消費量を記録するかも決めなければならない。失敗したリクエスト、再試行、キャッシュされた入力、バックグラウンドでの推論、委任されたツール呼び出しはすべて、合計に影響し得る。

したがって、料金モデルは製品アーキテクチャの一部である。開発者が最適化する行動、顧客が制限する振る舞い、営業チームが約束する成果を形作る。

クラウドAI課金はハイパースケーラーを再び中心に据える

従量課金は、AI市場の大部分を支えるインフラストラクチャの計測基盤をクラウドプロバイダーが握っているため、その力を強める。

AIアプリケーションは独立したソフトウェア製品として見えるかもしれないが、多くはモデルアクセス、データストレージ、ネットワーク、コンピューティング容量をハイパースケールクラウドに依存している。各レイヤーで個別の消費記録が生成され得る。

単一のエージェントリクエストでも、ストレージから文書を取得し、ベクトルデータベースを検索し、複数の言語モデルを呼び出し、コードを実行し、活動を記録する場合がある。顧客には1つのタスクに見える。インフラストラクチャスタックには、課金対象となる操作の連鎖に見える。

この連鎖は、Amazon、Microsoft、Googleに複数の戦略的優位性をもたらす。これらの企業はすでに、成熟した請求システム、エンタープライズ契約、ID管理、コスト管理ツールを運用している。顧客が他のインフラストラクチャ用途で利用する関係に、モデルアクセスを組み込める。

クラウドプロバイダーは複数の経済モデルも提供できる。従量制推論は不確実な需要に対応する。予約容量は予測可能なワークロードに対応する。バッチ処理は即時応答を必要としない柔軟な作業に対応する。

Google Cloudの改定された支出コミットメントは、業界が消費と契約上の予測可能性をどのように組み合わせられるかを示している。同社のFinOps explanationは、消費モデルに基づく直接的な割引価格への移行を説明している。

コミットメントは利用量の測定をなくすものではない。その周囲に商業上の境界を設ける。顧客は一定量を消費することに合意し、プロバイダーは収益の可視性とインフラストラクチャ計画への確信を得る。

この均衡は、クラウド戦争の中核にある。プロバイダーはAI導入とともに成長するワークロードを求めるが、需要のすべてが確実になる前に顧客からコミットメントを得る必要もある。

モデル企業も同様の選択に直面している。アクセスを直接販売するか、クラウドマーケットプレイスを通じて配布するか、あるいは両方のチャネルを使うかだ。既存のクラウド契約を持つ顧客にとって、マーケットプレイスは調達を簡素化できる。

同じマーケットプレイスは、モデル企業と顧客との直接的な商取引関係を弱める可能性もある。クラウドプロバイダーが請求書、割引体系、そして顧客体験の一部を管理するためだ。

大手ソフトウェアベンダーには別の利点もある。より広範な契約の中にAI利用を一部組み込んだり、購入者にとって馴染みのある利用枠を提供したりできる。小規模なAI企業には、予測不能な推論需要を吸収できるほどの製品収益がない場合が多い。

この格差は製品設計にも影響しうる。スタートアップは厳格な制限を設けたり、小規模なモデルを優先したり、タスクを複数のプロバイダーに振り分けたりするかもしれない。大規模プラットフォームは、コミットメント、社内インフラ、あるいはポートフォリオ全体の経済性を活用し、より幅広い利用を支えられる。

従量課金は、モデルルーティングを商業的にも重要なものにする。ルーティングでは、期待される品質、速度、リソース要件に応じて、各タスクに使用するモデルを選択する。

単純な分類タスクに、常に最も高性能なモデルが必要とは限らない。アプリケーションは難しい作業のために高性能なシステムを確保し、定型的なリクエストは小規模なモデルに任せることができる。

プロンプトキャッシュももう一つの手段となる。すでに処理したコンテキストを再利用し、同じ内容を再度処理しないようにする仕組みだ。多くのリクエストが同じ指示や文書を共有する場合、重複作業を減らせる。

バッチ処理は、即時の結果を必要としないジョブのリソース負荷を抑えられる。プロビジョニング済みキャパシティは、トラフィックが安定している場合に予測可能性を高められる。

これらの手法はいずれも、目に見えるユーザーインターフェースを変えずに経済性を変える。だからこそ購入者は、AI機能の宣伝上の課金単位だけでなく、その背後にあるアーキテクチャを評価しなければならない。

トークン単価が最も低いプロバイダーが、必ずしもワークフロー全体のコストを最も低くするわけではない。より多くの再試行、より長いプロンプト、追加の検証を必要とするモデルは、全体としてより多くのリソースを消費する可能性がある。

品質上の失敗には、モデル請求以外のコストも伴う。従業員は信頼できない出力を確認し、誤りを修正し、中断された作業をやり直さなければならない。こうした活動は、AI利用ダッシュボードに現れることはほとんどない。

したがってクラウド競争は、ベンチマークスコアの先へ進むことになる。プロバイダーは、自社のモデル、インフラ、コスト管理が、実際のワークロードで信頼できる成果を生むことを示さなければならない。

Google Newsの報道は注目を集める変化を取り上げるかもしれないが、エンタープライズの意思決定はこうした目立たない詳細に左右される。課金粒度、キャパシティ保証、ルーティング制御、監査可能性が、どのプラットフォームが継続的に利用されるかを決める。

予測可能性の問題は未解決のままだ

従量課金は個々の料金を透明にできる一方で、総予算の予測をより難しくする可能性がある。

企業は1回のモデル呼び出しのコストを見積もれても、年間のAI支出を予測できないことがある。欠けている変数は行動だ。

ツールが有用になると、従業員は利用頻度を変える。プロダクトチームは、より多くのワークフローにAI機能を追加する。エージェントは、能動的な人間のセッションに対応しないバックグラウンド活動を生み出す。

ベンダーがモデルを更新した場合にも需要は変化しうる。新バージョンはコンテキストの使い方を変えたり、より長い応答を生成したり、顧客により複雑なタスクの自動化を促したりする可能性がある。

その結果、複数の変数が相互に作用する予測上の問題が生じる。財務チームは、導入状況、タスク頻度、入力サイズ、出力サイズ、モデル選択、再試行、将来の製品変更を見積もらなければならない。

技術的な効率が、総請求額の縮小を保証するわけではない。単位当たりの消費量が減れば、従来は採算が合わなかったタスクも実行可能になる。組織はその結果、より多くの作業を自動化し、総需要が増加する。

このパターンは、他の技術で見られるリバウンド効果に似ている。効率化は活動のコストを下げ、それが追加利用を促す。顧客はタスク当たりの支出を減らす一方、はるかに多くのタスクを完了する。

AIエージェントはサブタスクを開始できるため、その可能性を強める。調査エージェントは複数の情報源を検索し、主張を比較し、草案を生成し、参照を検証し、結果を改訂するかもしれない。

各ステップは品質を高めうる。各ステップは追加の消費も生み出しうる。

購入者には、請求書が届く前に機能する制御が必要だ。予算、クォータ、アラート、モデルルーティング方針、タスク単位の制限により、不具合のあるワークフローが無制限にリソースを消費することを防げる。

また、帰属情報も必要になる。すべてのモデル呼び出しは、ユーザー、アプリケーション、顧客、または業務プロセスに紐付けられるべきだ。そうでなければ、組織は総利用量を確認できても、それを生み出した主体を特定できない。

チャージバックは、技術支出をそれを担う事業部門に割り当てる。ショーバックは費用を移転せずに同じ情報を報告する。どちらの手法も、チームが利用と責任の所在を結び付ける助けになる。

FinOpsは、財務、エンジニアリング、事業チームをまたいで変動するクラウド支出を管理する規律であり、有用な基盤を提供する。AIは新しい単位を導入するが、説明責任の問題自体は馴染み深い。

ただし、従来のクラウドツールは多くの場合、アカウント、サービス、インフラリソースを中心に支出を整理する。AIのリーダーは、タスク、モデル、プロンプト、成果も理解する必要がある。

エージェントは、1つのワークフローの中で複数のサービスをまたぐ可能性がある。これらの料金が分離されたままであれば、チームはタスク全体のコストを過小評価しかねない。

標準化された請求データはこのプロセスを改善できるが、正規化だけで価値が確立されるわけではない。技術的に正確なコスト記録にも、ビジネス上の文脈が必要だ。

顧客は、従量課金の条件を受け入れる前に、ベンダーへいくつかの直接的な質問をするべきだ。

  • どの正確なイベントが課金単位を発生させるのか?

  • 不成功の試行、再試行、またはキャッシュされた入力はカウントされるのか?

  • 管理者は厳格な支出上限を設定できるか?

  • 利用状況はどれほど迅速にダッシュボードへ反映されるか?

  • 記録をユーザーおよびワークフローのレベルでエクスポートできるか?

  • モデル変更は消費量にどのような影響を与えるか?

  • ベンダーは請求書の1項目を1つの業務タスクに追跡できるか?

  • 自動化プロセスがループに入った場合、何が起こるか?

これらは調達上の細部ではない。企業が管理された実験の範囲を超えてAIを安全に拡大できるかどうかを決める問題だ。

ベンダー側も、自社のメーターを理解しやすくする必要がある。クレジットはインターフェースを簡素化できるが、技術的な利用と最終請求額の関係を隠してしまう可能性がある。

モデルや機能によって換算レートが異なる場合、クレジット制度は評価が難しくなる。顧客は残りのクレジット数を把握できても、それらがどれほどの作業を支えられるかは分からないかもしれない。

PwCは、請求の透明性、予測、アラート、顧客向けのリターン測定が、信頼できる従量モデルに不可欠だと主張している。同社の価格分析では、利用指標は顧客成果と直接相関すべきだとしている。

その相関こそが未解決の問題だ。トークンはモデルの活動を示す。精度、顧客満足度、完了した収益、節約された時間を測るものではない。

成果指標はより良く聞こえるが、双方が信頼する定義を必要とする。カスタマーサービスエージェントは、ケースを誤ってクローズする可能性がある。コーディングエージェントは、後に不具合を生む変更を完了する可能性がある。

最も安全な契約は、技術指標とビジネス指標を組み合わせるものかもしれない。技術的な消費量で請求額の変動部分を決め、サービス品質、エラー率、成功した成果でクレジットや商業上の保護を決めることができる。

顧客は、作業を他所へ振り分ける能力も維持すべきだ。独自モデル、不透明なクレジット、限定的なエクスポート制御を組み合わせるプラットフォームは、経済的なロックインを生み出しかねない。

プロバイダーを切り替えても、必ずしも問題が解決するわけではない。プロンプト、評価データ、セキュリティレビュー、ワークフロー統合は移行が難しい場合がある。課金単位は移植可能でも、アプリケーションはそうでないことがある。

オープンモデルとローカル推論は、もう一つの逃げ道を提供する。安定した大量処理タスクや、より厳格な制御が求められるワークロードでは理にかなう場合がある。一方で、ハードウェア、人員、保守、稼働率のリスクももたらす。

予約済みクラウドキャパシティは中間的な道を示す。顧客がすべてのインフラ層を運用することなく、予測可能性を高められる。

Microsoftは、予約済みモデルキャパシティとトークン消費を明確に区別している。そのアプローチは、AI経済が単一の普遍的なメーターへ向かっているのではないことを示す。利用量、キャパシティ、コミットメントという選択肢のポートフォリオへと変化しているのだ。

この複雑さは、経験豊富なクラウド購入者に有利に働く。小規模組織には、専任のコストエンジニアや調達チームがいないかもしれない。彼らに必要なのは、さらに専門化した財務規律ではなく、より明確な製品レベルの制限だ。

ナレッジワーカーにとって、この問題はより個人的な形で現れる。すべての操作が高額に感じられたり、厳しく監視されているように感じられたりすれば、従業員はAIツールの利用をためらうかもしれない。

組織には、無駄を抑えながら価値ある利用を促すポリシーが必要だ。検索可能な個人ナレッジベースは、従業員が自分の文書からコンテキストを必要とする際、繰り返しの情報取得作業を減らせる。

目標は、可能な限り少ないトークン数ではない。有用な結果を得るための、最も低い信頼できるコストであるべきだ。

クラウド戦争の次の段階を決める3つのシグナル

勝つ課金モデルは、AI支出を測定可能で、統制可能で、技術チームと財務責任者の双方に説明可能なものにする。

第1のシグナルは、ハイブリッド契約の広がりだ。より多くのベンダーが、基本コミットメントに従量利用と予約済みキャパシティを組み合わせるかを注視すべきだ。それは、純粋なサブスクリプションでは集中的なAIワークロードを支えられないことを裏付けるだろう。

同時に、純粋な従量課金も中核的なエンタープライズシステムには予測不能すぎることを示す。コミットメントはベンダーに計画上の確実性を与え、利用量に基づく要素は需要とのつながりを維持する。

第2のシグナルは、ベンダーが顧客の前に提示する課金単位だ。トークン価格は、開発者やインフラチームにとって引き続き重要である。ビジネス購入者は、完了したタスク、解決件数、文書、その他の観測可能な成果に結び付いた単位を求めるようになる。

成果ベースのメーターへの移行は、AIソフトウェアがデジタル労働の一形態になりつつあるという主張を強める。それは、単にインフラ活動を顧客へ転嫁するベンダーの立場を弱める。

第3のシグナルは、コストガバナンスが製品自体に組み込まれるかどうかだ。購入者は、リアルタイム制限、ワークフロー帰属、モデルルーティング規則、異常検知、説明可能な請求書に注目すべきだ。

これらの制御は、支出が発生する前に機能しなければならない。詳細な月次レポートでは、数週間前に予算を消費した暴走エージェントを止めることはできない。

クラウドプロバイダーには、すでに変動するインフラ支出を管理しているという先行優位がある。それでもAIネイティブのベンダーは、利用と価値の関係を理解しやすくすることで競争できる。

次のクラウド競争は、ここで戦われる。モデル品質は依然として重要だが、購入者には、モデルが何を行うのか、どれほど頻繁に動作するのか、どの成果が費用を正当化するのかに対する制御も必要だ。

AIエージェントが任意のアシスタントから継続的な業務プロセスへ移行する時、従量モデルは最も厳しい試練に直面する。顧客はもはや、不明確な単位や弱い支出管理を容認しないだろう。

Google Newsはこの変化を際立たせているが、決定的な証拠は請求書、更新交渉、本番導入から得られる。購入者は今から、完了したワークフロー当たりのコストを測定し始めるべきだ。

各自動化タスクが時間を節約するのか、品質を改善するのか、測定可能なビジネス価値を生むのかを問うべきである。そのうえで、その結果をベンダー、モデル、導入方法の間で比較する。

従量課金は、自動的により公平になるわけでも、より高額になるわけでもない。これは責任の移転である。ベンダーは信頼できる計測指標を提供し、顧客はそれらの指標を成果と結び付けなければならない。

この両面を解決する企業が、AI競争の次の段階を形作る。価値を説明せずにあらゆるものを計測する企業は、より厳しい利用制限、代替モデル、そしてより厳格な調達審査を招くことになる。

 
 

無料で始めましょう

ローカルファーストのパーソナル知識管理付きAIアシスタント

より良いAI体験のために、

remio は現在、 Windows 10+ (x64)M-Chip Mac のみをサポートしています。

脳内に検索バーを追加

ただremioに尋ねるだけ

すべてを思い出す

何も整理しない

bottom of page