top of page

Simon Willisonが示す「トークンポカリプス」――企業AIコストが無制限利用の夢を打ち砕く

Simon Willisonは8月7日、企業AIを巡る象徴的な矛盾を取り上げた。従業員は、よりシンプルなソフトウェアで既に処理できる仕事のために、高額なトークンを消費してしまう。例として挙げられたのは、PDFを画像、markdownファイル、プレゼンテーション資料へと変換する作業だ。一見すると些細だが、そこには深刻な予算問題が表れている。

404 Mediaが入手した音声によると、Accentureの幹部らは、急増するトークン消費と、その利用を事業価値に結び付ける難しさについて話し合っていた。ある幹部は、PDF変換が大きな「トークン食い」だと冗談を言ったとされる。このやり取りは、従業員にAI利用を促すことと、その促進に伴うコストを管理することの隔たりを捉えている。

この圧力は今やAccentureにとどまらない。企業はClaude、ChatGPT、Copilot、Codex、AIエージェントを、幅広く使える生産性向上システムとして導入してきた。しかし、無制限の実験は、自然な上限のない変動的な運用コストを生み出すことに気付き始めている。新たな対立軸はAI導入か拒絶かではない。最大限の利用か、測定可能な価値かである。

Simon Willisonが見つけた、完璧なトークン浪費の物語

ありふれたPDF作業が、企業AI支出がいかに財務管理から逸脱するかを極めて明確に示す例となった。

WillisonのPDFに関する警告は、404 Mediaが6月24日に報じた調査記事の逸話に注目を集めた。同メディアは、AI消費の増加を巡るAccenture社内の議論の音声を入手したとしている。

Accentureでエージェント型AI戦略を率いるJustice Kwakは、一部の高コストな利用パターンを主に生み出していたのはエンジニアではないと述べたとされる。議論の対象となっていた行動の多くは、非エンジニアによるものだった。

続いてAccentureのクライアントグループ責任者であるStuart Hendersonは、Kwakに対し、PDFを画像に変換してから、その画像をmarkdownに変換したことがあるかと尋ねた。Hendersonはそのプロセスを、大きなトークン食いだと呼んだとされる。

このやり取りが面白いのは、ありふれた文書の問題に対する手の込んだ解決策を描写しているからだ。重要なのは、その解決策が各段階で作業量を増幅させ得る点にある。

PDFには、選択可能なテキスト、ページ画像、グラフ、表、ヘッダー、レイアウト指示などが含まれる場合がある。AIワークフローは各ページを抽出し、画像を解析し、テキストを再構成し、レイアウトを解釈して、新たな形式を生成できる。モデルへの各リクエストは、入力・出力トークンを追加する。

エージェントが失敗した抽出を繰り返したり、自らの回答を検証したり、別のモデルを呼び出したりすれば、消費量はさらに増える。作業者には洗練されたスライドデッキしか見えないかもしれない。しかし企業側には、従量課金の推論リクエストが連なる連鎖として映る。

トークンとは、生成モデルが処理する小さなデータ単位である。テキストの一部を表し、システムによっては画像やその他のメディアから得られた情報も含む。組織は通常、モデルが読み取り、生成したトークン数に応じて料金を支払う。

この計測モデルは、従来のオフィスソフトウェアのライセンスとは異なる。ワープロソフトで別の文書を開いても、通常は新たな利用料金は発生しない。その文書をAIエージェントに解釈させると、複数の有料処理が起動する可能性がある。

従業員がこの連鎖を理解する必要はない。現代のAIインターフェースは、意図的にその多くを見えにくくしている。「このレポートをスライドにして」といった依頼は、抽出、計画、要約、整形、修正、検証を開始し得る。

その結果、可視性の問題が生じる。従業員は利便性と出力品質でワークフローを判断する。技術部門のリーダーは、コスト、正確性、セキュリティ、そして出力を作る価値があったかどうかで判断しなければならない。

元の調査記事は、Accentureの経験をより広範な支出是正の一部として位置付けた。企業は従業員にAI実験を促してきたが、消費量が予測不能になったため、統制を検討し始めたところもある。

Accentureは、この非公開会議に関して伝えられた詳細のすべてを公に認証したわけではない。したがって、流出音声に基づく説明は明確に404 Mediaの報道として帰属させるべきである。ただし、同社のその後の行動は、トークン管理が正式な企業課題になっているというより広い結論を裏付けている。

7月29日、Accentureは、消費量をチーム、ワークフロー、製品、意思決定、事業成果と結び付けるために設計されたトークノミクスのサービスを発表した。このタイミングにより、PDFの逸話は単なるオフィスでの笑い話ではなくなった。社内のコスト問題が、いかに迅速にコンサルティングのカテゴリーへと変わり得るかを示したのである。

トークン単価の低下は総請求額を下げていない

利用量が単価の下落より速く増えれば、AIはより高コストになる。

初期の企業向け提案では、生成AIは別のソフトウェア導入のように扱われていた。企業はアクセスを購入し、従業員を教育し、組織全体に利用を広げる。導入が進むほど、生産性も高まるように見えた。

エージェント型AIは、この計算を変える。エージェント型ワークフローとは、限られた人間の指示の下で、手順を計画し、ツールを呼び出し、作業を修正するシステムだ。従業員の1件の依頼が、数十回のモデルとのやり取りになることもある。

Gartnerは、極めて大規模な言語モデルでの推論は2030年までに大幅に効率化されると予測している。しかし、その推論予測には重要な警告がある。プロバイダーのコスト低下が、企業顧客に完全に還元されるとは限らない。

Gartnerはまた、エージェント型モデルでは、標準的なチャットボットと比べてタスク当たり5倍から30倍のトークンが必要になると見積もっている。より高性能なシステムは、より多くの行動を実行し、より長いコンテキストを利用し、需要をさらに生み出し得る。

ここに中心的な逆転がある。知能が安価になるほど、企業はAIをより多くの業務に適用したくなる。その結果、各ワークフローは1回の応答から、検索、ツール呼び出し、評価、修正の連続へと拡大する。

同じパターンはクラウドコンピューティングでも見られた。個々のコンピューティングまたはストレージ単位の価格が下がっても、企業の請求額が下がるとは限らなかった。アクセスが容易になったことで、チームはより多くのサービスを展開し、より多くのデータを保持し、より多くの活動を自動化するようになった。

AIでは、消費量が非決定的になり得るため、さらに複雑になる。同じタスクでも、常に同じ経路をたどるとは限らない。あるエージェントは3ステップで終える一方、別のエージェントはツールを再試行したり、複数の代替案を探索したりするかもしれない。

McKinseyによると、同じエージェント型コーディングタスクでも、トークン使用量は最大30倍異なり得る。同社の企業支出分析は、AIコストがクラウドプロバイダー、モデルベンダー、ソフトウェアプラットフォーム、実験、事業部門に分散していることも指摘している。

この断片化は、検知を遅らせる。企業は、複数の妥当に見える購入を承認しても、その合計の影響を把握できない場合がある。コスト超過は、トークンがすでに消費された後で明らかになる。

請求額はトークンだけにとどまらない。企業はデータパイプライン、検索基盤、評価、セキュリティレビュー、モニタリング、そして信頼性の低い出力を監督する従業員にも費用を支払う。安価なモデル応答が、高コストなワークフローの一部に組み込まれていることもある。

長いコンテキストウィンドウは、この問題をさらに難しくする。コンテキストウィンドウとは、モデルが1回のやり取りで受け取る情報の範囲である。全文書、長いチャット履歴、ツールの説明、繰り返し参照される資料を送ると、モデルが何かを生成する前から消費量が増える。

文書作業はこれを明確に示す。システムは、抽出、分析、下書き、修正のそれぞれで同じレポートを再送する可能性がある。キャッシュや慎重なコンテキスト選択がなければ、各段階で重複する情報が処理される。

Simon Willisonの例がPDF以外でも重要なのはそのためだ。これは、AIトークンコストに関する抽象的な議論を、誰もが認識できるワークフローへと置き換える。ユーザーは1つの成果を求めるが、インフラはそれ以上の作業を実行している。

企業は、モデルベンダーの請求書だけを見てこの問題を解決することはできない。消費単位ごとに、その背後にあるチーム、タスク、モデル、エージェント、事業成果を特定する必要がある。

この要件により、AIコスト管理は運用上の規律となる。それは年次のソフトウェア更新会議の中ではなく、セキュリティ、信頼性、データガバナンスと並ぶ領域に位置付けられるべきだ。

圧力を受けるのはエンジニアだけではない

企業AIの予算は今や、何千人もの従業員が通常のプロンプトを通じて技術的なコスト判断を下すことに左右されている。

エンジニアは、モデル呼び出しがリソースを消費することを理解している。ログを確認し、プロンプトを短くし、繰り返しのコンテンツをキャッシュし、より小さなモデルを選択できる。ほとんどのナレッジワーカーは、そうした選択をすることを期待されてこなかった。

彼らが目にするのは、身近なオフィス業務に接続されたチャットボックスだ。インターフェースは自然言語、反復、実験を促す。文を1つ書き換えることと、スキャンされた文書群を分析することのコスト差を説明することはほとんどない。

この設計は、新しい種類のシャドー支出を生む。従業員は支払い情報を入力したり、クラウド基盤を展開したりする必要がない。より強力なモデルを選んだり、依頼を繰り返したりするだけで、企業の消費量を増やせる。

Accentureの逸話は、非エンジニアが文書変換やプレゼンテーション作業を通じて相当な利用量を生み出し得ることを示唆している。だからといって、その従業員たちが無責任ということにはならない。雇用主はAIを使うよう求め、ベンダーは利用を容易にするよう製品を設計した。

対立が始まるのは、企業が方針を転換するときだ。従業員はまず、AIの習熟が不可欠だと聞かされる。その後、トークン上限、モデル制限、不要な依頼に関する警告を受ける。

これは誤った行動を生む可能性がある。ルールが不明確なため、従業員が価値あるワークフローを避けるかもしれない。一方で、「価値がある」とは何かが定義されていないため、高価なモデルを使い続ける人もいるだろう。

より良い方針は、期待される成果に応じてタスクを区別することだ。定型的なメールの下書きに、複雑なエンジニアリング提案のレビューと同じモデルは必要ない。PDFから選択可能なテキストを抽出するのに、常に視覚的推論が必要なわけでもない。

モデルルーティングは、その区別を自動的に行える。ルーティングシステムは、単純なリクエストをより小型で低コストなモデルに送り、難しいタスクには高度なシステムを割り当てる。また、従来のソフトウェアの方が適切に処理できるリクエストを拒否することも可能だ。

Associated Pressは、トークン消費の最大化が支持を失うなか、企業がこうしたルーティングの検討をますます進めていると報じた。同社の職場コスト報告は、企業がAI利用によるリターンを検証し、定型業務での高度なモデル利用を抑制している状況を伝えている。

ルーティングにも判断は必要だ。短いプロンプトの背後に高リスクなタスクが隠れていることもあれば、長い文書が基本的な抽出だけを必要とすることもある。企業には、機密性、複雑性、正確性の要件、期待価値に基づく方針が必要だ。

調達チームにも圧力がかかる。サブスクリプション、利用量契約、クラウドサービス、そして活動をそれぞれ異なる方法で計測する組み込みAI機能を比較しなければならない。予測可能なシートライセンスにも、利用上限や制限が含まれている場合がある。

CIOは技術的な問題を引き継ぐが、その支出を継続的に支持するに値するかを判断するのはCFOだ。事業部門のリーダーは、ツールが何を生み出すのかを説明しなければならない。セキュリティチームは、従業員がどの情報を外部モデルに送信しているかを追跡する必要がある。

その共有された説明責任は新しいものだ。従来のソフトウェア予算では、ライセンスを部門に割り当てることが多かった。エンタープライズAIでは、各ワークフローを消費量と成果の両方に結び付ける必要がある。

成果は「従業員がより多くAIを使った」では不十分だ。解決の迅速化、不具合の削減、追加収益、反復作業の削減など、組織が価値を置くものを示さなければならない。

ナレッジワーカーには代替手段も必要だ。情報がすでにローカルに存在する場合、検索可能なナレッジベースは、文書の繰り返しアップロードを減らせる。検索精度を高めれば、ファイル全体ではなく関連する箇所だけを送信できる。

したがって、この変化は支出方針だけでなく、ワークフロー設計にも及ぶ。単にトークン上限を設ける企業は消費量を減らせる。しかし、継続すべき業務を特定できるとは限らない。

AI利用の最大化が測定可能な価値と衝突している

活動量が生産性の証拠の代わりになると、無制限利用という夢は破綻する。

ここ数年、経営幹部は従業員のAI導入が十分に速くないことを懸念していた。企業はパイロットに資金を投じ、アシスタントを配布し、研修プログラムを整備し、チームにユースケースの発掘を促した。

導入がボトルネックだった時期には、この戦略は理にかなっていた。生成AIがどこで機能するのかを理解していた組織は少なかった。幅広い実験は、有用なパターンを明らかにするのに役立った。

ボトルネックは移った。数千人の従業員が高度なモデルを呼び出せるようになると、実験は継続的な運用コストとなる。問いは「人々はAIを使っているか」から、「どの利用を拡大する価値があるか」へと変わる。

Accentureの対応は、この移行を明示している。同社のtokenomics programは、リアルタイム監視、説明責任、モデルの適合、トランザクション当たりのコストを掲げている。

同社は、消費を可視化し、非効率な設計を修正し、ワークロードの変化に合わせて統制を維持するという3段階のアプローチを説明している。この構造はクラウドの財務運用に似ているが、AIではタスク品質やエージェントの振る舞いをめぐる不確実性がより大きい。

したがって、主な対立軸はAccenture対モデルベンダーではない。摩擦のないAIの潤沢さという約束と、説明責任を伴うエンタープライズ支出という現実の対立である。

利用の最大化は目に見える高揚感を生む。プロンプト数、生成文書、エージェント実行数、導入ダッシュボードを生み出す。しかし、これらの指標のどれも、組織がそれに見合う価値を得たことを確認するものではない。

測定可能な価値は、より時間がかかり、見栄えもよくない。基準値との比較が必要になる。チームは、AI導入前に作業にどれだけ時間がかかったか、品質が変化したか、人による確認がどれほど必要なままかを問わなければならない。

PDF変換は、ここでも適切な試験となる。AIワークフローがレポートをスライドに変換するなら、企業は従来の抽出・プレゼンテーションツールと比較すべきだ。修正時間、事実誤認、書式の修復、レビューも含める必要がある。

それでもAIの経路が勝つ可能性はある。モデルは不規則なレポートを解釈し、テーマを特定し、硬直的なソフトウェアより速く有用なストーリーを下書きできるかもしれない。要点は、AIがPDFに決して触れるべきでないということではない。

要点は、モデル利用がその存在意義を示さなければならないということだ。より多くのリソースを消費するエージェントでも、より価値の高い作業を完了させるなら価値がある。誰も出力を必要としないなら、低コストのワークフローでも無駄なままだ。

この違いはモデルベンダーにも課題を突き付ける。顧客がより長いコンテキストを送り、より多く推論し、より多くの手順を委任するほど、その製品には利益がある。エンタープライズの購入者が利益を得るのは、それらの手順が成果を改善するときだけだ。

ベンダーはキャッシュ、バッチ処理、小型モデル、ルーティング機能を追加している。こうしたツールは無駄を減らすが、インセンティブの不一致を解消するわけではない。プロバイダーは依然として消費量や導入拡大から収益を得る。

企業には独自の測定レイヤーが必要だ。リクエスト、モデル選択、トークン量、レイテンシー、失敗率、人の介入、関連する業務プロセスを記録すべきである。

また、停止ルールも必要だ。エージェントは可能だからという理由で、価値の低い文書の修正を続けるべきではない。予算、ステップ上限、信頼度しきい値、承認ゲートによって、際限のない作業を制約できる。

同じ規律は個人のAIワークフローにも当てはまる。同じ情報源を繰り返しアップロードすることは、時間とコンテキストの浪費だ。knowledge blendingをサポートするシステムなら、リクエストごとに完全なコンテキストを再構築せず、選択した情報を取得できる。

Simon Willisonは長年にわたり、言語モデルの実務上の振る舞い、その限界、コスト、セキュリティ上の影響に注目してきた。彼のPDFに関する指摘は、その姿勢に合致する。示唆に富む詳細は、大きなモデル発表ではなく、日常的な実装上の選択に現れることが多い。

トークン統制はそれ自体が失敗を生む可能性がある

大ざっぱな支出抑制は、有用な実験を破壊する一方で、最も見えにくい無駄を温存しかねない。

コスト管理の必要性は強いが、入手可能な証拠は、非エンジニアがエンタープライズAIの過剰支出の主因であることを証明していない。Accentureのコメントは、公開された消費監査ではなく、報じられた非公開の議論に基づくものだった。

印象的なPDFの話は注意を歪めうる。文書変換はワークフローが過剰に聞こえるため、批判しやすい。高価なエンジニアリングエージェントも、大きなコンテキストを消費し、テストを実行し、リポジトリを調べ、失敗した変更を再試行することがある。

こうしたエンジニアリング作業はより大きな価値を生むかもしれないが、企業にはなお証拠が必要だ。技術的なラベルが消費を効率的にするわけではない。同様に、非技術的な依頼が重要な法務、営業、研究の仕事を支えることもある。

組織はトークン管理を従業員監視に変えるべきではない。プロンプトログには、機密業務、人事情報、顧客記録、初期段階のアイデアが含まれうる。詳細な監視はセキュリティとプライバシーに関する義務を生み出す。

コスト配賦は協働を妨げる可能性もある。各部門に厳格なトークン予算が与えられると、チームは実験を隠したり、中央ダッシュボードの外に残るツールへ支出を移したりするかもしれない。

厳しい上限には別のリスクもある。エージェントが価値あるタスクを完了する前に停止し、従業員には手作業での復旧がなお必要な中途半端な成果物が残る可能性がある。組織はトークンを節約するが、期待された利益を失う。

低コストモデルへのルーティングは、品質を下げながら支出を抑えることがある。小型モデルは文書の詳細を見落とし、ツール指示を誤って処理し、もっともらしい誤りを生成する可能性がある。繰り返し修正が必要なワークフローは、全体ではより高コストになりうる。

EYは、トークンはエージェント経済性の中で最も目に見えやすい部分にすぎないと論じている。同社のagent cost analysisには、インフラ、ガバナンス、組織変革、障害復旧、規制上のリスクが含まれる。

局所的な最適化が費用を別の場所へ移す可能性があるため、この広い視点は重要だ。モデルの消費を減らすと、従業員のレビュー時間が増えるかもしれない。評価実行を削減すると、高コストな誤りが本番環境に入り込む可能性がある。

企業は、トークン総数の低下を祝うのではなく、ワークフロー全体のコストを測定すべきだ。また、介入の前後で品質、速度、リスクを比較すべきである。

ここで「tokenpocalypse」という呼称は誤解を招きうる。問題は、トークンが突然どこでも手の届かない価格になったことではない。急速な導入によって、弱い測定と不明確な責任分担が露呈したことだ。

一部の組織は、AIプログラムが依然として経済的に魅力的であると判断するだろう。他方で、戦略的価値の乏しい業務を従業員が自動化していたと気付く組織もある。大半の企業は、同じ社内に両方のパターンを見つけるだろう。

単位コストは下がり続け、モデルも改善を続ける。こうした傾向は、恒久的な支出の壁という予測を弱める。一方で、低コスト化がさらに大きな消費を招くため、ガバナンスの必要性を強める。

したがって、懐疑的な結論はより限定的だ。企業が必ずしもAIを放棄しているわけではない。導入目標から配分の意思決定へ移行しており、その意思決定は依然として評価が難しい。

次の3つのシグナルがtokenomicsの有効性を示す

次の段階は、ワークフローレベルの収益、自動モデルルーティング、エンタープライズの購買行動の変化によって評価される。

最初のシグナルは、企業がトークン総削減ではなく、完了した業務プロセス当たりのコストを報告するかどうかだ。有用な指標は、解決した1件のサポート案件、レビュー済みの契約、完了したソフトウェア変更、完了した調査タスクを追跡するものになるだろう。

これは、支出を出力と結び付けるため、tokenomicsの主張を強める。企業が消費量の低下だけを公表するなら、生産性を改善せずに利用を抑制している可能性がある。

Accentureが自社の提供サービスをどのように発展させるかに注目したい。同社のアプローチは、ワークフロー、所有者、モデル、エージェントをまたぐ可視性を約束している。404 Mediaが特定した社内懸念が実行可能な管理規律になったことを示すには、再現可能な顧客成果の証拠が必要となる。

2つ目のシグナルは、自動ルーティングの広範な普及だ。現在、従業員は製品メニューやデフォルト設定を通じて多くのモデル選択を行っている。これは、評価に必要な情報を持たないユーザーの前に、技術的なコスト判断を置くことになる。

効果的なルーティングは、それを必要とするタスクにのみ高度な推論を割り当てる。単純な抽出、分類、書き換えは、小規模なシステムや従来型ソフトウェアに送ることになる。

決定的な指標はルーティングの頻度ではない。総ワークフローコストを下げながら品質を維持できるかどうかだ。修正率が高ければ、積極的なモデル格下げの根拠は弱まる。

3つ目のシグナルは、エンタープライズ購買の変化である。購入者は、共有利用プール、詳細なテレメトリー、強制可能な予算、キャッシュ統制、成果とより密接に結び付いた契約を求めるかもしれない。

また、ドキュメント全体をフロンティアモデルへ繰り返し送ることなく、ローカル情報を処理できる製品を好む可能性もある。それは最大限のトークン処理量ではなく、効率的なコンテキスト管理に報いることになる。

ベンダーがより明確な統制と予測可能な消費を提供すれば、現在の反発は通常の成熟サイクルとして映るだろう。エンタープライズAIは、より厳格な財務ルールの下で拡大を続ける。

コストが不透明なままであれば、企業はより広範な制限を課す。その結果、実験は鈍化し、小型、オープンウェイト、またはローカル運用のモデルに対する需要が高まるだろう。

Simon Willisonの指摘は、あらゆるAIワークフローを評価する際の実践的な問いを読者に与える。モデルは実際にどの作業を行っており、その作業になぜこのモデルが必要なのか。

次に大きな文書をエージェントへ送る前に、この問いを当てはめてほしい。テキスト抽出、検索、ローカル処理、または小型モデルで最初の段階を完了できるか確認する。高価な推論は、判断を要する部分に限定する。

tokenpocalypseはエンタープライズAIの終わりではない。生成されたすべての出力を進歩の証拠として扱う時代の終わりである。成果を測定し、コンテキストを制御し、意図的にタスクをルーティングする企業は実験を続ける。導入数だけを数える企業は、その後になって請求書を発見し続ける。

 
 

無料で始めましょう

ローカルファーストのパーソナル知識管理付きAIアシスタント

より良いAI体験のために、

remio は現在、 Windows 10+ (x64)M-Chip Mac のみをサポートしています。

仕事のAIパートナー
remioでもっと仕事が進む

計画・作成・仕上げまで
すべてをひとつに

bottom of page