top of page

Microsoftの28,000ドルAI異常値、より効率的なAI活用への転換を試す

9月2日
読了時間: 20分

Microsoftでは、ある従業員が28日間で28,000ドル相当のAIリソースを消費したと報じられ、直近のGoogle News見出しの裏で鮮明な対立が浮かび上がった。同社は長年にわたり、従業員にAIの活用を促してきた。しかし現在は、より多くのトークンを消費しても、必ずしもより大きな価値が生まれるわけではないと伝えている。

この異例の数値は、監査済みの企業支出報告書ではなく、自主的に記入された報酬情報のスプレッドシートに掲載された。報道によると、約350人の従業員がAI利用額を入力し、提出額の中央値は約300ドルだった。このため見出しとなった数字は、極端な外れ値、報告ミス、あるいは非常に高コストな業務を示している可能性がある。

より大きな論点は、その1件の入力が代表的であるかどうかには依存しない。社内ガイダンスに関する報道によれば、Microsoftは部門別のトークン予算と個人の利用状況追跡を別途導入している。同社のメッセージは、導入の最大化から、AI消費の各単位から測定可能な成果を最大化することへと移っている。

この変化は、企業AI全体に広がる問題を捉えている。エージェント型コーディングシステムは、ファイルの読み込み、コード生成、テスト実行、失敗の確認、再試行を繰り返すことができる。各ループでは、プロンプトの処理や応答生成に使われる小さな単位であるトークンが消費される。

大量消費は、価値ある自動化、無駄な反復、あるいはその両方を反映し得る。利用状況ダッシュボードは活動を記録するが、通常はこれらの結果を区別できない。Microsoftは、企業にAI中心の未来を売り込むのと同じ組織内で、この測定上のギャップに直面している。

Microsoftで報じられたAI利用データが実際に示すこと

28,000ドルの記録は目を引くが、見出し以上に重要なのは分布とデータ品質の弱さだ。

この数値は、Microsoft従業員が報酬の詳細とAI利用状況を自主的に共有した社内スプレッドシートに由来する。決算報告書、規制当局への提出書類、Microsoftの公式発表を通じて示されたものではない。

元のAI支出レポートによると、最高額の提出はMicrosoftのCustomer and Partner Solutions組織からのものだった。この記録は、直近28日間のローリング期間を対象としていた。

参加者は限定的だった。報道によれば、米国の従業員約600人が何らかの情報を提供し、そのうち約350人がAI利用額を含めた。Microsoftの世界全体の従業員数は223,000人超であり、この標本は非常に小さく、自己選択された集団である。

この制約により、報告された中央値をMicrosoft全体へ責任を持って外挿することはできない。利用額を入力した従業員は、入力しなかった従業員と大きく異なる可能性がある。スプレッドシートには、社内システムで算出された推定値と手入力の値が混在している可能性もある。

それでも、報告された数値は重要なパターンを示している。類似した組織で働く人々の間でも、AI消費は数桁の差があった。

報道によれば、部門別中央値が最も高かったのはCoreAIで975ドルだった。続いてSecurityが526ドル、Microsoft AIが490ドル、Cloud and AIが325ドル、Experiences and Devicesが250ドルだった。

Azureの中央値は241ドル、Customer and Partner Solutionsは134ドルだったとされる。しかし、最高額の個人記録は、この中央値の低い組織から出ている。

報じられた他の外れ値には、CoreAIの16,000ドル、Cloud and AIの15,000ドル、Securityの10,000ドルが含まれる。これらの数値は、役職や部門だけでは消費量を説明できないことを示唆している。

このデータは、各従業員が何を生み出したかを明らかにしていない。モデル、ワークロード、エージェント数、請求方法、各金額の背後にある事業成果も特定していない。

この欠けている文脈は決定的だ。エンジニアは、重大インシデントの解決、大規模コードベースの移行、社内製品のテストを行う際に多額を使うかもしれない。別の利用者は、ほとんど使える成果を生まない管理不十分なループによって、同程度の請求額を発生させる可能性がある。

28,000ドルの記録自体が誤っている可能性もある。単位換算、重複した会計イベント、誤った自己申告により、人工的な外れ値が生じることがある。Microsoftは、この個別の数値を公に検証しておらず、算出方法も説明していない。

こうした留保を踏まえても、このスプレッドシートは、生の消費量が弱い業績シグナルである理由を明らかにしている。最上位の利用者は報告中央値の90倍以上を使ったが、入手可能なデータは、価値が比例していたかを何も示していない。

これこそが、この出来事が引き起こした本質的な問題だ。Microsoftはもはや、従業員がAIを導入するかどうかだけに対処しているのではない。どのような導入形態が変動的なインフラコストを正当化するかを判断しなければならない。

Google Newsの見出しは物語の一部にすぎない理由

Google Newsの注目は1人の従業員に集まっている一方、Microsoftの社内方針は全社的なインセンティブの変化を示している。

Microsoftが報じられた対応を始めたのは、この外れ値が拡散する見出しになる前だった。2026年7月、同社の各部門にはAIトークン予算の目標が伝えられたとされる。従業員は社内ダッシュボードを通じて、自身の消費量も確認できるようになった。

MicrosoftのCoreAIグループでエグゼクティブ・バイス・プレジデントを務めるJay Parikhは、8月初旬のメモでこの方針を強調した。そのメッセージは、AI利用の一律削減ではなく、価値に焦点を当てたものだった。

報じられた社内AIガイダンスによると、Parikhは「私たちが最適化しているのはtokenmaxxingではない」と記した。彼は従業員に対し、顧客と事業に影響する成果へ注力するよう求めた。

Parikhはまた、Microsoftが他の重要なリソースに適用している規律でトークン支出を管理すると述べた。報道によれば、このメモでは一律の支出上限は示されなかった。

この違いは重要だ。MicrosoftはエンジニアにAIの利用をやめるよう命じたのではない。利用量だけでは会社の目標を満たさないと伝えたのである。

この方針は、企業導入の第1段階で生じたインセンティブの問題を反映している。企業は従業員に実験してほしかったため、経営陣は利用の増加や目に見えるエンゲージメントを称賛した。

一部の組織はダッシュボードや非公式の競争を導入した。これらの仕組みは、実用的な成果を定量化するのが難しい場合でも、トークン消費を測定しやすくした。

従業員は可視化された指標に反応する。経営陣が利用量を強調すれば、従業員にはモデルを動かし続けたり、並列エージェントを起動したり、リソース集約型のシステムを選んだりする理由が生まれる。

この行動はtokenmaxxingとして知られるようになった。この用語は、AIトークンの消費量を最大化しようとする取り組みを指し、ときに高い利用量が意欲や生産性の証拠として扱われることを背景としている。

Microsoft CEOのSatya Nadellaは、自身がAIを多用することに惹かれていると認めている。さらに重要なのは、顧客が高価なフロンティアモデルと、それらに提供するデータから十分な価値を得ているのかを問いかけていることだ。

この変化は、ソフトウェア管理における過去の誤りを思わせる。かつてコード行数は便利な生産性指標として使われた。この測定は出力量を報いる一方、より短く保守しやすいコードの方が問題をうまく解決することも多かった。

トークンも同じ誘惑を生む。客観的に見える正確な数字を提供するからだ。しかし、その数値が測るのは計算活動であり、完了した仕事、顧客満足度、信頼性、収益ではない。

したがって、この拡散した外れ値は、Microsoftにとってより難しい課題から注意をそらしている。同社は、単純な導入指標を、エンジニアリング、営業、セキュリティ、プロダクトチームにまたがって機能する成果モデルへ置き換えなければならない。

管理職は、消費量を具体的な成果物に結び付ける必要がある。たとえば、解決済みのインシデント、完了した移行、承認されたコード変更、短縮されたサポート待ち行列、検証済みの顧客機会などが該当する。

こうした測定には、月次ダッシュボード以上のものが必要だ。チームには、プロンプト、出力、レビュー判断、最終結果を保存する追跡可能なワークフローが必要になる。

構造化されたAIワークフローは、チームが生成物を、それが支えた意思決定と結び付ける助けになる。この文脈は、トークン総数よりも多くの情報を提供する。

Microsoftの方針転換は、導入がより厳しい段階に入ったことを示唆している。実験は引き続き推奨されるが、説明のつかない消費は精査を受けることになる。

より多くのトークンがより良いAI成果を保証しない

エージェント型システムは、精度を比例して改善することなく、膨大なコンテキストを消費し得る。

従来のチャット形式のやり取りは、比較的範囲が限定されている。ユーザーがプロンプトを送信し、モデルがコンテキストを処理して回答を返す。その後、追加のターンに価値があるかをユーザーが判断する。

AIコーディングエージェントは異なる動作をする。リポジトリの調査、ドキュメントの検索、ファイルの修正、コマンド実行、失敗の確認、サイクルの反復が可能だ。

各アクションはコンテキストを追加する。長いコードファイル、コマンド出力、ログ、過去の試行結果は、その後のステップでモデルに再び渡される場合がある。そのため、1つの割り当てが多数の大規模な推論呼び出しへと拡大することがある。

並列エージェントは影響を増幅させる。従業員は複数のエージェントに同じバグの調査や競合する実装の作成を依頼するかもしれない。このアプローチは網羅性を高め得るが、高コストな作業を繰り返す可能性もある。

作業量と品質の関係は線形ではない。8つのフロンティアモデルを対象とした2026年の研究では、エージェント型コーディングタスクは通常のコーディング対話よりもはるかに多くのトークンを消費したことが示された。

研究者らは、同一のタスクでもトークン消費量が最大30倍異なり得ると報告した。利用量が多いほど精度が一貫して高くなるわけではなかった。

エージェント支出に関する研究によると、性能は中程度の水準までは向上することが多いが、その後は飽和した。フロンティアモデルも、最終的なトークン使用量を予測することに苦戦した。

これらの知見は、従業員に一律の上限を設けることが粗雑な手法である理由を説明している。一部の難しいタスクには広範なリポジトリ調査が必要だ。一方で、エージェントに情報が不足していたり、弱い計画に従っていたりするために、反復ループへ入るタスクもある。

測定された消費量の多くは入力コンテキストによって左右された。この点は、従業員が短い回答を求めるだけでコストを簡単に管理できるという考えに疑問を投げかける。

大規模なリポジトリを繰り返し読み込むエージェントは、目に見える出力を生成する前にかなりのリソースを消費し得る。ツールの結果やテストログは、コンテキストをさらに膨らませることがある。

モデル選択も別の変数を加える。最も高性能なモデルは、アーキテクチャの判断、難しいデバッグ、セキュリティ分析では正当化されるかもしれない。書式設定、定型的なドキュメント作成、単純なコード変換には不要な場合がある。

報道によれば、Microsoftは社内作業のデフォルトとしてGPT-5.6 Solを採用することで対応した。報道では、同社のワークフローにとってよりトークン効率の高い選択肢と説明されている。

デフォルト設定は、他のモデルを禁止するものではない。従業員に各リクエストを手作業で評価させることなく、何千もの日々の選択に影響を与え得る出発点を変えるものだ。

これは、ソフトウェアがより簡単なタスクを効率的なシステムに送り、より高価なモデルを難しい作業のために確保するモデルルーティングに似ている。ルーティングは、方針、自動分類、ユーザー選択を通じて行うことができる。

Microsoft自身の商用ドキュメントは、AIエージェントに対する利用制御を重視している。Copilotのコストガイダンスでは、従量制消費、支出管理、不必要な処理を減らす方法が説明されている。

したがって、この社内方針の転換は、Microsoftの顧客が直面する製品上の課題とも一致している。企業は、変動する利用量を理解・管理できる状態を保ちながら、エージェントに有用な作業を担わせたいと考えている。

効率性とは、すべてのプロンプトを最小化することではない。信頼できる結果を得るために、十分なコンテキスト、推論、検証を選択することだ。

誤ったコードを生成する短い実行は、経済的ではない。許容できる回答に到達した後も、延々とテストを繰り返すエージェントも同様だ。

有用な単位は、許容できる品質水準で完了した作業である。トークン数は、その成果に到達するコストに影響するため重要だが、それ自体が成果を定義することはできない。

MicrosoftのAIファーストの約束、予算の現実と衝突

Microsoftは、従業員に求めてきたAIファーストの行動を弱めることなく、非生産的な利用を抑えようとしている。

これがこの記事における中心的な逆転である。Microsoftが幅広い導入を促したのは、社内利用が開発を加速させ、自社製品への自信を示せる可能性があったからだ。

その戦略は二次的な問題を生んだ。AIがワークフロー全体に組み込まれると、その追加的な利用量を予測することが難しくなった。

シート単位のソフトウェアは、財務チームに予測可能な継続コストをもたらす。エージェント型サービスでは、タスクの複雑さ、モデルの選択、コンテキスト長、再試行の挙動によって利用量が変動する。

従業員は1つのエージェントを起動することも、複数を起動することもできる。各エージェントはツール呼び出しを行い、最初のプロンプトの後も作業を続けられる。従業員数が固定であっても、ソフトウェア利用量が固定とは限らなくなった。

この緊張関係は、Microsoftの社内予算を超えて広がっている。同社は、同じ会計上の問題に直面する顧客に、クラウドインフラ、Copilot製品、開発者ツール、エージェントプラットフォームを販売している。

したがってMicrosoftには2つの役割がある。顧客のAI利用が増えれば利益を得る一方、利用増が事業価値を生むことを証明しなければならない。

社内方針は、より良いガバナンスの証拠になり得る。同時に、コストの可視性、ルーティング、製品のデフォルト動作にある弱点を明らかにする可能性もある。

報じられたメモは、この2つの役割を慎重に両立させようとしていた。Parikhは、Microsoftがトークン数の削減を最適化しているのではないと述べた。目指しているのは、トークン当たりのインパクト向上だという。

この表現は、同社のAIファーストの姿勢を保ちながら、評価基準を変えるものだ。従業員は実験を続けられるが、高い活動量には成果に基づく説明が必要になる。

より広い市場でも、すでに同様の調整が始まっている。Associated Pressは、トークン費用の上昇に伴い、企業がルーティング、オープンモデル、より効率的なシステムを検討していると報じた。

Bainのコンサルタント、Jue Wangは、一部の大企業ではトークンコストがほぼ隔月で倍増していると語った。企業はしばしば、それを必要としないタスクにも高性能モデルを割り当てていると指摘した。

Mozillaの最高技術責任者であるRaffi Krikorianは、tokenmaxxingを、プログラマーをコード行数で測ることになぞらえた。企業が生産性との弱い結び付きを認識するにつれ、この慣行は廃れていくと予想した。

企業におけるトークン利用の変化は、OpenAIとAnthropicにも圧力をかける。両社は大量利用の恩恵を受けるが、顧客はより高い効率性と明確なリターンを求めるようになる。

Microsoftは、OpenAIと密接な関係を維持しつつ、自社のモデル、インフラ、オーケストレーション層を開発しているため、特に複雑な立場にある。

社内のデフォルト設定は、そのバランスに影響し得る。定型的な作業を効率的なモデルへルーティングすれば、専門システムへのアクセスを維持しながら利用量を削減できる。

競合各社も同じトレードオフに直面している。Amazonは、コストへ焦点を移す前に、社内AI利用ランキングを試験的に導入したと報じられている。Metaも導入ラッシュの際、積極的なトークン消費を促した。

Uberは、AIコーディングツール向けに計画していた年間配分を数カ月以内に使い切ったと報じられている。この事例は、従来型の開発者ソフトウェアを前提に設計された予算を、エージェント導入がどれほど急速に圧倒し得るかを示した。

これらの例は、企業向けAIに価値がないことを証明するものではない。導入の進展が、ガバナンスや会計を上回る速さで進み得ることを示している。

問題は、エージェントがテキストエディタより多くのリソースを消費するかどうかではない。納品期間を短縮し、信頼性を高め、アウトプットを拡大し、あるいは利用量を正当化できるだけの手作業を削減するかどうかだ。

Microsoftの方針は、この問いを避けられないものにしている。Copilotを購入する、あるいはエージェントを構築する大企業はすべて、いずれ財務責任者から同じ説明を求められるだろう。

それでも$28,000の主張が証明しないこと

報じられた外れ値だけでは、ワークロードと成果のデータなしに、無駄、生産性、あるいはMicrosoft全体の行動を立証できない。

スプレッドシートが任意提出であることは、選択バイアスを生む。AI利用を綿密に追跡している従業員ほど提出しやすく、軽度の利用者はその列を無視する可能性がある。

数値も自己申告だった。Microsoftは、従業員が標準化されたトラッカーから数値を転記したのか、推定したのか、異なる利用カテゴリーをどう解釈したのかを説明していない。

ドル換算の欄は、さらに曖昧さを生み得る。社内インフラコスト、顧客向けの相当価格、割り当てられたクレジット、あるいは別の会計モデルを示している可能性がある。

これらの値は互換ではない。小売価格相当の金額は、同社の限界計算コストを大幅に上回る場合がある。社内配分には、直接的なモデル推論以外の間接費も含まれ得る。

入手可能な報道は、その従業員を特定していない。その人物の役割、タスク、モデル、成果物、事業上の結果も説明していない。

そのため、最も刺激的な解釈を検証することはできない。Microsoftの外部にいる人は、その従業員がリソースを浪費したのか、並外れて価値の高い作業を完了したのかを判断できない。

この記録は、ストレステストを反映している可能性がある。製品評価、顧客デモ、データ準備、または大規模なソフトウェアプロジェクトに関わるものかもしれない。

一方で、高コストのループに陥ったエージェントを反映している可能性もある。実行トレースがなければ、どちらの説明も推測の域を出ない。

報じられた部門別中央値にも、同様の慎重さが必要だ。任意提出に基づく中央値は、Microsoftの各組織における平均利用量を測るものではない。

部門ごとに行う業務も異なる。CoreAIのエンジニアが、顧客関係や管理プロセスを中心とするグループの従業員より頻繁にモデルとやり取りするのは、合理的なことだ。

有効な比較であっても、成果の指標が必要になる。高コストのセキュリティ調査は、はるかに大きな損失を防ぐ可能性がある。低コストで生成された要約でも、見逃された誤りを含んでいれば被害を生む可能性がある。

この不確実性は、厳格な上限へ急ぐことではなく、より良い測定の必要性を強める。ハードリミットは無駄を止められるが、最悪のタイミングで価値ある作業を中断させる可能性もある。

タスク単位の予算は代替案の1つだ。チームは複雑な作業により多くの能力を配分しつつ、定型的な要求は効率的なシステムにルーティングできる。

承認のしきい値も別の選択肢だ。従業員は通常の範囲内であれば自由にモデルを利用し、特に負荷の高いワークロードについては目的を記録することができる。

成果レビューでは、受け入れられたコード、解決済みの問題、デプロイ頻度、インシデント率、削減された時間を調べられる。いずれも単独では完全な答えを与えない。

品質は、引き続き計算の一部でなければならない。もっともらしいが欠陥のある作業を生成するエージェントは、労力を作成からレビューへ移すだけになり得る。

データガバナンスは、別のコスト面を加える。独自の資料を外部モデルへ送信すると、トークン支出が控えめに見える場合でも、セキュリティ、機密性、保持に関する懸念を生み得る。

したがってMicrosoftは、ある単純な指標を別の指標に置き換えることを避けなければならない。低消費を奨励することは、高消費を奨励するのと同じくらい評価を歪める可能性がある。

最も強い方針は、効率的かつ信頼性の高い完了を測定するものだ。必要な実験を認めつつ、説明のつかない外れ値を調査する。

このアプローチは、信頼できる記録にも依存する。チームは、どの情報源、プロンプト、モデル出力、人間の意思決定が結果に寄与したかを把握する必要がある。

検索可能なナレッジベースは、その運用上の文脈を保存できる。リターンを自動計算することはできないが、月次合計を超えた証拠をレビュー担当者に提供する。

Microsoftは、そのような評価フレームワークを公表していない。報じられた予算とダッシュボードはコスト可視化を表しており、それはガバナンスの最初の層にすぎない。

同社の次の課題は、帰属の明確化だ。トークンに代わる指標を従業員が操作することを促さずに、利用量と有用な成果を結び付けなければならない。

Microsoftのトークン抑制策の後に注目すべきこと

Microsoftがより良いAI経済性を構築しているのか、それとも目に見えるコスト問題を抑え込んでいるだけなのかは、3つのシグナルで分かる。

第1のシグナルは、Microsoftのデフォルトモデル方針だ。報道によると、同社は効率性の向上を目指し、GPT-5.6 Solを社内標準の選択肢とした。

Microsoftがこのデフォルトを維持するのか、自動ルーティングを拡大するのか、あるいは高消費モデルへのアクセスを変えるのかに注目したい。安定したルーティング方針は、同社が無差別な削減ではなく、より賢明な配分を目指しているという主張を支えるだろう。

モデルルーティングは、タスク要件に応じたものでなければならない。すべての作業を最も安価なシステムへ送れば、手戻りが増え、品質が落ち、見込んだ節約が失われる可能性がある。

注目すべき指標は、トークンのグラフが下がることではなく、タスクを成功裏に完了できたかどうかだ。Microsoftは、デフォルト変更後もチームが納品速度、コード品質、インシデント対応の成果を維持しているかを検証すべきだ。

第2のシグナルは、部門別予算が従業員の行動にどう影響するかである。Microsoftは、全社共通の個人上限を公表せず、部門ごとにトークン目標を割り当てたと報じられている。

この構造は管理職に柔軟性を与える一方で、一貫しない運用を招く可能性もある。あるグループは目標を指針として扱い、別のグループは厳格な上限に変えるかもしれない。

有用なシステムであれば、高価値な作業について、記録を伴う例外を認める。また、すべての大きな数値を不正利用と決めつけず、繰り返し現れる外れ値を調査する。

Microsoftが成果管理なしに厳格な制限を導入すれば、この抑制策は従来型のコスト削減に見えるだろう。予算とタスク帰属を組み合わせれば、この方針はより広範な効率化戦略を支えるものになる。

第3のシグナルは、Microsoftが企業顧客に何を提供するかだ。社内での経験は、Copilotのダッシュボード、エージェント制御、ルーティング、コスト予測に影響を与えるはずだ。

顧客が必要としているのは、利用後に届く請求書だけではない。アラート、予算、モデルの推奨、タスクレベルの帰属、コストのかかるエージェント動作に関する明確な説明が必要だ。

これらの制御を製品横断でより簡単に設定できるようになれば、Microsoftはその立場を強化できる。そうすれば、社内のガバナンス問題を製品上の教訓へと変えられる。

失敗した場合は異なる姿になる。コストは引き続き顧客を驚かせ、管理者は大まかな制限を課し、従業員は追跡されていないツールへ作業を移すだろう。

競合の対応も重要だ。OpenAI、Anthropic、Google、Amazon、そしてオープンモデルの提供者にはすべて、トークン効率と可観測性を改善するインセンティブがある。

より安価なモデルは、難しいベンチマークで最強のシステムに後れを取っていても、定型的なワークロードを獲得できる。企業の購買担当者にとって、予測可能な完了コストは、最高性能と同じくらい重要になり得る。

$28,000という外れ値はいずれGoogle Newsのサイクルから消える。会計上の問題は残る。

Microsoftは、正しい問いを可視化した。組織はAI利用によって何を得たのか。その答えをトークンだけから導くことはできない。

開発者は、新しい制御機能が難易度の高い作業を遅らせることなく、無駄を減らせているかを注視すべきだ。エンタープライズの購入担当者は、導入を拡大する前に、タスク単位のコストと品質に関する根拠を求める必要がある。

ナレッジワーカーも、目に見える活動と完了した成果を区別すべきである。より多くのエージェントを稼働させることは生産的に感じられるかもしれないが、追加のレビュー、重複作業、分断されたコンテキストを生む可能性がある。

エンタープライズAIの次の段階では、モデルを説明責任のあるワークフローと結び付けられる組織が報われるだろう。Microsoftは社内の制御機能が成果を改善することを示せるのか。それとも、次の極端なスプレッドシートのエントリーが、再び同じ測定上のギャップを露呈させるのだろうか。

 
 

無料で始めましょう

ローカルファーストのパーソナル知識管理付きAIアシスタント

より良いAI体験のために、

remio は現在、 Windows 10+ (x64)M-Chip Mac のみをサポートしています。

仕事のAIパートナー
remioでもっと仕事が進む

計画・作成・仕上げまで
すべてをひとつに

bottom of page