OpenAIのCodex Agentsが社内AIトークン利用を支配
OpenAIによると、現在、同社の社内における週間出力トークンの99.8%はCodexが生成している。これは、企業のAI支出を扱った最近のGoogle Newsの記事で注目された逆転現象だ。
この数値は、支出、売上、生産性を示すものではない。技術を販売している企業の内部で、モデルが生成したテキストの断片である出力トークンを測定したものだ。それでも、OpenAIの従業員によるAIの使い方に大きな変化が起きていることを捉えている。
かつてはChatGPTが社内AI業務の大半を担っていた。より長いタスクを実行し、ツールも利用できるエージェントであるCodexが、現在ではエンジニアリング、法務、財務、採用にわたる活動を支配している。
重要な競争は、もはやOpenAIと別のモデル提供者の間ではない。チャットベースの支援と、委任されたエージェント作業との間にある。チャットボットは依頼に答える一方、エージェントはファイルを調べ、ツールを呼び出し、方針を修正し、数分から数時間にわたって動作できる。
OpenAIは、この移行を、生産的な仕事がエージェントへ移っている証拠として提示している。同時に、この移行はAI消費を予測、帰属、保護、評価することをより難しくする。
したがって企業の購入担当者は、Google Newsの見出しが示す以上に切実な問いに向き合う必要がある。増加するトークン利用が価値ある委任作業を表すのか、それとも同等の成果を伴わない活動を生む高価なループなのかを見極めなければならない。
OpenAIのトークン移行が実際に示すこと
OpenAIの社内データは決定的な行動変化を示しているが、すべての企業が同じ成果を得られることを立証するものではない。
OpenAIは2026年8月12日に分析結果を公表した。同社は個人顧客、組織ユーザー、自社従業員におけるCodexの活動を調査した。
2025年8月までは、平均的なOpenAI従業員がCodexに向けるトークンの割合は10%未満だった。この期間、ChatGPTは社内AI利用のデフォルトのインターフェースであり続けた。
Codexがより長時間の実行、より優れたモデル、並列タスクへの対応を獲得するにつれ、バランスは変化した。OpenAIによると、現在では平均的な従業員が出力トークンの85%以上をCodex経由で生成している。
OpenAIのagent adoption dataによると、Codexは全社の週間出力トークンの99.8%を占める。この2つの数値の差は重要だ。
1つ目の数値は、平均的な従業員におけるCodexとChatGPTの活動構成を表す。2つ目は生成トークン全体を反映しており、エージェントを集中的に利用するユーザーの影響を大きく受ける。
エージェントは、通常のチャットより自然に多くのトークンを生成する。コンテキストを繰り返し読み込み、行動を計画し、結果を確認し、ツールを呼び出し、作業を修正するためだ。
1人の従業員が複数のエージェントを同時に動かすこともできる。そのため、出力トークンの比率は、従業員数や完了した業務の直接的な件数ではなく、計算活動の指標となる。
OpenAI社内の最も利用量が多いユーザーは、この違いをよく示している。2026年6月までに、99パーセンタイルの従業員は、Codexエージェントのターンを1日あたり60時間超、定常的に生成していた。
この数値は、1人が60時間働いたことを意味しない。人間の操作者が作業を指示またはレビューする間に、複数のエージェントが並列で動いていたことを反映している。
サンプル対象の個人ユーザーでは、より長いタスクも一般的になっている。2026年5月までに、80.6%がOpenAIの推定で人間の作業時間30分超に相当するCodexリクエストを少なくとも1件送信していた。
さらに70.2%は、1時間超と推定されるリクエストを送信していた。別の25.6%は、8時間超と推定されるリクエストを少なくとも1件送信していた。
これらの推定は、タスクに関連する人間の労力に関するものであり、必ずしもエージェントの実行時間や削減された労働量を示すものではない。OpenAIの分類手法も、生成されたすべての結果が採用され、有用だったことを証明できるわけではない。
こうした限界があっても、方向性は明確だ。ユーザーは、個別の回答を求めるのではなく、より大きな作業単位をAIに任せている。
チャットでのやり取りは、要約、下書き、コード断片を生み出すかもしれない。エージェントはリポジトリを調査し、複数のファイルを変更し、テストを実行し、失敗を解釈し、修正を試みることができる。
この違いは、企業のAI活動が従業員数やメッセージ量よりはるかに速く増加し得る理由を説明する。委任された1件の仕事には、1つのユーザーリクエストの背後に隠れた複数のモデル対話が含まれている。
これが、この出来事における中心的な逆転だ。目に見えるプロンプトは作業のより小さな部分になり、自律実行が計算のより大きな割合を消費するようになっている。
組織にとって、これはAI導入の意味を変える。ライセンス数とメッセージ数を数えるだけでは、モデルが業務にどれほど深く関与しているかを説明できなくなった。
リスク境界も変わる。チャットボットは通常、回答を提案するが、エージェントは接続されたシステムをまたいで行動できる。
このより広い権限により、権限設計、監査記録、レビューゲート、コスト管理は導入の一部となる。もはや副次的な管理上の詳細ではない。
Google Newsのシグナルがチャットボットの先を示す理由
Google Newsの記事が重要なのは、OpenAIのデータが、増大するトークン需要をソフトウェアエンジニアリング以外へ広がるエージェント利用と結び付けているためだ。
Codexは当初、コーディングに関連する製品として始まった。エンジニアは、OpenAIの利用の大半をChatGPTからエージェントへ移した最初の従業員だった。
平均的なOpenAIエンジニアは、2025年12月までにその閾値を超えた。OpenAIは現在、平均的なエンジニアがChatGPTではなくCodex経由で出力トークンの99%を生成していると述べている。
より注目すべき移行は他の部門で起きた。法務、財務、採用は、エンジニアがすでにこのパターンを確立した後の2026年4月頃に、Codex利用が過半数へ移行した。
OpenAIによると、平均的な弁護士または採用担当者は現在、出力トークンの85%以上をCodex経由で生成している。これは、これらの従業員が一日の大半をプログラミングに費やしていることを意味しない。
むしろ、Codexは汎用的な実行環境になっている。技術職ではないユーザーも、自動化、構造化分析、データ変換、デバッグ、社内ツール作成に利用している。
OpenAIの職種別内訳は、その解釈を補強する。ビジネス部門の従業員が生成したCodex作業の4分の1超は、エンジニアリングまたはコーディングのカテゴリに分類された。
財務および事業運営では、分類されたCodex出力の31%をエンジニアリングまたはコーディングが占めた。ナレッジワークは34%、財務分析は16%だった。
プロダクト、マーケティング、オペレーションの従業員では、ナレッジワークが分類済み出力の51%を占めた。エンジニアリングまたはコーディングはさらに25%を占めた。
これらのカテゴリは、エージェントが技術作業を依頼することと、それを直接試みることの間にある実務上の障壁を下げていることを示唆する。専門家が不要になったことを示すものではない。
採用担当者は、複数のソースのデータを社内ワークフローへ変換するようエージェントに依頼するかもしれない。財務担当者は、ファイルの照合、再利用可能な分析の構築、小さなツールのテストを任せるかもしれない。
従業員は引き続き、コンテキスト、判断、承認、レビューに責任を負う。しかし、実行経路には、従来型のソフトウェアプロジェクトを必要とせずにコードが含まれ得る。
非開発者による利用は、OpenAIが調査した3つの母集団すべてで急速に増加した。2025年8月から2026年6月上旬にかけて、週間の非開発者ユーザーは個人ユーザーで137倍に増えた。
OpenAIは、組織ユーザーでは189倍、自社従業員では12倍の増加を報告した。これらの倍率は異なるベースラインから始まっているため、同等の導入水準として比較すべきではない。
それでも、同じ方向性の発見を裏付けている。エージェント利用は、最初にCodexを採用した技術的な利用者層を超えて拡大している。
このパターンは、OpenAIのより広範なエンタープライズ報告とも一致する。enterprise usage studyによると、ChatGPTのメッセージ量は8倍に増え、API組織あたりの推論トークン消費量は前年比で約320倍に増加した。
この先行研究はCodexだけを対象としたものではない。OpenAIのエンタープライズ製品における集計利用データと、約100組織の9,000人の従業員を対象にした調査が含まれていた。
OpenAIはまた、100万社超のビジネス顧客と700万超の職場シートを報告した。約200の組織が、それぞれ1兆トークン超を処理していた。
これらの数値を合わせると、2つの導入曲線が見えてくる。人間向けのメッセージ量は増加しているが、統合された複数ステップのワークフロー内の計算量は、はるかに速く増加している。
だからこそ、チャットは企業AIを測る単位として不十分になりつつある。1つのメッセージが、推論、検索、ツール利用、検証、修正という長い連鎖を開始し得る。
この変化は、複数の組織を同時に圧迫する。財務チームは変動する消費量を予測しなければならない。セキュリティチームはシステムアクセスを統制しなければならない。管理者は、どの業務に継続的なキャパシティを割くべきかを判断しなければならない。
従業員も新しい形の業務上の責任に直面する。多数のエージェントを稼働させることは生産的に見えるかもしれないが、並列活動は完了し、承認された仕事と同じではない。
組織には、エージェント実行中に何が起きたのかを示す共有可能な証拠が必要になる。検索可能なAI knowledge baseは関連するコンテキストを保存できるが、権限や正式な評価に取って代わることはできない。
機会は本物だ。エージェントは、従業員が技術的な境界を越え、これまで別のチームのキューで停滞していたタスクを完了する助けになり得る。
管理上の課題も同様に現実的だ。企業は、その自律性が再現可能な価値を生む場所と、単にモデル呼び出しを増幅するだけの場所を見極めなければならない。
チャット支援とエージェント実行は異なる経済性に従う
エージェントは、企業AIを主にユーザーのペースで進むサービスから、実行の振る舞いに応じて消費量が変動するワークロードへ変える。
従来のチャットには、活動量に対する自然な制限がある。人が質問し、回答を待ち、それを評価し、続けるかどうかを決める。
エージェント実行は、その中断の一部を取り除く。システムは次の行動を選び、以前の結果をコンテキストに戻し、停止条件に達するまで継続できる。
各サイクルでは、エージェントが指示、ファイル、ツールの応答、蓄積された履歴を読み直すため、入力トークンが追加される可能性がある。出力トークンは、その総ワークロードの一部しか捉えていない。
長いタスクでは分岐も生じる。エージェントはある実装を試し、エラーを確認し、計画を修正して、別のテストを実行するかもしれない。
現実の仕事が完璧な最初の計画に従うことはまれなため、こうした再試行は生産的になり得る。一方で、エージェントに完了に必要な情報、権限、能力がない場合には、無駄にもなり得る。
このため、最も安価なモデルを選ぶだけでは、コスト管理への答えとして不十分だ。性能の低いモデルは1回あたりのリソース使用量が少ないかもしれないが、より多くの試行と人間による修正を必要とする可能性がある。
OpenAIはAI investment guidanceで、この主張を展開している。同社は、完了したタスク、削減時間、改善された意思決定、拡張可能なワークフローを測定するよう推奨している。
同社によると、GPT-4からGPT-5.4までに、100万トークンあたりの価格は97%低下した。また、GPT-5.6はコーディングエージェント指標において出力トークンを54%削減し、タスクを57%速く完了したとしている。
これらはOpenAIが報告したベンチマーク結果であり、すべての顧客ワークロードを保証するものではない。企業ごとのコンテキスト、ツール、評価基準、失敗コストによって、結果は変わり得る。
単価の低下が、必ずしも総支出の削減につながるとは限らない。特にエージェントの実行時間が長くなり、並行して稼働する場合、利用量は効率改善を上回るペースで拡大し得る。
この力学は、従来型のソフトウェアライセンスよりもクラウドコンピューティングに近い。需要は、実行時の挙動、ワークロード設計、モデル選定、コンテキストの規模、反復実行に左右される。
同時に、測定上の問題も生じる。トークン数が多いことは、価値ある自動化や難度の高い作業を示す場合もあれば、不要なコンテキスト、繰り返される失敗、あるいは効率的に停止できないエージェントを示す場合もある。
独立した研究は、購入側が消費量を慎重に扱うべき理由を示している。2026年にコーディングタスクを調べた論文では、エージェント型ワークロードはコードチャットやコード推論よりはるかに多くのトークンを使用した。
研究者らは、実験環境で消費量に最大1,000倍の差が生じたと報告した。同一タスクの実行でも、最大30倍のばらつきがあった。
トークン使用量の増加が、一貫して精度の向上をもたらしたわけではない。性能はしばしば中程度の水準でピークに達し、その後は消費量が増えても横ばいになった。
この研究では、モデルが自身に必要なトークン量を予測するのにも苦戦していたことが分かった。報告された相関は最大でも0.39にとどまり、推定値は実際の使用量を系統的に過小評価していた。
これらの知見は、特定のコーディングタスクとモデル群に基づくものだ。すべての企業向けエージェントに当てはまる万能の倍率として一般化すべきではない。
ただし、プロンプト単位の単純な予算設定が信頼できなくなる理由は示している。同じ依頼でも、実行経路や必要リソースが大きく異なる可能性がある。
企業側の対応はすでに見え始めている。OpenAIは2026年6月、ChatGPTとCodexのクレジット消費を統合して表示する機能をGlobal Admin Consoleに追加した。
管理者は、ユーザー、製品、モデル別に利用状況を確認できる。また、同社の支出管理ツールを通じて、ワークスペースのデフォルト、グループ上限、個別の上書き設定も行える。
DatabricksもUnity AI Gatewayに同様の管理機能を導入した。このシステムは上限を設定し、暴走した消費を検知し、適した業務に対してより低コストなモデルを推奨できる。
この新たな制御レイヤーは、市場の行き先を示している。企業導入において、モデルへのアクセスだけでは不十分になりつつある。
組織には、そのアクセスを取り巻く帰属管理、ポリシー、評価、介入が必要だ。消費量を責任を負うチームと定義済みの業務プロセスに結び付けなければならない。
したがって、最も強力な測定単位はトークンではない。合意した品質、リスク、レビュー要件のもとで完了した成果だ。
コーディングエージェントであれば、テストとセキュリティレビューに合格した、受け入れ済みの変更がそれに当たるかもしれない。財務なら、追跡可能な入力に基づく照合済みレポートだろう。
採用では、候補者について無許可の判断を下すことなく、管理業務の負担を減らすワークフローが該当し得る。各成果には異なる証拠が必要となる。
この経済モデルは、頻繁に繰り返され、明確に評価できるワークフローを有利にする。成功が主観的な印象に依存する曖昧なタスクには不利に働く。
エージェントへの移行は、トークン測定を無用にするわけではない。トークン数を事業価値の代理指標ではなく、複数ある運用シグナルの一つに位置付け直すものだ。
トークン数では証明できないこと
OpenAIの印象的な社内導入指標は需要と利用強度を示すが、生産性、品質、セキュリティの成果については未解決のままだ。
第一の限界は、標本の選択にある。OpenAIはCodexの開発元であり、実験的なAIに慣れた人材を雇用し、通常より直接的な製品支援を提供できる。
同社の従業員は、銀行、病院、政府機関、製造業者、中小企業を代表する標本ではない。これらの組織は、異なる技術的・規制上の制約のもとで運営されている。
また、顧客が利用増加をより深い導入の証拠と解釈すれば、OpenAIにも利益がある。同社のデータは注目に値するが、読者は測定された行動と、同社が示すより広範な予測を区別すべきだ。
第二の限界は、成功指標としてのトークンに関わる。出力量は、モデルがテキストやコードを生成したことを示す。ユーザーがどれだけ採用したかは分からない。
エージェントは、開発者が却下する大規模なパッチを生成する可能性がある。従業員が書き直す分析を生成したり、本番環境に届かない自動化を作ったりすることもある。
OpenAIの長期タスクに関する推定にも、同様の留保がある。人間なら8時間かかると分類されたタスクが、自動的に8時間の削減を意味するわけではない。
ユーザーは依然として、入力の準備、実行の監視、情報源の確認、エラーの解決、結果の統合に時間を費やすかもしれない。エージェントがなければ発生しなかった作業もあるだろう。
そのように拡大した出力にも、なお価値はあり得る。しかし、回避された労働は可能性のある便益の一つにすぎず、直接測定が必要だ。
第三の限界は信頼性である。タスクが長くなるほど、誤り、古い前提、不適切なツール選択、後続のステップに影響する初期段階のミスが起こる機会は増える。
企業システムにアクセスできるエージェントは、より広いセキュリティ境界も生み出す。誤った回答は有害だが、無許可の操作ははるかに取り消しにくい場合がある。
したがって、権限はエージェントの最大能力ではなく、タスクに合わせるべきだ。読み取り権限、書き込み権限、外部通信、不可逆な操作には、それぞれ別の管理が必要である。
セキュリティチームには、人間の依頼と各ツール操作を結び付ける記録も必要だ。その連鎖がなければ、インシデント対応と説明責任は難しくなる。
コスト監視は別の緊張関係を生む可能性がある。企業は無駄や侵害された認証情報を特定するために十分な可視性を必要とする一方、従業員の詳細な監視は信頼を損ないかねない。
管理者は、あるワークフローが高価なモデルを繰り返し呼び出していることを知る必要があるかもしれない。しかし、機微なコンテンツに無制限にアクセスする必要があるとは限らない。
優れたガバナンスは、可能な限り運用メタデータと業務コンテンツを分離する。また、誰がどの状況で各レイヤーを確認できるかも定める。
第四の限界は、コーディング以外への一般化に関わる。Codexは非開発者も支援できるが、OpenAIのデータでは依然としてコーディングとエンジニアリングが主要カテゴリとして示されている。
構造化された技術業務には、比較的明確な検証手段がある。テストを実行でき、ファイルを比較でき、エラーがあれば再試行を促せる。
法的分析、採用支援、戦略、財務解釈には、より主観的な要件が含まれることが多い。自動検証が弱いため、誤りがより長く残る可能性がある。
この違いにより、エージェントが事業機能へ広がるほど、成果の評価は重要になる。企業は導入速度がそのまま準備完了を意味すると考えるべきではない。
世論はすでに、その区別へと移りつつある。7月に発表されたAI支出分析は、高い消費量を成果として扱う「tokenmaxxing」への反発が強まっていると述べた。
Moody'sのアナリスト、Vincent Gusdorfは、AIによって組織が必要としない仕事を容易に生み出せるようになると警告した。この批判は、トークンベースのステータスシグナルの弱点を直接突いている。
エージェントが価値ある結果を生み出すなら、大量消費は合理的であり得る。活動を受け入れ済みの成果に結び付けられる責任者がいない場合、それを正当化するのは難しくなる。
適切な懐疑的立場は、エージェントが単に無駄の多いチャットボットにすぎないというものではない。OpenAIの導入データは、そのように退けるにはあまりに大きい。
より妥当な結論は、より限定的だ。エージェントはAIが試みられる仕事の量と範囲を拡大する一方、実現した企業価値に関する証拠には依然としてばらつきがある。
したがって企業は、自社環境の中でOpenAIの仮説を検証すべきだ。そのためには、ベースライン、評価セット、レビューコスト、失敗率、測定可能な成果が必要となる。
また、エージェントのワークフローを現実的な代替手段と比較すべきだ。代替手段には、人による実行、従来型ソフトウェア、より短いチャット対話、より小規模なモデルが含まれる。
そうして初めて、経営陣は増加するトークン使用量がレバレッジを表すのか、摩擦を表すのかを判断できる。OpenAIの社内比率だけでは、その問いに答えられない。
企業の購入担当者が次に注視すべき3つのシグナル
次の段階を決めるのは、また一つトークン数の記録を更新することではなく、成果報告、非技術部門での定着、セキュリティ管理である。
第一のシグナルは、ベンダーがエージェントの消費量を完了した業務成果に結び付けるかどうかだ。現在の利用ダッシュボードは、クレジット、ユーザー、モデル、傾向を重視している。
こうしたビューは、管理者が想定外の需要を見つけるのに役立つ。しかし、ワークフローが受け入れ済みの成果を生んだかどうかまでは示していない。
購入側は、承認済みのコード変更、解決済みのサポート案件、完了した分析、その他の領域固有の出力に結び付いた報告を求めるべきだ。受け入れ済み成果あたりのコストが示されれば、比較はより有意義になる。
ベンダーが信頼できる成果の帰属管理を実現すれば、OpenAIの主張はより強まる。企業は、そこから生じる価値が可視化される場合に、高消費のワークフローへ資金を投じられるようになる。
報告がトークンと推定時間にとどまるなら、懐疑論は強まるだろう。組織は、集中的で生産的な仕事と、集中的だが失敗した仕事を分けるのに苦労する。
第二のシグナルは、エンジニアリング以外でCodexの利用が持続するかどうかである。OpenAIは、法務、財務、採用、マーケティング、オペレーションの従業員で顕著な成長を報告している。
次の問いは、初期の試行後もそれらのユーザーが使い続けるかだ。小さな出発点からの急速な増加よりも、定着率のほうが重要である。
企業は、どの非技術タスクが反復可能なワークフローになるかを注視すべきだ。また、専門家がエージェント生成の成果物を救済または作り直さなければならない頻度も追跡すべきである。
品質が安定したまま利用が継続すれば、エージェントが従業員に機能横断の境界を越えさせるというOpenAIの主張を裏付ける。定着率が低下すれば、最も強い価値は依然として技術チームに集中していることを示唆する。
第三のシグナルは、エージェントの行動を取り巻く管理機能の成熟度である。支出上限は急速に導入されつつあるが、コストは運用リスクの一部にすぎない。
組織には、タスク単位の権限、承認チェックポイント、監査可能なツール呼び出し、認証情報の分離、行動が定義済みの境界を逸脱した際の確実な停止も必要だ。
こうした安全策は、複数のモデルやツールにまたがって機能しなければならない。企業がすべてのワークフローをいつまでも単一ベンダーに標準化することはほとんどない。
この領域の進展は、特に規制産業において、より広範な委任を正当化しやすくする。管理機能が弱い、あるいは断片化していれば、モデル能力にかかわらず導入は遅れるだろう。
この3つのシグナルはつながっている。成果報告は、なぜエージェントにリソースを割く価値があるのかを説明する。定着率は、目新しさが薄れた後も従業員がそれを有用と感じるかを示す。
セキュリティとガバナンスは、そのエージェントに重大な業務を任せることを組織が許容できるかを決定する。3つのうち一つでも欠ければ、導入の成功を妨げかねない。
Google Newsの見出しは、チャットからエージェントへの実際の移行を捉えている。しかし、トークンシェアは物語の始まりであって、最終的なスコアではない。
OpenAIは、同社の従業員が長く複雑なタスクをCodexへ委任する機会を増やしていることを示した。出力トークンの99.8%が、組織価値においても同等の比率をもたらすことまでは示していない。
企業の購入担当者は、その消費を称賛する前にも制限する前にも、実務的な問いを投げかけるべきだ。どの完了済み成果が可能になり、それらがリスクに見合う価値を持ったことを、どの証拠が示しているのか。
この問いは、トークン量だけよりも優れた指針となる。組織は機能するワークフローを拡大し、逸脱するものを制約し、エージェント導入を活動量ではなく結果で評価できる。



