OpenAI Codex Can Now Control Your Desktop: AIコーディングエージェントレースが意味するもの
- Aisha Washington

- 6月5日
- 読了時間: 16分
更新日:6月17日
OpenAIは4月16日、キーボードに触れることなく、Mac上のあらゆるアプリを開いたり、カーソルを移動させたり、ボタンをクリックしたり、文字を入力したりできるCodexのアップデートをリリースしました。その3週間前、AnthropicはClaude Codeで同様のことを行っており、TechCrunchはすでに「多くの企業が選ぶツール」と評していました。OpenAIは追いつこうとしており、4月16日のリリースは、そのことを認識していることを示す最も明確なシグナルでした。
これは単なる機能発表ではありません。実際には、定義がAIコーディングエージェント(開発者がコードを作成、テスト、出荷するのを支援するソフトウェア)がリアルタイムで書き直されています。このカテゴリは、オートコンプリートツールから自律型デスクトップオペレーターへと移行しており、世界で最も資金調達されている2つのAI企業が、それをコンシューマーサブスクリプションレベルでどのように定義するかを競っています。
この記事では、4月16日のアップデートが実際に何をもたらしたのか、マーケティングコピーを超えてなぜそれが重要なのか、CodexとClaude Codeの競争が数字の上で実際にどの程度なのか、そしてOpenAIのプレスリリースでは触れられていないセキュリティコミュニティが何を言っているのかを分析します。
何が起こったか
OpenAIの「(ほぼ)あらゆるものに対応するCodex」リリースにおけるヘッドライン機能は、コンピュータのバックグラウンド使用です。これは、Codexが独自のカーソルを使用してmacOSアプリケーションを自律的に操作できる機能です。APIのないアプリケーションを含め、あらゆるアプリケーションで画面を確認し、インターフェイス要素をクリックし、入力することができます。複数のCodexエージェントをバックグラウンドで並列実行でき、ユーザーがフォアグラウンドで行っていることを妨げることはありません。OpenAIの開発者向けドキュメントによると、エージェントは分離されたプロセスで実行され、メインアプリケーションと非同期に通信します。
これは、コンピュータ使用AI(画面キャプチャとシミュレートされた入力によってデスクトップGUIを制御するAIのパラダイム)が、大規模なコンシューマー向けサブスクリプションティア製品に搭載されたのは初めてです。Anthropicは2024年10月にリサーチプレビューとしてこのコンセプトを先駆けて発表しました。2026年4月までには、両社はこのコンセプトを月額20ドルで購入できるものへと進化させました。
4月16日のアップデートでは、Background Computer Useに加えて、5つの追加機能がバンドルされました。アプリ内ブラウザユーザーがライブウェブページにコメントを付けて注釈を付けることができ、Codexにポイントアンドクリックの精度でフロントエンドとデザインのワークフローを提供します。 メモリプレビュー過去のセッション、技術スタックの好み、繰り返し行われるワークフローを追跡し、以前のプロジェクトのどこから再開できるかの提案を表示します。画像生成 gpt-image-1.5 を使用すると、Codex は同じワークフロー内で UI モックアップ、ゲームアセット、プレースホルダービジュアルを生成できます。90個のプラグインAnthropicが元々導入したオープンスタンダードであるModel Context Protocol (MCP) 上に構築されており、現在CodexをAtlassian Rovo、GitLab Issues、Slack、Microsoft Suite、Google Calendar、および80以上の他のサービスに接続します。今回のアップデートでは、GPT-5-Codex、エージェントコーディングタスクに最適化されたGPT-5のバージョンです。
具体的に言うと、同じマシンで同時に3つのCodexエージェントが実行されている状況を想像してみてください。1つはリポジトリでフィーチャーコードを記述し、2つ目はテストスイートを実行し、3つ目はデザインブリーフからUI画像アセットを生成しています。その間、開発者は4つ目のウィンドウでドキュメントを記述しており、どのエージェントも互いに、またはフォアグラウンドアプリに干渉しません。これは仮説上のシナリオではなく、OpenAIは発表および開発者ドキュメントで、サポートされているワークフローとして直接説明しています。
このリリースを支える成長数は注目に値します。OpenAIは、2026年4月時点でCodexの週アクティブ開発者数が300万人以上であると引用しており、これは2026年3月初旬に報告された160万人からほぼ倍増しています。AI Code Detectorが公開したデータによると、Codex CLIのnpmダウンロード数は、2025年4月の82,000件から2026年3月の1,453万件へと増加しました(177倍の増加)。Fortuneによると、トークン使用量は2026年第1四半期を通じて月70%以上のペースで増加していました。
なぜ重要なのか
4月16日のアップデートが示す変化は、漸進的なものではありません。2021年にGitHub Copilotが登場し、よりスマートなオートコンプリートツールとして始まったAIコーディングエージェントのカテゴリは、現在、AIがあなたのコンピュータ全体をあなたの代わりに自律的に操作できる領域に達しました。それは質的に異なる種類のソフトウェアであり、開発者(そしてますます多くの非開発者)がこれらのツールに期待できることを変えます。
Temporalは、ワークフロー自動化企業であり、Codexを使用して機能開発の加速、問題のデバッグ、テストの作成と実行、大規模なコードベースのリファクタリングを行っており、チームは2〜3倍速いイテレーションサイクルを報告しています。メールクライアントであるSuperhumanは、Codexを使用して、プロダクトマネージャーがエンジニアを呼び出すことなく軽量なコード変更に直接貢献できるようにし、従来は専用のエンジニアリングスプリントまたは長いバックログの待ち時間が必要だったギャップを解消しています。
開発者以外の視点は、開発者の生産性向上ストーリーよりも重要であると言えるでしょう。Hacker Newsの議論で引用されたCEOは、Claude Codeの同等のコンピューター使用ワークフローを使用して、2時間で「3〜4週間かかったであろう」ソーシャルメディアキャンペーンを完了したと報告されています。別のHacker Newsのコメント者は、非技術系の家族が、言語を全く理解せずにAI支援を通じてPythonアルゴリズムを実装することで、複雑なスケジューリング最適化問題を解決したと説明しています。これらはエッジケースではありません。これらは、デスクトップ自動化AIが技術的作業と非技術的作業の境界を曖昧にしている初期の兆候です。
AI Automation Global が引用したデータによると、2026年半ば時点で、プロの開発者の73%がAIコーディングエージェントを日常的に使用していると報告されています。AIコーディング市場は2030年までに260億ドルに達すると予測されています。これらは大きな数字ですが、構造的な変化を強調しています。AI支援開発は、2年足らずで、早期採用者の好奇心から、デフォルトのワークフローの前提へと移行しました。
サム・アルトマンは、The Neuron AIが報じた記者会見でOpenAIの戦略的ロジックを次のように述べました。「複雑なものに対して洗練された作業を行いたいのであれば、[GPT-5.2]は断然最も強力なモデルです。しかし、使用が難しくなってきているため、そのレベルのモデル能力を取り出し、より柔軟なインターフェースに入れることが、非常に重要になると考えています。」この表現は示唆に富んでいます。野心は、より優れたコードエディタではなく、複雑な知識作業のための汎用インターフェースレイヤーなのです。
一日の仕事で複数のツールやコンテキストを管理する開発者にとって、これは実用的な課題も提起します。これらのエージェントがより自律的になるにつれて、それらが必要とする基盤となる知識やコンテキスト(ドキュメント、コードベースの理解、チームのワークフロー)を整理し、アクセス可能に保つことが、解決する価値のある別の問題になります。これについては最後に触れます。
誰も話したがらないセキュリティの問題
OpenAIが4月16日のリリースを発表した同じ日、Help Net Securityは「Codexはアプリ間で動作できるようになりました。境界線はどこにあるのでしょうか?」という見出しの記事を掲載しました。これは誰もよく答えられていない質問であり、製品の制限よりも深刻なことを示唆しています。
AIコーディングエージェントがメールクライアントを開き、ブラウザをクリックし、カレンダーを読み取り、あらゆるアプリケーションに入力できるようになると、そのエージェントの攻撃対象領域はコードリポジトリではなく、デスクトップ全体になります。OpenAI自身の開発者向けドキュメントでは、特にインターネットアクセスが有効になっている場合、プロンプトインジェクション、コードやシークレットの漏洩、マルウェアや脆弱性の混入、ライセンス制限違反などを「高リスク」として直接挙げており、これを認めています。公式ガイダンスは「必要なドメインとメソッドのみを許可し、常にCodexの出力と作業ログを確認してください」です。
そのガイダンスは間違っていません。それはまた、レビューなしでこのツールを使用することがリスクが高いという告白でもあります。
理論上のリスクは、4月16日のアップデートが出荷される前に、実証された脆弱性となった。2025年12月、BeyondTrustのPhantom Labsのセキュリティ研究者たちは、CodexのCLI、SDK、および開発環境の統合において「重大なコマンドインジェクションの脆弱性」を発見した。攻撃ベクトルは正確だった。悪意のあるコマンドをGitHubのブランチ名に埋め込むことだ。Codexが十分な入力サニタイズを行わずにブランチを処理すると、ペイロードが実行され、ユーザーのGitHub認証トークンが漏洩した。この攻撃は共有リポジトリ全体で自動化できるため、潜在的なエンタープライズの被害範囲は甚大だった。1つの侵害されたプロジェクトが、すべての貢献者に拡散する可能性があった。OpenAIは、BeyondTrustの最初の報告から50日以上経過した2026年2月5日に、この脆弱性を修正した。
4月16日の発表に関するHacker Newsのスレッドでは、より構造的な懸念が浮上しました。あるコメント投稿者がそれを的確に表現しました。エージェントの文脈では、「データは事実上実行可能になる」ということです。これは比喩ではありません。AIエージェントが電子メールを読み、ウェブページを見て、その内容に基づいて行動できる場合、表示されるコンテンツはすべて潜在的な命令になります。悪意のある攻撃者は、エージェントを直接侵害する必要はありません。エージェントが読み取るものにプロンプトインジェクションを仕掛けるだけでよいのです。それは、エージェントが閲覧するウェブページ、開くドキュメント、または目にする通知かもしれません。攻撃対象領域は、AIがアクセスできるものによって定義されるのではなく、AIが認識できるすべてのものによって定義されます。
Hacker Newsでの議論における2つ目の懸念は、製品レベルの信頼性の問題です。技術に詳しくないユーザーは、しばしばAIエージェントが有能な秘書のように機能し、曖昧な指示を処理し、意図を推測し、絶え間ない監視を必要とせずにタスクを完了することを期待します。スレッドの懐疑論者によると、現在の大規模言語モデルは、監視されていない自律的なコンテキストでは、この期待を確実に満たすものではありません。「作業中にバックグラウンドでエージェントが実行される」といったマーケティング上の言葉と、曖昧なタスクに対する実際の信頼性との間には、現実のギャップがあり、それはユーザーベースの非開発者層で最も顕著です。
CodexのOSレベルのサンドボックスアーキテクチャ(Linux/WSL2ではbubblewrap (bwrap)、WindowsではWindows Sandboxを使用)は、Claude Codeのアプリケーションレイヤーのフックよりも強力なプロセス分離を提供することに言及する価値があります。サンドボックスは、エージェントがワークスペースディレクトリ外に書き込めるものを制限し、デフォルトではネットワークアクセスは無効になっています。しかし、サンドボックスの存在自体がシグナルです。OpenAIがこれらの制約を構築したのは、無制限のデスクトップアクセスが現実のリスクを生み出すからであり、仮説上のリスクではないからです。
OpenAIはまた、という別の製品もリリースしました。Codex Security、120万件のコードコミットをスキャンし、報告によると10,561件の高深刻度問題を検出しました。その主張は、同じエージェンティックレイヤーが「他のエージェンティックツールが見逃す複雑な脆弱性」を特定できるというものです。デュアルポジショニング(生産性向上のためにAIエージェントを使用し、その結果生じるセキュリティ問題をスキャンするために別のAIエージェントを使用する)は、業界の現状を正確に反映しています。
Codex vs. Claude Code: レースの背後にある数字
ベンチマークの状況は、どちらの企業のマーケティングが示唆するよりも複雑であり、ワークフローに適したツールを選択するには、その違いを理解することが不可欠です。
CodexもClaude Codeもすべての側面で勝利しているわけではありません。それぞれが異なる分野でリードしており、測定する内容によってその差は大きく異なります。自律的なソフトウェアエンジニアリングタスクの標準ベンチマークであるSWE-benchでは、Claude Codeは報告によると72.5% Codexの約49%と比較して。これは広く引用されている指標においてかなりの差です。コマンドラインタスクのパフォーマンスを測定するTerminal-Bench 2.0では、GPT-5.3-CodexはClaude Codeの65.4%と比較して77.3%のスコアを記録しました。GitHub CopilotはSWE-benchで56%、Cursorは52%ですが、どちらも2つのリーダーに遅れをとっており、重要なことに、どちらも現在デスクトップレベルのコンピューターの使用を提供していません。
レースのタイムラインは、ベンチマークと同様に多くのことを明らかにします。Anthropicは2026年3月24日にmacOSデスクトップコントロールをローンチしました。OpenAIは3週間後の4月16日にそれに続きました。さらに注目すべきは、OpenAIの発表の2日前である4月14日に、Anthropicは並列セッションとAPIまたはGitHubイベント経由でトリガー可能なスケジュール済みワークフローである自動化されたRoutinesを備えた再設計されたClaude Codeデスクトップアプリをリリースしました。この一連の出来事は偶然とは思えません。それは、Anthropicが競合他社の発表を予測し、OpenAIがそれを設定する前に物語を形作るために動いたように見えます。
製品の差別化に関して、両ツールには明確な強みがあります。Claude Codeの100万トークンのコンテキストウィンドウ(Opus 4.6ベータ版)は、大規模なコードベースの推論や複数ファイルのリファクタリングにおいて大きな利点をもたらします。これは、コンテキストウィンドウが狭いと不完全または一貫性のない結果を生むようなタスクです。Codexは同等のタスクで約3倍のトークン効率の利点を主張しており、これは大規模なコストに直接反映されます。Codexのプラグインエコシステムは90以上の統合があり、現在はより広範ですが、Claude Codeは同じMCP標準をサポートしており、急速に拡大しています。
価格は差別化要因にはなっていません。両ツールとも、それぞれの基本プランで月額20ドル、上位プランで月額100ドルで利用できます。OpenAIは新しい$100 Pro tier4月9日に、より多くのCodexユーザーを対象としたPro tierがリリースされました。これは、ベースプランの5倍の利用量を提供します。AnthropicのMax planも100ドルで、Claude Codeへの同等のアクセスをより高い制限で提供します。価格競争はまだ始まっていません。機能競争は始まっています。
Cognition社のDevinは、市場で最も完全に自律的なオプションであり続けていますが(独自のシェル、ブラウザ、エディタを実行します)、エンタープライズ向けに位置付けられており、Nubankのような企業が大規模なETLリファクタリングに利用し、主張されている12倍の効率向上を実現しています。個々の開発者にとって、Devinは主な検討事項ではありません。ほとんどの実践者にとって実際に重要な競争は、CodexとClaude Codeの間で行われています。
次は何?
AnthropicとOpenAIの両社による2026年4月のリリースは、閾値を超えたことを示しています。コンピューター利用AIは、研究プレビューからコンシューマーサブスクリプションの標準へと移行しました。今後6ヶ月に何が起こるかは、いくつかの収束する圧力によって形作られるでしょう。
コンピューター使用機能セットは拡張され、標準化されます。Codex のバックグラウンドコンピューター使用は現在 macOS に限定されています。Windows サポートは 4 月 16 日のリリースには含まれていませんでしたが、Codex CLI は WSL2 を介して Windows をサポートしています。EU および UK 市場は、今後の展開に向けてフラグが立てられています。両社が完全なクロスプラットフォームの同等性を目指して進むにつれて、デスクトップレベルの AI 制御は、差別化機能ではなく、基本的な期待となるでしょう。問題は「どのツールがコンピューターを使用できるか?」から「どのツールがより確実に、より優れた判断で実行できるか?」へと移行します。
マルチエージェントの連携は、次のアーキテクチャ上のフロンティアです。OpenAI と Anthropic はどちらも、複数のエージェントが異なるタスクで同時に実行される並列エージェント実行を出荷しました。次の課題は、エージェント間のコラボレーションです。単なる並列独立実行ではなく、サブタスクを互いに委任し、結果を報告し、共有された目標を調整できるエージェントです。Anthropic の Routines 機能は、GitHub イベントまたはスケジュールされた API 呼び出しによって Claude Code をトリガーできるようにするもので、この方向への初期のステップです。
非開発者市場は、より大きな成長ベクトルです。プロの開発者はすでに飽和した採用者であり、73% が毎日使用しているということは、そのグループ内の浸透率の上限に近いことを意味します。増分市場は、現在、自律型デスクトップエージェントが直接実行できるタスクのためにエンジニアリングキューに依存しているプロダクトマネージャー、デザイナー、コンテンツストラテジスト、およびオペレーションチームです。これはニッチなシナリオではありません。Superhuman が PM にエンジニアの関与なしにコード変更をリリースできるようにすることは、部門横断的なチームが機能する方法における構造的な変化のプレビューです。
規制の枠組みは追いついていません。EU AI 法および同等のガバナンス構造は、AI がコンテンツを生成したり推奨を行ったりすることを想定して設計されており、AI がユーザーのデスクトップを自律的に操作することを想定していませんでした。この規模のコンシューマー製品におけるコンピューター使用 AI は、2026 年の開発です。エージェントコンテキストにおける監督、責任、およびデータ制御に関するポリシー議論は、年後半に加速するでしょう。そして、これらの機能を出荷している企業が主要な参照ポイントとなるでしょう。
AIコーディングエージェントと汎用AIエージェントのカテゴリ境界は積極的に消えつつあります。The New StackはOpenAIの戦略を「開発者向けスーパーアプリ」の構築と特徴づけました。Codexは狭いコーディングツールではなく、開発者のワークフロー全体のためのオペレーティングレイヤーです。この考え方は、CodexとClaude Codeの両方にますます当てはまるようになります。AIがあらゆるアプリを制御し、あらゆるサービスにアクセスし、セッション間でメモリを維持できるようになった時点で、「コーディングエージェント」という言葉は控えめすぎます。構築されているのは、自律コンピューティングレイヤーに近いものです。
AIエージェントがすべてを実行できるようになったときに、方向性を維持する
「エージェンティックなコンテキストでは、データは事実上実行可能になる」と指摘したHacker Newsのコメント者は、セキュリティ上の懸念よりも一般的な何かを特定しました。AIコーディングエージェントがデスクトップ全体で動作する場合、その作業の質は、アクセスできるコンテキストの質、つまりドキュメント、コードベースの規約、チームの現在の優先順位、過去の決定に直接依存します。
構造化されたコンテキストなしで実行されるエージェントは、より悪い決定を下し、一貫性のない出力を生成し、エラーを検出するために、より多くの人間のレビューを必要とします。TemporalとSuperhumanが説明する生産性の向上は、エージェントの能力だけではありません。それらは、エージェントの周りに組織的な足場を築いたチームを反映しています。明確なドキュメント、定義された境界、レビューされた出力。
ワークフロー全体で複数のAIツールを操作する開発者やナレッジワーカーにとって、検索可能なナレッジベースを構築することは、プリインストールされていないスタックの一部です。AIコーディングエージェントがより自律的になるにつれて、それらが引き出す知識レイヤー(そしてそのレイヤーが整理されているか断片化されているか)が、その自律性のどれだけが実際に役立つかを決定します。エージェントがさらに有能になる前に、今考える価値のある問題です。


