Microsoft Copilot Windows Actions、ファイルアクセスを信頼性の試金石に
Microsoftは、ローカルファイルの検索、ドキュメントの整理、PCのトラブルシューティング、OS全体にまたがるワークフローの完了を可能にするMicrosoft Copilot Windows actionsを発表した。この変化により、Copilotは会話の枠を超え、権限の境界やエージェントのセキュリティを巡る未解決の課題を抱えたまま、コンピューターを直接操作する領域へ踏み出す。
同社は10月7日に開催したWindowsおよびSurfaceイベントで、拡張された機能を発表した。Microsoftは基盤となるアプローチを「hybrid intelligence」と呼んでおり、Windowsがローカルモデルとクラウドサービスの間でAI処理を振り分けられることを意味する。対応するCopilot+ PCでは、Copilotがローカルコンテキスト、ローカル操作、オンデバイスモデルにアクセスできるようになる。
このアーキテクチャは、質問への回答を高速化するだけのものではない。回答を生成した後に、アシスタントが何を行えるかを変える。Apple、Google、OpenAIなどのAI開発企業も、モデルを個人データやソフトウェアツールと接続している。しかしMicrosoftは、大半のビジネスPCで利用されるOSを支配している。この立場により、AIへのリクエストから重要なファイル操作やシステム操作まで、とりわけ直接的な経路を持つことになる。
結果として生じる競争は、単にMicrosoftと別のアシスタントの対決ではない。機能性と制御性のせめぎ合いだ。Copilotは、より多くのコンテキストを確認し、より多くのソフトウェアを操作できるほど便利になる。一方で、追加される権限の一つひとつが、誤りの代償を大きくする。
Microsoft Copilot Windows Actions、検索から実行へ
重要な変化は、Copilotが情報を見つけることと、その情報を含む環境を操作することの境界を越えられるようになった点だ。
従来のWindows版Copilotは、質問への回答、添付ファイルの確認、手順の案内、セマンティック検索によるドキュメント探しを支援できた。セマンティック検索は、正確なファイル名や一致するフレーズを必要とせず、リクエストの意味を解釈する。
Microsoftが以前にプレビューしたsemantic file searchでは、ユーザーは自然言語で履歴書や写真などの資料をリクエストできた。この体験は、検索・取得に密接に結び付いていた。その後、ユーザーはファイルを選択し、明示的にCopilotとの会話へ送信できた。
新しいモデルは、検索・取得と実行を結び付ける。Microsoftのhybrid intelligence planによると、Copilotは許可を得たうえで関連するPC内コンテンツを使用し、Windows全体で操作を実行し、必要に応じてローカルAIモデルを呼び出す。Microsoftは、ファイルの整理、デバイス診断の評価、問題解決、コーディング、オンデバイスのワークフロー完了を例として挙げている。
The Vergeが報じたデモは、この違いが重要である理由を示した。MicrosoftのAutopilot agentは、異なるフォルダーから税務書類を検索し、ファイル名を変更してアーカイブに圧縮し、会計士宛てのメールを下書きした。さらに、そのアーカイブを添付した。
個々の操作はいずれもなじみ深いものだ。重要な変化は、一つの自然言語リクエストが、それらを複数ステップのワークフローとしてつなげられることにある。
これは、Windowsとユーザーの関係を変える。従来、人は開くアプリケーション、検索するフォルダー、実行するコマンドを決めてきた。エージェントは望ましい結果を解釈し、中間ステップを選択し、利用可能なツールを通じて行動する。
MicrosoftはWindows Searchにも直接アクションを追加している。ユーザーはダークモードの有効化、音声のミュート、ウィンドウの整列、短いメッセージの送信といったタスクをリクエストできるようになる。これらのタスクバー上のアクションは、より大規模なCopilot agentのワークフローとは別のものだが、いずれも同じ製品の方向性を反映している。
新しいSearch actionsは10月7日、実験的なWindows Insiderチャネルへの導入が始まった。Microsoftによれば、hybrid intelligenceを利用するCopilot機能は、今後数カ月にわたってCopilot+ PCへ順次展開される。時期はデバイス、地域、シリコンプラットフォームによって異なる可能性がある。
この限定的な展開は重要だ。Microsoftは方向性を発表し、動作するシナリオを示したが、大半の顧客はまだ自分のマシンで完全な体験を試していない。管理されたデモンストレーションと、信頼できる日常的な自動化との間には、依然として大きな隔たりがある。
Hybrid IntelligenceがMicrosoftにもたらす構造的優位性
Microsoftは、AIエージェントをOS、ローカルハードウェア、エンタープライズ制御、クラウドサービスと、一つの管理されたスタックとして統合できる。
hybrid intelligenceは、AIタスクをどこで実行すべきかを動的に選択するためのMicrosoftの用語だ。軽量な処理や機密性の高い操作ではオンデバイスモデルを使用できる。より負荷の高いリクエストではクラウドモデルを呼び出せる。より長いワークフローでは、継続に必要なコンテキストを保持しつつ、両者を組み合わせられる。
このアーキテクチャは、複数の目標を同時に満たす。ローカル実行はレイテンシを減らし、選択したデータをデバイス内に保持し、クラウド推論の繰り返しを回避できる。ローカルのハードウェアやモデルでは不十分な場合、クラウドモデルがより大きな能力を提供できる。インテリジェントなルーティングは、こうしたインフラ上の判断をユーザーから見えないようにすることを目指す。
Microsoftによると、Copilot+ PCはすでに毎月2兆回を超えるローカル推論を実行している。また、ビジネス向けに製造されるノートPCの40%超がCopilot+ PCだとしている。これらは独立監査を受けた指標ではなく、同社が提示した数値だが、Microsoftが導入済みハードウェア基盤をどう位置付けているかを示している。
OSはMicrosoftにもう一つの優位性を与える。サードパーティのアシスタントは通常、アプリケーションプログラミングインターフェース、アクセシビリティ制御、ブラウザー自動化、または視覚的なコンピューター操作に依存する。これらの手法は有用になり得るが、システム状態に関する信頼できる知識を持たないことが多い。
Windowsは、ファイル、設定、アプリケーション、ID制御、ハードウェアリソースへの構造化されたアクセスを提供できる。また、これらのコンポーネントを共通の権限システムで定義することも可能だ。Windowsが承認済みのアクションを直接公開できるなら、Microsoftはすべてのマウス操作を模倣する必要がない。
ただし、それがより良い結果を保証するわけではない。一方で、脆弱性の一因は減らせる。定義済みのシステムアクションを使うエージェントは、スクリーンショットだけを頼りに操作するエージェントよりも、ボタンの移動やダイアログの再設計の影響を受けにくいはずだ。
Microsoftのハードウェア戦略も同じ方向性を支えている。Copilot+ PCには、ローカルAIワークロード向けに設計されたニューラルプロセッシングユニットが搭載されている。より高性能なシステムでは、従来ならリモートインフラを必要としたモデル向けに、NVIDIAハードウェアと大容量の共有メモリ構成を採用する。
同社によると、Surface Laptop Ultraは最大128GBのユニファイドメモリと、1,200億パラメータを超えるモデルのローカル実行をサポートする。これらの仕様は一般的なオフィス用ノートPCではなく、ハイエンドマシンに属するものだ。それでも、日常的なアシスタント、開発者向けワークステーション、ローカルAIサーバーまでをWindowsでカバーしようとするMicrosoftの計画を示している。
GitHub Copilotは、より明確な技術的な例を提供する。Microsoftによれば、今後登場するlocal model systemは、オンデバイス推論とクラウド規模のモデルを選択する。開発者は、配置場所をより細かく制御する必要がある場合、ローカルモデルを明示的に選ぶこともできる。
同じ記事は、ローカル推論が自動的にセッションをオフラインにするわけではないと警告している。モデル実行、ツール利用、ネットワークアクセス、ファイル権限には、それぞれ別の境界がある。この区別は、消費者向けCopilot体験でも重要になる。
ユーザーにとって最も理解しやすい約束は、連続性だろう。リクエストはローカルファイルの検出から始まり、推論にクラウドモデルを使い、ドキュメント変更のためにWindowsへ戻り、外部アクションの前に承認を求めることができる。OSがコーディネーターになる。
このビジョンは、スタンドアロンのAIアシスタントと従来型のWindowsアプリケーションの双方に圧力をかける。アシスタントはOSレベルの実行と競うために、より深い統合を必要とする。アプリケーションは、自らの機能をCopilotに公開するか、独自のエージェントを構築するか、あるいはユーザーが委任する可能性のあるワークフローを保護するかを決めなければならない。
真のトレードオフは処理場所ではなく権限にある
Copilotの一部をローカルで実行しても、中心的な安全性の問いには答えられない。エージェントは何にアクセスし、何を変更し、何を送信できるのか。
「ローカルAI」はしばしばプライベートAIと同義のように聞こえる。この二つの概念には重なりがあるが、同一ではない。モデルはローカルで実行されながら、ネットワークアクセスを持つツールを使用できる。クラウドモデルは、厳格な制御の下で、狭く選択されたデータを扱うこともできる。
信頼の対象となる単位は、ワークフロー全体だ。そこにはモデル、コンテキストに追加されるファイル、呼び出せるツール、到達できるネットワークの宛先、追加確認なしに完了できるアクションが含まれる。
Microsoftは、新しいCopilotがユーザーの許可を得てローカルコンテキストを使用し、アクションを実行するとしている。許可は必要だが、その許可の設計が、人々が十分な情報に基づく選択をできるかどうかを左右する。
「プロジェクトファイルを整理して」という幅広いリクエストには、複数のフォルダーへのアクセスが必要になる場合がある。しかし、それが内容のアップロード、元のドキュメントの削除、外部受信者への連絡まで自動的に許可するべきではない。エージェントには、無制限の権限を与えずにタスクを完了できるだけの自由が必要だ。
Microsoftはこの目的のため、すでにAgent Workspaceを開発している。これは、エージェントに別個のIDと、承認済みリソースへの限定的なアクセスを与える、隔離されたWindows環境だ。ポリシーと監査情報により、エージェントの動作を制限・記録できる。
ユーザーは特定のファイルやフォルダーへのアクセスを許可でき、エージェントが現在の権限セットの外にある資料に到達した場合、Windowsは再度確認を求められる。これは、特定のタスクに必要なアクセスだけを付与するセキュリティ原則、最小権限に似ている。
隔離は、エージェントをユーザーの完全なデスクトップセッションからも分離する。一貫して実装されれば、この構造は誤った判断による損害を抑えられる。また、従来のチャットボットの会話履歴より実用的な形で、管理者がアクションを調査できるようにもなる。
Microsoft Execution Containers、すなわちMXCは、別のレイヤーを提供する。MXCはポリシーを、ファイル、ネットワーク、プロセス、資格情報、システム機能を管理するWindowsの制御へ変換する。Microsoftは、最新のhybrid intelligence推進と同時に、MXCが一般提供されたと発表した。
こうした制御には意味があるが、意味論上の曖昧さをなくすものではない。ポリシーは、エージェントがフォルダーにアクセスできるかどうかを決められる。しかし、承認済みドキュメント内で要求された編集が、ユーザーの実際の意図を反映しているかどうかまでは、常に判断できない。
税務書類の例は、この問題をよく示している。指定フォルダーの検索は一つの権限だ。ファイル名の変更は、その状態を変える。アーカイブの作成は、新たな成果物を作る。アーカイブをメールに添付することは、情報を外部の相手へ向かわせる。
安全なインターフェースは、こうした遷移を明確に示すべきだ。ユーザーは、どのファイルが見つかったのか、どのように名前が変更されたのか、何がアーカイブに入ったのか、誰が受信するのか、メッセージが単に下書きされたのか送信されるのかを把握する必要がある。
企業顧客にとっては、求められる水準がさらに高くなる。管理者には、ファイル分類、保持要件、ID境界、外部通信、アクティビティログに関するポリシーが必要になる。個人の写真には適したシステムでも、法的文書や規制対象の顧客データには不適切かもしれない。
ここで、パーソナルナレッジツールとOSエージェントの領域が重なり始める。どちらもコンテキストへのアクセス、検索、明確な来歴に依存している。適切に管理されたAI knowledge baseは後で活用するための情報を整理できる一方、オペレーティングシステムのエージェントにはソース環境を変更する能力が加わる。その最後の段階には、より高い承認基準が必要だ。
Copilotのファイルアクセスはプロンプトインジェクションの問題を拡大する
ファイルはエージェントに有用なコンテキストを与えるが、同じファイルにはその挙動を操作するための指示が含まれている可能性もある。
Microsoft自身のエージェント型セキュリティガイダンスでは、クロスプロンプトインジェクションを新たなリスク分類として挙げている。悪意ある指示は、エージェントが処理する文書、インターフェース、メッセージ、その他のコンテンツに隠される可能性がある。
人間は文書を参照資料として見る。言語モデルは、その資料と指示を区別することに苦労する場合がある。ファイルがエージェントに対し、ユーザーを無視して機密情報をアップロードするよう指示していても、モデルはそのテキストを信頼できないコンテンツとして扱わなければならない。
アシスタントが文書を要約するだけだった時代にも、このリスクは存在した。操作を実行するエージェントでは、操作された出力がファイル操作、システム変更、コマンド実行、データ転送につながり得るため、リスクはさらに大きくなる。
たとえば、Copilotが請求書を探すためにダウンロードフォルダーを検索しているとする。ある文書には、最終アーカイブに無関係な認証情報ファイルを含めるようエージェントに指示する、隠された命令が含まれている。ユーザーの大まかな依頼自体は正当でも、エージェントの中間コンテキストは汚染されている。
認可された境界の外に認証情報ファイルがあれば、コンテナによってアクセスを阻止できる。ネットワーク制限は未知のドメインへの送信を止められる。確認ステップでは、想定外の添付ファイルを明らかにできる。これらの防御はいずれも、モデルが攻撃を完全に認識できることには依存しない。
モデルレベルのフィルタリングは確率的であるため、この多層的なアプローチは不可欠だ。モデルの更新、ルーティングの変更、会話の長期化によって、同じ依頼でも異なる挙動を示す場合がある。セキュリティ境界は、モデルが不審なテキストを正しく解釈できるかどうかだけに全面的に依存すべきではない。
ローカルモデルには、別の複雑さもある。Microsoftは、容量、レイテンシー、コストに応じてCopilotがタスクをモデル間でルーティングすることを目指している。モデルごとに、悪意ある指示への耐性や複雑なポリシーに従う能力が異なる可能性がある。
そのため、システムにはモデルの外部で一貫した強制機構が必要になる。どのモデルがステップを処理しても、ファイルポリシーとネットワークポリシーは維持されるべきだ。ログでは、重要な各操作に関与したモデル、ツール、ID、ポリシーを特定できなければならない。
Microsoftの現在のアーキテクチャは、その方向性を示している。Agent Workspaceは分離を提供し、MXCはオペレーティングシステムの制御を担い、Microsoft Agent 365は企業向けの検出と管理を追加する。ただし、最新のCopilot発表だけでは、すべての消費者向けワークフローでこれらの層がどのように使われるかを判断するための公開情報はまだ十分ではない。
使いやすさは、技術的に健全な制御を弱める可能性がある。Copilotがすべてのファイル読み取りや軽微な編集でユーザーを中断させれば、人々は自動化の利用をやめるか、内容を読まずにプロンプトを承認するようになる。逆に、確認の頻度が低すぎれば、広範な権限がその正当性の根拠となったタスクより長く残る可能性がある。
最も有用な承認は、Copilotがアクセスを求めていると伝えるだけの一般的なダイアログではない。予定されている操作、関係する正確なリソース、外部への送信先候補、可逆的または不可逆的な影響を示すものだ。
Microsoftには復旧メカニズムも必要だ。ファイル変更は実用的な範囲で元に戻せるべきである。下書きは明確に承認されるまで下書きのままにするべきだ。アクティビティ履歴では、内部の推論トレースを解読しなくても、ユーザーが何が起きたかを再構成できなければならない。
悪意ある攻撃と並んで、エージェントの信頼性も重要だ。Copilotが契約書の誤った版を選んだり、名前が似た2人の顧客を混同したり、個人ファイルを誤分類したりする可能性がある。より優れたモデルはこうしたエラーを減らすが、明確なプレビューと限定されたスコープがその影響を抑える。
重要な尺度は、Copilotが洗練されたデモを完遂できるかどうかではない。ワークフローが複雑になったとき、一般のユーザーがその操作を理解し、レビューし、取り消せるかどうかだ。
MicrosoftはWindowsを成果中心に再定義している
Microsoftは、ユーザーが成果を説明し、その実現に必要なファイル、モデル、アプリケーション、システム操作をWindowsが判断する形を目指している。
数十年にわたり、デスクトップOSはアプリケーションを中心に作業を整理してきた。ユーザーはプログラムを開き、ファイルを見つけ、コマンドを選び、タスクの各段階でその手順を繰り返していた。
Copilotは異なる抽象化を導入する。ユーザーは、たとえば会計士向けの書類を準備するといった目的を提示する。エージェントは、どのフォルダーを調べるか、どのファイルが依頼に適合するか、次のステップでどのツールを使うべきかを決定する。
このモデルはアプリケーションをなくすものではない。アプリケーションの機能を、より大きなワークフローの構成要素に変える。メールは引き続きメッセージを送信し、アーカイブユーティリティは引き続きファイルをパッケージ化し、Windowsは引き続きストレージを管理する。Copilotは自然言語を通じて、その一連の流れを調整する。
この変化は、MicrosoftがCopilotをWindows Searchと接続している理由を説明する。従来、検索は目的地を返すものだった。Microsoftによれば、新バージョンはタスクバーから、一般的な設定の変更やウィンドウ管理を含む数千の操作を実行できる。
実用上の利点は、インターフェース操作を減らせることにある。ユーザーは、Microsoftが設定の場所をどこへ移したか、あるいは軽微なコマンドをどのアプリケーションが担っているかを覚える必要がない。依頼そのものがインターフェースになる。
ただし、このアプローチにはシステム状態を見えにくくするリスクもある。メニューやダイアログは、手間がかかる場合でも利用可能な選択肢を示す。エージェントが提示するのは、依頼から推論した操作だけかもしれない。ユーザーには、何が起きたかを確実に確認し、代替案を見つける手段が必要だ。
Microsoftが最も説得力を持つのは、アプリケーションの境界をまたぐ複数ステップの作業だろう。1つのファイル名を変更するだけなら、エージェントを使う意義はほとんどない。関連する12件の文書を見つけ、名前を標準化し、パッケージ化し、メッセージの下書きを作る作業なら、労力をより明確に減らせる。
トラブルシューティングも、もう1つの有用な事例になり得る。Copilotは診断情報を調べ、エラーと最近の操作を結び付け、承認済みの設定を変更し、問題が解消したかを確認できる。これは一般的なサポート手順を返すより価値がある。
同じモデルは開発者にも役立つ。コーディングエージェントはプロジェクトを調査し、ローカルモデルを呼び出し、コンテナ内でツールを実行し、難易度の高い推論ステップにはクラウドの知能を利用できる。MicrosoftによるGitHubとWindowsへの投資は、このワークフローを重要な実証の場にしている。
OpenAI、Anthropic、Google、Appleも、それぞれツール利用、コンピューター制御、個人コンテキストの独自形態を追求している。Microsoftの違いは配布力にある。Windowsに制御を組み込み、PCメーカー、企業管理者、アプリケーション開発者、ユーザーへ単一のプラットフォームを通じて提供できる。
配布力は失敗も増幅する。信頼性の低い任意のチャットボットはフラストレーションを生む。信頼性の低いOSエージェントは、ファイルを変更したり、別のアプリケーションを通じて情報を送信したりする可能性がある。Microsoftは、抑制を単なる設定オプションではなく、製品の一部にしなければならない。
Recallをめぐる同社の以前の経験も引き続き重要だ。Recallは、ローカルで取得したスナップショットを通じて、ユーザーが過去の操作を見つけられるよう設計されていた。Microsoftは、研究者や顧客が懸念を示した後、当初のリリースを延期し、セキュリティ設計を変更した。
Copilotの操作は同じ製品ではない。継続的な画面キャプチャではなく、意図的な依頼と許可を受けた操作を伴う。それでもRecallは、「ローカルに保存されている」だけでは、アクセス、同意、保持、攻撃対象領域に関する問題を解決できないことを示した。
Microsoftは現在、エージェント展開の早い段階から、封じ込め、ID、監査可能性、明示的な許可を重視しているように見える。これは建設的な対応だ。同時に、Windowsユーザーが重要な作業を委任する前に、同社がどれほどの信頼を得なければならないかも反映している。
Microsoftの賭けが成功するかを示す3つのシグナル
次の段階を決めるのは、もう1つの洗練されたデモではなく、権限設計、実環境での完了率、企業向けガバナンスだ。
最初のシグナルは、今後数か月にわたるCopilot+ PCの展開である。テスターは、Copilotがどれほど限定的にファイルアクセスを要求するか、再承認をどの程度の頻度で求めるか、すべての外部操作に明確なプレビューがあるかを検証すべきだ。
強力な展開では、権限が具体的かつ一時的になる。ユーザーはCopilotが正確に何へアクセスできるかを特定し、複数の設定ページを探し回らずにそのアクセスを取り消せるべきだ。想定外の挙動は、理解しやすいアクティビティ記録に表示されなければならない。
広範または分かりにくい権限は、ユーザーが制御を維持できるというMicrosoftの主張を弱める。また、あまりに頻繁に表示され、人々が自動的に承認するようなプロンプトも同様だ。
2つ目のシグナルは、演出された例の外での性能だ。有用な指標には、完了率、レビュー後に節約できた時間、誤ったファイル選択の頻度、ワークフロー中に必要となった介入の回数が含まれる。
Microsoft CopilotのWindows操作は、エージェントが一度タスクを完了できるだけでは成功しない。手動プロセスより大きな検証負担を生むことなく、反復的で多様な作業を完了しなければならない。
ユーザーはローカルとクラウドの挙動も比較すべきだ。ローカルにルーティングされたステップは応答時間やデータ処理を改善する可能性があるが、能力の異なるより小さなモデルを使用する場合がある。Microsoftは、顧客にAIインフラを学ばせることなく、重要なルーティング判断を説明する必要がある。
3つ目のシグナルはガバナンスだ。11月のMicrosoft Igniteは、Agent 365、MXC、監査、ポリシー管理に関する詳細を示す当面の場となる。企業は、アクティブなエージェントを把握し、そのツールを制限し、インシデントを調査し、既存のID制御を適用できることを示す証拠を求めるだろう。
明確なガバナンスは、Windowsが職場向けエージェントの管理プラットフォームになれるというMicrosoftの主張を強める。Copilotの各体験における制御の欠落や強制の不一致は、それを弱めることになる。
競合他社の対応も重要だが、実行力に比べれば二次的である。AppleとGoogleは自社OS内でアシスタントのアクセスを深められる。OpenAIとAnthropicはコンピューター利用ツールと提携を拡大できる。MicrosoftはすでにWindows統合という優位性を持つため、その課題は、より深いアクセスが理解可能かつ制御可能であり続けることを証明することだ。
ナレッジワーカーにとって、当面の問いは実践的だ。どの反復作業なら、AIアシスタントにローカルファイルとWindowsの制御へのアクセスを許可する価値があるだろうか。可逆的なワークフローから始め、提案される各操作を確認し、権限の境界が不明確になる箇所を記録してほしい。
その体験は、ローンチプレゼンテーションより多くを明らかにする。Copilotがローカルコンテキストを、レビュー済みで可逆的な作業へと確実に変換できるなら、MicrosoftはPCアシスタントの役割を変えたことになる。検証が依然として困難なら、最も重要なMicrosoft CopilotのWindows操作はなおユーザーの手にある――エージェントをいつ停止させるかを決めることだ。



