top of page

Wavestone AI Cyber Benchmark 2026、ガバナンスが運用セキュリティを先行していることを明らかに

1 時間前
読了時間: 19分

Wavestoneは2026年のベンチマークを公表し、明確な矛盾を示した。組織はAIを導入後に保護する能力よりも、AIをはるかに適切に統治している。Wavestone AI Cyber Benchmark 2026では、調査対象パネルの88%がガバナンスの仕組みを整備していた。一方、AIアプリケーションのログをセキュリティオペレーションセンターの監視に接続しているのは、わずか8%だった。

この差は重要である。なぜなら、組織がAIシステムに対して負う責任は大きくなっているからだ。評価対象組織の半数は、既存フレームワークまたは事前学習済みモデルを用いてシステムを設計しており、2025年の35%から増加した。さらに40%は開発チェーン全体を管理している。

したがって、このベンチマークが測定しているのは、ポリシー策定の進展だけではない。テクノロジー提供者から、企業のエンジニアリング、セキュリティ、データ、事業チームへと運用リスクが移転している状況を捉えている。これらのチームは今や、機密情報を検索し、ツールを呼び出し、行動を実行できるシステムを所有している。

Wavestoneの中心的な発見は耳の痛いものだ。ガバナンスはAIシステムを承認できるが、承認しただけで、そのシステムが可観測になるわけでも、復旧可能になるわけでも、インシデント時に安全になるわけでもない。カスタムモデルやエージェント型ワークフローへ最も速く移行している組織ほど、この問題により大きく直面している。

Wavestone AI Cyber Benchmark 2026が浮き彫りにした大きな統制ギャップ

組織は、障害の封じ込め、インシデント調査、信頼できるシステムの復旧に必要な運用上の統制よりも速く、AIガバナンスを確立している。

Wavestoneは2026年9月14日にこのベンチマークを公表した。調査パネルは、大手の公的組織および民間組織30社で構成される。評価には、同コンサルティング企業が過去3年間に手掛けたAIセキュリティ業務から得た知見も取り入れられている。

このフレームワークでは、NIST Cybersecurity Frameworkを基にした5つの機能を用いる。各機能には30を超える評価項目が含まれ、成熟度は0から100%の尺度で採点される。

機能が実際のセキュリティ運用に近づくにつれて、結果は低下している。

  • Governは54%だった。

  • Identifyは55%だった。

  • Protectは48%だった。

  • Detectは40%だった。

  • Respondは29%だった。

最も高いスコアはリスクの特定に関するもので、最も低いのはリスクが実際の事象になった際の対応に関するものだった。この分布は、WavestoneのパートナーであるGérôme Billois氏の結論を裏付ける。すなわち、組織はAIを統治することには長けている一方で、本番環境で安全に運用することには十分対応できていない。

詳細な結果は、この対照をさらに際立たせている。2026 benchmarkによると、パネルの88%はAIガバナンスの仕組みを導入していた。しかし、活動内容、関係者、説明責任モデルを明確に定義していたのは32%にとどまった。

この違いは、ポリシーと運用モデルを分けるものだ。ポリシーでは、誰が承認済みシステムを監視するかを特定しないまま、セキュリティレビューを要求できる。誰が侵害されたナレッジベースを調査するかを定めないまま、エスカレーションを義務付けることもできる。

スキルの状況にも同様の偏りがある。システムのライフサイクル全体を通じて技術チームと事業チームを支援できる専任のAIセキュリティ専門家を特定していた組織は、わずか44%だった。

組織はテストではより進展している。3分の2がAIセキュリティに特化したペネトレーションテストを実施し、半数が高度なAI重視の評価を行っている。50%は、定期的な監査およびペネトレーションテストのプログラムにAI評価を組み込んでいる。

それでも、テストが捉えるのは特定時点におけるシステムにすぎない。モデル、検索ソース、権限、統合、ユーザー行動は導入後に変化する。評価を通過しても、こうした変化を継続的に可視化することの代わりにはならない。

このベンチマークの手法にも注意が必要だ。その割合は評価対象となった30組織を表すものであり、世界市場全体を示すものではない。Wavestoneも、このパネルを市場の代表的な推計として解釈しないよう明示的に警告している。

この制約があっても、内部的な傾向には意味がある。承認や評価に関連する統制は、検知、調査、復旧に関連する統制よりもはるかに一般的だ。そこに、このベンチマークの本当のニュースがある。

企業はAIの利用からAIの所有へ移行している

企業がAIスタックのより多くを構築し、これまで提供者が担っていた責任を引き継ぐにつれて、セキュリティギャップの影響はさらに大きくなる。

2025年には、Wavestoneのパネルの30%が既存製品を通じて提供されるAI機能のみを利用していた。この割合は2026年には10%へ低下した。この変化は、受動的な利用を明確に超えた動きを示している。

2026年のパネルの半数は、既存フレームワークまたは事前学習済みモデルを使用して、AIシステムを社内で設計している。この割合は前年の35%から上昇した。開発チェーン全体を管理する組織も、35%から40%へ増加した。

これらの分類には、それぞれ異なるセキュリティ上の責務が伴う。AI機能を利用する企業が主に管理するのは、データ露出、ユーザーアクセス、設定、サプライヤーリスクだ。検索システムを構築する組織は、それに加えてデータパイプライン、ベクトルデータベース、モデル接続、アプリケーションロジックも保護しなければならない。

ベクトルデータベースは、AIが応答に関連する情報を取得する際に使う数学的表現を保存する。攻撃者がこのストアを操作した場合、基盤モデル自体を侵害せずとも、システムに汚染された情報を取得させることができる。

所有の問題はナレッジリポジトリにも及ぶ。組織は内部文書を統制対象の事業情報として扱うことが多いが、AIの攻撃対象領域を構成する能動的な要素とは見なしていない。検索によってこの前提は変わる。保存された情報がシステムの挙動に直接影響し得るためだ。

Wavestoneによると、パネルの72%はAIトレーニングに向けたプライバシー対策の導入を開始していた。65%はデータセットの品質チェックを実施していた。本番導入前にデータセットの品質とセキュリティの両方を体系的に評価していたのは、わずか9%だった。

品質チェックは、データが正確で完全であり、目的に適しているかを問う。セキュリティチェックは、データが操作、露出、または不正な経路で取得されていないかを問う。一方のプロセスが他方を代替することはできない。

提供者側の統制も別の例になる。クラウドおよびモデルプラットフォームは、認証、ログ、フィルター、設定上の保護策を提供する。しかし、これらの保護がカバーするのは、提供者が保持する責任の範囲に限られる。

Wavestoneのパネルで、提供者ネイティブの統制を超える保護策の評価または導入を開始していたのは、わずか11%だった。チームがモデルをファインチューニングし、コンポーネントをセルフホストし、あるいはエージェントを社内ツールに接続する場合、この点はさらに大きな懸念となる。

このベンチマークは、組織が社内開発を避けるべきだと主張しているわけではない。システムを構築することで、アーキテクチャ、データの保存場所、依存関係に対する統制を向上できる。一方で、追加した各コンポーネントを保護する責任は組織に生じる。

Wavestoneの2025 findingsは、すでにこの問題を示唆していた。同調査では、AIユーザーと、サードパーティモデルをオーケストレーションする組織、独自システムを構築する高度なビルダーを区別していた。

2026年の結果は、より多くの組織が要求の厳しいカテゴリーへ移行したことを示している。その移行に合わせて、セキュリティプログラムが均等に進展しているわけではない。

このため、運用AIセキュリティは現在、複数チームにまたがる負荷を生んでいる。エンジニアリングは利用可能なテレメトリーを提供しなければならない。セキュリティ運用チームはそれを解釈する必要がある。アイデンティティチームは権限を制約し、事業責任者はエージェントに何を許可するかを決定しなければならない。

この移行では、文書化と検索可能な運用ナレッジも重要になる。チームには、最新の所有者記録、システムの依存関係、意思決定、対応手順が必要だ。維持管理された検索可能なナレッジベースはこの作業を支援できるが、セキュリティ統制の代わりにはならない。

AIセキュリティガバナンスは本番環境の統制と同義ではない

主要な争点は、AIポリシーの有無ではなく、文書化されたガバナンスと継続的に強制される統制の間にある。

ガバナンスは必要な境界を設ける。許容される利用を定義し、システムの重要度を分類し、レビュー要件を割り当て、エスカレーション経路を確立できる。こうした基盤には価値があるが、システムを自動的に運用するものではない。

運用上の統制は異なる問いを投げかける。組織は不審な挙動を確認できるか。エージェントを隔離できるか。調査担当者は何が起きたかを再構築できるか。チームは信頼できるモデル、データセット、ナレッジリポジトリを復旧できるか。

Wavestone AI Cyber Benchmark 2026によると、88%の組織がAIアプリケーションのログを収集している。これらのログをセキュリティオペレーションセンターの監視へ送っているのは、わずか8%だ。

これは主としてデータ収集の失敗ではない。AI運用とセキュリティ運用の間にある統合の失敗である。

AIアプリケーションチームは一般に、レイテンシー、コスト、出力品質、失敗したリクエスト、モデル性能を監視する。セキュリティチームは、侵害されたアイデンティティ、異常なアクセス、悪意ある入力、データ抽出、不正な変更を探す。

同じイベントでも、各グループには異なって見える場合がある。ツール呼び出しの急増は、人気のワークフロー、欠陥のあるエージェントループ、あるいは攻撃を示している可能性がある。有効な検知には、アプリケーションとセキュリティ環境の両方からの文脈が必要だ。

ログには明確な目的も必要である。アクセスイベント、ツール呼び出し、モデルバージョン、検索ソース、認可判断を伴わずにプロンプトを収集しても、調査担当者には不完全な記録しか残らない可能性がある。

NISTのAI RMF Coreは、導入後の監視、インシデント対応、復旧、変更管理を相互に関連する成果として扱っている。また、インシデントやエラーを追跡し、そこから復旧するための文書化されたプロセスも求めている。

このライフサイクルの考え方は、一度きりの承認と相容れない。AIシステムは、従来型のソフトウェアリリースを行わずに変化することがある。提供者がモデルを更新することもあれば、チームが検索ソースを置き換えることもあり、管理者がエージェントの権限を拡張することもある。

こうした変更は、それまでの前提を無効にし得る。読み取り専用の文書検索を承認したレビューは、後にレコードを編集したりメッセージを送信したりできるワークフローについて、ほとんど何も語らない。

同じ問題はテストにも当てはまる。Wavestoneのパネルの3分の2はAIセキュリティ専用のペネトレーションテストを実施している。しかし同ベンチマークは、成熟した組織ではテストを例外的なものではなく、定期的なものにすべきだと主張している。

定期的なテストは、重要な変更に追随すべきだ。こうした変更には、新しいモデル、ツール、データセット、ファインチューニング、アクセス範囲、自律的なステップが含まれる。テストプログラムは、組織のAIポートフォリオ全体をカバーする必要もある。

自動スキャンは、脆弱なコンポーネントや設定エラーを見つけられる。しかし、曖昧な指示、汚染されたコンテキスト、複数の接続されたツールを伴う敵対的な相互作用を完全に再現することはできない。

AIレッドチーミングは、構造化された敵対的テストを通じて、こうした相互作用に対応する。しかし、レッドチーミングで得られるのも、テストされた条件に関する証拠であって、恒久的な保証ではない。監視と対応は、テストが見逃す挙動に対処しなければならない。

したがって、ガバナンスと運用の差は、異なる種類の仕事を反映している。ガバナンスは何が起きるべきかを決める。運用セキュリティは、現実がその決定から逸脱したときに検知し、チームが介入できる手段を与える。

エージェント型AIは脆弱なアイデンティティ統制を事業リスクへ変える

過剰なアクセス権を持つAIエージェントは、誤解を招く入力やモデルエラーを、不正な事業行為へと変換し得る。

エージェント型AIとは、タスクを計画し、ツールを呼び出し、人間による限定的な指示のもとで行動を実行するシステムを指す。この能力により、セキュリティの目的は生成テキストの管理から、認可された行動の管理へと変化する。

Wavestoneの調査対象企業のうち、33%はエージェント型AIのリスクをガバナンスの枠組みに組み込んでいた。開発標準にAI機能およびツールへの安全なアクセスを含めていたのは、わずか17%だった。

ID管理に関する統制では、導入率はさらに低下する。AIシステムとエージェント向けに専用のID・アクセス管理保護策を設けていたのは、わずか15%だった。

この隔たりは重要である。なぜなら、エージェントは確率的なモデル判断と、決定論的なエンタープライズシステムを結びつけるからだ。モデルは不確実な文脈から行動を選択する可能性がある一方、下流のデータベースやワークフローはその行動を具体的に実行する。

このリスクには、悪意あるモデルは必要ない。改ざんされた文書、間接的なプロンプトインジェクション、曖昧な要求、あるいは不適切な計画ステップによって、本来は正当なエージェントが別の方向へ誘導される可能性がある。

OWASPは過剰なエージェンシーを、過度な機能、権限、または自律性によって可能になる有害な行動と説明している。同団体のガイダンスは、限定的なツール、最小権限、下流での認可、活動監視を推奨している。

これらの統制は、モデルの外部に強制力を置く。この設計判断は重要である。モデル自身に権限を監視させると、循環依存が生じるためだ。

ファイルを読み取り、要約を作成する社内リサーチエージェントを考えてみよう。承認済みリポジトリへのアクセスは必要だが、削除権限まではおそらく必要ない。そのファイルコネクターは、必要な操作だけを公開すべきである。

カスタマーサービスエージェントは異なるリスクをもたらす。アカウント情報の閲覧、クレジットの発行、サービス設定の変更を行う可能性がある。各行動には、明確な上限、認可チェック、監査記録が必要だ。

ソフトウェアエージェントは、ソースコード、課題管理システム、デプロイメントシステム、クラウドインフラと連携する可能性がある。これらのシステム全体で単一の特権IDを使うと、帰属の追跡が難しくなり、一つの障害が及ぼしうる影響も拡大する。

最小権限の原則は、各エージェントを必要最小限のリソースと行動に限定する。短命な認証情報は露出時間を短縮する。エージェントごとのIDは活動を追跡しやすくする。

影響の大きい行動には、人間による承認も必要になり得る。この統制は、モデルがすでに重要システムを変更した後ではなく、実行前に適用されるべきである。

Wavestoneは、エージェントの行動は制約され、追跡可能で、中断可能であるべきだと強調している。中断には、ユーザーインターフェース上の停止ボタン以上のものが必要だ。セキュリティチームには、認証情報を確実に失効させ、下流アクセスを遮断する手段が必要である。

AI Controls Matrixは、クラウドベースのAIシステムに向けた、より広範な統制フレームワークを提供している。その2026年版には、18のセキュリティ領域にまたがる247の目標が含まれる。

ただし、フレームワークの利用可能性が主な制約ではない。ベンチマークは、組織がすでに多くのリスクをガバナンスの水準で認識していることを示している。より困難なのは、アプリケーションアーキテクチャとセキュリティ運用の内部で実装することだ。

エージェント型AIは、この実装を急務にする。統制の弱いチャットボットは情報を開示したり、有害な回答を生成したりする可能性がある。統制の弱いエージェントは、その回答に基づいて行動する可能性もある。

インシデント対応と復旧は依然として最も弱い環

AIに特化した調査、対応計画、標準化された復旧手法を大半が欠いている限り、組織は運用レジリエンスを主張できない。

Wavestoneのベンチマークでは、「対応」は29%で最も低い成熟度スコアとなった。その裏付けとなる指標は理由を明確に示している。

評価対象組織のうち、AIプラットフォーム上でフォレンジック調査を実行できたのは8%にすぎなかった。AIフォレンジックでは、関連するプロンプト、取得コンテンツ、ツールの活動、モデルバージョン、権限、システム変更を再構成する。

調査対象の半数は、体系的な対応プロセスを持たず、場当たり的な修復に依存していた。AIに特化したインシデント対応計画を文書化していたのは13%にとどまり、Wavestoneによると、それらの計画も一貫して適用されていなかった。

復旧も限定的だった。AI関連資産をバックアップしていたのは22%で、実施方法の大半は標準化されていなかった。

従来のアプリケーションバックアップでは、コードとデータベースを保存できる可能性がある。AIサービスは、モデル構成、ファインチューニングデータ、埋め込み、安全性ポリシー、プロンプト、外部知識ソースなど、追加の資産に依存し得る。

可用性を復元しても、信頼性が確立されるわけではない。復旧したナレッジリポジトリには、依然として汚染された文書が含まれている可能性がある。復元したエージェントが、侵害された認証情報や安全でない権限を保持している場合もある。

最初の対応上の課題は分類である。チームは、セキュリティイベントを、信頼性障害、ポリシー違反、モデルエラー、通常のユーザーミスと区別しなければならない。一部のインシデントは複数のカテゴリにまたがる。

認可されていないエージェントの行動は、プロンプトインジェクションから始まり、データを露出させ、不正確な記録を作成する可能性がある。対応者には、セキュリティ、プライバシー、法務、エンジニアリング、モデルリスク、事業に関する専門性が求められる場合がある。

第二の課題は証拠である。調査担当者には、モデルサービス、IDシステム、検索コンポーネント、ツールゲートウェイ、対象アプリケーションにまたがる同期済みの記録が必要だ。文脈が欠けていれば、再構成は不可能になり得る。

したがって、Wavestoneの88%というロギングの数値は、実態以上に安心感を与える可能性がある。ロギングが対応に役立つのは、チームが適切なイベントを保存し、それらを相関付け、調査担当者が利用できるようにした場合に限られる。

第三の課題は封じ込めである。組織は、より広範な混乱を引き起こすことなく、エージェントを無効化し、認証情報を失効させ、データセットを隔離し、モデルを切り替え、接続済みツールを停止する方法を把握していなければならない。

第四の課題は復旧である。システムを運用に戻す前に、チームには既知の正常状態と整合性テストが必要だ。そうでなければ、復旧によって同じ脆弱性や侵害された情報を復元してしまう可能性がある。

この運用上の複雑さは、対応の成熟度がガバナンスに遅れを取る理由を説明している。ポリシーは既存のリスク管理体制を拡張できる場合が多い。AIインシデント対応には、新たな技術的証拠、部門横断の手順、演習が必要だ。

ベンチマークの小規模な調査パネルは、依然として重要な制約である。これらの割合を、すべての大企業に関する主張へと拡大解釈すべきではない。詳細な評価に自発的に参加した組織は、より広い市場とは異なる可能性もある。

測定方法も変更された。Wavestoneは2026年の評価を拡張し、エージェントセキュリティ、専門的な保護策、監視、対応を含めた。そのため、直接的な前年比較は、明確に対応する指標に焦点を当てるべきである。

それでも、この傾向は確立されたリスクガイダンスと一致している。NISTの生成AIプロファイルは、インシデントの文書化、ロギング、報告、ライフサイクルにわたる情報共有を重視している。

懐疑的な解釈は、ガバナンスが失敗したということではない。運用上の証拠が乏しいままでは、ガバナンスの成熟度が誤った安心感を生み出し得るということだ。

ポリシーは社内マイルストーンを満たすかもしれない。しかし、それはセキュリティチームが侵害された検索を検知し、エージェントの行動を追跡し、信頼できるシステムを復旧できることを示すものではない。

運用が追いつくかを示す3つのシグナル

AIセキュリティ成熟度の次の段階は、連携したテレメトリー、強制可能なエージェント権限、そして訓練された復旧によって測定される。

第一のシグナルは、AIイベントをアクティブなセキュリティ監視に取り込んでいる組織の割合である。Wavestoneは、アプリケーションログの収集とSOC監視への統合の間に80ポイントの差があることを明らかにした。

この隔たりを埋めるには、単にすべての記録を転送するのではなく、明確に定義された検知ケースが必要だ。チームは、不審な検索、権限昇格、異常なツール使用、データ抽出の試みを示すイベントを特定すべきである。

改善の証拠には、テスト済みのアラート、調査プレイブック、AIチームとSOCチームの共同責任が含まれる。別のポリシー文書では、運用上の隔たりは解消されない。

第二のシグナルは、エージェント向け専用ID統制の導入である。現在の15%という結果は、ガバナンス上の認識が技術的な強制に先行していることを示している。

進展は、個別のエージェントID、狭く限定されたアクセス、短命な認証情報、下流サービス内での認可を通じて現れるはずだ。影響の大きい行動には、明示的な承認要件を設けるべきである。

組織がエージェントを財務、顧客対応、ソフトウェアデリバリー、社内ナレッジワークフローに導入するにつれ、このシグナルの重要性は増す。ツールが一つ増えるごとに、過剰なアクセスがもたらす影響は拡大する。

第三のシグナルは、組織がAIに特化したインシデント復旧を実施しているかどうかである。文書化された計画は有用だが、チームは封じ込め、調査、復元、整合性検証をテストしなければならない。

演習では、侵害されたデータセット、汚染された知識ソース、漏洩した認証情報、安全でないモデル変更、認可されていないエージェント行動を扱うべきである。また、封じ込め中にも組織が重要業務を継続できるかを検証すべきだ。

これらのシグナルは、Wavestoneの中心的な判断を強めるか、弱めるかのいずれかとなる。監視統合の向上は、ガバナンスが運用へ移行していることを示す。ID統制の改善は、エージェントポリシーが強制可能になりつつあることを示す。

復旧演習の成功は、最も強力な証拠となる。それは、すべての保護策が機能すると仮定するのではなく、予防に失敗した際にも組織が統制を維持できることを示すからだ。

Wavestone AI Cyber Benchmark 2026は、企業リーダーが単に導入ペースを遅らせるだけでは解決できないトレードオフを提示している。社内開発を増やせば、自律性とアーキテクチャ上の統制を改善できる一方、責任も内側へ移転する。

セキュリティリーダーは、あらゆるガバナンス上のマイルストーンの裏付けとなる証拠を求めるべきだ。どのシステムがSOCへ実行可能なイベントを送信しているのか。どのエージェント権限を即座に失効できるのか。どのAI資産にテスト済みの復旧手順があるのか。

エンジニアリング部門と事業責任者も、並行して問いかけるべきである。承認後、展開された各システムを誰が所有するのか。どの変更が再評価を引き起こすのか。自律的な行動が重要アプリケーションに到達する前に、どの人間が止められるのか。

決定的な問いは、組織にAIポリシーがあるかどうかではなくなった。その組織が、AIシステムが想定外の振る舞いをしたときに、検知、封じ込め、調査、復旧できるかどうかである。

 
 

無料で始めましょう

ローカルファーストのパーソナル知識管理付きAIアシスタント

より良いAI体験のために、

remio は現在、 Windows 10+ (x64)M-Chip Mac のみをサポートしています。

仕事のAIパートナー
remioでもっと仕事が進む

計画・作成・仕上げまで
すべてをひとつに

bottom of page