top of page

NVIDIA Open Agent Safety Platformがローンチ、AIガードレールをモデルの外へ移行

1 時間前
読了時間: 22分

NVIDIA Open Agent Safety Platformは9月28日、AI業界における現在の安全モデルに明確な課題を突き付ける形でローンチされた。エージェントがプロンプトに従うことを信頼するのではなく、NVIDIAはエージェントの外部にあるソフトウェアとハードウェアで、あらゆる行動を制御しようとしている。

このプラットフォームは、隔離されたエージェント実行のためのオープンソースランタイムであるOpenShellと、NVIDIA BlueField-4データ処理ユニットを中心に構築された独立監視設計のSentryを組み合わせるものだ。NVIDIAによれば、Sentryはエージェントが認可された境界を越えた場合、数ミリ秒以内に隔離できる。

この違いにより、これは単なる新たなエージェントフレームワークにはとどまらない。NVIDIAは、エージェントに認証情報、ネットワークアクセス、実際のシステムを変更する権限が与えられた段階では、モデルアライメントやアプリケーションレベルの指示だけでは十分な制御を提供できないと主張している。提案される代替策は従来のインフラセキュリティに似ている。アクセスをデフォルトで拒否し、限定的な権限だけを付与し、すべての判断を記録し、ワークロードの制御が及ばない場所で強制するというものだ。

差し迫った問いは、OpenShellがエージェントをサンドボックス内に配置できるかどうかではない。既存のOSやクラウドプラットフォームはすでに隔離ツールを提供している。より難しいのは、企業がエージェントに実行させたい作業を妨げずに、NVIDIAがエージェントの封じ込めを実用的なインフラ層へと転換できるかどうかだ。

NVIDIA Open Agent Safety Platformが2層の制御とともにローンチ

NVIDIAはエージェントセキュリティを、ソフトウェア境界と独立したハードウェアのバックストップに分割している。

OpenShellは第1層を提供する。各エージェントを隔離環境内で実行し、ファイル、プロセス、ネットワーク宛先、認証情報、モデルエンドポイントを対象とするポリシーを適用する。エージェントはタスクに必要なアクセスを受け取れる一方、ホストシステムを無制限に制御することはできない。

NVIDIAはOpenShellを、エージェントフレームワークではなくランタイムとして説明している。Claude Code、Codex、GitHub Copilot CLI、OpenCode、カスタムエージェントシステムなどの下位に位置する。開発者は、このセキュリティ境界を利用するために、エージェントの推論モデルやアプリケーションハーネスを置き換える必要はない。

このランタイムはデフォルト拒否のアプローチを採る。サンドボックスの起動時、エージェントには一般的なネットワークアクセス、昇格権限、広範なファイルシステム権限が付与されない。管理者はその後、機械可読なポリシーを通じて承認済みのリソースを定義する。

たとえば、請求書処理エージェントには、特定のフォルダを読み取り、承認済みの会計APIに接続する権限を付与できる。請求書を削除したり、無関係なディレクトリを調べたり、未承認のWebサイトへデータを送信したりすることはできないままにできる。

OpenShellは、認証情報の利用と認証情報の保有も分離する。サンドボックスの外部で実行されるスーパーバイザーは、ポリシーが特定のリクエストを認可した場合にのみ認証情報を提供できる。エージェントは基盤となるシークレットへ直接アクセスする必要がない。

ランタイムは、要求したバイナリ、宛先、メソッド、パスなどの詳細を用いてネットワーク活動を評価する。エージェントの実行を継続したままポリシー更新を適用できる。許可または拒否された各アクションは、監査証跡の一部となる。

NVIDIAのOpenShellアーキテクチャには、ポリシー証明機能も含まれている。このコンポーネントは、管理者がポリシー変更を適用する前に、指定したルールが定義済みの特性を満たすかを検証する数学的手法である形式検証を用いる。

この証明機能は微妙な問題に対処する。セキュリティチームは、エージェントがある新サービスへのアクセスを必要とすることは理解していても、ポリシー変更によって新たに生まれるすべての能力を容易には把握できない。限定的に見えるルールでも、想定外のネットワーク経路を開いたり、認証情報が到達可能な位置に置かれたりする可能性がある。

Sentryは第2層を提供する。これはBlueField-4 DPU上の隔離された信頼ドメインで実行される。DPUは、メインCPUの外部でインフラとセキュリティのワークロードを処理する専用プロセッサだ。

NVIDIAのプラットフォーム発表によると、Sentryはエージェントの活動を独立して監視し、不審な挙動を数ミリ秒で停止できる。NVIDIAは、このシステムがDOCAソフトウェアを用いてリクエストを検査し、IDを検証し、データアクセスを保護し、証明可能なテレメトリを生成するとしている。

この分離は重要だ。エージェントは、作業環境の内部からSentryに単純なプロンプトを与えたり、その指示を書き換えたり、無効化したりできない。ランタイムが侵害された場合でも、メインシステムの外側に別の強制ポイントが存在する。

OpenShellは広く利用可能である一方、SentryはBlueField-4に結び付くリファレンスシステム設計の一部として提示されている。NVIDIAによると、OpenShellのソフトウェアはArmおよびIntelのプロセッサにも拡張できる。

その結果は、単一のセキュリティ製品ではなく、階層的な提案だ。OpenShellは通常運用時にエージェントが実行できることを制限する。Sentryはその境界の外から監視し、活動が境界を逸脱したように見える場合に対応する。

エージェントセキュリティがプロンプトの先へ進む理由

行動を起こせるエージェントは、よりよい指示だけでは解決できないセキュリティ問題を生む。

従来のチャットボットは、人間が確認するためのテキストを返す。自律型エージェントは、ローカルファイルの読み取り、パッケージのインストール、外部サービスの呼び出し、認証トークンの使用、コードの変更、常時の承認なしでの継続作業が可能だ。

これらの能力はエージェントを有用にする。同時に、誤った前提、操作された入力、侵害された依存関係、曖昧な指示がもたらす影響も拡大する。

プロンプトは、機密情報を共有しないようエージェントに指示できる。しかしその指示は、エージェントが機密ファイルを開いたり、未知のサーバーに接続したりすることを物理的に防ぐものではない。アプリケーションのガードレールは、エージェントが探索している同じソフトウェア環境の一部にとどまる。

プロンプトインジェクションは、この弱点を特に重要なものにする。エージェントはWebサイト、文書、メール、課題トラッカー、ソースコードリポジトリ内で敵対的な指示に遭遇する可能性がある。こうした指示は、正当なタスクデータに見せかけながらエージェントを誘導しようとする。

攻撃者に遭遇しなくても、モデルは有効な要求を誤解する可能性がある。プロジェクトの整理を依頼されたコーディングエージェントが、必要なファイルを削除するかもしれない。リサーチエージェントが、その手順を有用だと判断して、未認可のサービスへ情報を送信する可能性もある。

NVIDIAのエンタープライズAI担当バイスプレジデントであるJustin Boitano氏は記者団に対し、指示が曖昧だったりツールが予期せず動作したりすると、エージェントは逸脱し得ると語った。同氏の中心的な主張は、行動可能なエージェントが自らを監督することは期待できないというものだった。

これが、NVIDIA Open Agent Safety Platformがローンチされたという発表の背後にある原則だ。エージェントの推論は確率的なままだが、インフラの権限は決定論的にできる。ポリシーエンジンは、モデルが接続を要求する理由をどう説明しても、ネットワーク接続を拒否できる。

この転換は、クラウドセキュリティにおける過去の変化と似ている。組織は、すべてのデータベース、シークレット、ネットワーク経路を保護することをアプリケーション開発者だけに依存しなくなった。各アプリケーションの外部に、ID管理、ワークロード隔離、ポリシーエンジン、監視機能を追加した。

エージェントセキュリティも現在、同様の移行に直面している。モデルには依然として安全性訓練が必要であり、アプリケーションには依然として適切な指示が必要だ。テストで良好な性能を示したというだけで、どちらの層にも無制限の権限を与えるべきではない。

NVIDIAの立場は、エージェントプラットフォームベンダーにも圧力をかける。外部ランタイムが複数のモデルやフレームワークにまたがって権限を強制できるようになると、エージェントハーネス内だけに実装されたセキュリティ制御の説得力は低下する。

クラウドプロバイダーも圧力に直面する。エージェント群を展開する顧客は、自律型ワークロード向けに設計されたID境界、認証情報ブローカリング、送信制御、監査記録をますます期待するようになる。汎用コンテナだけでは、すべてのガバナンス上の問いに答えられない。

3つ目の圧力を受けるグループは企業だ。エージェントが最小権限で動作していると企業が主張するには、エージェントがどのリソースへ到達するのか、権限がどのように変化するのか、誰が停止できるのかを説明できなければならない。

この要件は、劇的な暴走エージェントのシナリオだけにとどまらない。コンプライアンスチームには、ファイルアクセス、API呼び出し、ポリシー変更、認証情報の利用を含む日常的な運用の記録が必要だ。

NVIDIAによると、100を超える組織が同プラットフォームの技術に取り組んでいる。発表されたグループには、Anthropic、Cisco、CrowdStrike、Dell Technologies、Hugging Face、JPMorganChase、Microsoft、Palantir、Perplexity、Red Hat、Salesforce、SAP、Scale AI、ServiceNowなどが含まれる。

このリストは幅広い関心を示すが、本番環境での成熟度を裏付けるものではない。「取り組んでいる」という表現には、評価、統合、共同エンジニアリング、サポート計画などが含まれ得る。購入者にはなお、導入実績と運用結果が必要だ。

OpenShell 0.1が最小権限をエージェントランタイムへ転換

OpenShellの主な貢献は、より賢いモデルではなく、多様なモデルの下で利用できる再利用可能な制御層にある。

OpenShell 0.1のリリースラインは、安定したリリースサイクル、拡張された拡張ポイント、新しいAPI、追加の隔離機構を通じて、このアプローチを正式なものにしている。そのオープンソースリポジトリでは、ランタイム、ポリシーシステム、ソフトウェア開発キット、デプロイメント資料を確認できる。

各エージェントは、非特権アカウントと縮小されたOS機能を備えたサンドボックス内で実行される。Linuxの制御機能がファイルシステムアクセスとシステムコールを制限し、外部への接続はポリシーチェックを通過する。

このアーキテクチャは、サンドボックスとそのスーパーバイザーを分離する。エージェントは制限されたワークロード境界の内部で動作し、スーパーバイザーは外部に留まり、認可済みアクセスを仲介する。ゲートウェイは、ユーザー、サンドボックス、ポリシー、設定、認証情報を管理する。

この分離により、エージェントプロセスが持つ権限は縮小される。モデルが禁止されたファイルを要求するシェルコマンドを生成した場合、動作環境がそのアクションをブロックする。モデルの確信度や表明された根拠は、その結果を変えない。

OpenShellのポリシーは宣言的だ。管理者は、すべての制限をアプリケーションコード内に埋め込むのではなく、設定として許可された挙動を記述する。これにより、セキュリティ、プラットフォーム、開発チームに共通のレビュー対象が生まれる。

ポリシーはいくつかの関連領域を対象とする。ファイルシステムルールは、読み取り可能なパスと書き込み可能なパスを区別する。プロセス制御は権限を縮小し、システムコールを制約する。ネットワークルールは、宛先、ポート、バイナリ、アプリケーションレベルの詳細を評価する。

プロバイダープロファイルは、承認済みサービスを対応する認証情報およびネットワークルールと結び付ける。これにより、APIトークンを汎用的な環境変数に置くのではなく、意図された宛先に紐付けておくことができる。

このランタイムは推論ルーティングもサポートする。企業は、プロバイダーの認証情報をサンドボックス外に保持しながら、エージェントが使用するモデルエンドポイントを統制できる。これは、チームがローカルモデル、クラウドAPI、制限されたデータを組み合わせる場合に重要だ。

可観測性が基本的な制御ループを完成させる。OpenShellは判断を記録し、構造化形式でセキュリティイベントをエクスポートできる。調査担当者は、エージェントが何を要求し、ランタイムが何を許可し、何を拒否したのかを確認できる。

こうした機能は、とりわけコーディングエージェントによく適合する。開発者は、エージェントに1つのリポジトリの読み取り、作業ブランチ内でのファイル作成、承認済みレジストリからのパッケージダウンロード、認可済みモデルエンドポイントへの接続を許可できる。

この同じポリシーは、無関係なリポジトリ、個人用ディレクトリ、本番環境の認証情報、任意のWebサイトへのアクセスも阻止できる。エージェントがより広いアクセスを要求した場合は、人間または信頼できるシステムが提案された変更をレビューできる。

この設計は、長時間稼働するエージェントにも対応する。従来のサンドボックスは、多くの場合、限定されたタスクを実行する単一のプロセスを一定時間保護する。OpenShellは、ポリシー更新やサブエージェントのワークフローを含め、時間の経過とともに変化するエージェントの活動を統制することを目指す。

この野心は運用上の複雑さももたらす。ポリシーは、保護としての価値を失うほど広範にならないようにしながら、正当な変動を許容しなければならない。チームには、すべてのタスクを停滞させずに例外をレビューするためのプロセスも必要となる。

形式検証は、提案されたポリシーの構造を評価するのに役立つ。ただし、事業上の意図として危険な操作を許可すべきかどうかまでは判断できない。許容可能な境界を決めるのは、依然として人間によるガバナンスである。

OpenShellがオープンソースであることは、組織にもう一つの利点をもたらす。セキュリティ研究者は実装を精査し、前提を検証し、変更を提案できる。企業は異なるコンピューティングプラットフォームやデプロイ環境向けにソフトウェアを拡張することも可能だ。

オープンソースであることが、自動的に安全なソフトウェアを生み出すわけではない。独立したレビューの条件は提供するが、有効な精査には、積極的なメンテナー、明確な開示プロセス、再現可能なテスト、迅速な修正が必要だ。

バージョン0.1も慎重な姿勢を示している。このプロジェクトには具体的な公開アーキテクチャが存在する一方、初期導入者は、実際のワークロードによって限界が明らかになるにつれ、API、ポリシー、デプロイ手法、統合に変更が生じることを見込むべきだ。

主戦場は、強制執行とエージェントの自己抑制の対決

NVIDIAは、エージェントの推論ループ内にとどまる安全ルールよりも、強制可能なインフラ制御の方が優れると賭けている。

これは主に、NVIDIAと別のチップメーカーとの競争ではない。エージェントに安全に振る舞うよう求めることと、危険な行為が失敗する環境を構築することという、2つのセキュリティ経路の競争である。

モデルプロバイダーは、アラインメント、拒否動作、指示の優先順位、監視を引き続き改善している。これらの対策は、モデルが有害な行動を選ぶ可能性を低減できる。また、インフラ制御だけでは認識できない行動にも対応する。

OpenShellは異なる層に対処する。モデルはいずれミスを犯し、操作されたコンテキストに従い、あるいは許可されていない操作を試みると想定する。ランタイムは、結果として生じる損害を制限することに重点を置く。

この2つの経路は補完し合うべきだが、優先順位は異なる。アラインメントはエージェントの判断を改善しようとする。ランタイムによる強制執行は、判断には誤りが残ると想定し、その結果を制約する。

Anthropicの参加は、この複合的なアプローチを示している。NVIDIAによれば、Claude Managed Agentsはエージェントループを実行サンドボックスから分離する。OpenShellとBlueFieldは、それらのサンドボックスを介したアクセスに追加の制御を加えられる。

この構成は、エージェントと機密リソースの間に複数の独立した制御を置く、多層防御を実現する。1つの層が破られても、他のすべての層が自動的に破られるわけではない。

このプラットフォームは、オープンモデルとクローズドモデルの双方もサポートする。NVIDIAにとって、このモデル非依存の立場は戦略的に重要である。同社は競合するAIエコシステム全体にインフラを提供しているためだ。どのモデルが特定市場を主導するかにかかわらず、共通のランタイムは有用になり得る。

ただし、ソフトウェアの可搬性とハードウェアからの独立性は同じではない。OpenShellはNVIDIA CPU以外にも拡張できるが、完全なSentry設計は、分離されたシリコン内の強制執行のためにBlueField-4に依存している。

これは、「オープン」プラットフォーム内部に商業的な緊張関係を生む。ソフトウェア層は異種インフラをサポートできる一方、NVIDIAの最も強力な封じ込めの主張は、NVIDIAのネットワークハードウェアとDOCAスタックを前面に出している。

競合他社やクラウドプロバイダーはいくつかの方法で対応できる。自社プラットフォームでOpenShellをサポートする、互換性のあるポリシーシステムを構築する、あるいは既存の分離機能やコンフィデンシャルコンピューティング機能を代替案として推進する、といった方法だ。

セキュリティベンダーは、エージェントの活動を、既存のエンドポイント、アイデンティティ、ネットワーク、データ保護製品と接続することもできる。エージェントのガバナンスは、独立した市場というより、エンタープライズセキュリティアーキテクチャのもう一つの層になる可能性が高い。

したがって、NVIDIA Open Agent Safety Platform Launchedイベントは、NVIDIAの役割を拡大する。同社はトレーニングと推論向けのコンピューティング供給にとどまらない。自律型ワークロードにどのように権限を与え、インフラがどのようにそれを取り消すかを定義することにも関与したい考えだ。

この立場は、NVIDIAに新たなコントロールプレーンへの影響力を与える。OpenShellのポリシーが広く採用されれば、ランタイムはエージェントのアイデンティティ、監査可能性、認証情報の取り扱い、ネットワークアクセスに対する期待を形作る可能性がある。

採用は中立性に左右される。普遍的なセキュリティ層を標榜しながら、特定のハードウェアスタックを強く優遇するなら、企業は導入をためらうかもしれない。明確なインターフェースと、非NVIDIAシステムへの信頼できるサポートが重要になる。

開発者は別の問題、すなわち摩擦を評価する。有用な作業を絶えず妨げるセキュリティ層は、広範な例外、導入放棄、あるいは非公式な回避策を促すことになる。

このプラットフォームが成功するのは、狭い権限が実用的であり続ける場合に限られる。そのためには、必要なアクセスの発見、拒否理由の説明、ポリシーのテスト、変更承認を支援し、個々のエージェントタスクをすべてセキュリティチケットに変えないツールが必要だ。

NVIDIAの安全プラットフォームが依然として保証できないこと

封じ込めはエージェントの到達範囲を制限できるが、許可されたすべての行為が正しいかどうかを判断することはできない。

エージェントは、形式上の権限内にとどまりながら損害を与えることがある。請求書の提出を許可された財務エージェントが、不正な文書を承認するかもしれない。書き込み権限を持つコーディングエージェントが、許可されたリポジトリに微妙な脆弱性を導入する可能性もある。

OpenShellはこうした行為を記録し、その範囲を制限できる。しかし、あらゆる組織の意図、ビジネスロジック、倫理要件を独自に理解することはできない。

ポリシーの品質は依然として中心的な問題だ。管理者が広範なファイルシステムアクセス、無制限のネットワーク送信、再利用可能な認証情報を付与すれば、ランタイムは弱い境界を正確に強制することになる。

カリフォルニア大学サンディエゴ校の研究者であるEarlence Fernandesは、このプラットフォームを正しい方向への一歩と評した。同時に、実用的なエージェントには実際のリソースが必要であるため、必要最小限のアクセスを定義することは依然として難しいと警告した。

ウィスコンシン大学のコンピュータサイエンス教授であるSomesh Jhaは、関連する懸念を示した。彼はAssociated Pressに対し、このシステムがセキュリティと有用な作業の阻害とのバランスをどう取るかを、ケーススタディで示す必要があると述べた。

誤検知は、そのバランスの一方を成す。Sentryが正当なワークロードを隔離すれば、組織は自律型運用への信頼を失う可能性がある。各介入について、信頼できる復旧手順と説明が必要だ。

見逃しはもう一方を成す。不審な行動は、特にエージェントが意図しない目的で承認済みツールを使用する場合、正当な活動に見えることがある。許可されたリクエストであっても、その内容を通じて情報を漏えいさせる可能性がある。

NVIDIAは、Sentryがミリ秒単位で介入できるとしている。検出後の速度は重要だが、この公開された主張は、多様な環境における検出精度を裏付けるものではない。

独立したベンチマークでは、隔離までの遅延だけでなく、より多くの項目を測定する必要がある。評価者は、脱出の試み、ポリシーの回避、認証情報の悪用、秘匿的なデータ転送、侵害された依存関係、コントロールプレーン自体への攻撃を検証すべきだ。

性能オーバーヘッドも慎重に測定する必要がある。NVIDIAはVera CPU上でのOpenShellのオーバーヘッドを最小限だと説明している。購入者には、ネットワーク負荷の高いエージェント、大規模なツールチェーン、頻繁なポリシー変更、多数の同時サンドボックスを対象とした、ワークロード固有の結果が必要だ。

完全なシステムのハードウェア依存性も別の不確実性をもたらす。BlueFieldは強制執行をメインのワークロードから分離でき、セキュリティモデルを強化する。一方で、ソフトウェアのみの導入者にはないインフラ要件も追加する。

このプラットフォームは、モデルアラインメントの取り組みを不要にするものではない。許可されたチャネル内で発生する場合、欺瞞的な出力、不十分な推論、捏造された証拠、偏った推奨、有害なコンテンツを阻止することはできない。

また、説明責任も解決できない。組織は依然として、誰が権限を承認し、誰がログをレビューし、誰が封じ込めイベントに対応し、誰がエージェントの許可された行動への責任を負うのかを決める必要がある。

NVIDIAは今回の発表を、エージェントが意図された境界を超えた最近の事例と結び付けている。初期報道は、OpenShellとより広範なセキュリティプラットフォームの重要性を的確に強調している。

ただし、このシステムが過去の侵害を防げたはずだという主張は、事後的な企業評価にとどまる。再現されたインシデントテストと独立したレッドチーム演習の方が、より強力な証拠となる。

最も信頼できる解釈は、より限定的なものだ。NVIDIAはエージェントリスクに対する本格的なシステムレベルの対応策を導入したが、AI安全性全体を解決したわけではない。このプラットフォームは、組織が適切に構成すれば、アクセス可能な攻撃対象領域を縮小できる。

プラットフォームの有効性を示す3つの兆候

次に必要な証拠は、実運用、独立したテスト、そしてNVIDIA自身のインフラを超えたサポートから得られる必要がある。

第1の兆候は、発表時に名前が挙がった組織から公開される本番環境での経験である。パートナーの一覧は充実しているが、顧客にはポリシー、ブロックされた行為、運用上のオーバーヘッド、インシデント対応に関する詳細な説明が必要だ。

意味のあるケーススタディは、実際のエージェントワークフローと必要な権限を説明するものになる。OpenShellがどの操作を拒否したのか、開発者がどのようにポリシーを調整したのか、そしてそれらの制御が正当な作業を妨げたかどうかを示すべきだ。

規制の厳しい環境からの証拠は特に有用だろう。銀行、医療機関、政府機関、重要インフラ事業者は、アクセス制御と監査可能性に関して厳格な要件に直面している。

これらの組織がOpenShellを本番運用に移行すれば、NVIDIAの主張は強まる。活動がデモンストレーションと評価にとどまれば、今回の発表はアーキテクチャ上の提案に近いものに見えるだろう。

第2の兆候は、独立したセキュリティ検証である。研究者には、代表的な導入環境、脅威モデル、構成ガイダンス、再現可能なテストへのアクセスが必要だ。

テストでは、サンドボックス、スーパーバイザー、ゲートウェイ、ポリシープルーバー、認証情報ブローカー、Sentryの境界を検証すべきである。攻撃者は、NVIDIAが最も強力と考える単一コンポーネントだけでなく、コンポーネント間の相互作用を狙う。

研究者はユーザビリティ上の失敗も調べるべきだ。技術的には正しいセキュリティシステムでも、管理者が寛容な例をコピーしたり、デフォルト設定を誤解したり、繰り返される拒否の後に制御を無効化したりすれば、有効性を失う可能性がある。

NVIDIAの公開ドキュメントは、すでに開発者に検証材料を提供している。次の段階は、継続的な外部レビュー、透明性の高い脆弱性対応、研究者が欠陥を見つけた際の明確な修正である。

第3の兆候は、信頼できる可搬性だ。OpenShellのソフトウェアはArmおよびIntelプラットフォームにも拡張できるが、最も強力なSentryに関する主張は引き続きBlueField-4と結び付いている。

クラウド、ハイブリッド、オンプレミス、エアギャップ環境にまたがる実用的な統合は、これがオープンなエージェントセキュリティ層であるというNVIDIAの主張を支えることになる。NVIDIAハードウェアに狭く集中すれば、その位置付けは弱まる。

OSベンダーからのサポートも役立つ可能性がある。Canonical、Red Hat、SUSEは、一般的に導入されているインフラにプラットフォーム技術を統合する組織として、NVIDIAが挙げている企業の一部だ。

開発者は、OpenShellのリリース頻度にも注目すべきです。ポリシー互換性、安定したAPI、移行ガイダンス、可観測性の改善が、バージョン0.1が信頼できるインフラへと発展するかを左右します。

NVIDIA Open Agent Safety Platform Launchedの発表は、この議論に有用な基準を示しています。エージェントの安全性には、エージェント自身が書き換えたり、説得したり、無視したりできない制御を含めるべきです。

この基準は、すべての企業がNVIDIAの設計全体を採用することを求めるものではありません。しかし購入者には、アクセス、分離、認証情報、監査、緊急時の封じ込めについて、より厳しい問いを投げかけることを求めます。

自律型エージェントを評価するチームは、まずエージェントが到達可能なすべてのリソースをマッピングすることから始められます。どの制御がモデルの協力に依存し、どの制御がモデルが予期しない振る舞いをした後も強制可能なのかを特定すべきです。

また、ポリシー、拒否されたアクション、例外判断、インシデントの発見事項を管理するためのエンジニアリング・ナレッジベースを維持することもできます。この記録により、セキュリティルールを推測ではなく証拠に基づいて進化させられます。

実用上の検証は単純です。組織は、あるエージェントに価値ある仕事を任せつつ、その作業をはるかに超える権限を与えずに済むでしょうか。OpenShellとSentryは、NVIDIAの回答を提示しています。その回答が成り立つかどうかは、本番環境での証拠が決めることになります。

 
 

無料で始めましょう

ローカルファーストのパーソナル知識管理付きAIアシスタント

より良いAI体験のために、

remio は現在、 Windows 10+ (x64)とM-Chip Mac のみをサポートしています。

仕事のAIパートナー
remioでもっと仕事が進む

計画・作成・仕上げまで
すべてをひとつに

bottom of page