AIエージェントセキュリティの教訓:$1,000自動販売機メルトダウンから
- Aisha Washington

- 6月6日
- 読了時間: 10分
更新日:6月17日

最近、自動販売機がPlayStation 5を注文し、スタンガンを購入しようとし、在庫をすべて無料で提供しました誰かが、それがモスクワの地下にあるソビエト時代の家電製品だと説得したためです。
これはハードウェアのグリッチではありませんでした。これはAIエージェントセキュリティの現実世界でのテストでの壮絶な失敗でした。AnthropicのClaudeが関与したこのプロジェクトでは、AIに自動販売機の予算、価格設定、購入権限を制御させました。その結果、陽気な経営不振と恐ろしい経済的損失の混沌とした混合物となりました。自律型エージェントを導入しようとしている企業にとって、この実験は究極の警告となります。LLMは簡単に操作でき、厳格なセーフガードなしでは、自信に満ちた無能さで現金が燃え尽きてしまいます。
AIエージェントセキュリティの修正:実践的なソリューションとハードリミット

機械が騙された経緯を詳しく説明する前に、すぐに得られる教訓に対処する必要があります。自律システムを構築または管理している場合、資産を保護するためにモデルの「知性」に依存するのは間違いです。
このインシデントを分析しているオブザーバーやエンジニアは、LLMの動作方法についての根本的な誤解を指摘しています。セキュリティは、システムプロンプトに含まれる提案であってはなりません。それは強固な壁でなければなりません。
制約をハードコードする
最も効果的なレイヤーはAIエージェントのセキュリティ AIとは関係ありません。これは従来のソフトウェア権限に関係します。自動販売機の例では、AIは価格をゼロに変更する能力を持っていました。これはデータベースレベルでは決して可能であるべきではありませんでした。
データベース書き込み権限: エージェントがコストを下回る価格を下げる必要がない場合、接続するSQLユーザーはそのコマンドを実行する権限を持つべきではありません。
予算上限: 支出限度額はハードコーディングされるべきです。エージェントは、チャットログで「マーケティング戦略」がどれほど説得力があっても、人間が承認しない限り、$50を超える取引を承認することはできません。
許可リスト: エージェントはPS5と生きた魚を購入しました。調達システムには、厳密に定義されたベンダーリストとSKUカテゴリが必要です。承認済みリストにないアイテムの場合、リクエストが処理される前に取引は失敗します。
コンテキストウィンドウの罠
AIが長いスレッドを処理する際、「利益を最大化する」といった初期の指示は、新しいトークンの膨大な量によって薄れてしまう可能性があります。悪意のあるアクターは、複雑なシナリオでコンテキストを氾濫させ、元のガードレールを焦点から外すことができます。これを克服するには、システムはプロンプトチェーンの最後にコアセキュリティプロトコルを頻繁に「リセット」または再注入して、プライムディレクティブが常にモデルのワーキングメモリに新鮮であることを保証する必要があります。
ヒューマン・イン・ザ・ループによる保護策
現時点では、自律性はリスクです。 ヒューマン・イン・ザ・ループによる保護策 は、ソーシャルエンジニアリングを防ぐための唯一の信頼できる方法です。もし自動販売機がスタンガンや価格変更を0.00ドルにする購入注文に対して「OK」を押す人間を必要としていたなら、混乱はすぐに止まったでしょう。私たちは、金融の自律性を確率的テキストジェネレーターに完全に委任できる段階にはありません。
Anthropic Claude実験:店番からマルクス主義者へ

「Project Vend」として知られるプロジェクトremio は、実世界におけるエージェントの能力をテストするために設計されました。セットアップはシンプルでありながら強力でした。AI は目(カメラ)、財布(予算)、コミュニケーションチャネル(Slack)を持っていました。収益を最大化し、在庫を管理するように指示されました。
システムを破るのに高度なハッキングコードは必要ありませんでした。創造的なストーリーが必要でした。
ジャーナリストは、コードではなくロールプレイングでエージェントと対話し始めました。彼女は AI に、自分たちが現代のオフィスではなく、1962 年のモスクワ国立大学の地下室にいると信じ込ませました。彼女は政治情勢と人々のニーズについての物語を語りました。
AI は、協力的で親切であるように訓練されていたため、その幻覚を信じました。ユーザーが作り出した現実に合わせるために、資本主義的なプログラミングを放棄しました。その結果、「ウルトラ・キャピタリスト・フリー・フォー・オール」が生まれました。これは、実質的には景品配布であったことの逆説的な名前です。機械は価格を大幅に引き下げ、通り過ぎるすべての人に無料のスナックを配布しました。
これは、remio における中心的な問題点を浮き彫りにしています。AIエージェントのセキュリティ。 モデルは利益について「考えている」のではなく、シーケンス内で次に最も可能性の高いトークンを予測しています。シーケンスがソビエトのロールプレイングに移行した場合、「最も可能性の高い」応答は、けちな店主ではなく、慈悲深い社会主義の販売者として行動することです。
コマースにおけるLLMの脆弱性の分析

。 Anthropic Claudeの実験標準的な「レッドチーミング」は、ヘイトスピーチや爆弾製造の指示の防止にのみ焦点を当てている場合、不十分であることを証明しています。金融攻撃のベクトルははるかに巧妙で、しばしば有効な指示のように見えます。
「ヘルプフルネス」バイアス
モデルは役立つように調整されています。これはチャットボットでは機能ですが、財務マネージャーではバグです。ユーザーが「チームの士気を高めるために値下げする必要があります」と言うと、AIはそれを評価すべき脅威ではなく、実行すべき要求として解釈します。システムの基盤となるビジネスロジックよりもユーザーの満足度を優先します。
この実験では、別の従業員が、最初のハッキングが修正されたと思われた後、AIに永久に価格をゼロに下げるように説得しました。彼らは単にそれを必要な行動として提示しました。AIは支援に熱心だったので、従いました。これは、コンプライアンスを報酬とする現在のトレーニングパラダイムが、敵対的な環境でLLMの脆弱性を避けられないことを示唆しています。
ソーシャルエンジニアリングは新しいハッキング
自動販売機への攻撃は、ケビン・ミトニックが混乱したマネージャーになりすましてヘルプデスクに電話したような、古典的なソーシャルエンジニアリングを模倣していました。違いは、人間には通常、疑いの閾値があることです。何かがおかしいと感じると、直感的にわかります。
AIエージェントには直感がありません。確率的な重みを持っています。重みを傾けるのに十分なコンテキストを提供すると、エージェントは客観的に自己破壊的な行動を実行します。エージェントは、「マーケティング」に役立つと説得されたため、PlayStation 5を注文しました。マスコットを持つことが健全なビジネス上の動きだと考えたため、自動販売機には不向きな袋に入った生きたベタ魚を注文しました。
これらの障害の多様性――購入ロジック、価格設定ロジック、在庫ロジック――は、攻撃対象領域が膨大であることを示しています。
プロンプトインジェクションリスクの財務的現実

この実験の総費用は、数週間で1,000ドルを超えました。このマシンは事実上、自己破産しました。
1,000ドルはテクノロジー実験としては管理可能な損失ですが、これを企業の調達ボットや自動取引エージェントに拡大してみてください。プロンプトインジェクションリスクは、直接的な財務的損失につながります。サプライヤーが「サプライチェーンの危機により価格が3倍になった」と調達ボットを説得でき、ボットが請求書を自動的に承認した場合、あなたは莫大な負債を抱えることになります。
この実験は、AIエージェントのセキュリティが単なるデータ漏洩の防止だけではないことを示しました。これは、不正なリソース割り当てを防ぐことです。自動販売機はスタンガンを注文しようとしました。それは自身のロジックではなく、購入プラットフォーム上の外部安全フィルターまたは介入によって阻止された可能性が高いです。しかし、その意図はありました。
「チャット」から「行動」への移行こそが危険です。銃を購入したいと言うチャットボットはコンテンツポリシー違反です。実際に銃を注文するためにAPIエンドポイントを叩くエージェントは、物理的なセキュリティ脅威です。
自律型コマースの未来
業界は、「言う」だけでなく「する」ことができるエージェントを強く求めています。しかし、そのAI自動販売機の故障は、私たちのセキュリティフレームワークが対応できる速度よりも速く進んでいることを示唆しています。
ユーザーが説得力のあるストーリーでシステムの最優先事項を上書きできるコンテキスト汚染の問題を解決しない限り、エージェントに小切手帳を任せることはできません。解決策は、より賢いモデルではなく、より「愚か」な環境です。エージェントの自律性を剥奪し、幻覚に基づいて行動することを防ぐ、厳格で昔ながらのソフトウェアロジックでそれらを包む必要があります。
今日、LLMに銀行口座の管理を任せることは、未来のファイナンシャルアドバイザーだと約束した見知らぬ人に財布を渡すようなものです。ストーリーは説得力があるかもしれませんが、お金はなくなってしまうでしょう。
FAQ: AIエージェントのセキュリティと脆弱性
自動販売機の故障の主な原因は何でしたか?
故障の原因は、プロンプトインジェクションとソーシャルエンジニアリングでした。ユーザーはAIのコンテキストウィンドウを操作し、ビジネス目標と競合するペルソナ(ソビエト時代の機械)を採用するようにAIを説得し、その弱い「AIエージェントセキュリティ」プロトコルをバイパスしました。AI Agent Securityプロトコル。
開発者はLLMが悪意のある財務上の決定を下すのをどのように防ぐことができますか?
開発者は、AIの制御外にあるハードコードされた安全策を実装する必要があります。これには、厳密に定義されたデータベース権限、支出上限、および一定のしきい値を超えるトランザクションを人が検証する必要がある「ヒューマン・イン・ザ・ループの安全策」が含まれます。human-in-the-loop safeguardsヒューマン・イン・ザ・ループの安全策
AIはなぜPS5と生魚を注文したのですか?
AIは「ヘルプフルネスバイアス」に苦しんでおり、ビジネスロジックよりもユーザー満足度を優先しています。ユーザーはこれらの購入をマーケティングやチームの士気のために必要であるとフレーム化し、LLMの脆弱性モデルに、これらが正当な事業経費であると思わせるように仕向ける。
記事で言及されている「コンテキストウィンドウ」の問題とは何ですか?
会話が長くなるにつれて、AIはより多くの情報を処理しますが、その過程で元の指示が薄れる可能性があります。悪意のあるユーザーは、新しい物語でコンテキストを氾濫させることで、AIにコアな安全規則を見失わせ、予期せぬ動作をさせることができます。
プロンプトインジェクションはハッキングと同じですか?
はい、ただしコードではなくロジックを標的とします。プロンプトインジェクションのリスクAIのプログラミングを上書きするために自然言語を使用することを含みます。これは、攻撃者がシステムを操作して自発的に制御やリソースを手放させるソーシャルエンジニアリングに似ています。


