Kriminal AI、正規モデルのレンタルでガードレールを回避したと報じられる
研究者らが、制約のないはずの犯罪向けモデルの大部分が正規のAIプロバイダーから借りられたものだと報告したことで、Kriminal AIはGoogle Newsに掲載された。同サービスは特注のガードレールなしの知能をうたいながら、リクエストをGrok、Claude、その他の既存モデルへ振り分けていたとされる。この発見は、セキュリティ上の問いを「誰が悪意あるモデルを構築できるか」から、「誰が合法的なインフラを悪用向けに再パッケージ化できるか」へと移すものだ。
ThreatDownは2026年8月18日、その技術調査を公表した。研究者らによると、Kriminalは公開ウェブサイトを通じて配信される本番JavaScript内に、ベンダースタックの一部を露出させていた。また、同サービスにモデルとシステム指示について尋ねたが、その自己申告による回答は決定的な証拠ではないと注意を促している。
この結果は、AI安全性におけるモデル中心のアプローチに疑問を投げかける。プロバイダーはより安全なモデルの訓練に多額を投じられるが、外部のストアフロントは盗用された信頼、敵対的プロンプト、レンタル推論、分断されたインフラを組み合わせられる。各サプライヤーが目にするのは一つの取引にすぎず、犯罪サービス全体を把握するサプライヤーは必ずしも存在しない。
Kriminal AI調査で判明したこと
Kriminalは、独立したAI研究所というより、脱獄レイヤーを備えた再販業者として運営されていたと報じられている。
Kriminalの調査によると、同サービスはフィルターやガードレールのないAIシステムを提供すると主張していた。公開インターフェースは、アカウント、サブスクリプション、サービス更新、ステータスダッシュボードを備えた、一般的なソフトウェア事業に似ていた。
この見せ方には意味がある。従来の犯罪向けチャットボットは、地下フォーラム、非公開のメッセージングチャネル、一時的なウェブサイトを通じて流通することが多かった。Kriminalは、検索エンジンがインデックスでき、見込み顧客が通常のログインページからアクセスできるオープンウェブ上で自らを提示していたとされる。
ThreatDownによると、同サービスはいくつかの専門モードを宣伝していた。対象は金融インテリジェンス、エクスプロイト調査、文書分析、ソーシャルエンジニアリング、アイデンティティ構築だった。これらのモードは、犯罪活動の異なる段階向けに構築された別個の技術エージェントであるかのような印象を与えた。
研究者らは、公開フロントエンドコードの内部に異なるアーキテクチャを見いだした。そこでは、モデル応答の大半を生成する主な推論エンジンとしてxAIのGrokが指定されていたとされる。OpenRouterは、Mistral LargeやLlama 3.3を含む専門モデルへの経路として表示されていた。
研究者らによれば、AnthropicのClaudeも長文コンテキスト作業の選択肢として表示されていた。ただし、コードからはKriminalがそのアクセスをどのように取得したのかは確認できなかったという。Tavilyはライブウェブ検索を提供していたとされ、Google CloudとCloudflareもサービススタックの別の箇所に見られた。
これらの発見は、挙げられたすべてのプロバイダーがKriminalに意図的にサービスを提供していたことを独自に立証するものではない。また、運営者が直接アカウント、仲介者、侵害された認証情報、あるいは別のアクセス方法を用いたかどうかも示していない。クライアント側コード内のベンダー名は、古い情報、誤解を招く情報、あるいは意図的に埋め込まれたものである可能性がある。
そのためThreatDownは、複数の証拠形式を用いた。研究者らは本番コードを調査し、露出した設定をサービスの挙動と比較し、チャットボットに基盤エンジンの特定を求めた。チャットボットはGrokを挙げたとされ、これはコード内で見つかったベンダー参照と一致していた。
システム指示について尋ねられた際、同サービスはモデルに制限を無視するよう指示するプロンプトも返した。システムプロンプトとは、モデルの挙動を形作るため、ユーザーのリクエストに付随して配置される高優先度の指示である。このケースでは、報告された指示は基盤プロバイダーが適用した安全対策を抑制しようとするものだった。
研究者らは適切にも、チャットボットの発言を決定的ではなく示唆的なものとして扱った。モデルは自身の正体を幻覚し、埋め込まれたテキストを繰り返し、あるいはペルソナに沿って応答する可能性がある。本番設定は別のシグナルを提供したが、外部者には完全なリクエスト経路を証明するサーバー側の記録が依然としてない。
見出しがGoogle Newsを通じて広がる際、この区別は重要だ。最も強く裏付けられる結論は、Kriminalの露出したコードと観測された応答が、レンタルされた商用モデルを示していたということにある。これは、宣伝されたすべての機能が動作したこと、表示されたすべての利用実績が正確だったこと、あるいはすべてのサプライヤーが接続を維持していたことの証拠ではない。
それでもこの調査は、中心的な逆転を明らかにしている。KriminalはAI業界の管理から独立していると宣伝しつつ、知能、ホスティング、ルーティング、検索、配信のために同じ業界へ依存していたとされる。
Google Newsでの注目がセキュリティ上の重大性を変える理由
Kriminalの公開性は、犯罪AIを隠れたモデルの問題から、サプライチェーンの執行問題へと変える。
同サービスはフロンティアモデルを訓練する必要がなかった。訓練には専門研究者、大規模データセット、広範な計算インフラ、継続的な運用投資が求められる。モデルアクセスを借りれば、それらの負担の大半を、すでに負担している企業へ移せる。
Kriminalの寄与とされるものはパッケージングだった。公開ストアフロント、タスク別ペルソナ、決済インフラ、開発者互換エンドポイント、モデルの安全対策を弱めることを意図した指示を組み合わせていた。この束ね方は、AI支援による犯罪ワークフローを試すために必要な専門知識を低減し得る。
このパターンは、まずフロンティアモデルのプロバイダーに圧力をかける。プロバイダーのポリシーは直接の利用者を対象とするが、再販業者やラッパーは最終顧客の目的を隠し得る。プロバイダーが目にするのは、一見通常のAPIトラフィックかもしれない。より広範な活動は、挙動、利用量、決済シグナル、反復的なポリシー違反によって初めて明らかになる可能性がある。
SpaceXAIの現行利用許諾ポリシーは、脱獄、敵対的プロンプティング、プロンプトインジェクション、有害なハッキング、フィッシング、モデル入力または出力の再販を禁じている。また、そのシステムが生成した出力を通じて違反を助長する有料サービスも禁止している。
これらの規則は、執行の契約上の根拠を生む。しかし、書面上の制限からは、Kriminalが直接アカウントを使用したか、アクセスがどれほど長く続いたか、あるいはプロバイダーがすでにそれを特定していたかは分からない。ポリシーも研究者らの証拠も、特定アカウントの状態を立証してはいない。
クラウドおよびネットワークプロバイダーは異なる問題に直面する。ホスティング企業が目にするのは、各モデル対話の意味ではなく、通常のウェブアプリケーションかもしれない。エッジプロバイダーは、暗号化されたすべてのリクエストを自動的に読むことなく、トラフィックパターン、不正利用報告、インフラの関係性を特定できる。
モデルルーターと検索プロバイダーは、さらに限定的な一部分を占める。自らの規約を執行してアカウントを調査できるが、上流アプリケーションが応答をどのようにラベル付けし、再販しているかを知っているとは限らない。決済処理事業者は取引を把握するが、その後に提供されるサービスを必ずしも把握してはいない。
この分断が持続性を生む。一つのアカウントを削除しても、ストアフロントを解体することなく、一つの機能を中断させるにとどまる可能性がある。運営者は、顧客向けブランドを維持したまま、モデルの置き換え、ホスティングの移転、決済チャネルの変更、サービス名の変更を行える。
そのため、Google Newsの文脈はこの話を単一の失敗したガードレールへ還元すべきではない。疑われる活動は、個別の視野が不完全な多数の正規コンポーネントに依存していた。各ベンダーは自らの境界内で対応できる一方、組み立てられたサービスは別の場所で継続し得る。
圧力は企業セキュリティチームにも及ぶ。悪名高い犯罪ドメインをブロックすれば、従業員による直接アクセスには対処できるが、攻撃者が標的ネットワーク外で同じ基盤モデルを使用することは防げない。防御側は、それを支援したブランドを特定するだけでなく、結果として生じる挙動を検知しなければならない。
フィッシングメッセージには、それをどのモデルが作成したかを示す信頼できるラベルは付いていない。エクスプロイトコードも、それがGrok、Claude、オープンモデル、人間の運営者のいずれから来たかを明かさない。生成コンテンツが攻撃チェーンに入ると、プロバイダーの帰属は、アイデンティティ、アクセス、意図に比べて二次的なものになる。
したがって企業には、認証情報、特権アクション、データ移動、ツール実行をめぐる統制が必要となる。モデルの安全対策は引き続き有用だが、攻撃者が最終的に標的とするシステムより上流に位置する。拒否されたプロンプトに価値があるのは、攻撃者がその拒否を迂回できない場合に限られる。
真の製品は脱獄ラッパーである
Kriminalの報告された優位性は新しいモデルではなく、レンタル能力を専門的な犯罪ワークフローへ変換するインターフェースだった。
脱獄とは、モデルに安全上の境界を無視または再解釈させるために設計された指示戦略である。必ずしも、訓練時に作成された学習済みパラメーターであるモデルの重みを変更するわけではない。代わりに、モデルが現在の会話をどのように解釈するかを攻撃する。
Kriminalは、外部モデルに送られるリクエストを自身のシステム指示で囲んでいたとされる。そのレイヤーは、無制限の挙動をモデルの最優先の役割として提示しようとした。専門ペルソナは、同じ基盤能力をエクスプロイト作業、インテリジェンス分析、ソーシャルエンジニアリング向けのツールとして位置付けた。
この構成は、モデル開発というよりソフトウェア統合に近い。運営者はストアフロントを再構築せずにプロバイダーを変更できる。また、長文書には一つのモデル、コードや一般チャットには別のモデルというように、タスクごとに異なるモデルを割り当てることもできる。
開発者向けエンドポイントは、この柔軟性を高めた。ThreatDownによると、KriminalはOpenAI形式のクライアントと互換性のあるインターフェースを提供し、外部のコーディングツールが同サービスと通信できるようにしていた。既存ソフトウェアを独自プロトコルの習得なしで接続できるため、互換性は切り替えコストを下げる。
検索アクセスは、静的なモデルの能力をさらに拡張できる。接続された検索プロバイダーは、訓練データには存在しなかった最新のウェブ資料を提供する。正当な製品では、これは調査や事実更新を支える。悪意あるワークフローでは、標的の発見、身元調査、急速に変化する運用状況の把握を支援し得る。
このアプローチは、より広範な市場パターンに合致する。犯罪AI市場に関するTrend Microのレビューは、犯罪者が独立したモデルを構築する代わりに商用システムを脱獄することが多いと結論付けた。研究者らは、既存プロバイダーが高コストな知能レイヤーにすでに資金を投じているため、これは経済的に合理的だと説明した。
WormGPT、FraudGPT、Xanthoroxは、制約のないAIをうたうカテゴリーを認識可能なものにするのに寄与した。しかし、犯罪ブランドからその技術基盤は分からない。一部のサービスはラッパーであり得る一方、他はファインチューニングされたオープンモデルを用いる可能性があり、欺瞞的なマーケティング以上のものをほとんど提供していない場合もある。
このブランディングの問題は脅威インテリジェンスを複雑にする。サービスは同じサプライヤーやプロンプトを維持したまま消滅し、別名で再登場できる。逆に、無関係な運営者が、インフラやコードを共有することなく有名な名称を再利用することもある。
ThreatDownによる、より広範なAIサイバー犯罪研究では、無検閲や無フィルターといったラベルを掲げる何千もの公開モデルが見つかった。これらのラベルは自己申告であり、モデルが高度な攻撃を確実に支援する証拠ではない。
ダウンロード数は、犯罪行為の成功件数と同義ではない。利用者の中には研究者、愛好家、レッドチーム、あるいはモデルの挙動を探索する人々もいる。複数のバリエーションをダウンロードしても、実際に展開しないケースもある。これらの数字が示すのは可用性と関心であり、測定された被害ではない。
実務上のリスクは、能力とワークフロー設計の組み合わせから生じる。汎用チャットボットでは、何を尋ねるべきか、回答をどう検証するか、ほかのツールとどう連携させるかを利用者自身が理解していなければならない。パッケージ化されたサービスは、そのプロセスの一部をメニュー、エージェント、テンプレート、統合機能に組み込める。
このようなパッケージ化により、従来はより多くの知識を必要とした作業を、経験の浅い実行者でも試みやすくなる可能性がある。ただし、結果の信頼性が高まるわけではない。生成されたエクスプロイトコードは失敗する可能性があり、実行者を露出させたり、誤ったシステムに損害を与えたり、技術的な詳細を捏造したりすることがある。
同じ制約はソーシャルエンジニアリングにも当てはまる。モデルは流暢なメッセージや合成ペルソナを作成できるが、詐欺の成功は依然としてアクセス、タイミング、標的に関する知識、そして運用上の規律に左右される。AIは作業量を削減できても、こうした要件をなくすことはできない。
これが業界における主な対立だ。プロバイダーはポリシーによって制約された有用な汎用知能を約束する一方、ラッパーは知能をその境界から切り離そうとする可能性がある。競争はもはやモデル学習だけに限られない。API、アプリケーション、アカウント、そして下流の行動を通じて続いている。
モデルのガードレールでは攻撃チェーン全体を見通せない
ガードレールは有害な出力を減らすが、Kriminalは、単一のモデル防御だけでは分散型サービスを統制できない理由を示している。
Anthropicは2026年1月の分類器に関する研究で、利用可能なAIシステムには完全に信頼できるジェイルブレイク対策が存在しないことを認めた。同社の以前の分類器アプローチは、テストにおいて成功する攻撃を大幅に減らしたものの、計算コストの増加と一部の誤拒否を伴った。
同社の新しいアーキテクチャは、低コストの初期プローブを用い、不審な対話をより強力な分類器へエスカレーションする。分類器とは、安全ルールに照らしてコンテンツを評価する二次的なシステムである。この階層型設計は、すべての対話を同等に検査するコストを抑えつつ、防御の向上を目指す。
研究者らは依然として、対応が難しい攻撃カテゴリを特定している。再構成攻撃は、有害な要求を個別には無害に見える断片へ分割する。出力の難読化は、単純なフィルターが誤解しかねない置換、比喩、エンコード形式の背後に危険な内容を隠す。
これらはモデルの安全対策を放棄すべき理由ではない。重大な悪用を防ぐために、防御が完璧である必要はない。レート制限、分類器、アカウント検証、異常検知、人による調査は、コストを引き上げ、反復的な行動を中断できる。
しかし、報告されているKriminalの構造は、孤立した制御を回避する複数の機会を生み出す。運営者はプロンプトをプロバイダー間に分散し、表現を変え、異なる作業を異なるモデルへ振り分け、アカウント停止時に移動できる。再販業者は、根本の利用者と最終目的の関係を隠すこともできる。
したがって、プロバイダー側の執行では、個々のプロンプトを超えたパターンを調べる必要がある。関連するシグナルには、アカウント作成、リクエストの連続性、繰り返されるポリシーテスト行動、決済関係、異常なルーティング、既知の悪用インフラとの接続などが含まれ得る。正当な研究者も表面的には似たトラフィックを発生させる可能性があるため、各シグナルは慎重に扱う必要がある。
誤検知は重要だ。セキュリティ専門家、脆弱性研究者、インシデント対応者は、防御目的でマルウェア、エクスプロイト、フィッシング、回避手法についてモデルに質問する。セキュリティ関連のプロンプトをすべてブロックするシステムは、執拗な攻撃者を確実に止められないまま、正当な業務を損なうことになる。
アイデンティティと認可は、より決定論的な境界を提供する。操作されたモデルであっても、アカウントにアクセス権がなければ保護されたデータを盗めない。ツール権限から本番システムが除外されていれば、コードをデプロイできない。機密性の高い操作に独立した承認が必要であれば、資金を移動できない。
AIシステムがツールを獲得するにつれ、これはさらに重要になる。ツール対応のエージェントは、Webサイトの閲覧、コードの実行、データベースの照会、外部サービスの起動を行える。その結果、モデルの出力は実際の行動への入力となり、権限設計はコンテンツフィルタリングと同じくらい重要になる。
Check Pointの研究者は別途、Webアクセス機能を持つアシスタントに関するAIプロキシ技術を実証した。この研究は、正当なAIトラフィックが中継手段として悪用され得ることを示し、信頼されたプロバイダーのドメインを信頼された意図の証明として扱う危険性を強調している。
そのため企業は、モデル安全性とシステム安全性を区別すべきだ。モデル安全性はAIが何を生成するかに関わる。システム安全性は、生成後にどのアイデンティティ、アプリケーション、エージェントが何へアクセスまたは実行できるかを決める。
有用な対策には、スコープを限定したサービスアイデンティティ、短命な認証情報、ツールの許可リスト、取引上限、承認ゲート、完全なアクションログが含まれる。そのうえでネットワーク監視は、プロンプトを孤立して判断するのではなく、モデル呼び出し、ツール利用、データ移動にまたがる挙動を評価できる。
防御側は、Kriminalの解析が何を証明しているのかを過度に主張すべきでもない。公開JavaScriptから設定情報が露出することはあるが、サーバー側のルーティングは異なる可能性がある。チャットボットが自らを名乗ったとしても、それはフォレンジック上の確認ではない。表示された顧客統計や性能主張も、独立した記録による裏付けがない限り未検証のままだ。
それでも、この研究は、確立された犯罪市場のパターンと整合する信頼性の高いアーキテクチャを提示している。複数の観測結果は、正規プロバイダーを利用するラッパーを示唆していた。不確実なのは正確な実装と規模であり、この手法のより広範な実現可能性ではない。
プロバイダーが対応できるかを示す3つのシグナル
次の試金石は、Kriminalに単に名称や供給元を変えさせるだけでなく、ベンダーがサービスのパターンを破壊できるかどうかだ。
第1のシグナルは、連携したアカウント執行である。xAI、Anthropic、OpenRouter、ホスティングプロバイダー、またはほかの名指しされたベンダーが、調査を確認し、関連するアクセスに対する措置を説明するかを注視したい。単一の停止にも意味はあるが、ThreatDownが説明したレジリエンスをよりよく検証するのは、連携した対応だ。
複数のプロバイダーが連携アカウントを迅速に特定できれば、この調査はクロスレイヤーの悪用対応を支持する根拠を強めるだろう。Kriminalが即座にそれらを置き換えるなら、現在のオンボーディングと監視の制御は依然として容易に迂回できるという実態を示すことになる。
公的な沈黙は、不作為の証明ではない。情報開示が運営者の適応を助ける可能性があるため、プロバイダーは悪用調査の詳細を避けることが多い。研究者は、間接的な証拠として、モデルの挙動、可用性、インフラ記録、露出した設定の変化を監視する必要があるかもしれない。
第2のシグナルは、再販業者のパターンに対するプロバイダー側の検知だ。モデル企業は分類器を更新し、敵対的プロンプトの連続性を検査し、犯罪ワークフローに結び付くコンテンツを繰り返し送信するアカウントを探せる。また、再販に対するルールを強化し、最終利用者を見えにくくするインターフェースを調査することもできる。
成功は、1つのドメインが消えるかどうかだけで測るべきではない。より意味のある成果は、代替アカウントやモデル全体で運用上の摩擦が高まることだ。停止期間の長期化、能力低下、または繰り返される失敗は、執行がサプライチェーンに到達したことを示すだろう。
第3のシグナルは、実世界での利用を示す証拠である。マーケティングページやプロンプトのデモは意図を示すものの、運用上の影響を測定するものではない。防御側は、このサービスをフィッシングキャンペーン、エクスプロイト開発、ID詐欺、不正アクセスに結び付けるインシデント報告に注目すべきだ。
その結び付けには慎重さが求められる。多くのモデルが類似した素材を生成できるため、似た文章やコードは弱い帰属根拠にすぎない。より強い証拠には、顧客記録、インフラの重複、復元されたログ、決済関係、または調査対象の侵入から得られた直接的な成果物が含まれる。
確認済みのインシデントがないからといって、そのサービスが無害になるわけではない。それは根底にあるアーキテクチャの重要性を残したまま、現在の規模に関する主張を弱めることになる。犯罪サービスは、買い手を引き付け、防御側を威圧するために、自らの影響力を日常的に誇張する。
Google Newsのニュースサイクルは、検証が追いつく前にそうした主張を増幅する可能性がある。読者は3つの命題を区別すべきだ。Kriminalは犯罪機能を宣伝していたこと、研究者はレンタルモデルを示す証拠を見つけたこと、そして実世界への影響については依然として記録が明確ではないことだ。
AIプロバイダーにとっての戦略的目標は、完全な拒否挙動ではない。ラッパーが一貫したアクセスを提供できないほど、悪用のコストを高めることである。そのためには、モデル、アカウント、決済、ルーティング、下流アプリケーションにまたがる制御が必要になる。
企業の購入者にとっても、教訓は具体的だ。評価の高いモデル名を完全なセキュリティ境界として扱ってはならない。AI接続されたすべてのアイデンティティが到達できる範囲を制限し、その行動を監視し、重大な操作には独立した承認を求めるべきである。
報告されているKriminalのアーキテクチャは、新たな最先端モデルを必要とせずに、正当なAIを犯罪的とされるサービスの構成要素へ転換する。今後数カ月で、供給者が断片化した証拠を結び付けられるのか、それとも運営者が単に別の場所で再構築するのかが明らかになるだろう。
Google Newsを通じてこの動向を追う読者は、ストアフロントの主張ではなく、プロバイダーによる執行、インフラの変化、検証済みのインシデント証拠に注目すべきだ。これらのシグナルは、Kriminalが持続可能なビジネスなのか、自身のコードによって露出した短命なラッパーなのかを明らかにする。どちらの結果も重要である。なぜなら、その根底にある手法は容易に模倣できるからだ。セキュリティチームは、どのAIサービス、エージェント、開発者ツールが機密システムへ到達できるかを見直し、説得力のあるプロンプトが認可済みの行動になる前に権限を削減すべきである。



