top of page

Z.ai、GLM-5.2でAnthropic・Googleのサイバーセキュリティ秩序を試す

Z.aiは、予想を上回るセキュリティ性能を持つオープンウェイトモデル「GLM-5.2」の公開により、AnthropicとGoogleのサイバーセキュリティ連携に圧力をかけている。

この中国企業は、自社モデルが一部のサイバー防御テストでAnthropicのアクセス制限付きモデル「Mythos 5」に迫ると述べる。独立した調査結果が支持するのは、より限定的な結論だ。GLM-5.2は特定の脆弱性タスクでは主要なクローズドモデルと競合するが、より広範な評価でMythosに一貫して匹敵するわけではない。

この違いは、見出し上の比較以上に重要だ。GoogleはAnthropicのProject Glasswingに参加しており、選ばれた防御側にMythos級の能力へのアクセスを提供している。一方、GLM-5.2は別の道を取る。ダウンロード可能な重みにより、組織はプロバイダーにすべてのリクエストを管理されることなく、モデルを運用・改変できる。

したがって、この競争はZ.ai対Anthropicにとどまらない。アクセス制限とプロバイダー管理の安全策を、プライベートインフラ全体へ広がり得るモデルと対峙させる構図だ。中心的な問いは、オープンモデルが高度なサイバー能力に到達するかどうかではもはやない。差が縮まるなかで、防御側がどう対応するかである。

GLM-5.2はモデル公開をセキュリティテストへと変えた

Z.aiは、信頼に足るサイバー能力をダウンロード可能なモデル重みとして提供し、議論を変えた。

Zhipu AIとしても知られるZ.aiは、2026年6月13日にコーディングプラン利用者向けにGLM-5.2を導入した。3日後には重みと技術資料を公開した。同社はこのモデルを、コーディング、ソフトウェアエンジニアリング、長時間稼働するエージェントタスク向けに位置付けた。

オープンウェイトとは、組織が学習済みパラメータをダウンロードし、自ら管理するインフラ上でモデルを運用できることを意味する。この形態は、プロバイダーがトラフィックを監視し、安全策を変更し、利用者を停止し、アクセスを取り消せるホステッドサービスとは異なる。

この公開はすぐにセキュリティ研究者の注目を集めた。SemgrepはGLM-5.2を、安全でない直接オブジェクト参照の検出、一般にIDOR検出と呼ばれるタスクでテストした。この種の欠陥により、利用者は他人に属するデータや操作へアクセスできてしまう。

IDOR評価で、GLM-5.2はF1スコア39%を記録した。F1は適合率と再現率を一つの指標にまとめたものだ。Claude Codeは同じ基本的なプロンプト設定で32%を記録した。

Semgrepの特化型マルチモーダルパイプラインは53%から61%を記録し、なお上回った。この結果には重要な留保がある。強力なモデルであっても、対象を絞った分析、リポジトリのマッピング、構造化された検証を中心に構築されたセキュリティシステムを自動的に上回るわけではない。

この実験では、異なる支援形態も比較された。GLM-5.2には、コンテキストを提供し、モデルとのやり取りを管理するソフトウェアである基本的なハーネスが与えられた。Semgrepの内部パイプラインには、エンドポイントを特定して検索対象を絞り込む、目的別に設計されたガイダンスが与えられた。

これは、この結果がClaudeに対する幅広い優位性を示すものではないことを意味する。GLM-5.2が、大規模な足場固めなしでも、推論負荷の高い脆弱性タスクで優れた性能を発揮できることを示している。それでも、プライベート環境への導入を検討するセキュリティチームにとっては意味のある変化だ。

提供されたReutersの見出しは、このモデルがサイバー防御テストでMythos 5に近づいていると表現している。入手可能な証拠が「近づいている」を支持するのは、テスト対象のタスク、モデル構成、評価ハーネスが明確に特定される場合に限られる。

ベンチマーク結果は、定義された環境内での性能を測る。未知のリポジトリ、防御されたネットワーク、不完全なインシデント報告をモデルがどう扱うかを自動的に予測するものではない。

GLM-5.2の重要性は、アクセス性と能力の組み合わせにある。数千のチームが承認を待たずにダウンロード、カスタマイズ、運用できる場合、やや性能が劣るモデルのほうが運用上はより重要になり得る。

だからこそ、この公開は直ちに緊張を生んだ。Anthropicは最も強力なサイバー機能を管理された能力として扱っている。Z.aiは、元の開発者の管理範囲を越えて移動できるモデルの中に、競争力のある水準の能力を置いた。

Anthropic・Googleのセキュリティモデルが圧力に直面する理由

Anthropic・Googleのアプローチは管理されたアクセスに依存する一方、GLM-5.2は配布後のプロバイダーの役割を小さくする。

Anthropicは2026年4月、Project Glasswingを通じてMythos Previewを導入した。この取り組みは、Anthropicと米国政府、主要なテクノロジー、金融、セキュリティ組織を結び付けた。

GoogleはAmazon Web Services、Apple、Broadcom、Cisco、CrowdStrike、Microsoft、Nvidia、Palo Alto Networks、Linux Foundation、JPMorganChaseとともに参加した。掲げられた目的は、攻撃者に悪用される前に重要なソフトウェアの脆弱性を見つけることだった。

後にMythos 5は、承認されたGlasswing参加者が利用できる、より高性能な後継モデルとなった。AnthropicはこれをFable 5と同じ基盤モデルだと説明するが、選択的にサイバーセキュリティ上の安全策が外されている。

Mythosのリリースは、この区分を説明している。Fable 5は分類器とフォールバックを備え、一般利用者に提供される。Mythos 5は、Anthropicが特に機微だと考えるサイバー能力へのより広いアクセスを、審査済みの防御側に与える。

この構造は、プロバイダーがモデルと大半の利用者の間に存在し続けることを前提としている。Anthropicは無制限の機能を誰に提供するか決められる。また、不審な活動を監視し、モデルを取り巻くシステムを調整できる。

Googleの関与は、MythosをGoogleのモデルにするものではない。Googleを、Anthropicのアクセス制限付きシステムを利用する防御連合の一員にするものだ。この区別は、主要キーワードであるanthropic googleと、それを取り巻く競争圧力を解釈する際に不可欠である。

GLM-5.2は、この連合の運用上の前提に挑戦する。モデル重みがダウンロードされた後、Z.aiはすべての導入環境に同一の監視ルールを確実に課すことはできない。運用者は周辺ソフトウェアを改変し、挙動をファインチューニングし、拒否メカニズムを取り除ける。

この違いは、オープンウェイトが本質的に悪意あるものだという意味ではない。プライベート運用は、防御側がソースコード、規制対象情報、機密のインシデントデータを守る助けになる。また、研究者はベンダーのサービスに依存せずに調査結果を再現できる。

しかし、同じ制御性は攻撃目的の利用者にも利益をもたらす。悪意ある運用者は、プロバイダー側のレート制限、アカウント審査、集中型の不正利用検知を発動させずに、反復的な実験を実行できる。

このトレードオフは、Anthropicだけに圧力をかけるものではない。Googleや他のGlasswingパートナーは、管理されたアクセスが持続的な防御上の優位性を生むことを示さなければならない。特権的な能力を、より迅速な発見、協調的な開示、検証済みのパッチへと変える必要がある。

無制限の競合モデルが十分に近い性能を維持するなら、アクセス自体が性能の一部になる。やや強力なアクセス制限付きモデルが、多くの社内セキュリティチームに配備されたより弱いモデルよりも、必ずしも総合的な防御力を高めるわけではない。

圧力は短期的でもあり、長期的でもある。短期的には、組織はGLM-5.2がセキュリティワークフローに十分な信頼性を持つかを判断しなければならない。長期的には、最先端モデルの開発者は、類似の能力がダウンロード可能なシステムに現れたとき、どの安全策がなお機能するのかを再考する必要がある。

これは、この物語における最初の大きな逆転だ。サイバーセキュリティの主導権は、最も高性能なモデルへのアクセスを制限することに一部依存すると考えられていた。GLM-5.2は、政策枠組みが安定する前に、同等のツールがそのアクセスモデルの外部から出現し得ることを示唆している。

オープンウェイトがサイバーセキュリティの方程式を変える

決定的な違いは一つのベンチマークスコアではなく、誰がモデルを運用、適応、検査できるかにある。

サイバーセキュリティ業務は、複数の異なる活動にまたがる。モデルはコードをレビューし、既知の脆弱性を再現し、エクスプロイトを開発し、マルウェアを分析し、シミュレーションされたネットワークを探索するかもしれない。一つの分野での成功は、他の分野での成功を保証しない。

Anthropic自身のテストは、能力範囲の上限を示している。Mythos Previewは、パッチ適用済みソフトウェアと数千のオープンソース・ファジング対象に対して評価された。

Anthropicのサイバーセキュリティ評価によると、Mythos Previewは反復実験で動作するFirefoxエクスプロイトを181回生成した。以前のClaudeモデルは数百回の試行で2回成功した。

このモデルは、AnthropicのOSS-Fuzzテストで595件の低位レベルのクラッシュも生成した。完全にパッチが適用された10件の対象で、最も深刻な分類である完全な制御フロー乗っ取りに到達した。

これらは企業が実施した評価であるため、普遍的な測定値として扱うべきではない。それでも、Anthropicがアクセス制限プログラムを設けた理由を示している。問題となる能力は、不審なコードパターンを特定することを超える。

GLM-5.2は、直接比較可能な公開テストでこれらの結果すべてに匹敵したわけではない。現時点での評価は、一つの包括的なMythos再現ではなく、より限定的な複数の調査結果に基づいている。

英国AI Security Instituteは、最も強い同等性の主張に対する有用な対照材料を提供している。同研究所の研究者は、GLM-5.2を狭い範囲のサイバータスクと、シミュレーションされた複数段階の攻撃でテストした。

同研究所は、GLM-5.2が狭いタスクでは4カ月前に公開されたクローズドモデルと同程度の性能を示したと報告した。より長いサイバーレンジでは、ほぼ7カ月前に公開されたモデルに近かった。

したがって、そのオープンウェイト分析は、GLM-5.2をクローズドなサイバー最前線から4~7カ月遅れと位置付けている。これはMythos 5との同等性を意味しない。

それでも、持続的な技術的優位に依存する防御側にとって、この結果は決して安心材料ではない。同研究所の以前の内部評価では、オープンモデルは6~10カ月遅れていた。測定される遅れは短くなっている。

長期的な結果には特に注目すべきだ。GLM-5.2は当初、より新しいクローズドモデルに似た軌跡をたどったが、シミュレーションされた攻撃チェーンの途中で停滞した。

このパターンは、二つの異なる能力層を示唆する。モデルは個々の技術的ステップを解決できるが、長期にわたる作戦の中で計画を維持し、適応することにはより大きな困難を抱える。

この制約は実際の侵入において重要だ。攻撃者は認証情報、ネットワークの変化、誤った前提、防御側のアラート、不完全なアクセスに対処しなければならない。強力なコード分析スコアが捉えるのは、その過程の一部にすぎない。

それでも防御側は慢心を避けるべきだ。オープンウェイトにより、外部チームはハーネスを改善し、メモリを追加し、特化したツールを提供し、ドメイン固有の例でモデルをファインチューニングできる。

ベンチマークは、ある時点における一つのパッケージ化されたシステムをテストする。オープンな導入は開発プラットフォームを生み出す。改良は、元のモデルメーカーと一度も連携しない組織からも生まれ得る。

ここでGLM-5.2は競争の仕組みを変える。Anthropicは管理されたインターフェースの背後でMythosを改善できる。より広範なGLMコミュニティは、多数の独立した環境にわたって導入手法を改善できる。

anthropic google連合には重要な利点が残る。その構成員は、広範なセキュリティデータ、インフラに関する知識、脆弱性開示の関係を保有する。実システムに対して発見をテストし、広く利用される製品へ修正を反映できる。

GLM-5.2は別の利点を提供する。すなわち、配布力だ。利用者は、機密コードを外部サービスへ送ることなく、モデルをプライベートリポジトリのそばに配置し、ワークフローをカスタマイズできる。

どちらの優位性も、より優れたセキュリティを保証するものではない。結果は、組織が発見事項を検証し、本物のリスクを優先し、敵対者に悪用されるより速くシステムにパッチを適用できるかどうかに左右される。

ベンチマークの見出しが見落としていること

GLM-5.2がMythos 5に迫るという主張は、特定のタスクでは妥当だが、サイバー能力全体を表す説明としては誤りだ。

セキュリティベンチマークは、多くの場合、複数の選択を一つのスコアに圧縮している。そこにはプロンプト、利用可能なツール、トークン予算、試行回数、モデル設定、成功基準が含まれる。

あるモデルが高得点を得るのは、タスクが学習データに似ているためかもしれない。別のモデルは、安全性システムが評価の一部を遮断するために性能が伸びない可能性がある。専門的なハーネスが、より良いコンテキストを提示することで、より強力な基盤モデルを上回る場合もある。

Semgrepの結果は、この問題を明確に示している。GLM-5.2は単純な設定ではClaude Codeを上回った。しかし、モデルの推論と構造化されたアプリケーション分析を組み合わせたSemgrepのガイド付きパイプラインには及ばなかった。

英国の研究機関は別の限界も確認した。GLM-5.2は狭いスキル領域では旧世代の最先端モデルに近づいたが、長い連続タスクではさらに差を広げられた。この隔たりは、一つの脆弱性検出スコアが完全な攻撃能力を表すという主張を弱める。

最近の学術テストは第三の視点を加えている。CryptanalysisBenchは、既知の弱点を含む暗号方式や、実用的な解読手法が確立されていないより難しい設計に対する攻撃を評価する。

暗号解読ベンチマークでは、GLM-5.2は第1層タスクの65.3%を解決した。Mythos 5は85.7%を解決した。Opus 4.8、Sonnet 5、GPT-5.5も、この2モデルの間に位置した。

より難しいタスクでは差が拡大した。研究者がスケールされたバリアント全体での成功を数えた場合、GLM-5.2は24の方式を破った。Mythos 5は61に達した。

Mythos 5は、これまで報告されていなかった発見にも貢献した。研究者によると、同モデルは公表済みのセキュリティ証明の問題を特定し、完全な鍵復元攻撃の実現に役立ったという。

これらの結果は、GLM-5.2がすでにMythos 5に匹敵したという広範な主張を損なう。同時に、モデル比較には複数のタスク群が必要である理由も示している。

証拠は、より正確な評価を支持している。GLM-5.2は、一部の実践的なセキュリティテストで主要システムに挑戦できる水準に達した。Mythos 5は、要求の厳しい暗号学的推論では依然として大きな優位性を保っている。

これは、Z.aiのリリースが重要でないことを意味しない。攻撃者や防御側にとって有用になるために、モデルがすべてのベンチマークで勝つ必要はない。

現実のセキュリティ問題の多くは、高度な暗号解読ではなく、繰り返される一般的なミスに関わる。アクセス制御のバグ、安全でない入力処理、漏えいしたシークレット、脆弱な設定は、大規模なソフトウェアポートフォリオ全体に見られる。

これらのタスクを十分にこなせる広く利用可能なモデルは、自動レビューを受けるリポジトリの数を増やせる。一方で、ノイズの多い、あるいは誤解を招く報告の量を増やす可能性もある。

偽陽性には現実的なコストが伴う。セキュリティチームは各発見を再現し、悪用可能性を判断し、影響を受けるバージョンを特定し、修正対応を調整しなければならない。もっともらしいが誤った報告を生成するモデルは、限られたエンジニアリング時間を消費しかねない。

偽陰性は別のリスクを生む。チームは、一見有能なスキャナーを信頼し、他のレビュー活動を減らすかもしれない。ベンチマークでの勝利は、人間によるテスト、静的解析、確立されたファジングシステムを置き換える根拠にはならない。

汚染への懸念もある。公開ベンチマークのタスクは、直接的に、あるいは解説やコードを通じて学習データに含まれる可能性がある。強力な評価では、このリスクを抑えるため、新しい対象、管理された環境、トレース分析を用いる。

最善の対応は、見出しから一人の勝者を選ぶことではない。購入者は最近の内部コードでモデルをテストし、非公開の解答セットを維持し、生成された報告ではなく検証済みの発見を測定すべきだ。

したがって、anthropic googleの物語は能力と同じくらい検証に関するものでもある。防御的な連合は、制限付きモデルが実運用上のセキュリティ向上を生むことを証明しなければならない。オープンモデルのコミュニティは、幅広いアクセスが単に未検証の出力を増やすだけではないことを証明する必要がある。

真の競争は、制限付きアクセス対分散型能力だ

現在の競争の焦点は、有用なサイバー能力が広がる中でも安全策を有効に維持できるかどうかにある。

Anthropicは、高度なサイバーモデルが防御者と攻撃者の双方を支援し得ると主張している。このデュアルユースという性質が、Fable 5とMythos 5の分離を説明する。

Fableは、機微な要求を検出する別個のシステムである分類器を使用する。フラグが立ったタスクの一部はブロックされるか、別のモデルへ転送される。Mythosは、承認済みの研究者に対し、指定分野でより少ない制約を提供する。

この設計には複数の執行ポイントがある。Anthropicは申請者を評価し、トラフィックを監視し、繰り返される不審な行動を調査し、新しい悪用パターンが現れた際に分類器を更新できる。

このアプローチは、正当な利用者にも摩擦を生む。セキュリティ研究者は脆弱性を理解するために、悪用技術、マルウェアの挙動、回避手法について議論する必要があることが多い。慎重な分類器は、その作業を中断させる可能性がある。

オープンウェイトは、このプロバイダー管理下の摩擦の多くを取り除く。同時に、多くの中央集権的な制御も取り除く。拒否応答の学習は変更できる場合があり、ログを保持するかどうかは独立した運用者が決める。

この政策上の対立は、単に米国対中国という構図ではない。モデル開発者、規制当局、セキュリティチームがアクセスと悪用のバランスを取る、あらゆる市場の内部に存在する。

より広範なセキュリティ論争は、すでにMythosを超えて拡大している。他の最先端開発者もサイバー分野に焦点を当てたシステムを導入またはテストしており、研究者の間では危険な能力が現れる時期について意見が分かれている。

Googleは複雑な立場にある。大手ソフトウェア・インフラ事業者としてProject Glasswingを支援している一方、自社のモデルとセキュリティシステムも開発しており、Anthropicのアクセス方針を超える動機を持つ。

anthropic googleの関係が重要なのは、制限付きモデルがデプロイメントパートナーを通じて価値を得るためだ。Googleは大規模なコードベース、経験豊富な防御者、広く導入されたソフトウェアを修正する経路を提供できる。

Z.aiのアプローチは別の形の規模を生み出す。独立組織はGLM-5.2をプライベートな開発ネットワーク内に配置できる。チケット管理システム、コード検索、テスト環境、ローカルのセキュリティツールと接続することも可能だ。

企業にとって、この決定は生の精度だけにとどまらない。データガバナンスも重要だ。一部の組織は、ソースコード、脆弱性報告書、インシデントの証拠を外部モデルサービスに送信できない。

ローカルで運用するモデルは、この制約に対応できる。しかしその場合、組織はアクセス制御、モデル更新、ログ記録、悪用監視の責任を負う。

したがって、デプロイメントはリスクをなくすのではなく、移し替える。ホスト型サービスはモデル提供者への信頼を集中させる。セルフホスト型システムは、セキュリティ慣行が大きく異なる運用者に責任を分散させる。

この分散パターンは規制を複雑にする。政府は国内の提供者や主要クラウドサービスに条件を課せる。しかし、民間または外国のインフラ上で稼働するモデルのコピーに対する影響力は小さい。

インシデント対応も複雑になる。ホスト型プロバイダーは、サービス全体にわたってシステムレベルの弱点を修正できる。オープンモデルの運用者は、自ら更新を入手して適用しなければならない。

防御側は、両方の経路が存続すると見込むべきだ。高い機密性を持つ組織は、測定可能な優位性が得られるなら、制御された最先端モデルへのアクセスを求める。別の組織は、自らの環境内にとどまる適応可能なモデルを好むだろう。

戦略上の誤りは、どちらか一方の経路で十分だと見なすことだ。制限付きの最先端能力だけでは、すべてのソフトウェアプロジェクトを守れない。無制限の配布は、慎重な利用や信頼できる発見を保証できない。

より強力な防御は、有能なモデルと従来のセキュリティ制御を組み合わせる。これにはコードレビュー、ファジング、依存関係管理、ネットワーク分割、ID制御、再現可能なテスト、協調開示が含まれる。

AIは個々のタスクの速度と規模を変える。しかし、どのシステムが重要かを決め、結果を確認し、修正を展開し、実際に露出が減ったかを測定する必要性を取り除くわけではない。

Z.aiが本当に差を縮めたかを示す3つのシグナル

次の証拠は、別のモデル発表ではなく、独立テスト、現場での結果、測定可能な防御成果から得られるべきだ。

第1のシグナルは、汚染に強い幅広いサイバー評価におけるGLM-5.2の性能だ。研究者は、脆弱性発見、悪用、リバースエンジニアリング、暗号解読、継続的なネットワーク運用をテストする必要がある。

これらのカテゴリー全体でより強い結果が出れば、Z.aiによるMythos 5との比較を補強する。暗号解読や長期的な範囲での弱さが続けば、現在の同等性の主張が依然としてタスク固有であることを示す。

評価者は、比較を意味のあるものにするため、十分な方法論の詳細を公表すべきだ。成功を検証するために用いたハーネス、ツール、トークン制限、試行、安全策、基準を明らかにする必要がある。

第2のシグナルは、オープンモデルの運用者が周辺システムをどれだけ速く改善するかだ。GLM-5.2のダウンロード可能なウェイトにより、セキュリティ企業や社内チームは、その周囲に特化型エージェントを構築できる。

リポジトリマッピング、検索、ツール利用、メモリ、ファインチューニングによる、独立して再現された改善を注視すべきだ。これらのシステムが長期的な隔たりを埋めるなら、オープンウェイトはリリース時の構成を超えてモデルを増幅したことになる。

失敗もまた有益な情報となる。最適化されたデプロイメントが依然として信頼できないなら、基盤モデルのアクセスしやすさはMythosレベルの運用には結び付かない。

第3のシグナルは、検証済みの防御的影響に関する証拠だ。AnthropicとそのGlasswingパートナーは、発見された脆弱性、深刻度、重複率、修正時間、その後のパッチ採用状況を報告する必要がある。

Z.aiの利用者も同じ基準を満たすべきだ。報告が重複、偽陽性、影響の小さい問題、または保守者が再現できない欠陥である場合、大量の件数に意味はほとんどない。

最も強力な成果は、重要なソフトウェア全体で露出期間が短縮されることだ。それには発見、責任ある報告、エンジニアリングによる修正、リリース管理、利用者による採用が必要となる。モデルが影響を与えるのは、その連鎖の一部にすぎない。

広範な攻撃側の適応を示す証拠は、評価を逆方向へ変えるだろう。セキュリティチームは、脅威アクターがオープンモデルを反復可能な侵入ワークフローに組み込んでいるかを監視すべきであり、単にフォーラムで言及しているかを見るだけでは不十分だ。

短期的な勝者は、ある企業がベンチマーク首位を主張することで決まるのではない。運用リスクを制御しながら、モデル能力を検証済みの行動へ変換する者によって決まる。

開発者にとっての実践的な対応は、有能な自動脆弱性分析が広く利用可能になりつつあると想定することだ。高リスクのコードパスをレビューし、シークレットの取り扱いを改善し、スキャン量が増える前にセキュリティテストを再現可能にすべきである。

企業の購入者は、一般的なリーダーボードを受け入れるのではなく、自社ソフトウェアでの評価を求めるべきだ。また、誰が発見を検証し、モデルアクセスをどのように監査するのかも定める必要がある。

anthropic googleの競争を追うナレッジワーカーは、ソース資料、ベンチマークのバージョン、その後の訂正を保存すべきだ。能力に関する主張はすぐ変化する一方、スクリーンショットや単独のスコアはしばしば文脈より長く残る。

今後数か月で、GLM-5.2が限定的なベンチマーク上の圧力を表すのか、それともサイバー能力における持続的な変化なのかが明らかになる。独立テスト、最適化されたデプロイメント、検証済みのパッチに注目したい。

 
 

無料で始めましょう

ローカルファーストのパーソナル知識管理付きAIアシスタント

より良いAI体験のために、

remio は現在、 Windows 10+ (x64)M-Chip Mac のみをサポートしています。

脳内に検索バーを追加

ただremioに尋ねるだけ

すべてを思い出す

何も整理しない

bottom of page