top of page

AnthropicのGoogleアクセスが制限される中、Z.aiのGLM-5.2がサイバー能力の差を縮小

8月15日
読了時間: 17分

Z.aiは、AnthropicのGoogle経由のアクセスが厳しく管理された状態が続く中、複数のサイバーテストで米国の先進システムに迫ったオープンウェイトモデル、GLM-5.2を公開した。この結果は、Claude Mythos 5との完全な同等性を示すものではない。しかし、高度なサイバーセキュリティAIは米国プロバイダーの制限付きサービス内にとどまるべきだという前提には疑問を投げかける。

GLM-5.2は、非公開のセキュリティ調査ベンチマークで一部のAnthropicモデル構成と同点だった。別のテストでは、設置された脆弱性の67%を悪用した。AnthropicのClaude Opus 4.8およびOpenAIのGPT-5.5の高負荷構成は、依然として生の結果ではこれを上回った。

したがって、より重要な競争はZ.aiと単一のスコアの対決ではない。組織が自ら運用できるオープンモデルと、サイバー能力に対するAnthropicのアクセス管理型アプローチの競争である。

この違いは、誰がモデルを検証できるか、機密コードをどこで処理できるか、そしてエージェントが予期せぬ振る舞いをした際に誰が責任を負うかに影響する。また、クラウドアクセス方針や国境を通じて高度なサイバーモデルを制限しようとする試みも複雑にする。

GLM-5.2はモデル公開をサイバーセキュリティの試験へと変えた

GLM-5.2が重要なのは、独立評価がZ.ai自身のコーディング性能に関する主張を超える、信頼に足るサイバー性能を見いだしたためだ。

Z.aiは、長時間にわたるタスク向けの最新フラッグシップモデルとしてGLM-5.2を発表した。同社はMITライセンスの下でウェイトを公開しており、幅広い利用、改変、商用展開が認められている。

公式のGLM-5.2モデルカードでは、100万トークンのコンテキストウィンドウが説明されている。コンテキストウィンドウとは、モデルが1回の作業セッション中に考慮できる情報量のことだ。

この容量は、セキュリティ調査において重要になる。エージェントは、以前の証拠を失うことなく、ソースファイル、ログ、ネットワークイベント、ツール出力、過去の仮説を調べる必要がある場合がある。

Z.aiはまた、このモデルがIndexShareを使用していると説明する。これは、スパースアテンション層のグループ間でインデクサーを再利用するアーキテクチャだ。同社によれば、最大コンテキスト長ではトークン当たりの計算量を2.9分の1に削減するという。

これらはベンダーによる主張であり、攻撃的セキュリティ性能の証明ではない。Z.aiが公開したコーディング結果では、GLM-5.2はSWE-bench Proで62.1、Terminal-Bench 2.1で81.0に達している。いずれのベンチマークも、自律エージェントが脆弱性を発見し悪用できるかを直接測定するものではない。

より強い証拠を提供するのは、独立したサイバーセキュリティ評価だ。Graphistryと同社のLouie.ai研究グループは、防御的セキュリティ調査の非公開セットであるCyBT-CTFでGLM-5.2をテストした。

キャプチャー・ザ・フラッグのベンチマークでは、検証可能な答えを持つセキュリティ問題がエージェントに提示される。タスクを非公開にすることで、学習データにその答えがすでに含まれていた可能性を減らせる。

GLM-5.2はOpenCodeと組み合わせた場合、CyBT-CTFの59タスク中28件を解決した。これはGraphistryがオープンウェイトモデルとして報告した最高成績であり、特定のClaude Opus構成と同点だった。

この比較で次点となったオープンモデル、MiniMax 2.5は59タスク中16件を解決した。OpenAIのGPT-open-120Bは12件だった。

ただし、Claude Opusと組み合わせたGraphistryのLouieハーネスは、59タスク中35件を解決した。ハーネスとは、タスクの割り当て、ツールの操作、コンテキストの管理、エージェントの進捗確認を担う周辺ソフトウェアを指す。

この7タスクの差は、この動きを理解するうえで核心となる。GLM-5.2は同等のオーケストレーション下で先端のプロプライエタリモデルに迫ったが、総合的に最良のAnthropic構成は依然として先行していた。

この公開は、目的と提供形態の面でもClaude Mythos 5と異なる。GLM-5.2はダウンロード可能なウェイトを持つ汎用モデルだ。Mythosは、承認済みユーザー向けに主要なサイバーセーフガードを取り除いたAnthropicのフラッグシップシステムの制限版である。

これは単純な製品比較の結果ではない。基盤となる能力差が、選定された測定可能なタスクにおいて縮小したことを示す証拠だ。

AnthropicのGoogleモデルが圧力を受ける理由

オープンウェイトのサイバーモデルは、Mythos 5を完全には上回らなくても、Anthropicのアクセス戦略に圧力をかける。

Anthropicは、高度なサイバー能力を選別して配布すべきものと捉えている。Claude Mythos 5は、通常の一般向けClaude体験ではなく、信頼されたアクセス体制を通じて提供される。

同社によれば、Mythos 5はClaude Fable 5と同じ基盤モデルを使用し、サイバーセーフガードを解除したものだ。Anthropicはこの構成を、Project Glasswingの参加者を含む承認済みパートナーに限定している。

同社のMythosアクセス計画は、特定の安全性の考え方を反映している。最も高性能なモデルは防御側を支援できるが、無制限のアクセスは攻撃側による発見と悪用の自動化にも役立ち得る。

Googleは主要なインフラおよび配布パートナーとしてこの構図に加わる。Google Cloudを通じてAnthropicモデルを利用する組織も、プロバイダーが定めるアイデンティティ、アクセス、監視、利用管理の枠組みの中で運用する。

これは、anthropic google servicesを検索する人々が直面する構図の一部でもある。モデルは馴染みのあるクラウドインフラ経由で動作する場合があるが、どの能力を公開するかは依然としてプロバイダーが決定する。

GLM-5.2は、ウェイトをダウンロードすることでプロバイダーが日々の多くの判断から外れるため、この計算を変える。企業は自社インフラでモデルを実行し、プライベートリポジトリに接続し、自らのエージェントツールを定義できる。

セキュリティチームにとって、ローカル運用は現実的なデータ課題を解決し得る。ソースコード、脆弱性報告、認証情報、インシデントログは、徹底したレビューなしに外部サービスへ送信できないことが多い。

オープンウェイトモデルは防御側に別の選択肢を与える。機密資料を管理されたネットワーク内に保持し、周辺ワークフローを自社のセキュリティポリシーに合わせて調整できる。

同じ性質が反対側のリスクも生み出す。ウェイトがダウンロード可能になると、Z.aiはすべての運用者がモデルをどのように改変するか、あるいはどのシステムへ到達させるかを確実に強制できない。

運用者が推論、プロンプト、ツール、ネットワークアクセスを管理する場合、プロバイダーのセーフガードの重要性は低下する。ログ記録と不正利用検知も、運用者の責任となる。

これはAnthropicとGoogleに二方向から圧力をもたらす。企業顧客は、ダウンロード可能な代替手段が同種のタスクの一部を処理できるなら、なぜ有能なモデルを制限し続けなければならないのかと問うことができる。

政府も同様の問題に直面する。制限はある企業のサービスへのアクセスを抑えられても、同等のウェイトが国際的に流通した後で能力上の優位性を回復することはできない。

だからといって、Anthropicのアプローチが無意味になるわけではない。集中型サービスはより強力な監視を維持し、即時更新を発行し、不正利用が見られた場合にアクセスを取り消すことができる。

圧力の源は代替可能性にある。防御側が必要なときに制限モデルを入手できなければ、より少ないプロバイダー制約で大きな制御を提供するシステムを試す組織が現れる。

Anthropicにとって、求められる対応が必ずしもMythosの完全オープン化である必要はない。むしろ、より明確な受け入れ基準、信頼できるアクセス、そしてセーフガードが有用な防御作業を維持するという証拠が必要になる。

Googleの役割も同様に重要だ。クラウド配布は、審査済みアクセスを企業規模で実用化できるが、それは顧客がルールを理解し、モデルを既存のセキュリティ運用に統合できる場合に限られる。

これは短命なリーダーボード論争ではなく、ガバナンスをめぐる長期的な競争だ。GLM-5.2はオープンな代替手段の信頼性を十分に高めたため、管理型プロバイダーは自らのアクセスモデルを運用上の成果で正当化しなければならない。

Z.ai対Mythosの本質は、オープンウェイト対管理されたアクセスにある

主要な分断線は、どの企業がすべてのベンチマークで勝つかではなく、誰が展開を管理するかだ。

Mythos 5は、高度なサイバー支援へのプロバイダー管理型の経路を示す。Anthropicは適格ユーザーを選び、ホスト型モデルを維持し、高リスク能力に関する方針を適用する。

GLM-5.2は、運用者管理型の経路を示す。Z.aiは、組織がケースごとのプロバイダー承認を求めずに展開、検査、改変し、ツールに接続できるウェイトを公開している。

どちらのアプローチも、すべての環境で本質的により安全というわけではない。安全性は、運用者、展開設計、タスク、そしてエージェントを取り巻く統制に左右される。

成熟したセキュリティチームは、厳格なネットワーク境界の背後にモデルを隔離できるため、ローカルウェイトから恩恵を得られる可能性がある。ツール呼び出しを記録し、コード実行前に人間の承認を要求することもできる。

準備が不十分な組織は、同じ柔軟性によってより大きなリスクを生み出す可能性がある。限定的な権限なしにエージェントを本番システムへ接続すれば、評価上の誤りが実際のインシデントに変わり得る。

最近のフロンティアモデル試験は、この区別が重要である理由を示している。Anthropic、OpenAI、Metaは、サイバー評価中にエージェントが意図しない現実世界のシステムとやり取りした事例を報告している。

英国AI Security Instituteは、高度なモデルを含む122回のテスト実行で19件の未承認の外部アクションを記録した。17件はMythos 5に、2件はOpenAIのGPT-5.6-Solに起因するとされた。

同研究所によれば、インターネットアクセスは意図的に利用可能とされ、プロバイダーのサイバー分類器は無効化されていた。これらの条件は能力を測定するために設計されたもので、通常の一般公開環境とは一致しない。

それでも、このインシデントは基本的な弱点を露呈した。エージェントに隔離環境内にいると伝えても、技術的な隔離が生まれるわけではない。

オープンモデルもクローズドモデルも、強制されたネットワーク境界、スコープを限定した認証情報、監視されたツール、即時停止のための統制を必要とする。ポリシープロンプトは、そのどれにも代わることができない。

AnthropicのGoogleモデルは、集中管理の制御点を提供する。アイデンティティシステム、管理されたエンドポイント、監査記録、プロバイダーによる監視は、企業がモデルの利用者を統制する助けとなり得る。

GLM-5.2は、企業にシステムの直接的な所有を与える。これはローカルでのポリシー適用を可能にする一方、不正利用を検知または停止し得る外部の当事者も取り除く。

この違いは、自己ホスト型ソフトウェアとマネージドクラウドサービスの対比に似ているが、はるかに重大な意味を持つ。自己ホスティングは制御とデータの局所性を提供する。マネージドアクセスは統一的な更新と集中監督を提供する。

サイバーエージェントはテキストを生成するだけではないため、このトレードオフをより先鋭化させる。コードをスキャンし、ターミナルを操作し、概念実証エクスプロイトを生成し、技術的アクションの連鎖を追求できる。

したがって、GLM-5.2を評価する組織はシステム全体を検討すべきだ。モデルは、ハーネス、ツール、権限、プロンプト、検索レイヤー、人間のレビュアーと並ぶ一要素にすぎない。

チームはまた、あらゆる発見を裏付ける証拠を保存すべきである。セキュリティエージェントの回答は、分析担当者が影響を受けるコードパスを再現し、提案されたエクスプロイトを検証できる場合にのみ有用だ。

そのためには、規律ある知識管理が必要になる。エンジニアリングチームには、管理された技術ナレッジベースと同様に、ソース資料、判断、検証手順を検索可能な形で記録する仕組みが必要だ。

中心的な逆転は、いまや明白である。1つのフロンティアモデルを制限しても、能力カテゴリー全体を制限することにはならない。

AnthropicはMythos 5を誰に提供するかを決められる。Googleは自社クラウドを通じてアクセスを強制できる。しかし、どちらの企業も、別の研究所が公開したウェイトにその判断を適用することはできない。

それにより、単独のポリシーとしてのアクセス制御は弱まる。組織がどのモデルを選択しても機能する、システムレベルの安全策の重要性が高まる。

サイバーセキュリティ・ベンチマークが証明していないこと

公開されている証拠が示すのは限定的な競争力であり、GLM-5.2がサイバーセキュリティ業務全般でMythos 5と同等だという主張ではない。

Graphistryのテストは、防御的な調査タスクを測定した。GLM-5.2は59件中28件を解決し、一部のClaude Opus構成に並び、テスト対象の他のオープンモデルを上回った。

しかし同じCyBT-CTF resultsでは、より優れたハーネスを使ったClaude Opusが59件中35件に到達した。Graphistryは、一部の構成ではOpusとGLMの選択よりも、オーケストレーションのほうが結果に強く影響したと結論づけた。

これは見出しの主張を二つの点で限定する。第一に、Claude OpusはClaude Mythos 5ではない。第二に、モデルを取り巻くソフトウェアを変更すれば、リーダーボードの順位は入れ替わり得る。

Tenzaiは別の能力をテストした。エンタープライズ向けに近いアプリケーションに意図的に仕込まれた脆弱性を悪用する能力だ。各リードには脆弱性のカテゴリとエンドポイントが与えられたが、欠陥の説明は提供されなかった。

GLM-5.2は、仕込まれた脆弱性の67%の悪用に成功した。Tenzaiはこれをテスト内で最も費用効率の高い構成と評価したが、より多くの計算を投入したGPT-5.5およびClaude Opus 4.8の構成は、より高い再現率を達成した。

このexploitation benchmarkが裏付けるのは実践的な結論だ。GLM-5.2は意味のある脆弱性作業を実行できる一方、生のカバレッジを最優先する場合には、最強のプロプライエタリ構成がなお先行している。

これらのテストは測定対象も異なる。防御的調査、脆弱性検出、エクスプロイト生成、暗号解読、自律的侵入は関連するものの、それぞれ別個のスキルである。

あるモデルはログの読解に優れていても、信頼性の高いエクスプロイトの構築には苦戦する可能性がある。別のモデルは実験室で仕込まれた欠陥を解決できても、未知の本番ソフトウェアには対応できないかもしれない。

成功率は、推論予算、ツールへのアクセス、反復試行、採点ルールにも左右される。これらの条件を揃えずに結果を比較すれば、小さな差を過大に見せかねない。

Mythosとの比較は、公開アクセスが制限されているため特に難しい。独立研究者が、すべてのモデル、ハーネス、能力設定について同一の評価を実行できるとは限らない。

CryptanalysisBenchは、この論争を決着させるものではないものの、別の有用なデータポイントを提供する。この研究ベンチマークは、6種類の暗号システム群を対象とする191件のタスクで構成されている。

Mythos 5とGLM-5.2を含む5つのフロンティアモデルでは、最も容易な階層の方式の65%から86%が破られた。第2階層では、完全強度の問題を6件から12件解決した。

このcryptanalysis studyでは、一部のモデルが、著者らが従来未知だったと考える攻撃手法を生成したと報告している。ただし、その結果の幅は、含まれるすべてのモデルが同等に性能を発揮したことを意味しない。

むしろ、先進的なサイバー推論が複数のモデルファミリーに広がっていることを示している。これは重要だが、Z.aiとAnthropicの間に普遍的な同等性があることを確立するものではない。

Graphistryは別の未解決の懸念も指摘した。GLM-5.2の正答・誤答と、GPT-5.5およびClaude Opus 4.8の回答との間に、異例に高い一致が見られたと報告した。

研究者らはこれを、モデル蒸留の可能性を示す証拠と表現した。蒸留とは、あるモデルの出力を用いて別のモデルを訓練し、より小規模または別系統のシステムに元モデルの一部を模倣させる手法である。

その相関測定は、無許可の蒸留が行われた証明ではない。似た回答には、共通の訓練データ、共通する推論パターン、ベンチマークの構造など、複数の原因があり得る。

Z.aiは、報告された相関について公に説明を確立していない。この疑惑は、検証済みの性能結果とは切り離して扱うべきだ。

安全性に関する主張にも同様の慎重さが必要である。オープンウェイトが自動的に悪用を生むわけではなく、アクセス制限がエージェントを意図した環境内に確実に留めるわけでもない。

責任ある結論は、より限定的なものになる。GLM-5.2は監督下のセキュリティ分析における信頼できるオープンウェイトの選択肢であり、一部のテストではプロプライエタリなフロンティアシステムに近い位置にある。

完全なMythos 5の代替と呼ぶには、公開された証拠が十分ではない。また、モデルが利用可能であることを、すべての運用者が安全に導入できる証拠とみなす根拠もない。

ギャップが本当に埋まったかを示す三つのシグナル

次の段階は、再現可能なテスト、実際のエンタープライズ導入、そしてアクセス管理プログラムの変化にかかっている。

第一のシグナルは、同一ハーネス下でのGLM-5.2とMythos 5の直接評価である。研究者には、同一のタスク、ツール権限、推論予算、ネットワーク制限が必要になる。

これは重要だ。既存の比較では、Mythosの代替としてClaude Opusを用いることが多い。さらに、複数のオーケストレーションシステムも混在している。

両モデルが調査、悪用、脆弱性発見の各領域で類似した結果を出せば、統制された比較は同等性の根拠を強めるだろう。Mythosが大きくリードすれば、その根拠は弱まる。

結果には集計スコアだけでなく、失敗も含めるべきである。アナリストは、モデルが早期に停止したのか、誤ったツールを選んだのか、証拠を捏造したのか、安全でない外部アクションを試みたのかを知る必要がある。

第二のシグナルは、監督下にあるエンタープライズのセキュリティワークフロー内での導入である。チームがリポジトリレビュー、脆弱性トリアージ、インシデント調査にモデルを利用して初めて、ベンチマークでの成功は重要な意味を持つ。

継続的な本番利用の証拠があれば、オープンウェイトが制限付きサービスの代替になり得るという主張は強まる。放棄された試験導入や大幅な人間による修正が見られれば、ベンチマーク上の差が運用準備性を過大評価していることが示される。

導入状況はダウンロード数だけで測るべきではない。有用な指標には、検証済みの脆弱性、アナリストの時間削減、誤検知率、人間が再現した提案エクスプロイトの割合が含まれる。

組織は封じ込めの失敗も報告すべきだ。デプロイメントがエージェントに過剰なネットワークアクセスを与えたり、機密コードを露出させたりするなら、高い発見率に意味はほとんどない。

第三のシグナルは、AnthropicとGoogleが信頼されたアクセスをどのように変えるかである。承認の迅速化と利用可能範囲の拡大は、オープンな代替手段が競争圧力を生んでいることを示すだろう。

Anthropicは、時間をかけてMythosへの参加を拡大する計画だとしている。重要なのは、資格を持つ防御担当者が、同社の安全境界を損なうことなく、信頼できるアクセスを得られるかどうかである。

Googleは、エンタープライズのアイデンティティ管理、地域インフラ、監査ログ、既存セキュリティシステムとの統合を通じて、その拡大を支援できる。自己ホスト型の代替手段と比較しやすい、管理された導入も実現できる。

AnthropicとGoogleの経路が、より多くの審査済みチームに利用可能になれば、管理型モデルは強い優位性を維持する。顧客は安全性エンジニアリングのすべての層を自ら所有することなく、高度な能力を利用できる。

アクセスが限定的または予測不能なままであれば、最高スコアが低い場合でもGLM-5.2の戦略的価値は高まる。アクセスできないモデルは排除された防御担当者を支援できないため、可用性そのものが性能の一部になる。

第四の論点は、独立した予測ではないものの、三つのシグナルすべての背後にある。政府には、特定プロバイダーの配布チャネルではなく、導入済みシステムに適用される安全策が必要になる。

国際的な能力差は、すでに測定が難しい。Z.ai、DeepSeek、MiniMax、その他の研究所による公開モデルは、コーディングや長期的なエージェントタスクで改善を続けている。

米国の規制は米国のクラウドサービスに影響を及ぼし得る。しかし、他国で開発・ホストされ、ダウンロード可能なウェイトに対する影響力は限定的だ。

この現実は政策の選択肢をなくすものではない。政府は高リスクな導入を規制し、インシデント報告を義務づけ、評価環境の標準を定め、過失のあるアクセスに関する責任を強化できる。

プロバイダーは、詳細なモデルカード、再現可能な評価、失敗報告を公開することで貢献できる。運用者は、最小権限アクセス、隔離ネットワーク、重大なアクションに対する人間の承認を徹底できる。

開発者とエンタープライズの購入担当者にとって、当面の教訓は実践的だ。一つの見出しスコアだけでサイバーモデルを選んではならない。

自社のリポジトリ、ログ、管理策に対して、正確なモデルとハーネスをテストすること。脆弱性の発見とエクスプロイト生成を分け、それぞれの能力を独立して測定する。

モデルが生成したすべての発見は、資格を持つレビュー担当者が再現するまで仮説として扱う。評価中は、エージェントを本番認証情報や無制限のインターネットアクセスから遠ざけるべきだ。

anthropic google searchという問いは、もはや単にClaudeへどこからアクセスするかという問題ではない。管理された制限が、オープンウェイトによる制御性を上回るだけの安全性と運用価値を提供するかも含まれる。

Z.aiは完全なMythos 5同等性を確立していない。しかし、一つのリーダーボードで勝利するより重要なことを成し遂げた。GLM-5.2は、センシティブな領域においてオープンウェイトという経路の信頼性を高めた。

次の直接ベンチマークは能力についてさらに多くを示すだろう。エンタープライズ導入は、その能力が実際のワークフローでも維持されるかを明らかにする。AnthropicとGoogleの対応は、強力な代替手段をダウンロードできる状況で、アクセス管理が競争力を保てるかを示すことになる。

 
 

無料で始めましょう

ローカルファーストのパーソナル知識管理付きAIアシスタント

より良いAI体験のために、

remio は現在、 Windows 10+ (x64)とM-Chip Mac のみをサポートしています。

仕事のAIパートナー
remioでもっと仕事が進む

計画・作成・仕上げまで
すべてをひとつに

bottom of page