top of page

Z.ai、CyberGymでGLM-5.3がAnthropicのMythos 5を上回ったと主張

Z.aiによると、GLM-5.3はCyberGymで84.5%を記録し、アクセスが制限されたAnthropicのMythos 5を0.7ポイント上回った。この結果は、最も高性能なサイバーセキュリティAIを誰が管理するのかというAnthropicをめぐるTechmemeの論調を複雑にする。

この比較は、限定的なベンチマーク競争以上の意味を持つ。Z.aiは2週間の安全対策上の延期を経て、GLM-5.3をオープンウェイトモデルとして公開する計画だ。ただし、最も機微なサイバーセキュリティ機能は、認証済みユーザーと選定されたセキュリティパートナーに限定される。

この構造により、Z.aiは2つの相反する配布モデルの間に位置する。オープンウェイトは、組織が自らのインフラ上でソフトウェアを検証、改変、実行できるようにする。一方、認証済みアクセスは、防御的研究と攻撃的活動の双方を支援し得る高度な機能について、開発元に一定の管理権限を与える。

AnthropicはMythos 5で、後者のアプローチをより中央集権的に採用した。同モデルはウェイトの一般公開ではなく、信頼済みアクセスプログラムを通じて提供される。Z.aiは今、オープンモデルでも最高水準に近いサイバー能力に到達しつつ、最もリスクの高い層には統制を維持できると主張している。

このベンチマークだけで、どちらの企業のモデルが優れているかは決まらない。しかし、開発者、セキュリティチーム、政策立案者にとって、より鋭い問いを提示する。作成者が回収できないソフトウェアに、最前線に近いサイバー能力が搭載されたとき、何が起きるのか。

GLM-5.3、ベンチマークでの優位をアクセスの試金石へ

重要なのは、GLM-5.3が単に高いスコアを記録したことではない。Z.aiは最前線に近いサイバー性能を、オープンウェイトへと至る道筋と組み合わせている。

Z.aiのGLM-5.3リリースによると、同モデルはCyberGymで84.5%に達した。AnthropicはMythos 5について83.8%を報告している。0.7ポイントの差は小さいが、配布計画には顕著な違いがある。

CyberGymは、AIエージェントが実際のソフトウェアにおける脆弱性を再現できるかを評価する。モデルには脆弱性の説明と関連するソースリポジトリが与えられる。対象コードを特定し、欠陥を発生させる入力を作成しなければならない。

元となるCyberGym研究には、188のソフトウェアプロジェクトから集めた1,507件の脆弱性が含まれる。この設計は、選択式のセキュリティテストより多くの情報を提供する。エージェントはソースコードをたどり、ツールを操作し、観測可能な結果を出すことを求められるからだ。

Z.aiの結果は、依然として同社が報告したベンチマーク上の主張にとどまる。公開された数値は、異なるエージェントフレームワーク、計算予算、プロンプト、セキュリティ環境でもGLM-5.3が同じ性能を再現することを示すものではない。

こうした変数は重要だ。研究者がツールハーネス、再試行回数の許容範囲、時間制限、ビルドシステムへのアクセスを変更すれば、モデルの性能は変わり得る。わずかな方法論上の違いでも、GLM-5.3とMythos 5の報告上の差を上回る可能性がある。

それでも、このスコアはZ.aiの従来の公開水準から大きく改善している。GLM-5.1は公開CyberGymリーダーボードで68.7%と記載されていた。その水準から84.5%への上昇が確認されれば、同社は最も強力な制限付きシステムに近づくことになる。

Z.aiによれば、GLM-5.3は実行可能な環境でのポストトレーニングによって改善された。そこではエージェントがコードをコンパイルし、テストを実行し、失敗を調査し、より長いタスク連鎖から学習できる。

このアプローチが重要なのは、より大規模なベースモデルを作ることだけに依存しないためだ。焦点を絞った学習、より優れた環境、長時間のエージェント実行により、既存のモデルファミリーから大幅に専門能力を引き出せることを示唆している。

同社は安全策を強化するため、公開ウェイトのリリースを2週間延期している。その期間中、選定されたセキュリティパートナーは管理環境で高度な機能にアクセスできる。

しかし、ウェイトが公開されれば、同社の直接的な影響力は変化する。Z.aiはホスト型サービス、パートナープログラム、公式ツールを管理できるが、別の場所で展開された改変コピーをすべて確実に管理することはできない。

このため、今回のリリースは単なるモデル更新ではなく、アクセスの試金石となる。同社は、ユーザーのローカルな管理権限と、最も機微とみなす機能をめぐる本人確認を両立させようとしている。

AnthropicをめぐるTechmeme比較が重要な理由

AnthropicをめぐるTechmeme比較は、卓越したサイバー能力を少数の米国モデルプロバイダーの内部に集中させ続けられるという考え方に圧力をかける。

報じられた項目がGLM-5.3をMythos 5と対比するのは、Anthropicが高度なサイバー機能を制限する最も明確な先例を作ったためだ。Mythos 5は、一般向けの通常のClaudeリリースではない。

AnthropicはMythos 5を、Fable 5と同じ基盤モデルから選定したサイバーセキュリティ上の安全策を外したものだと説明している。同社はその構成を、Project Glasswingおよび関連する信頼済みアクセスプログラムを通じ、承認された組織に提供している。

Fable 5は、機微なリクエストをリダイレクトまたは拒否できる分類器を備え、より幅広い市場に向けられている。Mythos 5は、追加の統制が必要だとAnthropicが考える能力への、より直接的なアクセスを審査済みの防御側に与える。

Mythos 5の発表でAnthropicは、同モデルを当初は少数のサイバー防御組織とインフラプロバイダーに提供すると述べた。同社はまた、アクセスをデータ保持および安全性監視の要件と結び付けている。

Z.aiは同様の考え方を適用しているが、同じ配布上の境界は採用していない。機微なサイバー機能にはゲートが設けられている一方、より広範なモデルはオープンウェイトとして公開される予定だ。

この違いは、Anthropicに2つの面から圧力をかける。第一に、オープンな代替モデルがベンチマーク性能に近づくなら、制限付きモデルがなお必要なのかと顧客は問える。第二に、同等の能力が別の場所に現れる場合、1社への制限に意味があるのかを政府は考慮しなければならない。

この比較はZ.aiにも圧力をかける。オープンウェイトの公開は、再現性、文書化、モデルの完全性、責任ある開示への期待を生む。独立研究者がモデルを検証・改変できるようになれば、企業はリーダーボード上の主張だけに頼ることはできない。

企業の購入者にとって、判断は生の精度を超える。制限付きサービスは、中央集権的な更新、監視、契約上の統制、明確な運用主体を提供する。セルフホスト型モデルは、データのローカリティ、カスタマイズ性、外部の拒否システムへの依存の少なさを提供する。

セキュリティチームには、両方の形の価値が必要だ。インシデント発生時には、マルウェアの分析、侵入経路の再構築、不審なコードの調査をモデルに依頼する必要があるかもしれない。こうした依頼は、汎用的な安全性分類器には有害な活動に似て見える場合がある。

過去のインシデントはその問題を示している。Hugging Faceは、最前線システムの安全制御がAI主導の侵入に関する調査を妨げたと述べた。その後、同社は分析支援のためGLM-5.2をローカルで実行したと、エージェント主導の侵害に関する報道は伝えている。

この例は、防御側が管理するモデルを求めるZ.aiの主張を後押しする。ただし、無制限のローカル展開が常により安全であることを示すものではない。インシデント対応チームを助けるのと同じ独立性が、攻撃者による監視回避にも役立ち得る。

したがって中心的な競争上の論点は、中国対米国ではない。安全性がモデルの管理、特定ツールへのアクセス管理、あるいは機微な環境でユーザーができることの管理の、どれに依存するのかという問題だ。

Anthropicはプロバイダー管理型アクセスにより大きな比重を置いている。Z.aiは、基盤モデルを無期限に非公開とせずとも、混合構造で高度な機能を保護できると賭けている。

オープンウェイトと認証済みサイバーセキュリティアクセスの交点

Z.aiの設計はモデルの可用性と運用上の許可を分けているが、ウェイトが同社のサーバーを離れた後、その分離を強制することは難しくなる。

オープンウェイトのソフトウェアは、学習中に得られた数値パラメータへのアクセスをユーザーに与える。通常、これらのウェイトはダウンロード、ホスティング、ファインチューニングを行い、独立したツールに接続できる。

これは、最も厳密な意味でのオープンソースソフトウェアとは異なる。ウェイト公開には、学習データ、完全な学習コード、モデルの再現に必要なすべての構成要素が含まれない場合がある。それでも、すべてのリクエストを元のプロバイダーへ送らずにモデルを運用できるため、実用上の利点は大きい。

認証済みアクセスは別の層に対応する。Z.aiは、ホスト型サイバー機能に本人確認を要求し、パートナー環境を制限し、活動を記録し、エクスプロイト志向のツールへのアクセスを制限できる。

課題は、外部グループが公開ウェイトの周囲に代替システムを構築した時点で始まる。公式のプロンプト層を置き換え、異なるツールを接続し、ホスト型の制限を外し、追加のエクスプロイトデータでモデルを学習させることができる。

Z.aiは、公開後には改変に対する管理を失うことを認めている。この認識は小さな免責事項ではなく、この方針を理解する上で中心的なものだ。

したがって同社のアプローチは、公開モデルとゲート付きサイバースタックの間に意味のある能力差があることに依存する。最も機微な性能に非公開ツール、データセット、学習コンポーネントが必要なら、認証済みアクセスには実用的な価値が残る。

公開ウェイトにすでに能力の大半が含まれている場合、外部開発者が欠けた層を再現する可能性がある。Z.aiの関与なしに、シェルアクセス、デバッガー、脆弱性データベース、ファザー、自動再試行システムを追加できる。

だからといって、この公開が定義上無責任になるわけではない。多くの防御組織は、保護されたネットワーク内で動作するモデルを必要としている。独自のソースコード、認証情報、インシデントの証跡を外部APIにアップロードすることはできない。

ローカル展開は、調査中の証拠保全にも役立つ。機微なデータが組織外へ流出したり、プロバイダーの保持ポリシーの対象になったりするリスクを低減する。

オープンなサイバーモデルを支持する最も強い論拠は、非対称性にある。攻撃者はすでに公開リポジトリを調査し、エクスプロイトコードを再利用し、偵察を自動化している。人員が限られるメンテナーは、すべての依存関係を調べたり、報告されたすべてのクラッシュを再現したりできないことが多い。

Z.aiはGLM-5.3を、そうしたメンテナーに同等の自動化を提供する手段として提示している。関連するOpenVulnプログラムでは、オープンソースプロジェクトがモデル支援によるセキュリティ分析のためにリポジトリを提出できる。

このサービスは、専門の研究チームを持たない防御側へ能力を振り向ける可能性がある。その価値は、誤検知率、開示慣行、再現性、そしてメンテナーが実行可能な修正指針を受け取れるかどうかに左右される。

同社は、より広範な脆弱性発見の実績も報告している。公開セキュリティ台帳には、収集済みの脆弱性が2,436件記載され、そのうち1,097件は重大または高深刻度に分類されている。

これらの数値はZ.ai独自の開示システムによるものだ。GLMモデルの貢献が独立して認められた発見の件数、ベンダーが確認した件数、モデルが無害な挙動を誤って特定した頻度は明らかにしていない。

それでも、この台帳は、一般的なセキュリティ専門性の主張よりも、外部の観察者が監査できる具体的な材料を提供する。公開脆弱性識別子、影響を受けるプロジェクト、開示日、パッチは、将来的により強固な評価を支え得る。

オープンウェイトと認証済み機能の混合モデルが成功するのは、その証拠が改善する場合に限られる。そうでなければ、「認証済みアクセス」は公式サービスを表すだけで、モデルの現実世界におけるリスクを表さないラベルになりかねない。

CyberGymのスコアは脅威全体を測るものではない

CyberGymで84.5%という結果は、脆弱性の再現能力が高いことを示すが、攻撃成功に必要なすべての段階を測定するものではない。

CyberGymは、エージェントにかなり明確な方向性を与える情報から始まる。このベンチマークでは脆弱性の説明と対応するソースリポジトリが提供される。エージェントはその後、既知の欠陥を引き起こす概念実証用の入力を作成しなければならない。

現実の攻撃者は、多くの場合さらに早い段階から始める。未知の標的を発見し、初期アクセスを得て、価値の高いシステムを特定し、検知を回避し、永続性を維持し、不慣れなネットワーク内を移動する必要があるかもしれない。

CyberGymで優れた成績を収めるモデルが、この一連の工程全体に自動的に熟達しているわけではない。それでも、人間のオペレーターが不足している文脈を提供すれば、実質的な攻撃的作業を高速化できる可能性はある。

このベンチマークは、クラッシュを引き起こすことと、意図された脆弱性を再現することも区別している。この違いは重要だ。クラッシュは何かが失敗したことを証明するにすぎず、エージェントが標的の欠陥を理解または悪用したことを示すものではない。

新しい評価システムに関する研究は、この隔たりをより明確にしている。ExploitGymは、単にバグを引き起こすのではなく、既知の脆弱性を不正なコード実行へと変換するようエージェントに求める。

ExploitGym benchmarkには、ユーザー空間ソフトウェア、ChromeのV8エンジン、Linuxカーネルにまたがる869件のタスクが含まれる。各タスクでは、脆弱なコードと、すでに欠陥を実証する入力が提供される。

エージェントは、その出発点を機能するエクスプロイトへと変換しなければならない。研究者らは、最新の防御機構が成功率を大幅に下げたと報告しているが、すべてのタスクで成功を排除したわけではない。

この評価では、モデルが意図された標的とは別の欠陥を通じてコード実行を達成する場合があることも確認された。この挙動は、単純な成功件数が誤解を招きうる理由を示している。

エージェントは、研究者が測定しようとした能力を示さずとも、ベンチマークのフラグを獲得する可能性がある。逆に、隣接する脆弱性の発見は、スコアリングを複雑にするとしても、価値あるセキュリティ作業を意味しうる。

時間と計算予算も、別の不確実性を加える。難しいタスクでは、より強力なエージェントは数時間にわたって改善を続ける一方、弱いシステムは早期に頭打ちになるかもしれない。

GLM-5.3とMythos 5の比較に意味があるのは、両者に同等のツール、予算、指示、再試行の機会が与えられる場合に限られる。公開された要約では、その同等性を確認するのに十分な詳細が必ずしも示されていない。

したがって独立した再現では、最終的な割合以上に注目すべきだ。研究者には、モデルのバージョン、エージェントフレームワーク、タスクのサブセット、実行環境、ツール権限、推論設定、スコアリング手法が必要となる。

汚染についても検証すべきだ。CyberGymは過去の脆弱性と公開リポジトリを用いるため、関連する詳細が学習データに含まれていた可能性がある。

モデルが記憶した情報を動作する概念実証へ変換するには、なお相当な推論が必要かもしれない。しかし、汚染によって結果が実際より汎用的に見える可能性がある。

新たな脆弱性と非公開テストセットは、より強固な測定を提供するだろう。評価者は、モデルが欠陥のない場所で脆弱性を捏造するかを確認するため、修正済みおよび非脆弱なコントロールも追加できる。

運用上の安全性には、別のテスト群が必要となる。研究者は、モデルがスコープを守るか、リスクを特定した後に停止するか、機密情報を保護するか、有用な修正手順を提示するかを測定すべきだ。

より多くのバグを見つけても、認証情報を露出させたりテストシステムを損傷させたりするモデルは、防御側に新たなコストを生む可能性がある。ベンチマーク精度だけでは、このトレードオフを捉えられない。

したがって84.5%という主張は、警告として読むべきだ。これは、オープンモデルが真剣な検証に値する能力の閾値に近づいていることを示唆する。しかし、GLM-5.3が最高のサイバーモデル、あるいは最も危険なモデルであることを証明するものではない。

真の競争は能力と統制の間にある

GLM-5.3はサイバーセキュリティAIを配布の問題へと変える。防御の到達範囲が広がるほど、この技術を別用途に転用できる人も増える。

これが本記事の中心的なトレードオフだ。有用なセキュリティモデルは、脆弱なコードを理解し、エクスプロイトについて推論し、ツールを操作できなければならない。その同じ能力が攻撃的作業を加速させうる。

中央集権型のプロバイダーは、本人確認、リクエスト分類器、監視、保存ポリシー、アカウント執行を通じてこのリスクを管理する。ユーザーがポリシーに違反した場合や、新たな証拠によってリスク評価が変わった場合には、アクセスを無効化できる。

こうした統制には限界がある。分類器は、正当なマルウェア分析、インシデント対応、エクスプロイト検証を遮断する可能性がある。リモートサービスは危機の最中に利用できない場合もあり、機密性の高い証拠には不向きなこともある。

オープンウェイトは、こうした問題の一部を解決する。防御側は保護されたネットワーク内でモデルを稼働させ、独自システム向けに調整し、ログや機密コードに対する直接の統制を維持できる。

一方で、開発者が介入する能力は弱まる。改変されたモデルは、本人確認、利用監視、中央で維持される安全対策なしに動作できる。

この対立は、より広範な配布方針が異なるにもかかわらず、Z.aiとAnthropicが信頼されたアクセスプログラムへ収束している理由を説明する。両社とも、一部のサイバー機能には通常のコーディング支援以上の精査が必要だと認識している。

Anthropicのモデルは中央統制から始まり、より深いアクセスを選択的に許可する。Z.aiは計画されたウェイト提供から始まり、選定された機能と環境の周辺で統制を維持しようとしている。

どちらのアプローチも悪用を排除するものではない。プロバイダー管理型モデルは、ジェイルブレイクされたり、侵害されたアカウント経由でアクセスされたり、能力抽出によって複製されたりしうる。オープンモデルは、ファインチューニング、組み合わせ、匿名での展開が可能だ。

重要な政策課題は、モデルが単独でオープンかクローズドかではない。政策立案者は、その周辺にある完全なシステムを検討する必要がある。

このシステムには、利用可能なツール、自律的なランタイム、ネットワークアクセス、脆弱性データ、計算予算、ログ、人間によるレビュー、生成されたコードを実行する能力が含まれる。

テキストしか生成しないモデルがもたらす即時のリスクは、同じモデルがスキャナー、デバッガー、ブラウザー、クラウド認証情報、永続エージェントに接続された場合とは異なる。

この区別は、企業にとってより実用的な安全性の目標も与える。類似の情報が公開リポジトリやセキュリティ研究全体に存在する以上、モデルの知識を制限するのは難しい。

高リスクな実行環境を制御する方が、より測定可能である可能性がある。プロバイダーは、エクスプロイトハーネスへのアクセスを制限し、標的を隔離し、認可を要求し、機微な操作の監査証跡を保存できる。

オープンな展開は依然としてこのモデルを複雑にする。特に高性能なツールもオープンである場合、外部の利用者は独自の環境を構築できる。

答えは単一のグローバルルールからは得られない。大規模インフラプロバイダー、独立メンテナー、学術研究者、政府のセキュリティチームは、それぞれ異なる脅威と責任に直面している。

企業は、通常のコードレビューとエクスプロイト可能な自動化を分離することから始めるべきだ。前者は従来の開発者向け統制で運用できる。後者には、より厳格な本人確認、スコープ、ログ、承認要件が必要となる。

チームは、どのモデルがどのリポジトリを調査し、どのツールを使ったかの記録も維持すべきだ。AIが生成した発見は、開示または修正プロセスに入る前に再現可能でなければならない。

急速なモデル変化を追うナレッジワーカーにとって、検索可能なAI knowledge baseは、ベンチマーク手法、システムカード、ポリシー変更を保存する助けになる。この文脈は、見出しのスコアが重要な評価詳細を省く場合に重要となる。

anthropic techmemeという枠組みは、新たに生まれつつある競争を浮き彫りにするため有用だ。より深い競争は、単にGLM-5.3対Mythos 5ではない。分散された能力と、執行可能な統制との競争である。

GLM-5.3のリリース後に注目すべき点

Z.aiが防御可能なアクセスモデルを構築したのか、それともまもなく制限なしとなる能力の周囲に一時的なゲートを設けただけなのかは、3つのシグナルによって決まる。

第1のシグナルは、独立したベンチマーク再現だ。研究者は、Z.aiが報告したものと同じCyberGymタスク、エージェントフレームワーク、ツール権限、計算予算を用いて、公開されたGLM-5.3ウェイトをテストすべきだ。

84.5%に近い結果が再現されれば、オープンモデルがMythos級のサイバー性能に到達したという同社の主張は強化される。大幅な低下があれば、ホスト型システム、非公開ハーネス、あるいは評価設定が実質的に寄与していたことを示唆するだろう。

再現には、新しいタスクと非脆弱なコントロールを含めるべきだ。これにより、本物のコード推論を、記憶、ベンチマーク汚染、あるいはもっともらしいが誤ったエクスプロイト入力を生成する傾向から切り分ける助けになる。

第2のシグナルは、公開ウェイトと検証済みアクセスの能力差だ。Z.aiは、どの機能が引き続き制限されるのか、そしてなぜ公開モデルではそれらを容易に再現できないのかを説明する必要がある。

有用な開示では、ゲート付きツール、実行制限、監視、パートナーの適格性、エスカレーション手順を説明するべきだ。悪用を容易にする詳細を明らかにすべきではない。

独立開発者が機微なスタックをすぐに再構築できるなら、検証済みユーザー向けポリシーの実効性はほとんどない。それはZ.aiの公式サービスを統制する一方で、同等の展開を同社の統制外に残すことになる。

ゲート付き環境が実質的に強い結果を生むなら、ハイブリッドモデルの信頼性は高まる。オープンウェイトは日常的な防御作業を支援しつつ、最も高リスクな操作は監視されたシステム内にとどめられる。

第3のシグナルは、測定可能な防御側での導入だ。OpenVulnプログラムとZ.aiの脆弱性台帳は、その結果を追跡する初期の手段を提供する。

観測者は、報告された発見のうち、公開識別子、ベンダー確認、パッチを受ける件数を注視すべきだ。開示の質、重複率、偽陽性、メンテナーがモデル生成レポートを検証するのに必要な時間も調べるべきである。

確認済み修正の記録が増えれば、オープンなサイバー能力が防御側を強化するというZ.aiの主張を裏付けることになる。目に見える修正のない大規模な非公開在庫は、評価がより難しい。

規制当局の対応は、3つのシグナルすべてを形作る。特にウェイトが即座に国境を越えられる場合、政府は脆弱性の発見と悪用を自動化できるモデルへの懸念を強めている。

広範な制限は、開発をより不透明な経路へと押しやる可能性がある。弱い統制は、重要インフラを安価で拡張可能な自動化にさらすおそれがある。

より信頼できる枠組みは、実証された能力と運用上の文脈に焦点を当てるだろう。通常のローカルコード分析と、標的を自律的に悪用し、防御を回避し、ネットワークをまたいで動作するシステムを区別できる。

モデル開発者は、標準化された評価、インシデント報告、アクセス記録、そして安全性に関する主張が独立テストに耐える証拠を求められることを想定すべきだ。

セキュリティチームは、そのような標準を待つべきではない。隔離された環境でサイバーエージェントをテストし、認証情報を制限し、書面による認可を要求し、発見と悪用の間に人間を置くことができる。

修正品質についてもモデルを比較すべきだ。欠陥を見つけることは重要だが、安全なパッチ、回帰テスト、理解しやすい説明を作成する方が、防御にとってより大きな価値を生むことが多い。

GLM-5.3をめぐる当面の話題は、限定的なベンチマーク上の優位性だ。より大きなanthropic techmemeの論点は、高度なサイバー推論をめぐる独占性の喪失にある。

Anthropicはサービスとその配布を管理しているため、Mythos 5を制限できる。Z.aiは、より広く複製されたモデルが、元のエンドポイントに付随するあらゆるポリシーより長く存続しうるモデルを公開しようとしている。

それにより、次回リリースの重要性は0.7ポイントのスコア差を上回る。独立した検証結果、検証済みアクセス機能の差、そして確認済みの脆弱性修正が、Z.aiの妥協策が機能するかどうかを示すことになる。

開発者と企業の購買担当者は、このモデルを採用する前に一つの問いを投げかけるべきだ。モデル自体がもはや希少ではなくなった後も、自社の統制でエージェントのツールと行動を管理できるのか。

 
 

無料で始めましょう

ローカルファーストのパーソナル知識管理付きAIアシスタント

より良いAI体験のために、

remio は現在、 Windows 10+ (x64)M-Chip Mac のみをサポートしています。

仕事のAIパートナー
remioでもっと仕事が進む

計画・作成・仕上げまで
すべてをひとつに

bottom of page