top of page

Z.ai、GLM-5.3を発表するも、そのサイバー能力がコーディングでの勝利を複雑にする

Z.aiは、コーディング性能を強化したGLM-5.3を発表したが、そのサイバー能力を理由に、ダウンロード可能なモデル重みの公開を2週間延期した。この対立により、中国の開発企業は、単なるコーディングベンチマークを超える理由でGoogle Newsに登場することとなった。

今回のリリースでGLM-5.3は、長時間にわたるソフトウェアエンジニアリング作業のために設計されたモデルとして提示されている。Z.aiはまた、脆弱性の発見や悪用を扱うタスクを実践させるため、管理されたサイバーセキュリティ環境で同モデルを訓練した。同社によれば、その結果として得られた能力は、ポストトレーニング段階で予想を上回る進展を見せたという。

この結果が、中心的な緊張関係を生んでいる。Z.aiは、AnthropicやOpenAIのクローズドシステムと競争できるオープンなコーディングモデルとして、開発者に評価されたい考えだ。しかし、最も重大な能力であるがゆえに、無制限の公開を正当化することはより難しくなる。

クローズドモデルの提供企業は、リクエストを監視し、ユーザーをブロックし、安全対策を更新し、アクセスを取り消すことができる。オープンウェイトの公開では、誰でもモデルの振る舞いを形作るパラメータをダウンロードし、改変できる。そうしたファイルが拡散すれば、Z.aiは同じような管理を適用できない。

したがって今回の発表は、単なるモデル更新ではない。オープンな配布が、最先端のサイバー能力と直面しても成り立つのかを問う、即時の試金石である。

GLM-5.3がGoogle Newsに登場した理由

注目すべきなのは、Z.aiが別のコーディングモデルを公開したこと自体ではない。サイバーリスクを理由に、同社がモデルへのアクセスと重みの配布を分離したことだ。

Z.aiは2026年8月14日にGLM-5.3を発表した。モデルは管理されたサービスを通じて利用可能になった一方、同社は公開重みのリリースを2週間延期した。Axios coverageによると、Z.aiはその期間を安全対策の試験と強化に充てている。

モデル重みとは、訓練中に作成される学習済みの数値パラメータだ。これを公開すれば、開発者はモデルを非公開で実行し、その挙動を検証し、安全対策を変更できる。

Z.aiはこれまで、オープンな提供と開発者による制御を軸にGLMファミリーを位置付けてきた。過去のGLMリリースはローカルデプロイメントやコーディング環境との統合をサポートしている。たとえばGLM-5はMITライセンスで公開され、複数の推論フレームワークをサポートした。

GLM-5.3は、このパターンを複雑にしている。開発者は新モデルを利用できるが、オープンウェイトの公開を後戻りしにくくする要素を、すぐには手にできない。

Z.aiはまた、選定されたセキュリティパートナーに対して段階的なアクセスを設けている。これらの組織は、無制限の配布が始まる前に、管理された環境でGLM-5.3をテストできる。このアプローチは、防御側に早期アクセスを提供しながら、同じ能力を未知の利用者へ直ちに渡すことを避けるものだ。

同社のサイバー分野での結果は、この慎重さを説明する。Z.aiは、既知のソフトウェア脆弱性の発見を対象にしたベンチマークCyberGymで84.5%を記録したと報告している。同社によれば、GLM-5.3は同テストで比較対象に含めた他システムを上回った。

同社はExploitBenchで54.4%という結果も報告している。このベンチマークは、モデルが実際の脆弱性を推論し、機能するエクスプロイトを構築できるかを検証するものだ。報告によれば、Z.aiがテストした範囲では、GLM-5.3を上回ったのは2つのクローズドな最先端システムだけだった。

これらの数値は、依然として企業自身が報告した結果である。独立した評価者は、同一のプロンプト、ツール、トークン上限、エージェント構成の下で、GLM-5.3の完全な評価をまだ再現していない。

この留保は重要だ。サイバーベンチマークは基盤モデルだけでなく、周辺のエージェント、利用可能なツール、再試行ポリシー、評価ハーネスも測定している。それらは結果に実質的な影響を及ぼしうる。

それでも、重みの公開を延期したことは、マーケティング用のグラフだけでは得られない重みを、Z.ai自身の懸念に与えている。開発企業は、その能力には追加の管理が必要だと考えているかのように行動している。

この判断により、コーディングモデルの発表はより大きな政策上の論点となった。また、同モデルが専門フォーラムを越えて広がり、Google Newsのテクノロジー報道に登場した理由でもある。

コーディングモデルがセキュリティモデルになった

GLM-5.3は、コーディング能力が、防御と攻撃の明確な境界なしに攻撃的セキュリティへと及びうることを示している。

現代のコーディングエージェントは、関数を生成するだけではない。リポジトリを調査し、ターミナルを操作し、テストを実行し、障害を追跡し、多数のステップにわたってファイルを改訂する。

同じ能力は、正当な脆弱性研究も支える。セキュリティエージェントは、未知のコードを読み、安全でない挙動を見つけ、仮説を検証し、欠陥が悪用可能かを判断しなければならない。

この重なりは構造的なものだ。両方のタスクで、通常とは異なる条件下でプログラムがどう振る舞うかを理解する必要があるため、ソフトウェア推論が向上すれば、保守能力と攻撃能力の双方が改善する。

Z.aiは特に、管理された実行可能な環境でサイバーセキュリティ作業を通じてGLM-5.3を訓練した。こうした環境では、モデルがタスクを試行し、稼働中のシステムから具体的なフィードバックを受けられる。

この手法は、静的な説明だけで教える方法とは異なる。実行可能な環境は、コマンドが成功したか、クラッシュが発生したか、エクスプロイトが標的に到達したかをモデルに伝える。

こうした結果からの強化学習は、多段階の挙動を改善しうる。モデルは脆弱性を説明するだけでなく、機能する経路を見つけるまでテストを続けることも学ぶ。

Z.aiは、最も大きなサイバー能力の向上を創発的なものと表現している。この文脈での「創発的」とは、最終的な挙動が訓練目標から予測される範囲を超えたことを意味する。サイバー訓練なしにモデルがその能力を身につけた、という意味ではない。

この区別は、過度な解釈を防ぐ。GLM-5.3は、無関係なオフィスタスクを学ぶうちに自発的にハッカーになったわけではない。Z.aiは意図的に、脆弱性研究と実行可能なサイバー課題に同モデルを触れさせた。

同社の説明によれば、驚きだったのは、その能力が示した規模と汎用性だ。発見が実際の行動へと変わる、悪用の連鎖のより先の段階まで性能が向上した。

この進展は重要である。不審なコードパターンを見つけることは有用だが、セキュリティチームにはすでに多くの静的解析ツールがある。信頼できるエクスプロイトを作るには、メモリ、状態、権限、システムの挙動に関するより深い推論が必要となる。

能力の高いモデルは、このプロセスを多数のリポジトリで繰り返すこともできる。モデルがまったく新しい攻撃手法を発見しなくても、自動化は経済性を変える。

同じ規模は防御側にも利益をもたらす。保守担当者は、すべての依存関係を調べ、すべての報告を再現し、攻撃者が対応する前にパッチを用意するだけの専門家を十分に確保できないことが多い。

Z.aiはOpenVulnを導入した。これは、オープンソースの保守担当者が防御目的のスキャンのために公開リポジトリを提出できるプログラムだ。初期のOpenVuln serviceは、モデルのセキュリティ能力を活用する実用的な場を提供している。

このサービスは、GLM-5.3に関するZ.aiの望ましい解釈を裏付ける助けにもなる。同社は、無制限のモデルアクセスが悪用の可能性がある利用者に届く前に、脆弱性の発見が保守担当者に届くことを望んでいる。

しかし、意図はモデル重みとともに移動しない。ダウンロード可能なモデルは、所有するソフトウェアをテストする保守担当者と、公開されたサーバーを標的にする侵入者とを、確実に区別できない。

ここで、コーディングにおける勝利はガバナンス上の問題となる。このモデルの有用性は、防御と攻撃のカテゴリーに明確に分けられない能力に依存している。

オープンモデルがサイバー分野の差を縮めている

GLM-5.3は、多くの安全計画が想定したよりも速く、オープンウェイトシステムがクローズドモデルのサイバー性能に近づいていることを示し、クローズドな研究機関に圧力をかけている。

英国のAI Security Instituteは最近、今回のリリースの前身にあたるGLM-5.2を評価した。その調査結果は、Z.aiによる新たなベンチマークの主張より前の、独立した文脈を提供している。

同研究所は、GLM-5.2が、4カ月前に公開された主要なクローズドモデルと、限定的なサイバータスクで同程度の性能を示したと明らかにした。これらのタスクは、悪用、リバースエンジニアリング、暗号技術、脆弱性研究を対象としていた。

より長時間のサイバーレンジでは、GLM-5.2の性能は、約7カ月前に公開されたクローズドモデルに近かった。サイバーレンジとは、多段階の攻撃テスト向けに設計されたシミュレーションネットワークである。

同研究所は、主要なオープンモデルが、クローズドモデルのサイバー最前線から4〜7カ月遅れていると結論づけた。2025年の大半では、測定された差は6〜10カ月だった。

この変化は、単一のリーダーボード順位より重要だ。類似の能力がダウンロード可能となり、非公開でデプロイできるようになるまでの準備期間が、クローズドな開発企業にとって縮小していることを示唆する。

AISI evaluationは、ローカルアクセスが防御側にとって魅力的な理由も説明している。組織は、機密コード、認証情報、インシデントデータを自らのインフラ内に保持できる。

ローカルモデルは、外部の提供企業によって密かに変更されたり、提供終了になったりしない。セキュリティチームは、プライベートなコードベースや専門的な社内ツールに適応させることもできる。

実際のインシデントは、その価値を実証した。Hugging Faceは、自律型エージェントシステムが関与した侵入の調査でGLM-5.2を使用したと述べている。

同社によると、複数の最先端サービスは、安全フィルターがその作業を有害と解釈したため、マルウェアおよびインシデント対応に関するリクエストを拒否した。そこでHugging Faceは、攻撃を調査するためにGLM-5.2をローカルで実行した。

この事例は、オープンモデルがインシデント対応において常に優れていることを示すものではない。一方で、時間制約のある調査の最中に、提供企業が管理する拒否が正当な防御作業を妨げうることを示している。

この問題は、Z.aiに説得力のある主張を与える。防御側には、リクエストにエクスプロイトコード、盗まれた認証情報、攻撃者のインフラが含まれる場合でも利用可能であり続ける、高性能なモデルが必要だ。

OpenAIも、クローズド側から同じデュアルユースの緊張関係を認めている。GPT-5.3-Codexの発表では、同社のPreparedness Frameworkに基づく最高水準のサイバーセキュリティ保護措置が有効化された。

OpenAIは、このモデルが高能力のしきい値を超えたという決定的な証拠はなかったと説明した。それでも、その可能性を排除できなかったため、この分類を採用した。

関連するsystem cardは、防御側のアクセスを維持しながら悪意ある行為者を妨げることを意図した、多層的な安全システムを説明している。この仕組みは、OpenAIがサービスを管理していることに依存する。

Z.aiは、GLM-5.3の重みを公開した後、その管理の多くを失うことになる。ユーザーは拒否行動を削除し、システムプロンプトを変更し、ネットワーク監視なしでモデルを実行できる。

そのためAnthropicとOpenAIは、二方向から圧力を受ける。正当な防御側のアクセスを改善しつつ、オープンモデルなら回避可能な制限を維持しなければならない。

オープンな開発企業は、逆の圧力に直面する。無制限の公開を自動的に善とみなすことなく、ローカルデプロイメントの実用的な利点を維持しなければならない。

GLM-5.3は、両方のアプローチを精査の対象にしている。クローズドシステムは制限を正当化する必要があり、オープンシステムは取り消し不可能な配布を考慮しなければならない。

オープンな盾に取り消しボタンはない

Z.aiにとって公開を支持する最も強い論拠は、同時に最も難しい安全上の問題でもある。防御側と攻撃側は、同じ適応可能なモデルを受け取る。

同社はGLM-5.3を、オープンなソフトウェア世界のためのオープンな盾として位置付けた。この表現は、サイバーセキュリティにおける現実の不均衡を捉えている。

オープンソースプロジェクトは、コードを検査、変更、共同作業のために公開している。攻撃者はそのコードを継続的に研究できる一方、多くのメンテナーは限られた時間と小規模なセキュリティ予算で対応している。

メンテナーに自動化されたレビュアーを提供すれば、この均衡を改善できる。モデルは古いコンポーネントを探索し、クラッシュを再現し、パッチを比較し、修正対応の優先順位付けを支援できる。

Z.aiの脆弱性開示台帳によると、同社のGLMシステムは269件のオープンソースプロジェクトで2,436件の脆弱性を特定したという。同社はそのうち1,097件を重大度がCriticalまたはHighに分類している。

この台帳が公開された時点で、一般に開示されていた項目は53件にとどまった。残る2,383件は未開示として掲載されており、主張全体を外部から評価するには限界がある。

台帳によると、脆弱性はソフトウェア史の45年にまたがる。同社は発見までの平均遅延を26.6年と報告し、Linux kernelのようなプロジェクトも含まれるとしている。

これらの数値は防御面で具体的な根拠を示す一方、慎重に読む必要もある。企業が管理する台帳は、個々の検出結果すべてについて独立した確認が得られたことと同義ではない。

重大度の分類はベンダーレビュー後に変わり得る。報告された欠陥の一部は既知の発見と重複していたり、特殊な設定に依存していたり、初期分析が示唆したほど悪用しやすくない可能性がある。

公表済みのサブセットが小さいことは、検証上の空白を生む。研究者は掲載された公開事例を調べられるが、完全な集合を監査したり、Z.aiの集計値を再現したりすることはまだできない。

ベンチマーク結果にも同様の制約がある。CyberGymは既知の脆弱性をテストするため、一貫した採点を支える一方で、ベンチマーク関連パターンへの露出という可能性を生む。

ExploitBenchは実践的な悪用により近い。それでも、制御されたタスクは、監視、認証、能動的な防御者が存在する、保守された本番環境への攻撃とは異なる。

英国の研究機関も、自らの研究でこの制約を明示している。同機関のサイバーレンジは、能動的対応ツールやアラート発報に対するペナルティを含め、防御の堅いネットワークに存在する一部の保護を省いている。

したがって、実験室での性能が現実世界での侵入成功に直接結び付くわけではない。ただし、それは侵入を可能にする各段階での能力が高まっていることを示している。

2週間の延期では、この根本的な問題は解決できない。Z.aiにとっては、テストの実施、開示の調整、拒否挙動の改善、選定した防御側の準備に時間を与える。

重みが公開されれば、これらの保護は任意のものになる。強い意志を持つ運用者はモデルをファインチューニングし、安全挙動を取り除き、隔離されたインフラで展開できる。

無制限に配布された後は、アクセス階層も機能しなくなる。本人確認と利用監視が適用されるのは、Z.aiがエンドポイントを管理している間だけだ。

これは一時的なローンチ上の問題ではなく、決定的なトレードオフである。オープンウェイトの能力は、責任ある利用者に永続的なアクセスをもたらすと同時に、悪意ある利用者にも永続的なアクセスを与える。

Z.aiがリリースを遅らせることでこの問題を認めた点は評価に値する。しかし、この延期は、従来のオープンソースに関する前提がすべてのモデルに当てはまらなくなったことも示している。

ソフトウェアライブラリは、人間が記した命令を公開する。最先端モデルは、未知の標的に対して探索、推論、適応、ツール操作を行える再利用可能な能力を公開する。

これらの成果物を同一視することは、運用上の違いを見落としている。有能なモデルは専門知識を圧縮し、それを機械の速度で繰り返せる。

したがって、セキュリティ上の問いは、オープンであることが良いか悪いかではない。特定の能力を、後から回収できないリスクを生まずに配布できるかどうかである。

ベンチマークでの首位にも独立検証が必要

GLM-5.3の報告スコアは注目に値するが、ソフトウェアエンジニアリングや実際の侵入における信頼できる優位性を、まだ確立してはいない。

コーディングベンチマークは、複雑な挙動を比較可能な数値に還元するため、モデルのローンチにおいて中心的な存在となっている。一方で、設定の選択にはかなりの余地が残る。

エージェントベンチマークは通常、モデルとスキャフォールドを組み合わせる。スキャフォールドは、モデルがファイルを読む方法、ツールを呼び出す方法、コンテキストを保存する方法、失敗を再試行する方法、回答を提出する方法を決定する。

より強力なスキャフォールドは、基礎パラメータを変えずにモデルのスコアを引き上げられる。トークン予算や推論設定の違いも、別の大きな差を生み得る。

コンタミネーションは別の懸念事項である。モデルは学習中に、ベンチマークのコード、関連する修正、または公開討論に触れていた可能性がある。

メンテナーは、より新しいタスクや非公開テストによってこのリスクを減らそうとしている。公開ベンチマークであっても、未知の非公開リポジトリがもたらす不確実性を完全に再現することはできない。

したがってGLM-5.3は、複数のハーネスにまたがる再現可能な評価で判断されるべきだ。評価者は、プロンプト、ツール権限、再試行ルール、リソース制限を公開する必要がある。

また、このモデルは学習カットオフ後に新たに作られた脆弱性でもテストする必要がある。そこで成功すれば、転用可能なセキュリティ推論を学習したという、より強い証拠になる。

実際のエンジニアリング作業には、さらに別の基準が加わる。開発者が必要とするのは、ローカルの慣習に従い、無関係な挙動を維持し、保守可能なテストを書き、リスクの高い変更を説明できるモデルだ。

狭いテストに合格するパッチでも、回帰を導入する可能性がある。脆弱性レポートも、動作する再現手順がなければ、限られたメンテナーの時間を浪費しかねない。

大規模運用では、偽陽性のコストが特に高くなる。何百ものリポジトリをスキャンするエージェントは、ほとんどの検出結果がもっともらしく見えても、チームを圧倒する可能性がある。

GLM-5インフラにおけるZ.aiの以前の経験も、別の注意点を示している。同社は、高並行性かつ長コンテキストのコーディングワークロードで、まれに文字化け出力、反復、異常な文字生成が発生したと報告している。

Z.aiはこれらの事象を、モデル自体ではなく、提供インフラにおける低レベルの競合状態に起因するとした。この出来事は、展開品質が見かけ上のモデル信頼性に影響し得ることを示している。

GLM-5.3のセキュリティ用途は、周辺システムにさらに大きな要求を課す。長期の調査には、安定したコンテキスト、決定論的なツール運用、信頼できないコードの慎重な隔離が必要だ。

企業は、モデル評価と本番環境での認可も分けるべきである。有能なコーディングエージェントに、デプロイメントキー、顧客データベース、無制限のネットワークツールへのアクセスを自動的に与えるべきではない。

脆弱性開示には、人間によるレビューが引き続き不可欠だ。セキュリティチームは影響を検証し、メンテナーと調整し、パッチが利用者に届く前に悪用可能な詳細を公開しないようにしなければならない。

モデルがオープンであることは、こうした責任をなくすものではない。それらの多くをプロバイダーから、重みを展開する側へ移すだけである。

これが、Google Newsのフレーミングが重要な問いを見えにくくし得る理由だ。見出しではGLM-5.3が別のモデルを上回ったと報じられるかもしれないが、購入者が必要とするのは信頼性と統制に関する証拠である。

独立したレッドチームは、拒否機構の除去、ツール権限の昇格、プロンプトインジェクション、データ抽出、自律的な持続性をテストすべきだ。これらの挙動は、リーダーボードでわずかに上回ることより重要である。

Z.aiは、評価ハーネスと詳細なシステム文書を公開することで、自らの主張を強化できる。第三者による再現は、同社のベンチマーク主張を防御側にとってより有用なものにするだろう。

それまでは、最も公正な結論は限定的なものにとどまる。Z.aiの結果とリリース時の予防措置に基づけば、GLM-5.3は非常に高い能力を持つコーディングおよびサイバーモデルに見える。

この結論が支持するのは、確信ではなく精査である。このモデルは真剣な評価に値するが、無条件の信頼を得たわけではない。

2週間の期間中に注視すべきこと

今後2週間で、Z.aiの延期が持続可能な安全プロセスを意味するのか、それとも不可逆的な配布前の短い停止にすぎないのかが明らかになる。

最初のシグナルは、最終的な重みのリリースである。Z.aiは、ファイルが予定通り提供されるのか、どのライセンスの下で提供されるのか、どのような文書化済みの保護策が付くのかを説明すべきだ。

発表された期間を超える延期は、テストで未解決の懸念が見つかったことを示すだろう。変更なしのリリースは、リリース後の統制が限定的であっても、Z.aiが自らの緩和策を十分だと判断していることを示唆する。

ライセンスは技術的な現実ほど重要ではないが、正当な導入のあり方には影響する。利用制限は準拠する組織の指針になり得るものの、オフラインでの悪用を物理的に止めることはできない。

2つ目のシグナルは、サイバー分野の結果を独立して再現できるかどうかである。研究者は開示された設定の下でCyberGymとExploitBenchを再実行し、複数のエージェントスキャフォールドでGLM-5.3を比較すべきだ。

新規脆弱性のテストはさらに有益である。モデルが既知のタスクや馴染みのあるソフトウェアパターンを超えて一般化できるかを示すからだ。

研究者は、集計スコアと併せて失敗モードも報告すべきである。不安定に成功するモデルは、エンドツーエンドの悪用を一貫して完了するモデルとは異なる運用リスクをもたらす可能性がある。

3つ目のシグナルは、防御プログラムから得られる証拠だ。OpenVulnには、検証済みの発見、メンテナーの応答、調整された開示、測定可能なパッチ結果が必要である。

Z.aiの台帳上の件数が増えても、それだけでは問題の決着にはならない。より強い証拠は、メンテナーが有用な報告を確認し、修正を出荷することから得られる。

これらのシグナルは、Z.aiのオープンシールド論を補強するか、弱めるかのいずれかになる。検証済みの発見と責任ある開示は、リソースの乏しいプロジェクトにとって意味のある価値を示すだろう。

再現されないベンチマーク、ノイズの多い報告、または安全でない公開は、その根拠を弱める。ローンチがガバナンスプロセスより速く進んだことを示唆するからだ。

競合他社の動向にも注目する価値があるが、補助的な文脈にとどめるべきだ。クローズドなプロバイダーは、インシデント対応中にユーザーがガードレールによるブロックを受け続ける場合、防御的アクセスプログラムを調整する可能性がある。

政府は同じ証拠を別の観点から注視するだろう。オープンとクローズドのサイバーモデルの差が縮まることで、政策立案者に残された、標的を絞ったルールを整備する時間は少なくなる。

広範な制限は、正当な研究や私的な展開を損ない得る。何もしなければ、監視なしに変更・運用できるモデルに対して組織が備えられないままとなる。

最も有用な対応は、セキュリティの基本から始まる。組織は露出したシステムにパッチを適用し、認証情報を制限し、ネットワークを分割し、エージェントの行動を記録し、インシデント対応を演習すべきだ。

GLM-5.3を評価するチームは、すべてのプロンプト、ツール呼び出し、ファイル変更、外部接続を保存すべきである。その記録は品質レビューとセキュリティ調査の両方を支える。

開発者は、価値あるインフラに接続する前に、使い捨て可能な環境内でモデルをテストすべきだ。運用者の意図が防御的であっても、能力は認可と同義ではない。

Google Newsを追う読者は、次のベンチマーク見出しの先を見るべきだ。決定的な証拠は、GLM-5.3が制御不能な運用リスクを生まずに、検証済みの修正を生み出せるかどうかにある。

Z.aiは延期を通じて、すでに重要な認識を示した。最先端のコーディングと最先端のサイバー作業は、対立する両側から見た同じ技術的問題になりつつある。

次の段階は、評価者、メンテナー、セキュリティチームに委ねられている。主張をテストし、失敗を文書化し、重みが恒久的な公共インフラになる前に、どの統制が必要かを判断すべきだ。

 
 

無料で始めましょう

ローカルファーストのパーソナル知識管理付きAIアシスタント

より良いAI体験のために、

remio は現在、 Windows 10+ (x64)M-Chip Mac のみをサポートしています。

仕事のAIパートナー
remioでもっと仕事が進む

計画・作成・仕上げまで
すべてをひとつに

bottom of page