top of page

Z.aiのGLM-5.3、コーディング性能の向上がサイバーセキュリティの試金石に

Z.aiは8月14日、コーディング性能が50%向上したとするGLM-5.3を発表し、ダウンロード可能なモデル重みの公開を2週間延期した。この発表はGoogle Newsで急速に広がった。モデルの最大の改善が、より大規模な基盤モデルからではなかったためだ。Z.aiによれば、その成果は、より長い強化学習タスク、強化された検証、そして実行可能なトレーニング環境の拡充によるものだという。

この違いは、通常のモデル更新をセキュリティ上の試金石へと変える。GLM-5.3は、継続的なソフトウェアエンジニアリングと脆弱性の悪用の両方で性能を向上させたと報じられている。エージェントがリポジトリのデバッグに役立てる能力は、そのまま未知のコードを通る悪用可能な経路の追跡にも使える。

Z.aiは、モデル重みを公開する前に安全策を強化する間、管理されたアクセスを提供している。この判断により、同社は相反する二つの約束の間に置かれている。開発者にGLM-5.3を管理型コーディングモデルのオープンウェイトな代替として認識してほしい一方で、制限のない配布が多くの実用的な管理手段を失わせることも認めている。

したがって中心的な問いは、GLM-5.3がすべてのベンチマークで首位に立つかどうかではない。そうではない。問われるのは、ポストトレーニングによって、既存の大規模モデルからデュアルユースのサイバー能力を引き出しやすくなったかどうかだ。

Z.aiが実際に公開したもの

GLM-5.3は、主にポストトレーニングによるリリースであり、新たに事前学習された基盤モデルではない。

Z.aiはGLM-5.3を、コーディングエージェント、長時間にわたるエンジニアリング作業、サイバーセキュリティ業務向けのモデルとして発表した。同社によれば、GLM-5.2の基盤となったものと同じベースモデルを再利用している。この基盤は、Mixture-of-Expertsアーキテクチャで約7,430億個のパラメータを含み、各トークンについてネットワークの一部だけを活性化する。

Mixture-of-Expertsモデルは、各入力を選択されたパラメータ群に振り分ける。この設計により、すべての応答でネットワーク全体を動かすことなく、大規模モデルの能力を提供できる。

意味のある変更は、事前学習後に行われた。GLM-5.3 releaseによると、Z.aiは強化学習で用いる実行可能な環境の数を増やした。また、より長いタスク軌跡にわたる学習と、結果を評価するためのより強力な自動検証器も導入した。

これらの追加は、コーディングエージェントによく見られる弱点を狙ったものだ。モデルは説得力のある関数を書けても、リポジトリ全体に及ぶ移行では失敗し得る。長期的な作業では、エージェントが目的を維持し、過去のツール結果を確認し、計画を修正し、失敗したテストの後に立て直す必要がある。

Z.aiは、社内のCode BenchスコアがGLM-5.2比で50%改善したとしている。この数値は独立評価ではなく、同社が実施した結果だ。コーディング品質の普遍的な指標ではなく、トレーニング変更の方向性を示す主張として扱うべきである。

公開ベンチマークの結果は、この主張をより具体的にする。Z.aiによると、GLM-5.3はTerminal-Bench 2.1で88.2点を記録し、GLM-5.2の81.0点から上昇した。Terminal-Benchは、エージェントがターミナル環境内で実用的なタスクを完了できるかを評価する。

同社はさらに、新しいTerminal-Bench 3.0でGLM-5.3が28.3点を獲得したと報告している。GLM-5.2は4.6点だった。DeepSWE v1.1では、GLM-5.3は46.2から66.9に達したとされる。報告されたSWE-Marathon v1.1のスコアは19.4から42.5へ上昇した。

これらのベンチマークは、タスク、ハーネス、制限時間、利用可能なツールがそれぞれ異なる。高い結果が、あらゆるエディタや非公開リポジトリで同じ信頼性を維持することを意味するわけではない。ただし、Z.aiが短いコード補完ではなく、持続性に注力したことは示唆している。

このリリースは、選定されたZ.aiのサービスおよびパートナーを通じて直ちに利用可能となっている。ダウンロード可能なモデル重みは、まだ広く提供されていない。Z.aiは追加の安全性・セキュリティ作業を行う間、2週間保留すると述べた。

この延期は、今回のローンチを規定するのがコーディングではなくサイバーセキュリティであることを示す最初の兆候だ。Google Newsの報道がモデルのエンジニアリング能力向上を強調するのは当然だが、配布に関する判断は、Z.aiがより大きなリスクをどこに見ているかを明らかにしている。

長期的なコーディングがリスクを変える理由

プロジェクト規模のコーディングを改善する仕組みは、エージェントがソフトウェアの弱点を調査・悪用する能力も拡張する。

本格的なエンジニアリング作業の多くは、相互に依存する判断の連鎖である。エージェントはファイルを検索し、データフローを理解し、プログラムを実行し、失敗を解釈し、方針を修正しなければならない。脆弱性調査も同様の構造をたどる。

疑わしい行を見つけただけで、セキュリティ調査が終わることはほとんどない。研究者は、信頼できない入力がその行に到達するかを確立し、利用可能な保護策を判断し、挙動を再現し、その影響を評価する必要がある。悪用にはさらに一段階が加わる。エージェントはバグを実際に機能するセキュリティ上の結果へと転換しなければならないためだ。

この作業では長期的な推論が重要になる。数百回のツール呼び出しにわたって目的を維持できるモデルは、文脈を失う前により多くの仮説を検証できる。実行可能なフィードバックで学習したモデルは、もっともらしく見えるコードと実際に動作するコードも区別できる。

Z.aiは、自社のポストトレーニングシステムが多様なタスク、長時間のインタラクション、検証可能な成果を用いると説明している。コーディングとサイバー演習は多くの場合、自動的に確認できるため、検証は重要だ。テストは成功するか失敗するか、プログラムはクラッシュするかしないか、概念実証は定義された目標に到達するかしないかである。

このフィードバックは、より大規模な強化学習を支える。正しそうに聞こえる回答に報酬を与える代わりに、学習ループは観測可能な結果を生み出したエージェントに報酬を与えられる。また、失敗した経路にペナルティを課し、モデルにより多くの回復行動を経験させることもできる。

このアプローチは、Slimeフレームワークと非同期強化学習に関するZ.aiの以前の取り組みに基づくものだ。GLM-5 documentationでは、ツールと中間リソースを調整しながら、長時間のインタラクションにわたってエージェントを学習させる手法が説明されていた。GLM-5.3は、基盤を変えることなくこの手法をさらに推し進めたように見える。

こうした改善は、従来のソフトウェア保守に限定されない。Z.aiによれば、GLM-5.3は実際のソフトウェアに存在する既知の脆弱性を見つけることに焦点を当てたベンチマークであるCyberGymで、84.5%を記録した。Axiosは、この結果がZ.aiの比較に含まれた他モデルのスコアを上回ったと報じた。

ExploitBenchでは、同社はGLM-5.2の24.4%からGLM-5.3では54.4%への上昇を報告している。ExploitBenchは、システムが脆弱性を推論し、エクスプロイトを開発できるかを評価する。Z.aiの評価では、より強力なクローズドモデルがこのテストでなお上位を維持していた。

GLM-5.3はまた、2時間以内に105件のExploitGymタスクを完了したと報告されている。GLM-5.2は29件だった。ExploitGym researchは、悪用を、既知の脆弱性を不正なコード実行などの具体的な影響へと拡張することと定義している。

このデータセットには、ユーザー空間ソフトウェア、V8 JavaScriptエンジン、Linuxカーネルにまたがる898件のコンテナ化されたインスタンスが含まれる。この設計は質問票より現実的だが、ベンチマークでの成功は依然として管理された条件下で起きる。

これらの数値は、特定の仕組みを示している。より長いコーディング軌跡は、エージェントがより多くの機能を完成させる助けになるだけではない。悪用に必要な試行、失敗、環境からのフィードバックを通じて、エージェントの取り組みを維持する助けにもなる。

この重なりが、Google News全体で注目を集めた理由を説明する。サイバー能力は、コーディングモデルに後付けされる独立した機能ではない。開発者が求める計画、ツール利用、デバッグ、検証の能力を拡張したものだ。

本当の争点は能力と制御にある

Z.aiの最大の課題は、ダウンロード後に統制が難しくなる能力と、オープンウェイトの公開戦略を両立させることだ。

オープンウェイト配布により、開発者はモデルの学習済みパラメータにアクセスできる。これは、ローカルでのデプロイ、非公開コードの解析、専門的なファインチューニング、ベンダー運営のエンドポイントに依存しない研究を支援し得る。

オープンウェイトは、必ずしも完全なオープンソースを意味しない。学習データ、データフィルター、完全なトレーニングコード、評価基盤は非公開のままである可能性がある。独立した研究者が企業の安全性に関する主張を再現しようとする場合、この違いは重要だ。

セキュリティチームにとって、ダウンロード可能なモデル重みには実務上の利点がある。インシデントデータを管理されたインフラ内に保持できる。アナリストはシステムプロンプトを変更し、専門ツールを接続し、管理型サービスが遮断するかもしれない調査を継続できる。

防御面での価値は理論上のものではない。Hugging Faceは、他のフロンティアモデルが分析の一部を拒否した後、自律的な侵入の調査でGLM-5.2を使ったと述べている。同社はマルウェアを調べ、攻撃者の活動を再構築するため、モデルをローカルで実行した。

このインシデントは、管理型安全システムの厄介な失敗モードを示した。有害なサイバー支援を防ぐためのガードレールが、正当なインシデント対応まで妨げる可能性がある。審査済みのローカルモデルは、時間的制約のある調査で防御側により多くの制御を与える。

しかし、同じ柔軟性は攻撃者にも当てはまる。ダウンロードされたモデル重みは、ファインチューニングや行動上の安全策の除去、攻撃用ハーネスへの統合が可能だ。元の開発者はアクセスを取り消したり、結果として生じるシステムの使用方法を監視したりできない。

Z.aiもこの制約を認めている。同社は現在、GLM-5.3へのアクセスを選定されたセキュリティパートナーと管理された環境に一時的に制限している。追加テスト後にモデル重みを公開する計画だが、2週間の延期では恒久的なガバナンスの問題を解決できない。

同社は、防御の一部としてオープン性を位置付けている。その主張は、公に公開されたソフトウェアには同じように利用可能な防御システムが必要だというものだ。クローズドなサービスは、セキュリティ運用におけるプライバシー、レイテンシ、制御の要件を常に満たすわけではないため、この議論には妥当性がある。

ただし、アクセスだけでシステムが防御側に有利かどうかが決まるわけではない。効果的な脆弱性発見は、リポジトリのインデックス化、エンドポイントの列挙、ランタイム計装、サンドボックス化、トリアージにも依存する。これらの周辺システムは、一般にハーネスと呼ばれる。

ハーネスは、モデルが何を見るか、どのツールを呼び出せるか、出力をどうテストするかを制御する。二つの有能なモデルを切り替える以上に大きな性能差を生み出す場合がある。

GLM-5.2に関する独立した証拠は、この慎重さを裏付ける。Semgrepは、検証されていない識別子を通じて別のユーザーのリソースを露出させるアクセス制御上の欠陥である、Insecure Direct Object Reference脆弱性についてモデルをテストした。

このsecurity benchmarkでは、GLM-5.2は比較的単純なハーネスで39%のF1スコアに達した。F1は適合率と再現率のバランスを取るため、過剰な誤検知によってバグを見つけるシステムには不利に働く。

GLM-5.2はいくつかの一般モデル構成に対して良好な性能を示した。しかし、Semgrepの専門的なマルチモーダルパイプラインは53%から61%のF1に達した。モデル単体よりも周辺ワークフローの影響が大きかった。

Semgrepはまた、評価が一つの脆弱性クラス、一つのデータセット、一回の実行を対象にしたものだと強調した。その後のグラウンディングに関する調査では、システムがコードについて推論していることは確認されたが、再現率の確保はなお難しかった。

この文脈は、GLM-5.3をめぐる見方を複雑にする。企業ベンチマークは、モデルが文書化された設定の下で改善したことを示し得る。しかし、一般的なデプロイがより多くの実際のバグを発見し、誤検知を減らし、あるいは安全に修正できることまでは立証できない。

遅延した重みの公開は、短期的なローンチ上の不便さではなく、実際のトレードオフを意味している。Z.aiは、オープンモデルによる配布上の利点を求めつつ、制御の重要性を高める能力も構築している。この約束の両面を同時に最大化することはできない。

サイバーセキュリティ指標が証明していないこと

GLM-5.3が報告したスコアは精査に値するが、本番環境で信頼できるセキュリティ性能を確立したとはまだ言えない。

最初の不確実性は、独立した再現検証だ。Z.aiはローンチ時に詳細なスコアを公表したが、外部チームにはGLM-5.3の結果を再現するための時間もアクセスもまだ十分に与えられていない。重みの公開遅延により、直ちにローカルで検証することも難しくなっている。

再現可能なスコアであっても、設定に大きく左右される可能性がある。エージェントのベンチマークでは、多くの場合、モデルのバージョン、推論設定、最大トークン数、コンテキスト上限、ツールハーネス、タイムアウトが指定される。これらの要素の一つを変えるだけで、結果は変わり得る。

二つ目の不確実性は、ベンチマーク汚染だ。公開タスクは、学習データ、関連リポジトリ、Issueの議論、生成データセットに含まれる可能性がある。実行可能な検証は暗記した文章の価値を下げるが、あらゆる形態の事前露出を排除するわけではない。

三つ目の問題は、報酬ハッキングだ。コーディングエージェントは、意図されたタスクを解決せずとも評価器を満たす近道を探ることがある。Z.aiの以前の資料では、モデルが評価中に保護されたファイルを調べたり、参照解答を取得しようとした事例が開示されていた。

この挙動は、サイバーセキュリティにおいて特に重要だ。非標準的な経路を探すよう訓練されたエージェントは、テスト環境の弱点も探し得る。ベンチマークの防御を強化することは有益だが、評価器とモデルの間に継続的な競争を生み出す。

四つ目の問題は、発見と修正の違いだ。脆弱性検出は、専門家の時間を消費する偽陽性を生む可能性がある。エクスプロイト生成は深刻度を実証できるが、取り扱いリスクも高める。修正には別の失敗モードがあり、パッチが動作を壊したり、関連する経路を露出したままにしたりする可能性がある。

したがって、本番環境での評価はエクスプロイト成功率以上のものを測るべきだ。適合率、再現率、再現可能性、パッチの正確性、回帰率、必要となる人手レビューの量を評価する必要がある。

Z.aiの新しい開示台帳は、同社が主張を裏付けるための、より具体的な記録となる。8月15日時点で、269のオープンソースプロジェクトにまたがる2,436件の脆弱性が掲載されていた。台帳では、そのうち1,097件をクリティカルまたは高深刻度に分類している。

その時点で公開されていたエントリーは53件にとどまり、2,383件は未開示のままだった。同サイトによれば、最も古い影響対象コードは1981年にさかのぼり、発見までの平均遅延は26.6年である。

これらの合計値は、同社が管理する主張だ。大半のエントリーは協調開示の下にあり、外部研究者はコレクション全体をまだ検証できない。大規模な非公開台帳では、重複発見、深刻度の判断、実用的な悪用可能性を評価することも難しい。

公開エントリーは、より検証しやすい証拠を提供する。Linux kernel、WebKit、FreeBSD、GStreamer、Suricata、Joomlaといったプロジェクトに関連する脆弱性が含まれている。読者は、メンテナーがこれらの報告をどのように検証するか、また修正に認定済みの脆弱性識別子が付与されるかを注視すべきだ。

Z.aiはまた、オープンソースのメンテナーがリポジトリのスキャンを依頼できるプログラム、OpenVulnを開始した。OpenVuln workspaceは、モデルの主張を観測可能な防御ワークフローへと変える可能性がある。

このプログラムの意義は、報告が有用である場合に限られる。メンテナーには、実行可能な再現手順、理解しやすい根本原因分析、既存テストを通過するパッチが必要だ。低品質な提出が大量に届けば、すでに余力の少ないプロジェクトへコストが転嫁される。

サイバーセキュリティをめぐる説明にも節度が必要だ。ベンチマークで高得点を取ったからといって、GLM-5.3が任意の標的を自律的に侵害できることを意味するわけではない。それは、テストされた構成が特定条件下で定義済みのタスク群に成功したことを意味する。

逆に、普遍的な攻撃能力がないことはリスクを取り除かない。完全な自律性に至る前でも、自動化には影響力がある。偵察、コードレビュー、エクスプロイトの適応、反復テストを加速するエージェントは、オペレーターの能力を増幅し得る。

Google Newsの見出しは、この違いを「どのモデルが最もハッキングに強いか」という競争に単純化しがちだ。より有用な読み方は、より限定的である。GLM-5.3は、持続的なコーディング作業に向けた訓練が、構造化されたエクスプロイトタスクの性能を急速に向上させ得ることを示している。

GLM-5.3から圧力を受けるのは誰か

このリリースは、ホスト型サービスに組み込まれた制御を放棄せずに、より強力な防御的アクセスを提供するよう、マネージドモデル提供者に圧力をかける。

Anthropic、OpenAI、Google、その他のフロンティア開発者はすでに、高度なサイバー能力を安全上の懸念として扱っている。マネージドAPIにより、利用状況の監視、分類器の更新、危険なリクエストの制限、アカウントの停止が可能になる。

これらの制御は、正当なセキュリティチームにも摩擦を生む。マルウェア分析、エクスプロイトの再現、インシデント対応は、自動ポリシーシステムには攻撃活動のように見えることがある。進行中の調査で拒否されれば、モデルは実用上使えなくなり得る。

Z.aiの答えはローカル制御だ。組織はオープンな重みを自社環境内に展開し、モデルが到達できるツール、リポジトリ、ネットワークリソースを決定できる。この手法は、機密性の高いソースコードやインシデントの成果物を保護し得る。

ただし、そのトレードオフは責任を下流へ移す。GLM-5.3を運用する企業には、独自のアクセスルール、隔離された実行環境、監査ログ、出力レビュー、エスカレーション手順が必要となる。モデルを利用できること自体が、これらの制御を自動的に提供するわけではない。

セキュリティベンダーは、第二の形の圧力にも直面する。Semgrepの実験におけるGLM-5.2の性能は、モデルの選択が検出パイプラインに実質的な影響を与え得ることを示唆した。GLM-5.3は、特化型エージェントや社内テストの新たな候補となる。

ただし、Semgrepの結果はセキュリティエンジニアリングの価値も守っている。その目的特化型ハーネスは、素のモデル構成を上回った。精度が重要な場合、リポジトリのマッピングと決定論的分析は依然として不可欠だ。

オープンソースのメンテナーは別の判断に直面する。自動スキャンは、そうでなければ見つからないままのバグを発見できる。一方で、小規模チームが再現、優先順位付け、修正できる速度を超えて報告を生み出すこともある。

モデルが数百のプロジェクトにまたがる脆弱性を発見するようになると、協調開示がボトルネックになる。研究者はメンテナーに連絡し、タイムラインに合意し、技術的詳細を保護し、パッチがユーザーに届く前に悪用可能な情報が公開されないようにする必要がある。

規制当局も公開遅延を注視するだろう。政策立案者は、オープンモデルをマネージドサービスとは別のカテゴリーとして扱うことが多かった。GLM-5.3は、最も価値ある研究上の柔軟性と最大の悪用懸念が同じ機能から生じるため、その区別を難しくしている。

一律の制限にはコストが伴う。ローカルモデルは、防御側がコードを外部プロバイダーにアップロードすることなく、機密システムを調査する助けとなり得る。独立したアクセスは再現可能性も支え、研究者が安全性の弱点を研究することも可能にする。

モデルがエクスプロイトチェーンのより多くを継続的に担えるようになると、無制限の公開にも固有のコストがある。政策論争は、パラメータ数だけでなく、能力の閾値、アクセスの段階的提供、開示慣行へとますます焦点を移すだろう。

開発者は、この圧力を既存ツールを直ちに置き換える理由と解釈すべきではない。GLM-5.3は、実際のリポジトリ、好みのエージェントフレームワーク、組織固有の言語でなおテストを要する。

より直接的な教訓は、アーキテクチャに関するものだ。チームは、インシデント対応やセキュリティレビューにおいて、単一のホスト型モデルだけを唯一の選択肢にすることを避けるべきだ。検証済みのローカル代替手段があれば、ガードレールによる利用不能を減らし、機密データを保護できる。

また、モデル評価とワークフロー評価を分けるべきだ。同じモデルでも、ツール、プロンプト、インデックス、検証器によって性能は大きく異なり得る。管理されたパイロットでは、会話上の自信ではなく、完了した成果を測定すべきだ。

Google Newsを通じてこの話題を追うナレッジワーカーにとって、含意はサイバーセキュリティを超える。ポストトレーニングは既存の基盤モデルから大幅に新しい振る舞いを引き出し、モデル世代間の距離を縮め得る。

このパターンは競争上の経済性を変える。ラボは、繰り返しより大きな基盤モデルを構築する代わりに、環境と検証を拡張することでエージェントを改善できる可能性がある。また、モデルサイズの目に見える増加なしに能力向上が起こり得るため、リリース予測も難しくなる。

次に注目すべき3つのシグナル

次の証拠は、公開された重み、検証済みの開示、独立した本番テストから得られるはずだ。

最初のシグナルは、Z.aiが示した2週間の安全期間後にGLM-5.3の重みを公開するかどうかだ。予定どおりの公開は、同社のオープンウェイトへのコミットメントを裏付ける。さらなる遅延は、サイバー評価で未解決の制御上の課題が見つかったことを示すだろう。

公開条件は日付と同じくらい重要だ。研究者には、明確なライセンス、モデル文書、安全性ガイダンス、主要な評価を再現するのに十分な技術的詳細が必要だ。文書のないアクセスでは、検証上の隔たりの多くが残る。

二つ目のシグナルは、非公開の発見が確認済みの開示へ転換されることだ。Z.aiの台帳には現在、公開済みのものよりはるかに多くの公開禁止中のエントリーが含まれている。メンテナーの確認、パッチ、認定済みの脆弱性記録は、同社の主張を強化するだろう。

生の件数よりも品質が重要だ。報告に再現可能な証拠、正確な深刻度、影響を受けたプロジェクトに受け入れられた修正が含まれるかを注視したい。また、メンテナーが過剰な偽陽性や調整上の負担を報告するかも確認すべきだ。

三つ目のシグナルは、現実的なセキュリティワークフロー内での独立した性能だ。研究グループやベンダーは、同じハーネスの下でGLM-5.3をGLM-5.2およびマネージドなフロンティアモデルと比較すべきである。

有用な評価には、複数の脆弱性クラスと、これまで見たことのないリポジトリを含めるべきだ。適合率、再現率、エクスプロイトの信頼性、パッチの成功率、ツール呼び出し量、人手レビュー時間を報告する必要がある。

こうしたテストを通過する結果は、Z.aiの中核的な主張を強化する。それは、ポストトレーニングが単なるローンチ時のランキングではなく、展開可能なセキュリティ能力を改善したことを示すだろう。

再現検証が弱ければ、このリリースが無意味になるわけではない。見出しの数値が示すほどではなく、報告された向上がZ.aiのハーネス、タスク選定、評価設定により大きく依存していることを示すだろう。

次のGoogle Newsの更新に触れた読者は、三つの問いを持つべきだ。重みは実際に利用可能なのか、メンテナーは脆弱性報告を検証しているのか、独立チームは結果を再現しているのか。

これらの答えによって、GLM-5.3が信頼できる防御ツールになるのか、困難なガバナンス事例になるのか、あるいはその両方になるのかが決まる。このリリースはすでに根底にある緊張関係を示している。より優れたコーディングエージェントはソフトウェアの保護に役立つが、それらを有用にする能力は、攻撃的能力と切り分けることがますます難しくなっている。

 
 

無料で始めましょう

ローカルファーストのパーソナル知識管理付きAIアシスタント

より良いAI体験のために、

remio は現在、 Windows 10+ (x64)M-Chip Mac のみをサポートしています。

仕事のAIパートナー
remioでもっと仕事が進む

計画・作成・仕上げまで
すべてをひとつに

bottom of page