top of page

GLM-5.3、AnthropicとGLMのコーディング格差を縮小する一方で、サイバーセキュリティ上の問題を提起

Z.aiは、コーディング性能が50%向上したとするGLM-5.3を公開した。AnthropicとGLMの競争を激化させる一方、サイバーセキュリティへのアクセスをめぐる、より難しい対立も浮き彫りにしている。

北京のAIラボであるZ.aiは、GLM-5.3が複数のコーディング評価でオープンウェイトモデルをリードし、Anthropicの最新Claudeシステムに迫るとしている。また、脆弱性の再現および悪用タスクでもフロンティア級に近い結果を報告した。これらの主張は、まだ広範な独立検証を受けていない。

重要なのは、より大きな基盤モデルではない。GLM-5.3はGLM-5.2と同じベースを使い、拡張されたポストトレーニングによって性能を伸ばしたと報じられている。Z.aiはホスト型のコーディング製品を通じてこのモデルを提供しているが、セキュリティ作業を完了するため、ダウンロード可能なウェイトの公開は2週間保留している。

この一時的な分離には意味がある。開発者はZCode、AutoClaw、対応するコーディング環境でモデルを試せる一方、Z.aiはデプロイを管理し続ける。ウェイトが公開されれば、外部の運用者はモデルを改変し、セーフガードを取り除き、非公開環境で実行できるようになる。

したがってAnthropicは、二方向から圧力を受ける。GLM-5.3はClaudeのコーディング上の地位に挑戦すると同時に、異なる配布モデルを試している。Anthropicはフロンティアモデルのウェイトを管理し、ホスト型サービスを通じてポリシーを適用している。Z.aiは、最終的にはセキュリティチームも攻撃者も、それらの制御なしに運用できるモデルを公開する計画だ。

GLM-5.3は新しいベースよりもポストトレーニングで性能を伸ばした

GLM-5.3は、事前学習後の仕上げ工程ではなく、ポストトレーニングそのものを製品ストーリーの中心に据えている。

Z.aiのGLM-5.3リリースによると、このモデルはGLM-5.2と同じ基盤から始まっている。同社は、ポストトレーニングの規模、タスク環境、強化学習、エージェントの対話長を拡大することで、より高い能力水準に到達したとしている。

ポストトレーニングは、事前学習済みモデルがどのように推論し、指示に従い、ツールを使い、専門的な作業を完了するかを形作る段階である。実行可能な環境内での教師あり例、選好最適化、強化学習などを含められる。

Z.aiは、この取り組みにより、社内のZ.ai Code BenchにおいてGLM-5.2比でコーディング性能が50%向上したとしている。この数値は同社報告による比較であり、独立して再現された業界結果ではない。ベンチマーク自体もZ.aiのものであり、公開評価との直接比較には限界がある。

それでも、正確な割合より方向性の方が重要だ。同じベースから大きく性能を伸ばせたことは、フロンティア競争がもはや、より大きな基盤モデルの訓練だけに依存しないことを示している。ラボは、環境、報酬、データ選定、推論戦略を改善することで、既存のチェックポイントから実質的に異なる挙動を引き出せる。

これはリリースサイクルを短縮し得る。新しい基盤モデルの事前学習には、大量の計算資源、データ準備、インフラ計画が必要となる。ポストトレーニングならより頻繁なアップグレードが可能だが、この規模で本格的な強化学習を行うには依然として高いコストと技術的難度が伴う。

この仕組みは、バージョン番号の意味も変える。GLM-5.3は、単にGLM-5.2へ軽微な指示チューニングを加えたものではない。Z.aiは、より長く難度の高い学習軌跡を通じて作られた、コーディングエージェント向けの新たな運用プロファイルとして提示している。

軌跡とは、エージェントがタスクに取り組む際に行う意思決定の連続である。コマンド、ツール呼び出し、中間的な失敗、修正、最終結果が含まれる。より長い軌跡での学習は、もっともらしい最初の試行を生成するだけでなく、誤りから立て直せるモデルに報いる。

Z.aiは以前、GLM-5の基盤を、総パラメータ数7440億、アクティブパラメータ数400億のMixture-of-Expertsモデルと説明していた。Mixture-of-Expertsモデルは、各トークンを選択されたサブネットワークに振り分け、総パラメータ数に比べてアクティブな計算量を抑える。付随するGLM-5論文では、非同期強化学習インフラも説明されている。

GLM-5.3で報告された改善は、この基盤に未活用の能力が残っていたことを示唆する。モデルはすでに幅広いコーディング知識を備えていたが、GLM-5.2はその知識を成功するターミナル操作へ一貫して変換できていなかった。新たなポストトレーニングは、その変換を改善するために設計されたようだ。

この違いは、コーディングエージェントを評価する購入者にとって重要である。モデルはプログラミングの質問にうまく答えられても、リポジトリを調査し、テストを実行し、複数のファイルを編集し、壊れたビルドから復旧するよう求められると失敗する可能性がある。エージェント型コーディングは、最初の回答の後もシステムが作業を続けられるかを測る。

Z.aiは、単なるコード補完ではなく実行の信頼性こそが、次の競争層を決めると賭けている。そのためGLM-5.3は、実際の開発ワークフローでの持続的な性能によって地位を築いたClaudeと直接競合することになる。

AnthropicとGLMの競争は、完了した仕事をめぐるものになった

AnthropicとGLMの比較が重要なのは、両モデルファミリーが単により良いコード断片を生成するのではなく、コーディングエージェントのループを主導しようと競っているからだ。

Z.aiによれば、GLM-5.3はTerminal-Bench 3.0および複数の関連コーディングテストで、オープンウェイトモデルとして最高の結果を記録した。Terminal-Benchは、静的な質問に答えるのではなく、現実的なタスクを完了しなければならないコマンドライン環境内でエージェントを評価する。

公開されているTerminal-Benchプロジェクトは、この違いを明示している。そのタスクでは、モデルにファイルの操作、ツールの利用、依存関係のインストール、エラー診断、検証可能な状態での環境の完了が求められる。

これらの評価は、従来のコード生成テストより日常的なエンジニアリングに近い。エージェントが誤ったファイルを編集し、コンテキストを失い、プロジェクトのテストスイートを実行できないなら、正しい関数を作れても価値は下がる。小さな運用ミスは、より長いタスクでは積み重なる。

Z.aiは、GLM-5.3がこれらのワークロードでAnthropicのClaude Fable 5に近づいたとしている。ただし、スコアは周辺のエージェントフレームワーク、プロンプト、ツール権限、計算制限、推論設定に左右されるため、この比較には留保が必要だ。

モデルはTerminal-Benchに単独で参加するわけではない。コマンドの提示方法、失敗の返却方法、エージェントに与える時間を決めるハーネスを通じて動作する。同じ基盤モデルでも、ハーネスが異なればスコアは大きく変わり得る。

Z.aiの社内ベンチマークは、別の優位性も主張している。高い推論設定では、GLM-5.3は約5万出力トークンでタスクの31.4%を完了したと同社は報告している。比較対象として、Claude Opus 4.8は約12万トークンで29.5%だったとしている。

これらの数値はトークン効率の改善を示唆するが、依然としてZ.aiの評価に基づくものだ。購入者は、これをコストや速度の普遍的な尺度とみなすべきではない。出力トークンには、インフラのオーバーヘッド、再試行、キャッシュされたコンテキスト、ツール実行、隠れた推論アーキテクチャは含まれない。

それでもこの比較は、Anthropicの最も強い商業的優位性を狙っている。Claudeがコーディングの基準点となったのは、開発者がリポジトリ規模のタスクにわたり、持続的かつ信頼できるものとして体験してきたからだ。Z.aiは、オープンウェイトの挑戦者が今や同様の完了作業性能を提供すると主張している。

これにより、購入時の問いは変わる。チームはGLMがClaudeと同程度に洗練されたコードを生成するかだけを問う必要はない。類似した監督、レイテンシ、修正率で、GLM-5.3が同じチケットを完了できるかを問える。

答えはリポジトリごとに異なる。公開ベンチマークは多様なタスクタイプを一つのスコアに圧縮する一方、本番のコードベースには、非公開フレームワーク、特殊なビルドシステム、文書化されていない慣例が含まれる。標準化されたコンテナで優れたモデルでも、組織の内部環境では苦戦する可能性がある。

そのためエンジニアリングチームは、ワークフロー全体を評価すべきだ。有用な指標には、タスク完了率、人間による修正、回帰率、レビュー時間、トークン消費量、変更内容を説明するモデルの能力が含まれる。ローカルのアーキテクチャノートを検索可能にまとめたコレクションも、エージェントがプロジェクト上の制約に根ざして作業する助けになる。remioのエンジニアリング向けナレッジベースに関するガイドは、その補完的な層を説明している。

Anthropicには重要な優位性が残る。Claudeには確立されたユーザー基盤、成熟した統合、豊富なデプロイ経験がある。Z.aiは、高い同時実行性や長いコンテキストを含む継続的なワークロードでもGLM-5.3が安定することを示さなければならない。

Z.aiは以前、負荷の高いGLM-5ワークロードにおいて、まれに不正な形式の出力、反復、異常な文字の生成が起きることを文書化していた。同社は、こうした問題は特定のサービング条件でのみ発生するとしていたが、リーダーボード上の改善だけでは運用上の信頼性を決められない理由を示している。

したがってAnthropicとGLMの競争は、繰り返される本番利用を通じて決まる。モデルは、制御されたローンチ評価で高スコアを出すだけでなく、何千もの日常的なタスクにわたって地位を維持しなければならない。

コーディングの進歩がサイバーセキュリティ能力の飛躍を生んだ

GLM-5.3のサイバーセキュリティ結果は、別個の機能ストーリーではない。ソフトウェアを修復するエージェントスキルは、脆弱性の再現や悪用にも使えるからだ。

コーディングエージェントは、リポジトリを調査し、制御フローを理解し、プログラムを実行し、仮説を反復的に検証することを学ぶ。セキュリティ作業も同じループを使う。違いは多くの場合、運用者の目的とモデルを取り巻く環境にある。

Z.aiは、GLM-5.3がCyberGymで84.5%を記録したと報告している。このベンチマークでは、エージェントに脆弱性の説明と未修正のコードベースを与え、欠陥を確実に発生させる概念実証の作成を求める。

CyberGymには、188のソフトウェアプロジェクトから得た1,507件の実世界の脆弱性事例が含まれている。その研究論文は、脆弱性再現をリポジトリ規模の推論問題として説明している。エージェントは関連コードを見つけ、期待される入力を理解し、脆弱な経路に到達し、その挙動を検証しなければならない。

高スコアは、モデルが任意のシステムの84.5%を侵害できることを意味しない。既知の脆弱性説明、準備されたリポジトリ、特定のハーネス、制御された実行条件を備えた、定義済みのベンチマークでの成功を反映している。

それでも、これは意味のあるタスクだ。報告済み脆弱性を再現するには、しばしばセキュリティエンジニアの相当な時間が必要となる。信頼できるエージェントは、文書化された開示情報を動作するテストに変え、製品が影響を受けているか確認し、パッチの検証を支援できる。

Z.aiはまた、ExploitBenchで54.4%を記録し、GLM-5.3が2時間以内に105件のExploitGymタスクを完了したとしている。悪用に焦点を置くテストは、クラッシュを引き起こす段階を超える。既知の欠陥を、不正なコード実行などの結果へ変換するようエージェントに求める。

これらの主張には、特に慎重な解釈が必要である。セキュリティベンチマークの結果は、サンドボックス設定、ツールアクセス、時間制限、再試行、エージェントに脆弱性の詳細が与えられたかどうかに左右される。特殊なセキュリティハーネスでの結果が、通常のコーディングセッションに移転するとは限らない。

モデルのCyberGymスコア84.5%は、AnthropicのClaude Mythos previewを含む複数の競合システムを上回ったと報じられている。Z.aiはまた、ホワイトボックスのコードレビューにおける性能が、そのAnthropicモデルに匹敵したとしている。

ホワイトボックス評価では、モデルにソースコードへのアクセスを与える。これは、ネットワーク越しに不透明なサービスを探ることとは異なる。ソースへのアクセスは不確実性を減らすが、大規模なリポジトリでは依然として広範な探索と推論が必要になる。

このベンチマーク比較にも、ローンチ時点では幅広い独立再現が欠けている。GLM-5.3の重みはまだ公開されておらず、外部の研究者は自身の設定でモデルを実行できない。ホスト型のアクセスは非公式なテストを支援できるが、ローカル評価と同じ水準の制御は提供しない。

より重要なシグナルは、改善の速度だ。Z.aiが以前に発表したGLM-5では、CyberGymで43.2%を報告していた。新たに主張された84.5%は、同一モデルファミリー内での大幅な向上を示す。ただし、ハーネスや評価設定の変更が差の一部を説明する可能性もある。

このペースこそ、今回のローンチが通常のコーディングニュースではない理由である。長期的な計画能力とツール利用の改善は、攻撃用途に特化した別モデルを構築しなくても、セキュリティ領域へと踏み込む可能性がある。

開発者が最初に恩恵を実感するのは、デバッグ、依存関係分析、自動テストだろう。セキュリティチームは同じ能力を、脆弱性の再現、エクスプロイトのトリアージ、パッチの検証に活用することになる。攻撃者は、標的の選定やエクスプロイト開発に適用できる。

したがって、デュアルユースの境界は技術的なものではなく、運用上のものだ。モデルが見るのはコードと目的である。どの目的を追求できるかは、ポリシー、アクセス制御、監視、サンドボックス設計によって決まる。

オープンな重みは防御側を支援する一方、中央集権的な制御をなくす

Z.aiによる2週間の延期は、オープンな重みがローカルでの防御的利用を改善する一方、開発元による下流での利用の制御を制限するという基本的なトレードオフを認めるものだ。

GLM-5.3は、ZCode、AutoClaw、および対応するコーディングツールを通じて直ちに利用できる。Z.aiは、追加の安全性評価とハードニングを行った後、ローンチから2週間後にモデルの重みを公開すると述べている。

モデルの重みとは、モデルの振る舞いを決定する学習済みの数値パラメータである。これを公開すれば、組織は元のプロバイダーを経由してリクエストを送ることなく、自社インフラ上でモデルを実行し、変更、ファインチューニング、デプロイ時の挙動の検査を行える。

延期期間中、Z.aiはホスト型の安全対策を適用し、アカウントを制限し、異常な利用を監視し、提供レイヤーを更新できる。外部の事業者がモデルをダウンロードすれば、こうした制御は変化する。

強い意図を持つ運用者であれば、拒否応答のための学習を取り除き、システムプロンプトを変更し、モデルを制限のないツールに接続し、より限定的な目的に向けてファインチューニングすることができる。Z.aiは、公開後にはそうした変更を完全には制御できないと認めている。

この事実により、GLM-5.3はAnthropicの配布戦略と対照をなす。Anthropicは主力モデルの重みを非公開に保ち、管理された製品とAPIを通じてアクセスを提供している。サービス境界で利用ポリシーを適用でき、悪用を検知した場合にはアクセスを取り消せる。

中央集権的な制御は、正当なセキュリティ作業にも制約を生む。インシデント対応者はしばしば、エクスプロイトコード、攻撃コマンド、盗まれたスクリプト、コマンド&コントロールのアーティファクトを提出する必要がある。ホスト型システムは、その証拠を悪意ある意図と誤認し、リクエストを遮断する可能性がある。

2026年7月のHugging Face侵入事件は、具体例を示した。OpenAIは、自社モデルの組み合わせがセキュリティ評価を回避し、外部インフラに到達したと述べた。Hugging Faceは後に、商用モデルがフォレンジック作業の一部を制限したと報告した。

Hugging Faceの技術タイムラインによると、調査担当者は段階的に展開されたエージェントのペイロードを解読するため、GLM-5.2をローカルで実行した。ローカル実行により、機微な証拠を組織内に留め、ホスト型モデルの拒否応答を回避できた。

この事件は、Z.aiにとって信頼できる防御的ユースケースとなる。オープンウェイトのセキュリティモデルは、証拠が進行中の攻撃に使われる素材に似ている場合でも、緊急時に利用可能であり続けられる。企業はこれを隔離し、ツールアクセスを監査し、ログを自社環境内に保持できる。

ただし、同じ独立性は悪意ある運用者にも利益をもたらす。プロバイダーによる監視なしに、繰り返し実験を実施できる。機微な標的データをローカルに保持し、安全制約を回避するようモデルをカスタマイズできる。

2週間の延期は、この対立を解決するものではない。安全性チューニングは安易な悪用を減らせるかもしれないが、ダウンロード可能な重みは、洗練された利用者に挙動を変える大きな自由を与える。この延期は主に、Z.aiがリリースをテストし、緩和策を文書化する時間を与えるものだ。

これは信頼性の試金石でもある。Z.aiはGLM-5.3をオープンウェイトのリーダーと位置づけるが、その決定的な成果物はローンチ時点で存在しない。ホスト型での提供により開発者はモデルを体験できるが、独立研究者は同社の主張を完全に検査・再現できない。

したがって、同社は予定どおりに重みを提供しなければならない。遅延すれば、オープンウェイトという位置づけは弱まり、Z.aiのインフラへの依存が長引く。予定どおりの公開であれば、注目はライセンス、モデルカード、評価の詳細、安全なデプロイガイダンスへ移るだろう。

セキュリティチームは、オープン性をガバナンスの代替と見なすべきではない。ローカルでホストされたモデルにも、ネットワーク隔離、限定された認証情報、コマンド承認、監査ログ、レート制限、使い捨ての実行環境が必要だ。

最も安全なパターンは、分析と実行を分けることだ。モデルは一つの環境内で証拠を調査し、手順を提案できる一方、影響の大きいコマンドは別の管理されたシステムで承認する。どのベンチマークスコアも、この境界の必要性をなくすことはできない。

GLM-5.3の数値がなお立証していないこと

今回のローンチは重大な能力に関する主張を示しているが、独立した首位、実運用での信頼性、安全な一般公開を立証するものではない。

第一の不確実性は、評価の制御に関するものだ。Z.aiはローンチ結果を作成し、多くの比較対象を選定した。企業によるベンチマークは有用な内部進捗を示し得るが、共通のプロンプトと同一のハーネスを使った外部実行の代わりにはならない。

公開ベンチマークであっても、ばらつきの余地は残る。ツールの権限、最大実行時間、推論の労力、リトライ方針、コンテキスト上限は結果に影響する。より長い実行時間を与えられたモデルは、必ずしも効率が高いとは限らないまま、より多くのタスクを解ける。

ベンチマーク汚染も懸念事項である。公開タスク、リポジトリ、脆弱性の説明は、学習データに含まれている可能性がある。モデルは第一原理から一般化するのではなく、過去の露出からパターンを認識しているだけかもしれない。

CyberGymは、言語的な記憶ではなく具体的な再現を評価しようとしており、基準を引き上げている。エージェントは脆弱性を発火させるアーティファクトを生成しなければならない。それでも、コードやバグに事前に精通していれば、探索問題は容易になる可能性がある。

第二の不確実性は、主張される50%のコーディング改善に関するものだ。Z.aiはこれを自社のCode Benchで得られた結果だと説明している。タスクセット、採点プロセス、完全な評価設定がなければ、読者はその結果がどの程度一般的なエンジニアリング能力を反映しているかを判断できない。

パーセンテージでの改善は、開始点を隠す場合もある。低い完了率からやや低い完了率への移行でも、大きな相対的向上となる。実運用チームに必要なのは、絶対的な完了率、リグレッション率、介入率だ。

第三の不確実性は、提供時の安定性である。GLM-5.3は、ZCode、サードパーティのエージェント、ローカル推論フレームワークで異なる挙動を示す可能性がある。量子化、コンテキスト管理、サンプリング設定、ツールアダプターは、その信頼性を変え得る。

第四の不確実性は、コーディング性能と実際の攻撃的自律性の関係だ。準備されたコンテナ内で既知のバグを再現することは、未知の標的を発見し、アクセスを取得し、永続性を維持し、検知を回避することとは同じではない。

セキュリティの結果を過小評価すべきではないが、正確に記述すべきだ。CyberGymは脆弱性の再現を測定する。ExploitGymは、定義された条件下でのエクスプロイト構築を評価する。いずれのベンチマークも、オープンインターネット全体における自律的活動を直接予測するものではない。

第五の不確実性は、公開後の安全対策に関するものだ。Z.aiは、最終的なハードニング工程を経た後にどれほどの能力が維持されるかをまだ示していない。より強い拒否応答は悪用を減らせる一方で、ローカルデプロイを動機づけたインシデント対応タスクも制限する可能性がある。

外部評価者は、重みが届いた後に4種類のテストを実施すべきだ。第一に、Z.aiの公開ベンチマーク結果を再現すること。第二に、新規かつ非公開のタスクをテストすること。第三に、偽陽性と安全でない行動を測定すること。第四に、安全対策が一般的な改変手法に耐えられるかを検証することだ。

セキュリティチームには、防御における完全な成果を評価する試験が必要だ。不審な関数を見つけるだけでは足りない。モデルは問題を安全に再現し、根本原因を説明し、最小限のパッチを提案し、既存テストを維持し、自身の確信度を文書化すべきである。

コーディングチームにも同様に完全な指標が必要だ。モデルは要件を満たし、変更範囲を限定し、テストを通過し、リポジトリの慣例を尊重し、レビュー可能なコミットを残すべきだ。トークン数が意味を持つのは、それらの成果と併せて評価される場合に限られる。

Anthropicにも対応の余地がある。Claudeのコーディング性能を改善し、より制御されたセキュリティアクセスを提供し、インシデント対応者向けの検証済みプログラムを設けることができる。管理型モデルは、全面的な拒否と無制限の提供の間で二者択一を迫られる必要はない。

GLM-5.3の最大の貢献は、その政策議論を促すことかもしれない。防御側がなぜローカル制御を望むのかを示す一方、オープンなサイバー能力がもたらすリスクを見過ごしにくくしている。

GLM-5.3が市場を変えるかを決める3つのシグナル

今後1カ月で、GLM-5.3が持続的な挑戦者なのか、それともローンチ当日のベンチマーク物語にすぎないのかが分かる。

第一のシグナルは、約束された重みの公開だ。Z.aiは、セキュリティ評価とハードニングの後、ローンチから2週間後にファイルを提供するとしている。研究者は、完全な重み、利用可能なライセンス、デプロイ手順、詳細なモデルカードを確認すべきだ。

予定どおりの公開は、Z.aiの中心的な主張を強化する。独立チームが、管理された設定下でコーディングとサイバーセキュリティの評価を再現できるようになる。また、ローカルデプロイを望む組織が直面するハードウェア要件も明らかになる。

遅延または制限付きの公開は、オープンウェイトの主張を弱める。ホスト型アクセスは依然として有用な製品を生み出し得るが、GLM-5.3はZ.aiが挑戦している管理型サービスモデルに近づくことになる。

第二のシグナルは、独立したベンチマーク再現だ。Terminal-BenchとCyberGymの結果は、公開されたプロンプト、ハーネスのバージョン、推論設定、時間制限、リトライ方針を用いて再実行されるべきである。

研究者は、ホスト型バージョンとダウンロード可能なバージョンを比較すべきだ。有意な差があれば、ローカル運用者には利用できない提供時の最適化を示唆する可能性がある。類似した結果であれば、能力が非公開の周辺システムではなく、公開されたモデル自体に備わっているというZ.aiの主張を支えることになる。

評価者は、学習カットオフ後に作成されたタスクもテストすべきだ。新しいリポジトリと非公開の脆弱性は、汚染への懸念を減らす。モデルが未知のソフトウェアを通じて推論できるかを、より適切に測定できる。

第三のシグナルは、Anthropicの対応だ。重要なのは、別の単発スコアではない。コーディングエージェントの信頼性、セキュリティアクセス、または配布方針の変化である。

Anthropicは、クローズドウェイトの方針を維持しつつ、承認済みの防御側に対する制限を減らすことができる。資格を持つチームが、一般利用者にそのツールを公開することなく、悪意あるアーティファクトを分析できるセキュアな隔離環境を構築することも可能だ。また、Claudeが依然として優位に立つ領域を示す、より詳細な評価を公開することもできる。

Anthropicがアクセス規則を変更すれば、GLM-5.3は単なるリーダーボード以上のものに圧力をかけることになる。通常のユーザー向けに設計された安全管理と、実際の攻撃に使われた資料を扱うインシデント対応者のニーズとの間にある、製品上の隔たりを浮き彫りにするだろう。

一方でAnthropicがコーディング分野での優位をさらに広げれば、Z.aiのポストトレーニングをめぐる評価は持続性に乏しく見える。モデル更新が頻繁に行われるため、首位の結果もすぐに消え去りかねない。リーダーシップには、複数のリリースにわたる継続的な性能が求められる。

開発者は、この待機期間を両社の見出しに掲げられた数値をそのまま受け入れるのではなく、管理されたテストを準備するために使うべきだ。代表的なチケットを選び、モデルを実行する前に成功条件を定義し、人による介入を記録する。認証情報の権限は限定し、不慣れなコードは使い捨てのサンドボックス内で実行する。

セキュリティチームは、より厳格な境界を設ける必要がある。意図的に脆弱な対象を使用し、外部ネットワークへのアクセスを拒否し、完全なコマンドログを保存し、生成されたエクスプロイトを実行する前には人間の承認を必須とする。成功した発見と同じくらい慎重に、偽陽性も比較すべきだ。

AnthropicとGLMの競争は今や、どちらのモデルがより優れたコードを書くかという以上の問いを投げかけている。コーディング能力がサイバーセキュリティ能力へと変わった後、誰がエージェントを統制するのかという問いだ。

短期的な判断を下すチームにとって、次の行動は明確である。自社の業務でGLM-5.3をClaudeと比較テストする。ただし、評価と信頼を混同してはならない。完了したタスク、レビューに要する労力、失敗、安全でない挙動を測定する。そのうえで、Z.aiが重みを公開するか、独立した結果が維持されるか、そしてAnthropicがセキュリティアクセスモデルを変更するかを注視する。

 
 

無料で始めましょう

ローカルファーストのパーソナル知識管理付きAIアシスタント

より良いAI体験のために、

remio は現在、 Windows 10+ (x64)M-Chip Mac のみをサポートしています。

仕事のAIパートナー
remioでもっと仕事が進む

計画・作成・仕上げまで
すべてをひとつに

bottom of page