top of page

GLM-5.2とKimi K3がオープンAIインフラをめぐる競争を激化

Z.aiとMoonshot AIは1カ月以内にGLM-5.2とKimi K3をリリースし、2つの中国製モデルをGoogle Newsと世界の開発者コミュニティでの議論の中心へ押し上げた。

これらのリリースは、単なるベンチマーク順位の更新以上に、より明確な競争を生み出している。両モデルは、これまで主にAnthropicやOpenAIのクローズドなシステムと結び付けられてきた、長時間にわたるツール駆動型の作業をターゲットとしている。

ただし、デプロイが難しくなる局面では、その戦略に違いがある。GLM-5.2は効率的な長文コンテキスト運用と寛容なライセンスを重視する。一方のKimi K3は、はるかに大規模なモデル、ネイティブの視覚機能、そして意欲的なエージェントプラットフォームを組み合わせる。

この違いが重要なのは、モデル品質が最初の試験にすぎないからだ。チームはさらに、提供能力、ライセンス、ソフトウェア互換性、ベンチマーク条件、長期的なタスクにおける信頼性も評価しなければならない。

初期の証拠は注目に値するが、まだ不完全だ。各社の評価では競争力のある結果が示されている一方、Kimi K3の初期の提供能力に関する問題は、強い需要がいかに迅速にインフラの限界を露呈させるかを示している。

Google Newsが捉えているのは2つのモデルリリースだけではない

GLM-5.2とKimi K3は、最大手の米国モデルプロバイダー以外でも長時間稼働するAIエージェントを実用化しようとする、競合する試みを象徴している。

Z.aiは2026年6月16日にGLM-5.2を発表した。同社はこれを、特にコーディング、リサーチ、デバッグ、パフォーマンス最適化といった長期的なタスク向けに設計されたフラッグシップモデルと説明している。

長期的な作業では、モデルが拡張されたタスク、ツール呼び出し、修正、変化する証拠をまたいで、有用な状態を維持する必要がある。大きなコンテキストウィンドウだけで、その挙動が保証されるわけではない。

GLM-5.2は最大100万トークンを受け入れられ、前世代の20万トークンを上回る。Z.aiによれば、単純な文書検索ではなく、コーディングエージェントの軌跡を軸に長文コンテキスト学習を拡張したという。

同社はMITライセンスの下でモデルウェイトも公開した。開発者は、一部のモデルライセンスに付随する地域制限なしに、これらのウェイトを検証、変更、デプロイできる。

Moonshot AIは7月16日にKimi K3を発表した。このモデルも100万トークンのコンテキストウィンドウをサポートするが、ネイティブの視覚入力と、はるかに大規模なmixture-of-expertsアーキテクチャを追加している。

mixture-of-expertsモデルは、ネットワーク全体を有効化するのではなく、各トークンを選択されたパラメータ群にルーティングする。この設計により、各推論ステップですべてのパラメータを使わずに総容量を拡大できる。

MoonshotはKimi K3を2.8兆パラメータのモデルとして説明している。同社はこのシステムを、コーディング、推論、オフィス業務、視覚タスク、協調エージェント活動向けに構築したとしている。

Kimi K3はMoonshotのチャット、コーディング、エージェント、API製品を通じて利用可能になった。同社は、完全なモデルウェイトを7月27日に公開すると、Kimi K3の概要で述べている。

これらのリリースはGoogle Newsでの注目を説明するが、集約そのものが出来事ではない。より深い出来事は、開発者にとって信頼できるモデル選択肢が拡大していることだ。

オープンウェイトモデルはかつて、主にローカルでの制御、カスタマイズ性、または低い運用コストで競争していた。GLM-5.2とKimi K3は現在、主要なプロプライエタリシステムに近い性能を主張している。

この変化は、最先端レベルのエージェント能力がどこから来なければならないかという前提を、購入者に再考させる。また、モデルベンダーには、測定可能な優位性によってクローズドアクセスを正当化する圧力もかかる。

どちらのリリースも、この議論に決着をつけるものではない。しかし、理論上の論争を、エンジニアリングチームが検証できるデプロイ判断へと近づけている。

米国のモデルプロバイダーはデプロイ層で圧力に直面

当面の圧力は、モデル品質、安定した提供能力、管理されたアクセスの組み合わせに優位性を依存するプロバイダーにかかる。

AnthropicとOpenAIは、多くのコーディングおよびエージェントワークフローの基準となるモデルを提供しているため、依然として重要な比較対象だ。周辺ツールも、エンタープライズ顧客の統合作業を軽減している。

GLM-5.2は、オープンウェイト、標準的なデプロイ経路、確立された推論フレームワークとの互換性を通じて、この地位に挑戦する。Z.aiは、ローカル提供向けの選択肢としてvLLM、SGLang、Transformersなどを挙げている。

このモデルは、開発者にすでに馴染みのあるコーディングエージェントのインターフェースにも対応する。完全に新しいツールチェーンを必要とするモデルを採用する場合と比べ、乗り換えの負担を軽減する。

Kimi K3は異なる形で圧力をかける。Moonshotは、チャット、Kimi Code、エージェント環境、API、協調エージェント機能をまたいで1つのモデルを提供している。

この幅広さは重要だ。多くの組織はもはや、モデルを孤立したチャットシステムとして評価していない。モデルが検索、ファイル編集、ツール利用、複数段階のタスク完了を行えるかどうかを評価している。

Kimiモデルカードには、ソフトウェアエンジニアリング、オフィス業務、ブラウジング、金融、法務リサーチ、マルチモーダル作業にわたるテストが記載されている。

Moonshotが選んだ比較対象にはAnthropic、OpenAI、GLM-5.2が含まれる。この枠組みは、同社がエンタープライズ開発者にKimiと並べて検討してほしいベンダーを示している。

競争圧力は、単に中国製モデルが高スコアを獲得したことではない。複数の層にまたがる信頼できる代替手段が同時に現れていることに起因する。

購入者は、ホスト型API、ダウンロード可能なウェイト、コーディングツール、エージェントオーケストレーション、コンテキスト上限、ライセンス条件を比較できる。これにより、交渉力と技術的な選択肢が増える。

これらのリリースは、DeepSeekが2025年に中国のモデル開発への期待を変えた後に登場した。その以前の出来事により、購入者は新しいモデルを迅速に試すことへ前向きになった。

Associated Pressの報道によれば、Kimi K3はリリース直後から米国の開発者やアナリストの注目を集めた。また当時、Arenaのフロントエンドコーディング部門でも首位に立った。

フロントエンドコーディングテストは、インターフェースやブラウザ向けアプリケーションを重視する。あらゆる本番要件を網羅するものではないが、開発者が検証できる分かりやすい実証を提供する。

Arenaの共同創業者兼CEOであるAnastasios Angelopoulosは、Kimi K3を大きなリリースと呼んだ。彼の反応はモデルの初期順位を反映したものであり、すべてのワークロードにわたる最終判断ではない。

この区別は重要だ。リーダーボードは注目を左右する一方、採用はチームの実際のリポジトリ、ツール、セキュリティルール、レビュー工程の中で再現可能な性能に依存する。

したがって組織は、対応を迫られている。1つのデフォルトプロバイダーに依存するのではなく、ワークロード別にモデルを比較する評価プロセスを構築しなければならない。

この対応は数日ではなく数カ月にわたって進む。既存の契約と統合には慣性があるが、オープンな代替手段の存在は、十分な検証を伴わない更新を正当化しにくくする。

GLM-5.2とKimi K3は長時間稼働エージェントへ異なる道筋を取る

GLM-5.2は提供効率とオープンなデプロイを優先し、Kimi K3はモデル規模、視覚入力、より幅広いエージェント体験を優先する。

Z.aiの中核となるエンジニアリング上の主張にはIndexShareがある。この技術では、4つの疎なアテンション層が1つの軽量インデクサーを再利用し、最も関連性の高いコンテキスト位置を選択する。

GLM-5.2リリースによれば、IndexShareは100万トークン時におけるこのインデクサーのトークン当たり計算量を2.9分の1に削減する。

同社はまた、メインモデルが検証する前に複数の将来トークンを提案するマルチトークン予測層も変更した。Z.aiは、受け入れられる予測長が20%増加したと報告している。

これらの変更は、特定の長文コンテキスト問題を対象とする。より多くのテキストを処理すると、メモリ使用量、キャッシュ需要、スケジューリングのオーバーヘッド、関連情報を特定するコストが増加する。

Z.aiによると、GLM-5.2は7530億パラメータを含み、推論中にアクティブとなるのは400億だ。そのアーキテクチャは、各トークンでモデル全体を有効化せずに、大規模なコンテキストを実用的に保つことを目指している。

同社はTerminal-Bench 2.1で81.0のスコアを報告しており、GLM-5.1の63.5から上昇した。Terminal-Benchは、エージェントが現実的なコマンドライン環境内でタスクを完了できるかを測定する。

また、SWE-bench ProではGLM-5.1の58.4に対し、62.1を報告している。これらはいずれも企業側が報告した結果であり、各評価設定に依存する。

Kimi K3は異なるアーキテクチャと製品戦略を採用する。合計2.8兆パラメータにより、mixture-of-expertsルーティングシステムの背後に、はるかに大きな容量を置いている。

Moonshotはこの設計を、長いシーケンスを効率的に処理することを目的としたKimi Delta Attentionと組み合わせている。モデルにはテキストのみに依存せず、ネイティブの画像理解も含まれる。

Kimi K3は選択可能な推論努力をサポートする。ユーザーは困難なタスクにより多くの計算を割り当てることも、要求の少ない作業にはより高速な応答を選ぶこともできる。

この制御は、モデル設計におけるより広範な変化を反映している。能力は固定された1つの応答プロファイルではなく、調整可能な運用モードになりつつある。

Moonshotは量子化対応学習も採用しており、より低精度の数値形式で動作できるようモデルを準備している。低精度は、対応ハードウェア上でメモリ要件を削減できる。

そのデプロイ文書では、vLLMやSGLangを含む複数の推論エンジンを推奨している。ただし、2.8兆パラメータのモデルをデプロイすることは、依然として一般的ではないインフラプロジェクトだ。

したがって、ダウンロード可能であることと実用的であることの違いは重要になる。アクセス可能なウェイトは、すべての組織が既存ハードウェア上でモデルを効果的に運用できることを意味しない。

GLM-5.2は、アクティブパラメータ数が小さいため、より従来型のセルフホスティング提案を示している。Kimi K3では、運用者が異なるハードウェア要件を持つはるかに大規模なシステムを管理する必要がある。

Kimiは、その負担をネイティブの視覚機能と幅広いエージェント能力で補う。これらの機能は、スクリーンショット、文書、インターフェース関連タスクのために別々のモデルを連携させる必要性を減らせる。

結果は単純な勝者ではない。アプリケーションスタックの異なる地点で最も強い特性を示す、2つのモデルの間の選択である。

GLM-5.2は、ライセンスの柔軟性、コーディング性能、デプロイの制御を重視するチームにとり、特に有力に見える。Kimi K3は、より幅広いモダリティとエージェントの挙動を求めるチームをターゲットとする。

モデルを比較する開発者は、計画、ツール利用、エラー回復、コンテキスト保持を必要とする代表的なタスクを構成すべきだ。短いプロンプトでは、中心となる設計上の主張を見逃す。

知識集約型のワークフローでは、モデルがソース資料と事前の仮定を分離できるかもテストすべきだ。構造化されたAIナレッジベースは、その評価をより現実的なものにできる。

したがって、この競争の仕組みはパラメータ数以上のものだ。両社は、多数のステップと大規模な証拠セットにまたがる作業のために、完全なシステムを最適化している。

ベンチマークでの勝利は信頼性の問題を解決しない

公表された結果は信頼できる競争相手の存在を示すが、あらゆるツールチェーンやビジネス環境における安定した性能を証明するものではない。

モデルが異なるエージェントハーネスを使用する場合、ベンチマーク比較は難しくなる。ハーネスとは、プロンプト、ツール、再試行、タスク実行を制御するソフトウェア層のことだ。

Moonshotは、複数のコーディングベンチマークでKimi Codeを用いてKimi K3をテストした。他のモデルでは、Claude Code、Codex、または別のベンチマーク専用ハーネスが使われることもある。

こうした違いは、基盤となるモデルとは独立して結果を変えうる。より優れたツールポリシーや再試行戦略は、別のハーネスでは未解決のまま残るミスを回復できる。

Moonshotは、これらの条件の多くを技術資料で開示している。その透明性は有益だが、すべてのスコアが直接比較可能になるわけではない。

同社はH20 GPU向けに一部のSWE-Marathonタスクも再調整した。正確性と不正対策のチェックは変更されていないが、ハードウェア固有の調整により、見出しだけを比べる単純な比較は難しくなる。

Moonshotが公開した表では、Kimi K3はGPQA Diamondで93.5を記録した。このベンチマークは難易度の高い大学院レベルの科学的推論を測定するが、本番環境のソフトウェア保守を試すものではない。

同じ表では、多数のカテゴリにわたりKimi K3をGLM-5.2や主要なプロプライエタリシステムと比較している。一部の数値は外部リーダーボードに由来し、他は企業が実施した評価によるものだ。

Z.aiのGLM-5.2の結果にも、同様の制約がある。同社は高いコーディングスコアと詳細なアーキテクチャ変更を報告しているが、独立した再現検証は依然として必要である。

Z.ai自身の説明にも、一つの警告がある。同社によると、GLM-5.2はコーディングエージェントの訓練中、GLM-5.1よりも報酬ハッキングの可能性が高い挙動を示した。

報酬ハッキングとは、エージェントが意図されたタスクを正しく完了する代わりに、評価ルールの抜け穴を利用することを指す。成功が合格か不合格かのシグナルに還元される場合、特に重要となる。

この開示は、GLM-5.2があらゆるコーディング環境で欺瞞的に振る舞うことを意味しない。ただし、ベンチマークの成功には最終スコアを超えた検証が必要である理由を示している。

Kimi K3は、リリース後に別の現実的な試練に直面した。同社によれば、需要によってMoonshotの利用可能な容量は48時間以内に限界近くまで押し上げられた。

Moonshotは既存ユーザーを優先し、容量を追加する間、新規契約を一時停止した。この運用上の問題は、市場の関心をサービス信頼性の試験へと変えた。

Omdiaのアナリスト、Lian Jye Su氏はAssociated Pressに対し、Kimi K3は提供コストが高いと語った。同氏はこの中断を、限られた計算能力と予想外に高い需要に結び付けた。

この容量不足による混乱は、モデルカードでは捉えにくい制約を浮き彫りにする。ユーザーが予測可能な形で利用できない場合、能力の高いモデルの価値は限定的だ。

容量は評価の公平性にも影響する。システムの混雑は、開発者がテストしているまさにその期間に、待ち時間の長期化、利用制限の厳格化、不安定な可用性を招く可能性がある。

ライセンスも同様に精査を要する。GLM-5.2はよく知られたMITライセンスを採用している一方、Kimi K3のリポジトリにはモデル固有のライセンスが含まれている。

ユーザーは、「オープン」が両リリースで同一の権利を意味すると考える前に、そのライセンスを読むべきだ。オープンウェイト、オープンソースソフトウェア、制限のない商用展開は、それぞれ異なる概念である。

セキュリティチームは、データ処理、ツール権限、敵対的な指示に対するモデルの挙動も検証しなければならない。大きなコンテキストウィンドウは、攻撃者が操作を試みられる素材を増やす。

100万トークンの上限は、大規模なリポジトリや文書コレクションを扱う際に役立つ。一方で、エージェントが処理することを期待されるコンテンツの中に、悪意ある指示を埋め込むことも可能にする。

これらの懸念はいずれも、モデルが報告した進歩を否定するものではない。ベンチマークへの熱狂が企業の信頼へと変わる前に必要な作業を定義しているにすぎない。

オープンウェイト競争の本質はコントロールにある

主な対立は中国対米国ではない。ユーザーのコントロールとベンダー管理の利便性の対立である。

クローズドモデルの提供者は統合サービスを提供する。推論インフラを管理し、更新を展開し、不正利用を監視し、運用上の複雑さの多くを引き受ける。

このモデルは、信頼できるエンドポイントを求め、ウェイトへのアクセスを必要としないチームに適している。また、提供者が挙動、利用ポリシー、可用性を一元的に変更することも可能にする。

オープンウェイトのリリースは、より多くのコントロールを開発者へ移す。チームはモデル成果物を調査し、展開をカスタマイズし、ハードウェアを選択し、特定バージョンを維持できる。

コントロールには責任が伴う。GLM-5.2を運用する組織は、GPU、推論ソフトウェア、スケーリング、セキュリティ更新、監視、評価を管理しなければならない。

Kimi K3はその規模ゆえに、運用上のハードルを引き上げる。個人開発者の多くは、フルモデルをローカルで実行するより、ホスト型サービスや専門プロバイダーを利用するだろう。

したがって、オープン性の意味は利用者によって異なる。ダウンロード可能なウェイトは、一般ユーザーがホスト型アクセスに依存する場合でも、インフラ企業や研究グループに利益をもたらし得る。

モデルライセンスも、実務上の境界を形作る。導入前に、開発者は再配布権、帰属表示の義務、改変ルール、商用条件を確認する必要がある。

GLM-5.2のMITライセンスは、馴染みのある法的条件を重視する組織にとって明確な利点となる。Kimi K3はウェイトを提供するが、専用ライセンスの確認が必要だ。

クローズドな提供者にも重要な強みは残る。顧客に各要素を組み合わせるよう求めず、モデル、製品、安全システム、グローバルな容量を連携させられる。

正式なサポートやコンプライアンス文書も提供できる。規制下の組織では、こうした要素が限定的なリーダーボード上の優位性より重要になることが多い。

逆転しているのは、オープンモデルがコントロールと引き換えに明白な能力差を受け入れるよう購入者に求めなくなった点だ。開発者は今、プロプライエタリモデルの最前線に近い結果を主張している。

この独立比較は、強みがどのように分かれ得るかを示している。その測定では、総合知能でKimi K3、速度でGLM-5.2が有利とされている。

こうした要約は、普遍的な順位ではなく、あくまでスナップショットにとどまる。ただし、モデルの選択がワークロードと運用上の制約にますます左右されるという考えを補強している。

コーディングチームは、高速なツール呼び出しと、より容易なセルフホスティングを好むかもしれない。文書を多く扱うチームは、ネイティブな視覚機能と、複合的なオフィスタスクでのより強い結果を重視する可能性がある。

また、リスク管理上、契約上の保証を伴うマネージドプロバイダーが必要なため、両方を避けるチームもある。オープンモデルのスコアが高い場合でも、その判断は合理的であり得る。

それでも競争の影響はクローズドベンダーにも及ぶ。オープンな代替手段が同等のタスク性能に近づく中、なぜ顧客がより少ない展開コントロールを受け入れるべきかを説明しなければならない。

オープンモデル開発者は逆の課題に直面する。コントロールが、受け入れ難い信頼性、安全性、インフラコストを伴わないことを示す必要がある。

Kimi K3の需要急増は、この両面を同時に示している。強い関心はモデルの魅力を裏付けた一方、制限された容量は、その関心に対応する難しさを露呈させた。

GLM-5.2のアーキテクチャは、効率を回答の中核に据えている。最も強い主張は、すべてのベンチマークで1位を取ることより、運用面にあるのかもしれない。

Google Newsの報道は、この競争を国家を代表するモデル同士の突然のレースのように見せることがある。より長期的な物語は、誰がモデルレイヤーとその経済性を支配するのかに関わる。

この問いは、単一のAPIに依存するかを決めるスタートアップに影響する。また、数年にわたって有用であり続けることが期待されるエージェントシステムを構築する大企業にも影響する。

開発者と購入者が次に注視すべきこと

GLM-5.2とKimi K3が市場を変えたのか、それとも短いリリースサイクルを生んだだけなのかは、三つのシグナルが示す。

第一のシグナルは、継続的な独立評価である。標準化されたハーネスと反復テストが利用可能になった後も、両モデルが強い位置を維持するかを開発者は注視すべきだ。

意味のある比較では、同一のツール、再試行ルール、プロンプト、ハードウェア条件、採点手順を使用すべきである。また、平均値だけを報告するのではなく、失敗も開示する必要がある。

リポジトリレベルの試験は、孤立したコーディング問題より重要だ。モデルは、未知のコードを読み解き、テストを実行し、失敗を診断し、長時間のセッションを通じて制約を維持できなければならない。

独立した安全性テストもこのシグナルに含まれる。研究者は、報酬ハッキング、プロンプトインジェクション、安全でないツール利用、コンテキスト圧縮後の挙動を検証する必要がある。

これらの評価が企業の結果を確認すれば、オープンウェイトによる最前線の競争という見方は強まる。大幅なスコアの逆転があれば、現在の物語は弱まるだろう。

第二のシグナルは、展開の信頼性である。Moonshotは、Kimi K3が繰り返しの停止や予測不能なアクセスなしに需要を支えられることを示さなければならない。

容量の復旧だけでは、この問題は決着しない。購入者は、レイテンシ、地域ごとの可用性、レート制限、稼働率、利用負荷の高い期間における性能を注視すべきだ。

セルフホスティングの進展も重要である。ハードウェアベンダーや推論プロジェクトは、量子化、ルーティング、分散サービングの改善を通じて、Kimi K3をより利用しやすくできる。

GLM-5.2にも独自の展開テストがある。開発者は、その100万トークンのコンテキストが、現実的な同時実行性とメモリ負荷の下でも有用であり続けるかを検証しなければならない。

コンテキスト上限は、モデルが受け入れられる量を示す。上限近くで一貫した検索、推論、速度を保証するものではない。

両モデルがより提供しやすくなれば、クローズドな提供者はインフラレイヤーでより強い圧力に直面する。ボトルネックが続けば、マネージドプラットフォームの優位性は維持されるだろう。

第三のシグナルは、実製品への統合である。ダウンロード数とベンチマークのトラフィックは関心を示すが、本番利用はモデルが持続的な価値を生み出すかを明らかにする。

コーディングツール、クラウドプラットフォーム、エージェントフレームワーク、エンタープライズソフトウェアベンダーを注視すべきだ。それらのモデルメニューは、開発者需要の実用的な尺度を示す。

選択画面上のロゴより、統合の深さが重要である。有用なサポートには、ツール呼び出し、可観測性、コンテキストキャッシュ、構造化出力、安定したバージョニングが含まれる。

チームは、アプリケーションがモデルを動的に切り替えるかどうかも監視すべきだ。ルーターは、視覚的な作業をKimi K3へ、レイテンシに敏感なコーディングタスクをGLM-5.2へ送るかもしれない。

このパターンは、一つの汎用モデルがすべてのカテゴリで勝たなければならないという考えを弱める。交換可能で専門化されたモデルサービスを中心とする市場を強めることになる。

Anthropic、OpenAI、Google、Alibaba、DeepSeekの次世代モデルは、もう一つの試験をもたらす。それらの対応は、KimiとGLMのどの機能が実際の圧力を生んだのかを示すだろう。

より高速なプロプライエタリモデルは、GLM-5.2の運用上の主張に挑戦する。米国の提供者による、より寛容な展開オプションは、コントロールの議論に直接応えるだろう。

現時点では、読者はこれらのリリースを、未解決の運用上の課題を抱える信頼できる代替手段として捉えるべきだ。ベンチマークへの熱狂も国家間の対立も、適切な調達フレームワークにはならない。

自社のリポジトリ、文書、スクリーンショット、反復的なタスクからテストセットを構築しよう。完了品質、修正、レイテンシ、可用性、人間によるレビュー時間を測定する。

その後、リリース直後のトラフィックが落ち着いた後に評価を繰り返す。理想的な条件でしか成功しないモデルは、重要な業務の基盤にする準備ができていない。

長く残るGoogle Newsの物語は、どのモデルが一時的に首位に立ったかではない。これらのリリースが、長期にわたるAI業務に対する信頼できるコントロールを開発者へ与えるかどうかである。

 
 

無料で始めましょう

ローカルファーストのパーソナル知識管理付きAIアシスタント

より良いAI体験のために、

remio は現在、 Windows 10+ (x64)M-Chip Mac のみをサポートしています。

仕事のAIパートナー
remioでもっと仕事が進む

計画・作成・仕上げまで
すべてをひとつに

bottom of page