top of page

Kimi K2.6 は Claude Opus 4.7 の4日後に登場しました。価格は10×安く、オープンウェイトです。

更新日:6月17日

Moonshot AIは4月20日にKimi K2.6をリリースしました。これはAnthropicがClaude Opus 4.7を出荷した4日後のことです。Kimi K2は現在、1兆パラメータの混合エキスパートモデルであり、262,144トークンのコンテキストウィンドウ、ネイティブビデオ入力、および実行あたり4,000ステップで最大300の並列サブエージェントを調整するエージェントスウォームプリミティブを備えています。

Kimi APIを通じて、変更されたMITライセンスの下でリリースされ、入力トークン100万あたり0.60ドル、出力トークン100万あたり2.50ドルで提供されます。Claude Opus 4.7は、同じサーフェスで5ドルと25ドルでリストされています。GPT-5.4 Proはさらに上位に位置します。タスクあたりで見ると、ほとんどのエージェントワークロードにおいて、Kimi K2はクローズドソースのフロンティアよりも約1桁安価です。

ベンチマークの状況はまちまちです。SWE-Bench Verifiedでは、Claude Opus 4.7がKimiの80.2%に対して87.6%で依然として勝利しています。SWE-Bench Pro、Toolathlon、BrowseCompでは、K2.6がクローズドフロンティアをリードまたはタイしています。2026年に実際のビルダーが最も気にかけているエージェントツールの使用は、Moonshotがリードすることを選択した分野です。

この記事では、Kimi K2.6が実際に何をリリースしたのか、ベンチマークでどこで勝ち、どこで負けたのか、価格設定とライセンスの細則が実際のデプロイメントに何を意味するのか、そしてClaude Opus 4.7と同じ週に着陸したリリースのタイミングが、より明らかになるストーリーである理由を解説します。

Kimi K2.6が実際にリリースするもの

K2.6はコーディングモデルではありません。モデルがアタッチされたエージェントプラットフォームであり、そのフレームワークが今回のリリース全体を説明しています。

ヘッドラインスペックは、オープンウェイトティアの新たな基準を設定しました。 Kimi K2.6 テックブログremio は、長距離推論のためのアテンション最適化、262K のコンテキストウィンドウ、画像とテキストに加えてビデオも受け入れるネイティブマルチモーダル入力パスを備えた 1T パラメータ MoE アーキテクチャについて詳しく説明しています。K2.5 はテキストのみでした。K2.6 は、初日からネイティブビデオ入力を備えた最初のオープンウェイトフロンティアモデルです。

エージェント固有の追加機能は、Moonshot が実際に賭けた部分です。K2.6 は、実行ごとに最大 300 の並列サブエージェントを 4,000 ステップの調整ウィンドウで調整する組み込みエージェントスウォームプリミティブを備えています。プロアクティブエージェントは、ユーザープロンプトを待たずに 24 時間年中無休のループで自律的に実行されます。K2.5 では実用的だったフロントエンド生成サーフェスは、ネイティブ出力形式としてビデオバックグラウンドと 3D 効果を備えたアニメーション UI を生成するようになりました。エージェントビルダーが以前のオープンウェイトモデルで不安定だと報告することが多い機能である長距離コード生成は、Moonshot がリリースノートで強調した安定性エリアです。

デプロイメントは、デモ用ではなく本番用に設計されたかのように見えるリリースにおけるもう一つの要素です。INT4量子化はネイティブでサポートされており、セルフホスト型ハードウェアでの推論速度が約2倍になります。vLLM、SGLang、KTransformersは初日からサポートされているため、AWS、Azure、またはベアメタルクラスターで稼働しているエンタープライズチームは、カスタム推論コードなしでデプロイできます。Kimi APIはOpenAIと完全に互換性があるため、既存のエージェントをGPT-5.4またはClaudeからK2.6に切り替えるのは、SDKの全面的な書き直しではなく、ベースURLの変更で済みます。このモデルはOpenRouterにも掲載されており、Kimi.comサイト、モバイルKimiアプリ、およびターミナルネイティブのエージェントワークフロー向けのClaude Code / CursorパターンをミラーリングするKimi CodeというCLIを通じて利用できます。

300サブエージェントという数は、保持する価値のある具体的なイメージです。Claude Codeのエージェントモデル、Cursorのエージェントモデル、Devinのエージェントモデルは、すべて依然としてツール呼び出しを実行する単一のプライマリエージェントとして機能しています。K2.6のアーキテクチャは、並列実行され、共有状態を通じて調整され、結果を再結合するエージェントのツリーをオーケストレーションするように構築されています。これは異なるワークフローの形状であり、Moonshotはそれが本番エージェントワークの方向性と一致すると賭けています。

ベンチマークの状況

Kimi K2は一般的なコーディングではクローズドフロンティアに後れを取っています。エージェントツールの使用ではリードしています。そのギャップが、このリリースの戦略的な声明です。

Claude Opus 4.7、GPT-5.4、Gemini 3.1 Proと直接比較すると、そのパターンは一貫しています。コーディング能力で最も一般的に引用されるベンチマークであるSWE-Bench Verifiedでは、Opus 4.7が87.6%でK2.6の80.2%を上回っています。GPT-5.3-Codexは同じテストで85.0%です。Gemini 3.1 Proは80.6%に近い値です。Kimi K2は競争力のある集団にいますが、リーダーではありません。

SWE-Bench Proでは、壊れやすい、または幻覚的なパッチに対してモデルを罰するより難しいバリアントで、K2.6が58.6%でトップに立ち、GPT-5.4の57.7%を上回り、Claude Opus 4.6の53.4%を打ち負かしました。Anthropicは、同じスイートでOpus 4.7の64.3%を報告しており、これはK2.6に対するクローズドフロンティアがまだ保持している唯一のクリーンコーディングベンチマークの勝利です。マルチステップワークフローにおけるエージェント的なツールの使用を測定するToolathlonベンチマークでは、Moonshotが最も明確に先行しており、K2.6はClaudeの47.2%に対して50.0%を獲得しています。WebブラウジングエージェントベンチマークであるBrowseCompは、K2.6で83.2%となり、Gemini 3.1 Proの85.9%とほぼ同等で、Opus 4.7の79.3%の退行を上回っています。

複合的な読み取り値はTheDecoder分析は、Moonshotが、エージェントが実際に行うプロダクションに近いベンチマーク(ツールの使用、長期間の推論、ウェブブラウジング)に最適化され、純粋なコーディングのヘッドライン数値ではわずかな低下を受け入れたということです。これは、2024年のパターンとは逆で、その時、すべてのオープンウェイトリリースはヘッドラインの同等性を求めてSWE-Benchを追いかけていました。

ツールを使用したHumanity's Last Exam(複合推論ベンチマーク)は、K2.6で54.0%に達しました。この数値は、絶対値よりも、モデルがクローズドモデルと同じレベルでツール拡張推論を効率的に処理できることを確認する点でより意味があります。ベンチマーク選択バイアスは現実であり、懐疑的な読者は独立した再現を待つべきです。しかし、方向性としては、Kimi K2は、ベンチマークポートフォリオが後付けでエージェントに隣接するのではなく、意図的にエージェント指向に見える最初のオープンウェイトモデルです。

4月末にモデルを選択するエージェントビルダーにとって、実用的な選択は単純です。ワークロードが既知のテストケースによる純粋なコード生成である場合、Opus 4.7 は依然として意味のある優位性を持っています。ワークロードにツールの使用、ブラウジング、または複数ステップの連携が含まれる場合、K2.6 はそれらの機能を測定するベンチマークにおいて競争力があるか、それを上回っており、セルフホスト可能な唯一のモデルです。

価格設定に関する議論

トークンあたりの差は 8〜10 倍です。オープンウェイトを考慮すると、タスクあたりの差は、あなたが望む通りになります。


K2.6 の OpenRouter リスティングshows $0.60 per million input tokens and $2.50 per million output tokens as of the April 20 launch. Claude Opus 4.7 lists at $5.00 input and $25.00 output, meaning K2.6 is roughly 8× cheaper on input and 10× cheaper on output through the hosted API. Claude Sonnet 4.6, the lower tier most enterprises actually deploy at scale, lists at $3.00 / $15.00, meaning the gap versus K2.6 is still 5× on input and 6× on output. GPT-5.4 Pro and Gemini 3.1 Pro sit in a similar band to Claude Opus.

The math on a representative agent task makes the gap concrete. An agent run that consumes 20,000 input tokens and 8,000 output tokens costs roughly $0.30 on Claude Opus 4.7 ($0.10 input, $0.20 output). The same run on Kimi K2 costs roughly $0.03 ($0.012 input, $0.02 output). Scale that to a team running 10,000 agent tasks per day, which is a realistic number for a production deployment inside a mid-sized enterprise, and the annual cost delta is on the order of $1M versus $100K for equivalent work.

The open-weight option changes the math further. For workloads where self-hosting makes sense, regulated industries, high-volume automation, latency-sensitive paths where network round-trip matters, the marginal token cost drops to whatever your GPU time plus amortization works out to, which at scale is often well below the $0.60 hosted price. The INT4 quantization support and day-one compatibility with vLLM, SGLang, and KTransformers mean the self-host path is operationally realistic, not a theoretical option.

The pricing gap on its own would be notable. Combined with the open-weight release, it becomes the first release since DeepSeek V3 where the cost-quality frontier for agentic work meaningfully diverges from the closed-source leaders. Anthropic's Opus 4.7 pricing did not move. Moonshot's release may force it to.

The License Fine Print

Modified MITは、ほとんどMITですが、最も恩恵を受けるであろう企業がデプロイをためらうような条項が追加されています。

MoonshotはK2.6をModified MITライセンスの下でリリースしました。これは、標準的なMITとは異なると仮定するのではなく、注意深く読む価値があります。帰属条項が新しい部分です。月間アクティブユーザーが1億人を超える、または月間収益が2,000万ドルを超える商用デプロイでは、製品のユーザーインターフェースで「Kimi K2.6」を明確にクレジットする必要があります。スタートアップ、SMB、社内エンタープライズツール、およびその規模を下回るエージェントシェルベンダーのほとんどを含む小規模なデプロイは影響を受けず、標準的なMIT互換の条件でモデルを使用できます。

このパターンは、MetaのLlamaライセンスを彷彿とさせます。Llamaライセンスは、商用利用を7億MAUの閾値で制限し、それを超える場合はカスタム契約が必要になります。Moonshotのバージョンは、閾値においてはより寛容で、別途ライセンスを必要とするのではなく、継続的な使用を許可しますが、標準的なライセンスページへの記載よりも満たすのが難しい、目に見えるUIクレジット義務を課しています。数十億人のユーザーを抱えるB2C製品にとって、UIに「Powered by Kimi K2.6」を追加することは、単なる法的注釈ではなく、ブランドとデザインにおける重要な決定となります。

Apple、Microsoft、Google、Meta、ByteDanceといった、このライセンスが最も直接的にターゲットとするエンタープライズバイヤーにとって、帰属条項は実質的な障壁となります。アシスタント製品にK2.6を組み込むハイパースケーラーは、エンジニアリングとコストのメリットと、中国のオープンウェイトモデル上で実行していることの明示的な譲歩を比較検討する必要があります。これは、中間規模の企業にとっての純粋なコスト便益分析とは異なる計算であり、UI義務なしでほぼゼロのライセンスコストで最先端のモデルを入手できます。

より広範な戦略的解釈としては、Moonshotはライセンスを使用して、実際に望む市場セグメント(ハイパースケーラー層以下のすべて)を切り分け、同時に最大のプレイヤーが無視できないプレッシャーポイントを残したということです。K2.6を本番環境で実行したい3億ユーザーのハイパースケーラーは、UIクレジット(ほとんどのコンシューマー製品ではありえない)を遵守するか、Moonshotとカスタムライセンスを交渉する(これがオープンソースから商用への収益化の通常の仕組みです)かのいずれかです。いずれにしても、Moonshotは標準的なMITでは得られなかった選択肢を獲得します。

デプロイメントとKimi Codeの賭け

Moonshotはモデルと同じ日にエージェントCLIをリリースしました。これは、彼らが競争が実際にあると考えている場所についての最も明確なシグナルです。

K2.6と同時にリリースされるコマンドラインエージェントシェルであるKimi Codeは、単なるモデルリリースではなくプラットフォームプレイにする製品戦略です。これは、Claude Codeが確立したパターン、つまりターミナルネイティブなエージェントインターフェースで、ファーストクラスのツール呼び出し、ファイル編集、セッションメモリを備え、Cursorのターミナルワークを反映していますが、ベースモデルはオープンウェイトでセルフホスト可能のままです。AIプレビューで高速に構築Kimi Codeを、ClaudeまたはCursorのサブスクリプションなしでエージェントコーディングをしたいチームにとっての実用的な代替案として位置づけています。

オープンウェイトの思想が試されるのは、セルフホストの選択肢です。vLLMは米国の企業にとってリファレンスとなるデプロイメントパスです。SGLangは、大規模なスループット最適化を目指すチームにとって推奨されるパスです。KTransformersは、Huawei AscendハードウェアやNVIDIA以外のアクセラレータで実行するチームにとって最も関連性の高いパスです。これら3つすべてがリリース初日からサポートされており、Moonshotがコミュニティへの統合を任せるのではなく、オープン推論エコシステムと連携したことを示す意味のある指標となります。

規制産業、金融サービス、ヘルスケア、防衛産業にとって、セルフホストの選択肢はブレークスルーとなります。最先端のエージェントモデルをオンプレミスで、INT4量子化を用いて既存のH100またはA100クラスタで実行することが、カスタム統合プロジェクトではなく、サポートされる構成となりました。これは、パートナークラウド(AWS Bedrock、Azure、Vertex AI)を通じてクローズドソースの価格設定でしかセルフホストできないClaude、GPT、Geminiに対する構造的な優位性です。

OpenAI互換APIは、移行コストのレバーです。現在 api.openai.com/v1/chat/completions を呼び出しているエージェントは、ベースURLを変更するだけでKimiのエンドポイントを指すことができ、SDK、リクエストスキーマ、レスポンスハンドリングはそのまま維持できます。これはDeepSeek、Together、Fireworksが行ったのと同じポータビリティへの賭けであり、過去18ヶ月で最も多くの本番環境でのモデル切り替えを促進した賭けです。

米中間のオープン・クローズドの分岐

米国の最先端研究室はすべて閉鎖されています。中国の最先端研究室はすべて開設されています。Kimi K2.6 は、その分裂の最も明確な例です。

Anthropic の Claude Opus 4.7 はクローズドでリリースされ、同社は最先端モデルである Mythos が内部にとどまっていることを明確に認めています。OpenAI の GPT-5.4 はクローズドです。Google の Gemini 3.1 Pro はクローズドです。米国の 3 つの最先端研究室は、安全性、能力制限、商業経済などを理由に、最上位モデルでクローズドウェイトの姿勢に収束しました。

中国の最先端研究室はすべて逆の方向に向かっています。Moonshot は Kimi K2.0 から K2.6 をオープンウェイトでリリースしました。DeepSeek V3 および V4 はオープンです。Qwen の最新版もオープンです。アーキテクチャの開示、ウェイトの公開、ライセンス条件、そして極めつけはトークンあたりの価格設定など、あらゆるレイヤーで戦略的な分岐が見られます。

エージェント開発者にとっての結果は、二極化した市場です。SWE-Bench の最後の 5〜7 ポイント、8 時間自律エージェントを首尾一貫して実行するモデルといった絶対的な能力のフロンティアは、クローズドであり、Anthropic、OpenAI、Google が保持しています。ほとんどの本番デプロイメントが行われるコスト・品質のフロンティアはオープンウェイトであり、ますます中国の研究室が担うようになっています。ほとんどの企業は、10 倍のコストのクローズドモデルと 90% の能力を持つオープンウェイトモデルの選択肢を与えられた場合、ガバナンスとセキュリティレビューが許可すれば、オープンな方を選択するでしょう。

ガバナンスとセキュリティレビューが残された課題です。中国製モデルの出所は、輸出管理、データ処理、サプライチェーンレビューに関する疑問を提起しており、米国の企業バイヤーはこれらを普遍的に解決していません。一部の大手銀行や防衛請負業者は、中国製モデルの導入に対して明確なポリシーを持っています。代わりに現れたパターンは間接的な利用です。企業は、OpenRouter、米国のホスティングパートナー、または米国のインフラストラクチャ上でのセルフホスティングを通じてK2.6またはDeepSeekを実行しており、これにより能力を拒否することなく調達上の異議を回避しています。

ロールアウトを妨げる可能性のあるもの

ライセンス、出所レビュー、ベンチマーク選択が、現在進行中の3つのリスクです。

帰属条項が最初の課題です。大企業の法務チームは、ClaudeやGPTと比較した場合の節約額に対して、目に見えるUIクレジットのコストをモデル化したいと考えていますが、その計算はコンシューマー向け製品の場合、Kimiにとって必ずしも有利になるとは限りません。Q2には、B2Cチームがこの条項を検討するにつれて、「気に入っているが、出荷できない」という会話が静かに広がるでしょう。

中国製モデルの出所が2番目の課題です。中国製モデルに対する企業のセキュリティレビューは、米国製モデルに対する同等のレビューよりも時間がかかり、費用が高く、そして「いいえ」という結果になる可能性が高いです。Moonshotのオープンウェイトリリースは役立ちます。モデルは検査、監査、セルフホスティングが可能ですが、Fortune 500規模での調達プロセスでは、依然として原産国が主要なフラグとして扱われます。

ベンチマークの再現性は3つ目です。K2.6がSWE-Bench Pro、Toolathlon、BrowseCompで示したリードは、来月中に独立して再ベンチマークされ、Moonshotの内部数値と第三者による再実行との間にギャップがあれば、その情報が急速に広まるでしょう。より広範なオープンウェイトエコシステムは、この点において良好な実績を持っています。DeepSeekの主張は、ほとんどが精査に耐えていますが、検証サイクルは信頼を獲得するプロセスの一部です。

サポートの継続性は、より静かなリスクです。最先端の研究機関は、継続的にセキュリティアップデート、品質パッチ、および微妙な安全性の調整をリリースします。オープンウェイトのリリースは、その時点でのスナップショットです。アップストリームのアップデートを追跡しないエンタープライズデプロイメントは、微妙な機能の差においてクローズドな競合他社に遅れをとることになります。Moonshotのリリーススケジュールは、彼らが高速な更新サイクルにあることを示唆していますが、セルフホストされたデプロイメントは、最新の状態を維持する責任を継承します。これは実際の運用作業です。

エージェントビルダーのための実践的な読み物

Kimi K2のリリースは、エージェントワークにおけるコストと品質のフロンティアがオープンウェイトに移行したことを示す最も明確なシグナルです。ワークロードがコーディング中心で既知のテストケースがある場合、Claude Opus 4.7が依然として直接対決で勝利します。ワークロードがエージェント中心で、ツールが多く、コストに敏感な場合、K2.6は機能面で競争力があり、コストは桁違いに安くなります。さらに、セルフホストオプションは、クローズドモデルが競合できない構造的なコスト優位性をもたらします。来四半期にプロダクションスタックを選択するチームにとって、ClaudeとKimiの両方を並行して実行し、コーディング中心のワークロードはAnthropicに、エージェントオーケストレーションワークロードはK2.6にルーティングすることは、機能ギャップが縮小または拡大するまで、合理的なアーキテクチャです。Moonshotがエージェントプラットフォームが純粋なモデルに勝つと見込んでいる広範な賭けは、Anthropicがタスク予算で行っていることと類似しています。/ultrareview、OpenAIがCodexで何をしているか、そしてCursorやDevinがそれらをどのように構築してきたかについてです。Moonshotのプラットフォームはオープンであり、コスト、制御、または出所を気にする人々のデプロイメント計算を変えます。マルチモデルスタック全体で何が機能し、何が失敗し、なぜ失敗したのかの耐久性のある記録を保持することは、モデル選択自体と同じくらい重要になり始めます。そこで、適切にスコープされた「AIネイティブのセカンドブレインエージェントスタックがその上に構築されるインスティテューショナルレイヤーになります。Kimi K2.6は、今月のエージェントビルダーリリースです。それを使って何をするかは、セルフホストできるかどうか、帰属条項に納得できるかどうか、そして調達プロセスで中国起源のモデルが承認されるかどうかにかかっています。それらのうち少なくとも2つに「はい」と答えられるほとんどのチームにとって、その判断は簡単です。

 
 

無料で始めましょう

ローカルファーストのパーソナル知識管理付きAIアシスタント

より良いAI体験のために、

remio は現在、 Windows 10+ (x64)M-Chip Mac のみをサポートしています。

脳内に検索バーを追加

ただremioに尋ねるだけ

すべてを思い出す

何も整理しない

bottom of page