top of page

Qwen3.6 オープンソースモデルが397Bの巨人を打ち負かす - Alibabaが静かにフラッグシップのウェイトを閉じる

AlibabaのQwenチームは2026年4月20日にQwen3.6-Max-Previewをリリースしました - そしてQwenの3年間の歴史で初めて、フラッグシップモデルは公開ウェイトなしで提供されます。Hugging Faceのダウンロードなし、ModelScopeのリリースなし、セルフホスティングオプションなし。APIアクセスのみ、Alibaba CloudのModel Studioエンドポイントを通じて。100を超えるオープンウェイトモデルをリリースし、コミュニティダウンロードをほぼ10億回蓄積したチームが、最も capable なモデルのセルフホスティングの扉を閉じたのです。

2日後、同じチームがQwen3.6-27Bをリリースしました。完全にオープンでApache 2.0ライセンス付きで、Alibabaのベンチマークによると、ソフトウェアエンジニアにとって最も重要なタスクで3970億パラメータの前世代モデルを上回る性能を発揮します。Qwen3.6のオープンソースリリースは、ダウンロードして自分で実行できるモデルです。リーダーボードでトップのモデルは、実行できないものです。

それが2026年4月のAlibabaリリースの中心にある緊張関係です。世界で最もダウンロードされたオープンソースAIモデルファミリーの最も capable なバージョンが、オープンソースの貢献ではなく、プロプライエタリなAPI製品として登場したのです。世界のオープンソースAIのチャンピオンが、これまで引いたことのない一線を引いたのです。そしてQwen3.6のオープンソースモデルが実行する価値があるという最も強い論拠は、Alibabaがロックを解除したままにしたモデルに詰め込まれています。

何が起きたのか

Alibabaは2026年4月20日にQwen3.6-Max-Previewをリリースし、six agentic coding benchmarks: SWE-bench Pro、Terminal-Bench 2.0、SkillsBench、SciCode、QwenClawBench、QwenWebBenchでトップの座を獲得したと主張しました。このモデルはOpenAI互換およびAnthropic互換のAPIの背後で動作し、260,000トークンのコンテキストウィンドウをサポートし、preserve_thinking機能を備えていて、マルチターン会話全体で推論トレースを維持します - コンテキストの連続性が重要な長時間実行のエージェントワークフローに関連します。

これはQwenのフラッグシップティアで初めてのクローズドウェイトリリースです。これまでの主要な世代 - Qwen、Qwen2、Qwen3、Qwen3.5 - はすべてApache 2.0の下でオープンウェイトで提供されました。Max-Previewのローンチと並行して、AlibabaはQwen Codeの無料ティアを終了しました。シグナルは明白です。製品ラインのトップがコミュニティダウンロードではなく、従量課金制のAPIモデルに移行しているのです。

チームがオープンにしたままにしたものも同様に重要です。2026年4月22日にリリースされたQwen3.6-27Bは、Hugging FaceでApache 2.0の下で利用可能な完全にオープンなdenseモデルです。262,144トークンのコンテキストウィンドウを搭載し - YaRNスケーリングにより100万トークン超に拡張可能 - Q4_K_M量子化で約16.8GBに収まります。Alibabaの報告したベンチマークでは、SWE-bench Verifiedで77.2%、SWE-bench Proで53.5%、Terminal-Bench 2.0で59.3%を記録しました。

その前世代 - Qwen3.5-397B-A17B、rawパラメータ数で約15倍大きいMixture-of-Expertsモデル - は同じタスクで76.2%、50.9%、52.5%を記録しました。27Bは397Bを上回ります。そしてダウンロードできるのは27Bだけです。

オープンなまま残っているもの: Qwen3.6-35B-A3B(4月2日リリースのMoEバリアント)、Qwen3.5-Plusシリーズ、Qwen3-Coder-Plus、Qwen3-VLマルチモーダルモデル。クローズドウェイトの決定はフラッグシップティアにのみ適用され、Qwenブランド全体には適用されません。しかしフラッグシップはどのモデルファミリーの軌道も定義するものであり、このファミリーはオープンソースのコモンズから離れました。

なぜ重要なのか

この特定の決定が重みを持つ理由を理解するには、Qwenのオープンソースの実績が実際に何を表しているかから始める必要があります。

Alibabaは2023年4月にTongyi Qianwenという元の名前でQwenを立ち上げました。2026年1月までにQwenファミリーの累積ダウンロード数はsurpassed 700 millionに達しました。2026年3月には9億4200万回に達し - 2月だけで1億5360万回のダウンロードがありました。Interconnects AIの追跡データによると、Qwenのglobal open-source download shareはその月時点で50%を超え - 次の8つのモデルファミリーの合計を2倍以上上回っていました。

これはニッチな研究プロジェクトではありません。Qwenは現在利用可能なダウンロード指標のいずれにおいても、地球上で支配的なオープンソースAIモデルファミリーです。その規模により、フラッグシップのクローズドウェイト決定は、小さなラボがハイブリッド戦略を試みる場合とは materially 異なります。Qwenが動くとき、それはオープンアクセスの期待の上に築かれたコミュニティの重みを持って動くのです。

信頼の側面は特にエンタープライズバイヤーにとって重要です。オープンウェイトモデルに依存する組織は、コストだけでなく、予測可能性のためにそうすることが多いです。デプロイするものを監査する能力、ファインチューニングのオプション、所有していないベンダーが制御するAPI非推奨スケジュールからの免疫です。フラッグシップをAPI専用に移行すると、Qwenチームがこれまで答えなければならなかったことのない質問がテーブルに上がります。Alibabaが価格を変更したり、エンドポイントをレート制限したり、API可用性に影響する規制圧力に直面したりした場合、生産依存はどうなるのか?

データ所在は2つ目の摩擦点をもたらします。QwenのAPIインフラはAlibaba Cloud上で動作し、中国の規制管轄下にあります。EUおよび北米の規制産業 - 金融サービス、ヘルスケア、法律 - にとって、機密ワークロードをAlibabaのクラウドインフラ経由でルーティングすることは、ClaudeやGPT-5のデプロイメントには存在しないコンプライアンス上の質問を引き起こします。クローズドウェイトへの移行は、コンプライアンスを意識するチームが以前にQwenモデルを自社のデータ境界内で使用するために頼っていたセルフホスティングの回避策を排除します。

タイミングは決定自体と同じくらい重要です。2026年4月は、世界で最も著名なオープンソースAI貢献者の2つ - AlibabaとMeta - が同じ3週間の窓で両方ともプロプライエタリなフラッグシップモデルをリリースした月です。MetaのMuse Spark、同社の初のクローズドソースモデルは4月8日にローンチされました。AlibabaのMax-Previewは4月20日に続きました。AIにおける2大オープンソース貢献者が数週間以内に同じ方向に動いたとき、それはもはや外れ値ではありません。トレンドです。

オープンソースのパラドックス - 勝つはずのない27Bモデル

Qwen3.6リリースで最も過小評価されている側面は、フラッグシップがクローズドになったことではありません。Alibabaが残したオープンウェイトモデルがエージェントコーディングタスクでoutperforms its 397B predecessorしたことです - その理由は理解する価値があります。

Qwen3.5-397B-A17BはMixture-of-Experts (MoE) アーキテクチャです。MoEモデルは各入力トークンを専門化されたサブネットワークのサブセットにルーティングし、推論パスごとに総パラメータのごく一部のみを活性化します。この場合: 総パラメータ3970億ですが、任意のトークンで活性化するのは170億のみです。実際の推論ごとのコンピュートを決定する数は170億で、3970億ではありません。

Qwen3.6-27Bはdenseモデルです。すべての270億パラメータがすべての推論パスで活性化されます。これら2つのモデルが推論時に使用する有効コンピュートを比較すると、27Bのdenseモデルは実際にはMoEモデルの397Bよりもトークンあたり多くのパラメータを実行します。サイズの数字は実際に発火するものを見ると逆転します。27Bの「より小さい」モデルは、そのはるかに大きいMoE前世代よりもトークンあたり計算量が重いのです。

Qwen3.6-27Bを駆動するアーキテクチャはGated DeltaNetハイブリッドです - 線形アテンション機構と従来のセルフアテンションを組み合わせています。Alibabaの技術文書によると、このハイブリッドアプローチは標準的なtransformerのみのアーキテクチャと比較して長文脈処理と推論効率を改善します。このモデルはQ4_K_M量子化で約16.8GBに収まり、1台のハイエンドコンシューマーまたはワークステーションGPUで実行可能です。1台のRTX 5090または1台のA100を所有するチームは、Alibabaの数字ではマルチGPU推論クラスタを必要とした397Bシステムのベンチマーク性能を上回るモデルを実行できます。

Alibabaが報告するbenchmarks Alibaba reportsでは、Qwen3.6-27BはSWE-bench Verifiedで77.2%を記録し、前世代の397Bは76.2%でした。Terminal-Bench 2.0 - 実際のターミナルベースの開発タスクをテストするもの - では、27Bは59.3%で前世代の52.5%に対し、6.8ポイントの差があります。SkillsBenchはさらに広いマージンを示します: 27Bで48.2%、MoEで30.0%、1世代で77%の相対改善です。

これらの数字が正確であれば、効率の話は現実的で重要です。実用的な意味は、組織が今や準フラッグシップレベルのコーディング性能を所有ハードウェア上でローカルに、完全なデータ所在で、1年前にはミッドティアモデル用に予約されていた量子化モデルサイズで実行できるということです。オープンな代替案がこれほど迅速にギャップを埋めるなら、クローズドウェイトモデルにAPIプレミアムを支払う理由は弱まります。

ただし、これらの数字を確定したものとして扱う前に懐疑心を適用することは正当化されます。

ベンチマークはAlibabaの内部エージェント足場を使用しています。SWE-bench Verifiedは実際のGitHub issue解決をテストしますが、そのベンチマークでのモデルのスコアはモデルとその周囲の足場の両方の関数です - エージェントがどのようにプロンプトされ、ツールの失敗をどのように処理し、フィードバックループをどのように処理するか。Alibabaの内部足場はQwenのパフォーマンスを最大化するように調整されている可能性が高いです。標準的な公開足場(SWE-agent、OpenHands、または類似)を使用した独立した評価は、この執筆時点では公開されていません。

ベンチマークの選択もAlibabaのものです。SWE-bench Pro、Terminal-Bench 2.0、SkillsBench、QwenClawBench、QwenWebBench、SciCode: これら6つのベンチマークはツール使用、コード生成、ウェブインタラクションに焦点を共有しています - Qwenチームがトレーニング投資を集中させた分野です。GPQA Diamond上の形式推論タスクやビジョン言語作業など、競合モデルがリードするベンチマークはAlibabaの比較表から欠落しています。

独立した評価者による実世界のテストは、より混合した絵を示しています。公開されたテストの1つは、Qwen3.6-Max-PreviewをClaude Opus 4.7およびGPT-5.4と、開発者ワークフローから得た20の実際のコーディングタスクで対決させました。公式リーダーボードでトップのモデルは、複数のツールコールにわたる反復的なデバッグを必要とするタスクでパフォーマンスが劣っていたと報告されており、モデルがアプローチを適応させるのではなく失敗したアクションを繰り返す文書化された事例がありました。ベンチマーク性能と開発者体験は常に一致するわけではありません。

これらのどれもAlibabaの数字を無効にするものではありません - それらを文脈化するものです。現代のdenseモデルがはるかに大きいMoEシステムとのギャップを埋めているという方向性の話は現実的です。具体的なパーセンテージポイントは、独立した評価フレームワークが結果を生成した後に確認または修正されるでしょう。Qwen3.6-27Bはそのサイズクラスで genuinely 強いオープンウェイトモデルのようです。より広いポイント - QwenのオープンソースラインナップがフラッグシップがAPI専用に移行しても競争力を維持している - はより耐久性のある観察です。

競争的文脈

Alibabaのクローズドウェイト決定は孤立して到着したわけではありません。フロンティアAIラボにわたるオープンウェイト対クローズドウェイトの議論はまさにこの瞬間に再形成されており、異なるラボが取る立場はAIスタックを選択する開発者にとっての競争環境を定義します。

DeepSeekは2026年4月24日にV4をリリースしました - Qwen3.6-Max-Previewの4日後 - MITライセンスの下でオープンウェイト、100万トークンのコンテキストウィンドウ、Alibabaのクローズドモデルを大幅に下回るAPI価格で。DeepSeekはAlibabaと同じく中国のラボですが、同じ瞬間に反対の方向を選択しました: フロンティア規模でもオープンウェイトに倍増しました。最も著名な2つの中国AIラボが今やオープンソースの質問で反対側にいます。

Mistral AIはApache 2.0の下でコアモデルバリアントを引き続きリリースしています: Devstral 2(コーディング)、Voxtral(オーディオ)、Leanstral(形式証明検証)。MistralはAPI SLAとエンタープライズサポートに料金を請求しますが、ウェイトは利用可能です。同等のモデルでのAPI価格はコストパートークンベースでQwen Max-Previewを下回り、すでに小さなオープンモデルに慣れている開発者にとってプロプライエタリな価格優位性を低減します。

Metaの軌道はAlibabaの動きに最も明確な並行を提供します。MetaはLlamaオープンウェイトリリース - Llama 3、Llama 3.1、Llama 4 - を通じて significant な開発者善意を築き、4月8日に初のクローズドソースモデルであるMuse Sparkをローンチし、クリエイティブおよびエージェントヘビーなワークロードをターゲットにしました。MetaとAlibabaの両方がたどったパターンは同一です: オープンソースを通じてエコシステム支配を築き、コミュニティが確立された後にプロプライエタリなトップティアを導入する。Stability AIはStable Diffusionでこのプレイブックのより初期のバージョンを走らせ、商用バリアントをクローズドにしました; 今との違いは、それがフロンティアモデル規模で起こっていることです。

今日モデルを選択する開発者にとって、市場は今や明確な方法で二極化しています: データ所在、ファインチューニング制御、予測可能なアクセス、またはローカルデプロイメントを必要とするチーム向けのオープンウェイトモデル; 推論インフラを管理せずにベンチマークトップの性能にプレミアムを支払う意思のあるチーム向けのクローズドウェイトAPIモデル。Qwen3.6は今や両方の立場にまたがっています - クローズド側にMax-Preview、オープン側に27Bと35B-A3B。そのデュアルトラック戦略が維持されるかどうかは、オープンティアがどれだけ速く追いつくかにかかっています。

次に何が起こるか

即時の未解決の質問はMax-Previewの性能主張の独立した検証です。サードパーティの評価者がAlibabaの内部スタックではなく標準的な足場を使用して6つのベンチマークランキングを再現するまで、数字は暫定的な状態にあります。以前のQwen世代は独立した精査の下で合理的に持ちこたえました; Max-Previewは今後2〜4ヶ月で研究グループと評価ラボが結果を公開するにつれて同じプロセスに直面するでしょう。

Qwen3.6-Max-Previewを生産依存として評価するエンタープライズバイヤーにとって、ベンチマーク位置に関係なく2つの摩擦点が採用を遅らせるでしょう。第一に、データ所在の質問: Alibaba Cloud上のAPIインフラはデータを中国の規制管轄内に置き、規制された北米および欧州の産業の組織にコンプライアンスの不確実性を生み出します。第二に、ベンダー集中リスク: クローズドウェイトAPI製品は、オープンウェイトのセルフホストデプロイメントではできない方法で価格を変更したり、エンドポイントを非推奨にしたり、ポリシー制限に直面したりする可能性があります。以前にApache 2.0の下でQwenをセルフホストしていた組織にはこれらの懸念はありませんでした。Max-Previewティアは両方を導入します。

長期的には、27Bリリースからの効率の話が追跡すべきより重要な開発です。もし27Bのdenseモデルが今日エージェントコーディングタスクで397BのMoE前世代と同等になれるなら、フロンティアのクローズドモデルと最高のオープンウェイト代替案の間のギャップは、クローズドウェイトの価格プレミアムが想定するよりも速く狭まっています。ほとんどのエンジニアリングチームはSWE-benchの最後の数パーセントポイントを必要としません。彼らは自社のインフラに適合し、確実に動作し、実際のタスク分布の広い中間を処理するモデルを必要とします。Qwen3.6-27Bは16.8GB量子化で、中規模のエンジニアリングチームが所有するハードウェア上で実行できるモデルです - そしてそれで十分かもしれません。

Alibabaのデュアルトラック戦略は、クローズドのMax-Previewとオープンの27Bの間のギャップがAPI価格を維持するのに十分広く、最高の性能を望むユーザーがそれにお金を払うだろうと賭けています。もしオープンウェイトモデルが2024年から2026年にかけて見られたペースで改善を続け - そしてdenseアーキテクチャが実際のワークロードにとって重要なベンチマークでMoEの対応物を上回り続けるなら - そのギャップはAlibabaの価格モデルが適応する前に閉じるかもしれません。

今のところ、Qwen3.6のオープンソースリリースは依然としてどのサイズティアでも利用可能な最も強いオープンウェイトモデルファミリーの1つを表しています。質問は、フラッグシップをクローズドにすることが、開発者コミュニティがQwenが出荷する他のすべてをどのように評価するかを変えるかどうかです。オープンソースの信頼性は累積的です。Qwenは3年とほぼ10億のダウンロードでそれを築きました。Max-Previewがその信頼性をどの程度侵食するかは、Alibabaのミッドティアモデルがオープンに留まった競合他社に追いつき続けるかどうか - そして開発者が2ティアのQwenで十分だと判断するか、決して一線を引かなかったラボを探し始めるかにかかっています。

2026年のAIモデルリリースのペース - Qwen、DeepSeek、Meta、Anthropicなどを横断して週に複数の主要アップデート - は、最新情報を保とうとするエンジニアリングチームや研究者にとって、競争環境の変化を追跡することを significant なオーバーヘッドにしました。どのオープンウェイトモデルがベンチマークする価値があるか、どのAPIプロバイダが価格を調整しているか、オープン対クローズドの議論が週ごとにどのように進化しているかを監視する必要がある場合、remio for engineersはあなたの読書と研究を自動的にキャプチャするローカルファーストのAIナレッジベースを提供します - なので、リーダーボードが変わるたびにゼロからコンテキストを再構築する必要はありません。

Qwen3.6のオープンソースとクローズドウェイトの分割は、今後も展開し続ける物語を語っています。ベンチマークの数字は独立して検証されるでしょう。エンタープライズ採用はデータ所在のテストに直面するでしょう。そしてオープンウェイトの27Bはリリースの物語としてその位置を維持するか - あるいはおそらく再びウェイトが添付されずにAlibabaが出荷する次世代に静かに追い越されるでしょう。

 
 

無料で始めましょう

ローカルファーストのパーソナル知識管理付きAIアシスタント

より良いAI体験のために、

remio は現在、 Windows 10+ (x64)M-Chip Mac のみをサポートしています。

脳内に検索バーを追加

ただremioに尋ねるだけ

すべてを思い出す

何も整理しない

bottom of page