Mamba 3モデルがポストトランスフォーマー論争を再燃させる
- Aisha Washington

- 6月16日
- 読了時間: 5分
Mamba 3モデルは2026年6月中旬にリリースされ、最大100万トークンまでのコンテキスト長で主要なトランスフォーマーシステムと同等のベンチマーク数値を達成した。このモデルは、2次関数のアテンションコストを回避する選択的状態空間アーキテクチャを用いてこの同等性を実現している。業界関係者はこのリリースを、アテンションのみのより大規模なモデルが唯一の実行可能なスケーリング経路であるという主流の前提に対する信頼できる代替案として位置づけた。
このリリースは、いくつかの大規模ラボがさらに大規模なアテ<|eos|>
一部の研究者は、モデルが制御されたベンチマークを超えてオープンエンドの生成に移行した際に、報告された利点が維持されるかどうかを疑問視している。Mamba 3 モデルの論文には限定的な人間評価しか含まれておらず、後で驚きが残る余地がある。APIユーザーからの初期の逸話的な報告では、タスクが複数のインターリーブされたエンティティの追跡を必要とする場合、数10万トークン後に長距離コヒーレンスの劣化が時折発生することを示している。
競合グループが同じ週に、疎なパターンによる同様のメモリ削減を主張するアテンションのバリアントをリリースした。完全な規模での直接的な対決テストはまだ実施されていない。それらのテストが実行されるまで、どちらのアプローチも確定した代替ではなく主張の域を出ない。追加のリスクとして、推論ツールの相対的な未熟さがある。TransformerのKVキャッシュ向けに最適化された既存のフレームワークは、Mamba 3 が標準的なGPUフリート上で同等のトークン/秒スループットを達成する前に、かなりのエンジニアリング作業を必要とする。
What Labs Must Decide Next
検索拡張製品を構築するチームは、Mamba 3 モデル上で独自の長文脈ワークロードを実行する必要がある。早期採用者は今後8週間以内に結果を公開する予定だ。2つの大手クラウドプロバイダーの調達チームは、実際のトラフィックパターン下での本番スループットをテストするため、2026年後半にベンチマーククラスタをすでにスケジュールしている。
2027年のハードウェア調達計画には、Transformerの継続的な成長に関する前提がすでに含まれている。ステートスペースモデルへの持続的な移行があれば、それらの発注内容が変わる可能性がある。データセンターのエネルギー使用を監視する規制当局は、2つの大規模トレーニング事業者に対して更新された予測を求めている。それらの報告書は8月上旬までに提出される予定だ。
Deployment Questions That Remain Open
Transformerのキーバリューキャッシュ向けに構築された本番サービングスタックは、ステートスペースモデルに直接移行しない。Mamba 3 モデルが同じスループット目標で実行できるようにするには、推論フレームワークの更新が必要だ。トレーニング向けのカスタムカーネルは存在するが、本番グレードのサービングランタイムはまだ初期ベータ版の段階にある。
アテンションレイヤーに焦点を当てた安全性評価にも、新しいテストスイートが必要となる。いくつかのレッドチームグループは、異なる内部状態表現に合わせてプロンプトの適応をすでに開始している。解釈可能性の研究者は、圧縮された状態ベクトルが機械論的分析に適するかどうかを探求しているか、あるいは新たな不透明性を導入するかどうかを調査している。今後3ヶ月間で、これらの実務的なギャップが効率面の優位性の拡大よりも速く解消されるかどうかが明らかになる。
Future Directions and What to Watch
Mamba研究グループは、画像とテキストのインターリーブされたトークンに同じ選択的ステートスペースの原理を適用するマルチモーダル拡張の計画を表明している。初期の内部結果では、高解像度画像が長いテキスト文脈を伴う場合に現在2次コストに苦しむビジョン言語タスクに対して、線形スケーリングが拡張されることが示唆されている。ハードウェア企業は、Transformerのワークロードで支配的な行列乗算ではなく、再帰的な更新パターンを最適化するアクセラレータ設計の議論を開始している。カスタムシリコンが登場すれば、ステートスペースモデルとアテンションモデルの間の効率ギャップはさらに拡大する可能性がある。Mamba 3 を既存の推論エンジンに移植するオープンソースの取り組みはすでに進行中で、最初のコミュニティチェックポイントは2026年夏の終わりまでに公開される見込みだ。
FAQ
Mamba 3 のTransformerに対する主な利点は何ですか?
Mamba 3 は、長文脈タスクで同等の精度を実現しながら、2次ではなく線形の計算を使用し、メモリ要件を約40%削減します。
Mamba 3 はTransformerを完全に置き換えますか?
ほとんどの専門家は、完全な置き換えではなくハイブリッド設計を予想しており、ステートスペースレイヤーが長いシーケンスを処理し、アテンションは特定の局所パターンに保持されると考えています。
開発者はいつMamba 3 にアクセスできますか?
早期APIアクセスは2026年6月に開始され、オープンソースのチェックポイントは夏の終わりまでに、オープンソースのチェックポイントは夏の終わりまでに、本番グレードの推論ランタイムは今年後半に提供される予定です。
Mamba 3 はトレーニングのエネルギー消費を削減しますか?
はい。論文では、30B規模でトレーニングトークンあたりのキロワット時が42%削減されたと報告されており、この数値は小規模なアブレーションで独立して検証されています。
推論にはどのような新しいツールが必要ですか?
既存のTransformer最適化フレームワークは、再帰的な状態表現をサポートするために更新が必要です。トレーニングおよび初期サービングランタイム向けのカスタムTritonカーネルはすでに存在し、初期のサービングランタイムはベータ版です。


