top of page

Black Forest Labs FLUX 3 Action、オープンなロボット重みでNvidiaに挑む

3 時間前
読了時間: 18分

Black Forest Labsは9月23日、オープンウェイトの70億パラメータモデル「FLUX 3 Action」を公開し、汎用ロボット制御を巡る競争に本格参入した。同社によれば、このモデルはNvidiaの競合するCosmos 3 Nano policyより少ないパラメータ数でありながら、有力なシミュレーションベンチマークで首位に立っている。

この比較こそが、今回のリリースの重要性を示している。Black Forest Labs FLUX 3 Actionは、単なる別のデモ向けに転用された画像生成モデルではない。動画とロボットの行動を同時に予測し、視覚的な観測情報と自然言語による指示を、一連の物理的なコマンドへと変換する。

初期結果は有望に見えるが、汎用ロボティクスにおけるブレークスルーと呼ぶには、なお範囲が限られている。最高スコアはシミュレーション上の卓上タスクで得られたものであり、小規模な外部ハードウェア試験はわずか30回の試行にとどまった。オープンウェイトにはライセンス条件、多大な計算要件、そして導入者に課される明示的な安全責任も伴う。

Black Forest Labs FLUX 3 Actionがロボティクス競争を変える

重要な変化は、有力なビジュアルAI開発企業が、実用可能なロボット向け重みと、それらを適応させるためのコードの両方を公開した点にある。

FLUX 3 Actionは、単一のアーキテクチャ内で将来の視覚状態とロボットコマンドを予測する、world action model(WAM)だ。カメラフレーム、ロボットの現在状態、テキストによる指示を受け取り、予測動画フレームとともに次のアクション群を生成する。

Black Forest Labsは主に3つのコンポーネントを公開した。ベースリポジトリには、アクションで事前学習されたモデルと共有エンコーダーが含まれる。別途提供されるDROIDおよびSO-101のチェックポイントは、確立された2つのロボット構成に適応したポリシーを提供する。

DROIDは、多様な環境における実世界のデモンストレーションから構築された、大規模なロボット操作データセットだ。公開されたDROIDポリシーは、3つのカメラビューを備えたFrankaロボット構成を対象としている。SO-101版は、Hugging FaceのLeRobotフレームワークで一般的に使われる、より小型で低コストのロボットアームを対象とする。

モデルは70億パラメータで構成される。公開されたモデルドキュメントによれば、DROIDでの1回の推論呼び出しは、約2秒間の動作をカバーする32個のアクションを返す。

このアクションの予測範囲は重要だ。ロボットコントローラーは観測、計画、行動を繰り返さなければならない。実用的な予測ウィンドウが長ければ、フルモデルを実行する頻度を減らせる可能性がある。ただし、計画開始後に環境が変化した場合、より長いアクション群は誤差を増幅するおそれもある。

リリースには、フルファインチューニング、パラメータ効率の高い適応、推論、チェックポイント変換、評価ツールが含まれる。開発者はベースモデルから始め、別のロボット向けに適応させることも、用意されたポリシーのいずれかを実行することもできる。

これはモデルカードとデモ動画を公開するだけのものではない。公開されたinference repositoryには、データ準備、分散トレーニング、チェックポイント管理、エクスポートツール、ロボット固有のサンプルが含まれている。

同社はNvidiaおよびHugging Faceとともに今回のリリースを開発した。この協力関係は競争という構図を複雑にする。Nvidiaはモデルの実現を支援し、ハードウェアスタックの大部分を供給している一方、そのCosmosポリシーは最も重要なオープンベンチマーク上の競合でもある。

FLUX 3 Actionは、より大きなFLUX 3プログラムから発展した。Black Forest Labsは当初、画像生成を中心に評価を築いた。同社の最新アーキテクチャは、この視覚的な基盤を動画、音声、アクション予測へと拡張している。

このつながりは表面的なものではない。動画モデルは、物体が時間とともにどのように移動し、衝突し、変形し、反応するかを推定しなければならない。ロボットポリシーにも関連する情報が必要だが、望ましい結果を生むコマンドも選択しなければならない。

Black Forest Labsは、この2つの問題が1つの共有モデルに属すると見込んでいる。その賭けには今や、ダウンロード可能な重み、動作するチェックポイント、そして他チームが検証できるベンチマーク結果がある。

より小さなモデルがRoboLab-120で首位に

FLUX 3 Actionの初期段階で最も強い主張は、RoboLab-120で42.92%の成功率を記録し、Nvidiaのより大きなCosmos3-Nano-Policyの36.8%を上回ったことだ。

RoboLab-120は、120の卓上操作タスクで構成されるシミュレーションベンチマークだ。各ポリシーは複数の難易度にわたり、視覚的、手順的、関係的な課題に取り組む。

例としては、正しい物体の識別、空間的な関係の理解、複数段階の指示の完遂などがある。このベンチマークは、DROIDスタイルのFrankaロボット設定でNvidia Isaac Sim上で実行される。

RoboLab論文は、テストを特定のモデルアーキテクチャに縛ることなく、現実的なシーンとタスクを生成するシステムを説明している。RoboLab-120では各タスクを10回試行するため、短いデモリールより大きな評価セットとなる。

Black Forest Labsによれば、DROID向けにチューニングされたモデルは全体で42.92%の成功率に達した。OASIS WAMは39.0%、NvidiaのCosmos3-Nano-Policyはデフォルトの言語設定で36.8%を記録したと報告されている。

Physical Intelligenceのπ0.5は同じ比較で28.0%に達した。DreamZeroは25.7%、Nvidiaのより小型なCosmos3-Edge-Policyは22.9%だった。

これらの数値により、FLUX 3 Actionは公開された比較における現在の首位となる。ただし、これは大半のタスクを確実に完了できることを意味しない。42.92%の成功率は、評価された試行の半数以上で失敗していることも意味する。

パラメータ数の比較も注目に値する。FLUX 3 Actionは70億パラメータであるのに対し、Cosmos 3 Nanoは160億パラメータを使用する。報告されたリーダーボード上では、Black Forest Labsのより小さなモデルが6.12ポイント先行している。

パラメータ数は、コスト、レイテンシー、知能を直接測る指標ではない。アーキテクチャ、精度、メモリー移動、サンプリングステップ、エンコーダーのオーバーヘッドはいずれも、実際の導入性能に影響する。

Black Forest Labsは複数の推論バリアントも提供している。ベースポリシーはガイダンス付きで4回のノイズ除去ステップを使う。別のチェックポイントは外部ガイダンスを除去し、ステップ蒸留版は1ステップで結果を生成する。

同社は、テストしたハードウェア構成全体でCosmos 3 Nanoより高速な推論を報告している。具体的な優位性は、チェックポイント、数値精度、GPUによって異なる。

これらの最適化は、ロボティクスにおける現実的な制約に対応するものだ。印象的なアクションを計画できても、応答が遅すぎるモデルでは、移動、干渉、知覚エラーから回復できない。

それでも、注目を集めるベンチマークには文脈が必要だ。RoboLabが評価するのはシミュレーション上の操作であり、人の周囲で起こる予測不能な作業ではない。シミュレーションは比較を標準化できるが、あらゆるセンサーエラー、機械的故障、衝突、環境変化を表現することはできない。

このベンチマークはNvidiaのロボティクス研究スタックからも生まれている。それによって結果が無効になるわけではないが、独立した再現の価値は特に高い。

Cosmosに関する公開されたissueでは、以前、公開済みのRoboLab結果の一部を再現する難しさが報告されていた。基礎となるCosmos reportは、異なる指示の具体性レベルにわたるスコアを示しており、ベンチマーク結果がテスト構成に依存することを示している。

購入者と開発者にとって、正しい解釈は限定的ながらも意義がある。FLUX 3 Actionは、より小さなモデルで信頼できるベンチマーク上の地位を確立した。独立したチームは次に、その優位性が異なるハードウェア、指示、物理環境でも維持されるかを判断する必要がある。

動画とアクションの共同予測が重要な理由

Black Forest Labsは、ロボット制御を、同じ変化し続けるシーン内にアクションを埋め込んだ視覚予測の問題として扱っている。

従来のvision-language-actionモデルは、視覚入力と言語による指示をロボットコマンドに直接結びつける。world action modelは、観測された世界がどのように変化すべきかという明示的な予測を追加する。

FLUX 3 Actionは、動画トークンとアクショントークンを共同でノイズ除去する。ノイズ除去とは、システムがノイズを含む候補出力から始め、それらを反復的に洗練して一貫した予測にすることを指す。

このモデルは、同期した2つの出力ストリームを備えるdiffusion transformerを使用する。一方のストリームは将来の視覚フレームを表し、もう一方はその時点に対応するロボットアクションを表す。

両ストリームは、各トレーニングサンプルで同じノイズレベルを共有する。この設計により、モデルは命令された動作と、その期待される視覚的な結果を結びつけるよう促される。

固定された動画オートエンコーダーがフレームをコンパクトな表現へ変換する。固定されたQwen3-VL-4Bエンコーダーがテキストによる指示を処理する。学習可能なアクションモデルは、これらの信号をロボット状態と組み合わせる。

DROIDポリシーでは、3つのカメラビューが1つの視覚キャンバスに配置される。システムは関節位置とグリッパー状態も受け取る。そして、7つの関節ターゲットとグリッパー値を含む32個のコマンドを返す。

これは、動画を生成して別のコントローラーにそれを模倣させる方法とは異なる。動画とアクションのシーケンスは同じモデルパスから生成され、時間的な整合性を保つ。

この仕組みは、Black Forest Labsにとって生成メディアからphysical AIへ進むもっともらしい道筋を与える。動画トレーニングは、モデルに動き、接触、物体の恒常性、因果関係を学ばせる。次にロボットデータが、特定の機械がそれらのシーンへどのように影響できるかを教える。

同社の以前のFLUX-mimic協業は、その先駆けを示していた。このシステムはFLUX 3の視覚的バックボーンを、産業用操作に関する取り組みを含むmimicのロボティクス専門知識と結びつけた。

FLUX 3 Actionは、この構想を公開された重みと再利用可能な適応ツールへと拡張する。同社の実験では、産業用アーム以外も対象としている。

Black Forest Labsは、2つのビデオゲームと屋内ドローン向けのバージョンを学習したと報告している。ゲーム向けポリシーは、稼働中のゲームを示すテキストキャプションとともに、別々の運転環境で1セットの重みを使用した。

ドローン実験では、モデルは256×256の機上カメラビューを受け取り、4つの制御値を生成した。トレーニングセットには、Isaac Simで作成された800件のスクリプト化された飛行が含まれていた。

同社によれば、ドローンは配置を変更した部屋を飛行し、トレーニング時の文と完全には一致しない言い換えられた指示にも従った。これらの結果は、標準化された独立評価ではなく、開発元によるデモンストレーションである。

それでも、これらはアーキテクチャ上の主張を示している。各エンボディメントが適切な入力と出力ヘッドを受け取れば、共有モデルはロボットアーム、ドローン、仮想車両のコマンドを表現できる。

ただし、これはモデルがあらゆる用途で交換可能になることを意味しない。各機械には、異なるカメラ、アクション次元、単位、タイミング、安全制限がある。適応には依然として、対象となる機体とタスクを表すデータが必要だ。

主な利点は、再利用可能な視覚的基盤にある。開発者は、新しい機械ごとにシーン理解をゼロから学習する必要がないかもしれない。その分、ロボットの観測と制御により多くの学習努力を集中できる。

このアプローチは、言語・画像ソフトウェアを変えたfoundation model戦略に似ている。ロボティクスは、誤った出力がハードウェアを損傷させたり、人を負傷させたりする可能性があるため、より厳しい試験となる。

モデルが予測する動画には、別の潜在的な利点もある。エンジニアは、送信する数値コマンドだけでなく、モデルが何が起こると予期しているかも確認できる。この視覚的予測はデバッグを支援する可能性があるが、正式な安全保証ではない。

オープンウェイトは無制限のロボティクスを意味しない

FLUX 3 Actionは検証可能かつ適応可能だが、そのライセンス、ハードウェア要件、導入時の安全対策は、実際に「オープン」が何を意味するかを制限している。

Black Forest Labsは、このリリースを完全なオープンソースではなく、オープンウェイトと位置付けている。モデルのパラメータは利用可能で、関連する推論・学習コードも公開されている。ウェイトにはFLUX Kommunity Licenseが適用され、ソフトウェアリポジトリの一部には一般的なオープンソースライセンスが適用されている。

モデルのライセンスは、非商用利用と、条件を満たすユーザーによる一部の商用利用を許可している。より大規模な組織や、これらの条件に該当しない導入では、別途契約が必要になる可能性がある。

この区別は、長期的な依存リスクを評価するロボティクスチームにとって重要だ。研究機関はウェイトを使って実験できる一方、商用メーカーは、想定する利用が条件を満たすかを確認しなければならない。

モデルのリソース要件も、もう一つの境界となる。公開されたハードウェアガイダンスによると、DROIDチェックポイントはNvidia H200上でbfloat16を使用する場合、約32 GBのGPUメモリを必要とする。

FP8量子化とテキストエンコーダのオフロードを使えば、24 GBのカードにもシステムを収められる。量子化は数値精度を下げることでメモリを節約し速度を改善し、オフロードはモデルの一部を主GPUから移す。

この要件は一部の最先端モデルと比べれば利用しやすいが、軽量なエッジ推論ではない。本番ロボットでは依然として、近くのGPUサーバー、高価なオンボードコンピュータ、または慎重に設計された通信経路が必要になる可能性がある。

レイテンシは運用上の懸念の一つにすぎない。ポリシーの出力は関節位置を対象とするが、関節速度、力、衝突、作業空間の制限は強制しない。

モデルカードは、導入者に対して、こうした制御をアプリケーション層で追加するよう明記している。シミュレータでの検証、稼働中ロボットの安全制限、人による監視、アクセス可能なハードウェア停止装置を推奨している。

これらの警告は、学習済みポリシーと完全なロボット制御システムの違いを示している。工場への導入には、状態監視、緊急時の挙動、故障検知、アクセス制御、保守手順、責任範囲も必要だ。

アクションチャンクは、追加の制御上の問題を生む。FLUX 3 Actionは、1回の予測で32個のコマンドを返せる。コントローラは、環境を観測して再計画するまでに、いくつを実行するか決めなければならない。

世界が想定どおりに動く場合、シーケンス全体を実行すると効率を高められる。物体が動いた、把持が滑った、人が作業空間に入ったといった場合には、より早く再計画することが役立つ。

SO-101の例は、このトレードオフを反映している。その制御ループは、より長い予測シーケンスから32個のアクションを実行し、残りを破棄してから再び計画する。

開発者は、各チェックポイントに関連するカメラの順序、正規化、関節単位、タイミング、状態の規約も維持しなければならない。これらの詳細を混在させると、もっともらしく見えても誤った出力を生む可能性がある。

これが、ダウンロード可能なウェイトがロボティクスエンジニアリングを不要にしない理由だ。ポリシーの学習から、統合、検証、安全性の強制へと作業の一部を移すにすぎない。

企業の購入担当者にとって最も有用な問いは、モデルがオープンかどうかではない。完全なシステムが、その組織の実際の運用条件の下で、テスト可能で、保守可能で、安全に保てるかどうかだ。

Nvidiaとの比較は現実的だが、不完全でもある

FLUX 3 ActionはNvidiaのモデル戦略に圧力をかける一方、このリリース自体もNvidiaのベンチマーク、シミュレーションツール、コンピューティングプラットフォームに大きく依存している。

最も明確な競合比較は、FLUX 3 ActionとCosmos3-Nano-Policyの比較だ。両者は将来の視覚状態とアクションを予測し、利用しやすいウェイトを提供し、汎用ロボットマニピュレーションを対象としている。

Black Forest Labsは、より少ないパラメータでRoboLabの性能が優れていると報告している。また、テストした複数のGPUで推論速度が高いとも主張している。

この組み合わせが重要なのは、ロボット開発者が能力、応答時間、メモリの間で三者の制約に直面することが多いためだ。タスク成功率を改善するより小さなモデルは、挙動を弱めることなくインフラ要件を減らせる可能性がある。

ただし、モデルサイズだけでは導入効率を立証できない。FLUX 3 Actionには凍結された視覚オートエンコーダとテキストエンコーダが含まれる。完全なメモリ・レイテンシプロファイルは、これらのコンポーネントをどのように動作させるかに左右される。

チェックポイントの選択も比較を変える。4ステップ推論は、より多くの計算を必要とする代わりに品質を維持できる。1ステップのチェックポイントは高速だが、一定の成功率を犠牲にする可能性がある。

Nvidiaはこのリリースの中心的存在であり続ける。RoboLabはIsaac Sim上で動作し、報告された推論テストはNvidia GPUを使用し、モデルはNvidiaの支援を受けて構築された。

Black Forest Labsは、Nvidiaのより広範なオープンモデル協業にも参加している。この関係は、既存勢力に単純に挑む競合というより、共有プラットフォーム内での競争に近い。

Hugging Faceも重要な役割を担う。同社のLeRobotフレームワークは、ロボットデータセット、ポリシー、ハードウェア統合をパッケージ化し、研究者がより一貫してワークフローを再現できるようにする。

FLUX 3 ActionのSO-101チェックポイントには、保存済みの前処理情報と正規化情報が付属する。これにより、リポジトリから実機アームへポリシーを移す際に生じがちなエラーの一因を減らせる。

より広い競争領域には、Physical Intelligenceのπモデル、Nvidia GR00T、DreamZero、OpenVLA、OASIS、その他のvision-language-actionシステムが含まれる。それぞれ、学習データ、モデルアーキテクチャ、オープン性、対応ハードウェアについて異なる選択をしている。

直接アクション予測に注力するものもある。ほかには、ワールドモデリングや計画コンポーネントを加えるものもある。ウェイトを公開しつつ、商用利用や学習データに関する制限を維持するものも複数ある。

FLUX 3 Actionの独自の位置付けは、生成動画の事前学習、将来フレームとロボットアクションの同時予測、公開された適応ツールを組み合わせる点にある。そのベンチマーク上の優位はこのパッケージを強化するが、アーキテクチャをめぐる議論に決着をつけるものではない。

直接アクションポリシーは動画を予測しないため、より小さく簡潔にできる。ワールドアクションモデルは、起こり得る将来の場面を表現するために計算資源を使う。これは物理的推論を改善する可能性がある一方、レイテンシも増やす。

決定的な証拠は、同じデータ、ハードウェア、安全制約、実世界タスクの下で行われる統制比較から得られる。公開リーダーボードがそのシステム全体を捉えることは、めったにない。

それでも、このリリースは期待値を変える。ロボティクスチームは今や、より大きい、あるいはクローズドなモデルが、関連するベンチマークで利用可能な70億パラメータの代替モデルより低性能なのはなぜか、と問える。

競合他社は、より強い結果、より速い導入、より幅広いエンボディメント対応、より明確なライセンス、あるいは実導入からの証拠で応える必要がある。その圧力は、リーダーボード上の順位だけよりも重要だ。

開発者と購入者が次に注視すべきこと

次の三つのシグナルは、独立した再現、より広範な実機ロボットテスト、新しい機械への持続的な適応である。

最初のシグナルは、RoboLab-120の結果の再現だ。独立したチームは、固定したバージョン、文書化されたプロンプト、同一の評価設定で、公開されたチェックポイントを実行すべきである。

42.92パーセントに近いスコアが再現されれば、FLUX 3 Actionが真のベンチマーク上の優位性を持つという主張を強める。大きな乖離があれば、設定、ソフトウェアバージョン、または未公開の詳細への感度を示すことになる。

再現は一つのチェックポイントにとどめるべきではない。ベース、ガイダンス蒸留、ステップ蒸留、bfloat16、FP8の各バリアントでは、速度、メモリ使用量、タスク成功率のトレードオフが異なる。

最も有用な報告は、完全なハードウェア詳細と失敗分布を公開する。総合成功率は、複雑な手順、空間関係、曖昧な指示における弱さを隠すことがある。

二つ目のシグナルは、より大規模な実機ロボット評価だ。報道で引用された第三者テストでは、10のDROIDタスク、各3回の試行、Frankaアームが用いられた。

報告によれば、FLUX 3 Actionは30回中28回を完了した。Cosmos 3 Nanoは27回、DreamZeroは20回、π0.5は13回を完了した。

これらの結果は有望な外部証拠を提供するが、30回の試行では導入に関する結論を出すには少なすぎる。失敗が1回増えるだけで、割合は大きく変わる。

今後のテストには、数百回の試行、未知の物体、照明変化、カメラの乱れ、移動した作業面、人による中断を含めるべきだ。最終的なタスク完了だけでなく、介入や危険な動作も記録すべきである。

シミュレーションでの成功は、ポリシーが異なるチームにより保守された物理サイトとハードウェア全体で優位性を維持したとき、より説得力を持つ。優位が消えれば、モデルはベンチマークとの整合性から利益を得ているだけかもしれない。

三つ目のシグナルは、真に新しいエンボディメントへの適応だ。Black Forest Labsは、ベースモデル、フルファインチューニングのサポート、パラメータ効率の高いSO-101ワークフローを提供している。

開発者は、新しいロボットが必要とするタスク固有データと計算量を注視すべきだ。有用な基盤モデルは、単に負担を移すのではなく、適応の負担を減らすべきである。

最も強い証拠は、外部チームがモデルを異なるアーム、移動マニピュレータ、ドローン、産業用ツールに適応させることから得られる。こうしたプロジェクトは、学習時間、データ量、信頼性、制御レイテンシを既存ポリシーと比較すべきだ。

ライセンスは、その採用を形作る。研究者は今すぐモデルを試せるが、商用ユーザーはFLUX Kommunityの条件が自組織と導入形態に適合するかを判断しなければならない。

ハードウェア経済性も重要になる。24 GBの推論経路はアクセスを広げるが、信頼できる本番運用には、予備容量、監視、制御ハードウェア、安全システムが含まれる。

これらの評価を進める開発者には、プロンプト、チェックポイント、カメラレイアウト、データセット、失敗の記録を厳密に残すことが必要だ。検索可能なエンジニアリングナレッジベースは、チームが実験をまたいでその文脈を保持する助けになる。

Black Forest Labs FLUX 3 Actionは、明確な技術的メカニズムを公開ウェイトと測定可能な結果に結び付けることで注目を集めた。汎用ロボット知能を確立したわけではなく、現在のベンチマークスコアには依然として大きな失敗余地が残る。

当面の機会は、実践的な実験にある。チームはコードを調べ、ロボットなしで記録済みの観測を実行し、物理ハードウェアに近づく前にシミュレーションでチェックポイントを評価できる。

より難しい問いはその後に来る。開発者は優位性を再現し、それを未知の機械へ移し、環境がベンチマークと一致しなくなっても安全な挙動を維持できるのか。

その結果が、FLUX 3 Actionが広く使われるロボティクスの基盤になるのか、それとも印象的な参照点にとどまるのかを決める。現時点で最も重要な貢献は、分野に対してテスト可能な、具体的で検証可能なモデルを与えたことにある。

 
 

無料で始めましょう

ローカルファーストのパーソナル知識管理付きAIアシスタント

より良いAI体験のために、

remio は現在、 Windows 10+ (x64)とM-Chip Mac のみをサポートしています。

仕事のAIパートナー
remioでもっと仕事が進む

計画・作成・仕上げまで
すべてをひとつに

bottom of page