top of page

NVIDIAのロボット推論はロボットの枠を超えた

4 分前
読了時間: 28分

Jetson Thorは40〜130ワットの電力枠内で2,070 FP4テラフロップスを実現するものの、NVIDIAのロボット推論はいま明確な分岐に直面している。高速な制御は依然としてオンボードで行う必要がある。一方で、最大級の推論モデルには、モバイルロボットでは搭載できないデータセンターGPU、共有メモリ、冷却性能がますます求められている。

この分岐は、ロボティクスにおける中心的な問いを変える。焦点は、ローカル推論とリモート推論のどちらがあらゆる場面で勝つかではない。機械内部に残すべき判断は何か、そして機械の信頼性を損なわずにネットワークを越えられる判断は何か、という問題だ。

SemiAnalysisが9月14日に公開したロボット推論の分析は、その経済性を異例なほど具体的に示している。再構成されたベンチマークによれば、1基のB300は500ミリ秒のアクションチャンク期限内で12台のロボットに対応できる可能性がある。ただし、その削減効果はバッチ処理、稼働率、予測可能なトラフィック、そして多くの建物には存在しない無線インフラに依存する。

Boston Dynamicsは、この分岐の一方を体現している。同社の報告されたアーキテクチャでは、Atlasのモーション制御をJetson Thor上に維持しつつ、より上位の計画処理をOrbitプラットフォーム経由でGoogleのインフラへ送る。他の開発者は、無線接続への依存を避けるため、小型モデルを受け入れつつ知覚から行動までのスタック全体をローカルに置いている。

その結果は、単純なエッジ対クラウドの競争ではない。集中した知能と運用上の確実性のせめぎ合いである。データセンターは、フリート全体でより大規模なモデルを経済的に運用できる。だがロボットは、接続が滞った場合でも安全であり続けなければならない。

ロボットの知能は2つのシステムへ分離している

重要な変化はアーキテクチャにある。ロボットの推論とロボットの動作は、もはや同じ場所で実行する必要がない。

汎用ロボットは、速度が大きく異なる複数種類の計算を実行する。低レベルの安全制御とサーボループは状態を推定し、バランスを維持し、アクチュエータへの指令を出す。これらのループは毎秒数百回実行される場合がある。

100ヘルツでは、次の出力は10ミリ秒以内に届かなければならない。通常の無線往復通信でさえ、推論が始まる前にその時間枠全体を使い切る可能性がある。したがって、低レベル制御をリモートGPUに依存させることはできない。

行動レイヤーにも厳格な時間要件がある。視覚・言語・行動モデル、すなわちVLAは、画像と短い指示を物理的な動作へ変換する。言語応答が遅れるのは煩わしいが、モーター指令が遅れれば、状況の変化によって意味を失う可能性がある。

計画処理はより遅いクロックで動作する。プランナーは作業指示を解釈し、サブタスクに分解し、モーションポリシーへ簡潔な指示を送る。これが5ヘルツで動作する場合、各判断には200ミリ秒の時間枠がある。

この広い予算により、ロボット外部での推論が可能になる。ローカルポリシーが即時の動作を処理する間、プランナーはより大きなモデル、より深いコンテキスト、データセンター級のメモリを使える。上位の推論に時間がかかっても、ロボットは物理的な応答性を維持できる。

SemiAnalysisによれば、Boston DynamicsはAtlasでこの階層型パターンを採用している。System 1層はJetson Thor上で視覚運動制御を扱う。System 2はOrbitとGoogleのインフラを通じてリモートで計画処理を行う。

たとえば製造指示は、Atlasに作業を完了し、成果物を特定の在庫ビンに置くよう命じるかもしれない。System 2はこの抽象的な要求を、System 1が実行可能なより小さな指示へ変換する。

この変換には視覚的なガイダンスを含められる。リモートプランナーはロボットの視界内にあるマーカーを用いて正しいビンを特定するかもしれない。ローカルVLAは、その後、見えている対象に結び付いた具体的な指示を受け取る。

報告によれば、System 2は実行も監督する。進行状況を観察し、低レベルポリシーが誤った振る舞いをした場合を検出する。この役割には、時折のタスク要求よりも頻繁な通信が必要となる。

SemiAnalysisは、実務上の想定として10秒ごとに1回のクエリから、毎秒1〜2回のクエリまでの幅があり得るとしている。この頻度では、ネットワークが運用ワークフローの直接的な一部となる。

このアーキテクチャは実用的な妥協案を提供する。Atlasは、最先端の推論能力と組み込み効率を兼ね備えた単一モデルを待つ必要がない。Boston Dynamicsは決定論的なループをローカルに保ちながら、より高性能な計画処理へリモートでアクセスできる。

この妥協は同時に、記事の中心的な対立を生む。リモートでの判断を1つ追加するごとにロボットの知能は拡張されるが、接続性が有用な作業を中断し得る瞬間も増える。

代替案は完全ローカル実行だ。限定的な倉庫、製造、家庭内タスクを追求する企業は、制約された環境に合わせて小型ポリシーを訓練できる。これらのシステムは、実行経路からリモート推論を排除する代わりに、ある程度の汎用性を犠牲にする。

どちらの経路でもネットワークを完全に排除するわけではない。ローカルで知能を備えたロボットも、学習データのアップロード、ソフトウェア更新の受信、フリートテレメトリーの報告、テレオペレーションの要求を行う。違いは、ネットワーク障害が現在の動作を止めるかどうかにある。

この違いはベンチマークスコアより重要だ。一時的にフリートサービスを失うロボットと、一時的に脳の一部へのアクセスを失うロボットを分けるからである。

NVIDIAのロボット推論はメモリの上限に直面している

Jetson Thorは組み込み機器の上限を引き上げるが、モデルの成長はモバイルプラットフォームが吸収できる速度を上回っている。

NVIDIAはJetson ThorをフィジカルAI向けの主力プラットフォームとして位置付けている。公開されたJetson Thorの仕様には、128 GBのメモリ、毎秒273 GBのメモリ帯域幅、2,070 FP4テラフロップスが記載されている。

このモジュールは40〜130ワットで動作できる。NVIDIAは、AGX Orinの7.5倍の性能と3.5倍のエネルギー効率を実現するとしている。これは同社による比較であり、独立した導入結果ではない。

ロボットにとって、この電力範囲は重要である。モバイルプラットフォームは、移動、センサー、アクチュエータ、通信、計算の間でバッテリーを配分しなければならない。冷却ハードウェアも空間とエネルギーを消費する。

データセンター向けB300は別の物理的カテゴリーに属する。大容量メモリ、高密度の電力供給、液冷を備えたラックマウントシステム向けに設計されている。歩行する機械が抱える重量、振動、熱の制約には直面しない。

違いは単なる生の演算性能ではない。大規模モデルは、パラメータと中間データをメモリ経由で繰り返し移動させる。メモリ容量はモデルが収まるかを決め、帯域幅は回答をどれだけ速く生成できるかを左右する。

Jetson Thorは前世代より多くのメモリを搭載する。Xavierは32 GB、AGX Orinは64 GBだったのに対し、Thorは128 GBへ倍増した。

ロボットモデルは最大級の言語モデルよりはるかに小さいが、拡大を続けている。SemiAnalysisは、約30億〜140億パラメータの汎用ポリシーを挙げている。アーキテクチャ、精度、コンテキスト、ランタイム設計のため、パラメータ数は完全な比較指標ではない。

現在のシステムの一部は、すでに組み込みモジュールの実用的な範囲を超えている。NVIDIAのDreamZeroは、動画拡散を中心に構築された140億パラメータのワールドアクションモデルだ。SemiAnalysisによれば、リアルタイム動作にはロボット外部のGB200 GPUを2基必要とする。

もう1つのNVIDIAプロジェクトであるRoboTTTは、逆の方向を示している。これは、動作中に一時的な重みを更新するテスト時学習を備えた小型ポリシーを使う。この設計は、オンボード導入に十分な小ささを保ちながら、より長い有効コンテキストを提供すると報告されている。

これらの対照的なプロジェクトは、NVIDIAのロボット推論を単一のロードマップに還元できない理由を示す。より優れたシリコンは開発者に、より多くの知能をローカルへ移すよう促す。大規模モデルはその進歩を消費し、オフロードの必要性を改めて高める。

この圧力は半導体サプライチェーンにも及ぶ。Jetson製品とデータセンターアクセラレータは、いずれも最先端の製造ノードへの依存を強めている。専用のハイエンド計算能力を持つロボットは1台ごとに、シリコンとメモリを恒久的に1台の機械へ割り当てる。

共有データセンター推論は、この配分を変える。同じアクセラレータが、異なる時点に届く複数ロボットの要求に応答できる。このプール化は、個々の機械が長時間待機したり、最大モデルを呼び出さずに移動したりする場合に特に魅力的になる。

SemiAnalysisは、共有GPUあたり約7台のロボットでシリコン効率の逆転点が訪れると見積もっている。メモリの見積もりでは、GPUあたり約5台で逆転する。これらの数値は、同社のモデル、ワークロード、ハードウェアに関する仮定に依存する。

正確な逆転点よりも方向性のほうが重要だ。専用計算能力は予測可能な所有を提供し、共有計算能力は高価なシリコンからより多くの仕事を引き出す。フリート規模はその違いを増幅する。

組み込みハードウェアは厳しい環境で稼働する。振動や衝撃を受け、ほこりにさらされ、ときには液体や温度変動のある環境で動作する。データセンターアクセラレータは、専門的な保守を受ける管理されたラック内に置かれる。

オンボード機器の交換は、計算予算以上の影響を持つ。モジュールの整備により、ロボット全体が運用から外れる可能性がある。故障したサーバーGPUは切り離せるため、他の機械は残りのクラスターを使い続けられる。

それでもデータセンターはローカルハードウェアを不要にするわけではない。すべてのロボットには、知覚、安全、フォールバック動作のために十分な計算能力がなお必要だ。オフロードは必要な能力目標を変えるのであって、ロボットをリモート制御の殻に変えるわけではない。

これが、Jetson ThorとB300が直接の代替品ではない理由である。Thorはモバイル向けの電力枠内で、制約されたローカル自律性を提供する。B300は、ワークロードとネットワークが許す場合に、プールされた推論能力を提供する。

B300の経済性は多忙なフリートに依存する

共有B300が魅力的になるのは、単にチップが高速だからではなく、多数のロボットが継続的に使う場合である。

SemiAnalysisは、公開コードとモデルの重みが利用できなかったため、NVIDIAのRoboTTTに似たワークロードを再構成した。この再構成はタスク精度ではなく、論文の計算量とメモリプロファイルに合わせたものだった。

この留保は不可欠である。このベンチマークが測るのは、代表的なワークロードを提供するコストだ。再構成されたシステムが、非公開モデルと同等にロボットタスクを実行できることを示すものではない。

テストでは、32のアクションヘッドブロックに16のテスト時学習モジュールを挿入した。各ロボットには151 MBの一時的な高速重み状態も保持された。サーバーは、バッチ化された呼び出しの前後でその状態を収集・再配布する必要があった。

これらの条件下で、1基のB300は500ミリ秒のチャンク期限内で12台のロボットを維持したと報告されている。RTX 6000 Pro Server Editionは4台を維持した。この比較では、高パーセンタイルのレイテンシー基準が用いられ、平均値より遅い応答が重視された。

続いてSemiAnalysisは、96台のロボットを運用する3つの導入形態をモデル化した。1つはデータセンターにB300能力を配置し、もう1つはRTXサーバーを使用し、3つ目は各ロボットにJetson Thorハードウェアを搭載した。

稼働率の調整前は、Jetson Thorも競争力を維持していた。この分析は、高密度FP4演算の単位あたり時間コストがThorとB300でほぼ同等になると算出した。RTXハードウェアは、この特定のワークロードではより不利な位置付けだった。

稼働率が結果を変えた。サーバーはフリート全体の需要をプールし、1日を通じて異なるロボットからの処理を実行できる。オンボードモジュールは、そのロボットが充電中、待機中、あるいは軽いタスクを実行中でも、1台の機械に縛られたままだ。

このモデルは、B300の稼働率を約90%、オンボードThorモジュールの稼働率を約40%と仮定した。この調整後、B300の高密度FP4演算単位あたりコストは、Thorの値のおよそ46%まで低下した。

家庭向け導入は、このモデル上の差をさらに広げた。SemiAnalysisによれば、ある企業が配備した家庭用ロボットの現在の稼働時間は、1日あたりわずか1〜2時間にとどまる。これは1日の約4〜8%に相当する。

同社は、能力の向上に伴い利用時間が4〜5時間程度まで伸びると見込んでいるという。それでも、家庭内の家事には自然な上限がある。ロボットに対して家庭内タスクが途切れなく並ぶわけではない。

産業用ロボットはより長く稼働できる。SemiAnalysisは、FigureによるBMWへの導入で、約11カ月間におよそ1,250時間の稼働実績があったと引用している。ロボットは1日約10時間、利用率約40%で稼働したとされる。

これらの観測結果は、プーリングの利点を説明する。データセンターGPUは、シフト、拠点、タイムゾーンをまたいでロボットにサービスを提供できる。ある導入先での遊休能力を、別の導入先の需要に振り向けられる。

モデルでは、産業用ロボット約5台あたりGPU 1基という水準から、B300の経済性が優位になった。この水準を下回ると、専用サーバーはまた別の低稼働な資本資産になりかねない。

これが、Jetson ThorとB300の総保有コストを比較する際の重要な条件である。B300は、サーバールームに置かれているだけでは経済的にならない。ラック、ネットワーク、電力、サポートシステムを償却できるだけの協調的な需要が必要だ。

小規模導入ではクラウドレンタルがリスクを抑えられるが、別の変数も持ち込む。運用者は、プロバイダーの利益率、地域別の容量、データ移動、サービス可用性を考慮しなければならない。SemiAnalysisがモデル化したのは所有・運用者の経済性であり、一般的なクラウドレンタル契約ではない。

高密度FP4コンピューティングも、事業上の指標としては不完全だ。ロボットの購入者が対価を払うのは、タスクの成功、予測可能なシフト、回復可能な障害対応である。ネットワーク中断によってスループットが低下したり、人間の介入が必要になったりするなら、低コストな計算能力の価値は限定的になる。

同じ警告はローカル推論にも当てはまる。オンボードモジュールがフル稼働していれば、紙の上では効率的に見えるかもしれない。しかし、それは有用な移動に必要なバッテリー容量を消費する可能性がある。より大きなバッテリーは重量を増やし、その結果、移動に必要なエネルギーも増える可能性がある。

したがってフリート運用者には、ワークロード単位での比較が必要となる。関連する単位は、完了したピッキング、成功した組立工程、自律稼働時間などだろう。ハードウェアのスループットは、あくまで一つの入力要素にすぎない。

B300の経済性は、汎用フリートを構築するロボティクス企業に圧力をかける。導入が十分な密度に達すると、ローカル専用アーキテクチャは、断続的にしか使われないマシン内に高価な計算能力を閉じ込めることになり得る。

逆の圧力は、リモートファーストの開発者にかかる。プールによる節約が、実際の建物、実際の無線干渉、高パーセンタイルの遅延を経ても維持されることを証明しなければならない。そうでなければ、理論上の利用率は運用上の停止時間に変わる。

ネットワークの壁はテールレイテンシの問題

平均的なネットワーク速度が許容範囲に見えても、まれな遅延によってリモートロボット推論は危険、あるいは利用不能になり得る。

固定的な遅延は、多くの場合管理可能である。システムはシーンがどのように変化するかを推定し、先回りして計画できる。一般にジッターと呼ばれる変動遅延は、次の更新がいつ到着するかをロボットが把握できない状態を生む。

最も大きな損害をもたらすイベントは、時折発生する1秒のスパイクかもしれない。ダッシュボードなら許容できる。しかし、部品を保持しているロボット、人に近づいているロボット、バランスを回復しようとしているロボットにとって、それを無害とは見なせない。

Microsoft Researchも、2026年のロボティクス・オフローディング研究で同様の結論に達した。研究者らは、オンボード、エッジ、クラウドのGPUプラットフォームでモバイルマニピュレーションのワークロードをテストした。

この研究では、小型のオンボードGPUではワークロードスタック全体を実行できなかった。より大型のオンボードGPUはバッテリー寿命を数時間短縮した。オフローディングはこれらの制約を緩和したが、追加のネットワーク遅延によってタスク精度は低下した。

帯域幅も別の障壁を生んだ。ロボットの観測データをリモートモデルへ送信するには、持続的な上り通信が必要になる場合がある。このトラフィックパターンは、比較的静止したデバイスへのダウンロードを優先する消費者向けインターネットサービスとは異なる。

ロボットは、カメラストリームやセンサーデータをアップロードしながら移動する。金属製のボディは無線信号を遮断または反射し得る。モーターや近隣機器は電磁ノイズを発生させ、姿勢の変化によってアンテナの形状関係も継続的に変わる。

工場には高密度のラック、移動する在庫、機械、多数のアクセスポイントがある。設置時に機能していたリンクでも、機器の移動や別の機械の稼働開始後に劣化する可能性がある。

家庭では異なる不確実性がある。壁によって電波の弱いエリアが生じ、家庭用ルーターは不均一なカバレッジしか提供せず、近隣ユーザーは共有容量を奪い合う。家庭用ロボットは、別の部屋に入るだけでデッドゾーンに到達し得る。

アクセスポイント間のハンドオフは特に危険だ。SemiAnalysisによれば、一般的なルーターは遷移中に100ミリ秒から数秒間、トラフィックを停止させる可能性がある。復旧にはさらに時間がかかる場合がある。

こうした障害は、単純な平均値では捉えられない。99件のリクエストに迅速に応答するネットワークでも、100件目がロボットの期限を過ぎて到着するなら受け入れられない可能性がある。

したがって、高パーセンタイルのレイテンシは、すべての導入レビューにおいてモデル精度やハードウェアスループットと並べて扱うべきだ。開発者は中央値の性能だけでなく、運用上意味を持つ最も遅い応答を測定する必要がある。

Microsoftの測定論文は、すべてのシナリオで機能する単一の配置戦略は存在しないと結論づけている。性能、帯域幅、エネルギー、レイテンシ、金銭的コスト、共有リソースの競合は相互に作用する。

この証拠は、ロボティクスがデータセンターへ全面的に移行するという主張を弱める。リモート推論が実現可能になるのは、ネットワーク変動を吸収できる期限を持つワークロードに限られる。安全性が重要なループには、依然としてローカル実行と定義されたフォールバック動作が必要だ。

リモート計画は、データガバナンス上の懸念も高める可能性がある。ロボットカメラは、生産手法、従業員、顧客の所有物、家庭内での活動を撮影する可能性がある。これらのフレームを施設外へ送ることで、セキュリティ境界は拡大する。

SemiAnalysisによれば、Boston Dynamicsは顧客に共有データのきめ細かな制御を提供している。OrbitはSOC 2 Type 2認証を取得しており、Googleのインフラストラクチャがリモート推論レイヤーを支えている。

認証や契約上の管理はガバナンスに対応するが、すべての導入要件を満たせるわけではない。軍事施設、原子力施設、その他の制限環境では、技術的な保護策にかかわらず施設外へのデータ移動が禁止される場合がある。

この制約により、オンプレミスのエッジクラスターには持続的な市場が生まれる。近隣のサーバーは、データを施設内に保持しながら、ロボットより大きな容量を提供できる。ネットワーク経路は短縮されるが、依然としてローカル無線の信頼性に依存する。

開発者はモデルをより慎重に分割することもできる。ロボットは画像を圧縮し、関連フレームを選択し、連続的な生動画ではなく中間特徴量を送信できる。それぞれの手法は帯域幅を削減する一方、ローカル計算とシステムの複雑さを増やす。

冗長リンクも別の選択肢となる。ロボットは複数のWi-Fi帯域を利用したり、Wi-Fiとプライベート5Gを組み合わせたりできる。重複送信は信頼性を向上させるが、追加の無線機は電力を消費し、協調的なスケジューリングを必要とする。

懐疑的な結論は明快だ。データセンター推論には信頼できる経済性と能力面の優位性があるが、一般的なネットワークが必要な信頼性をあらゆる場所で提供できることを示す公開ベンチマークはない。

導入事例が障害分布、介入率、完了タスクの指標を公開するまでは、TCO比較は条件付きのままである。ネットワークは推論システムの一部であり、独立したユーティリティではない。

ロボットネットワークはアップリンクトラフィックを中心に設計する必要がある

デバイス外での推論には、ロボットのカメラからデータセンターGPUまでを対象とした専用スケジューリングが必要だ。

多くの無線インフラは、ユーザーがアップロードよりもダウンロードする情報量が多いことを前提としている。ロボット推論はこのパターンを逆転させる。カメラは継続的に観測データを生成し、モデルが応答する前に上流へ送らなければならない。

公称帯域幅を増やしても、問題全体は解決しない。複数のロボットが同時に送信すると、キューや衝突が発生する。高容量チャネルでも、アドミッション制御と予測可能なスケジューリングがなければジッターが生じる。

ロボット対応のアクセスポイントは、各マシンに対して定期的なアップリンクスロットを予約できる。ロボットはエアタイムを競合するのではなく、定義された周期で観測データを送信する。その他のトラフィックは残りの容量を利用する。

このスケジュールはモデルのタイミングを理解しなければならない。数秒ごとに一度呼び出されるリモートプランナーには、毎秒複数フレームを処理するポリシーとは異なる予約が必要だ。ネットワーク設定と推論設計は密接に結び付く。

位置認識型ビームフォーミングは、移動するマシンの周辺に無線カバレッジを準備できる。ネットワークは位置情報と予定された動作を使い、既存接続が劣化する前に信号を向けたり、ハンドオフを開始したりする。

中央でのタイミング管理も重要だ。バッチ処理がデータセンターの節約を生むのは、複数ロボットからのリクエストが十分に近い時間に到着し、まとめて実行できる場合に限られる。到着時刻がランダムであれば、サーバーは待機するか、より小さなバッチを処理せざるを得ない。

共有クロックは、キャプチャ、エンコード、送信、推論を協調させられる。サーバーは次の観測グループがいつ到着するかを把握し、そのためのGPU容量を予約できる。

遅延した観測データを通常のキューに無期限に置くべきではない。次のバッチに回すべきかもしれず、あるいはローカルシステムが破棄する必要がある。古いフレームは、欠落したフレームより危険になり得る。

NVIDIAのデータセンタープラットフォームは、サーバー側がどこまで進化しているかを示している。GB300 NVL72システムは、72基のBlackwell Ultra GPUと36基のGrace CPUを液冷ラックに組み合わせている。

NVIDIAは、GPUメモリ総量20 TBと、毎秒130 TBのNVLink帯域幅を示している。ConnectX-8設計は、各GPUに広範なネットワーク容量を提供する。これらの数値が示すのは、従来型のエッジアプライアンスではなく、統合されたAIファクトリーである。

したがって、ラック内のデータセンターネットワークは経路の一部にすぎない。ロボットのトラフィックは、アクセラレータに到達するまでに、無線、アクセスポイント、施設ネットワーク、広域接続、プロバイダー境界を越えなければならない。

境界が一つ増えるごとに、新たなキューまたは障害ドメインが追加される。運用者には、個別のハードウェア主張ではなく、エンドツーエンドのサービスレベルが必要だ。高速GPUであっても、予測不能なアップリンクですでに失われた時間を取り戻すことはできない。

プライベート5Gは、屋外経路や大規模な産業拠点で役立つ可能性がある。Wi-Fiは、家庭や多くの工場で高いローカル容量を提供する。どちらの技術も、自動的に決定論的な動作を提供するわけではない。

最も強力なアーキテクチャは、複数のリンクを組み合わせるものになる可能性が高い。スケジューラーはローカル条件が良い場合にWi-Fiを選び、セルラーへフェイルオーバーし、その間も最小限のローカルポリシーを維持できる。

知覚の変更によって、トラフィックをさらに削減できる。ロボットは関連領域をクロップし、安定時にはフレームレートを下げ、タスク固有の特徴量をエンコードできる。目的は、利用可能なすべてのピクセルではなく、有用な情報を送信することだ。

こうした最適化には固有のリスクがある。ローカルフィルターが重要な何かを捨てれば、リモートモデルはそれを決して見ることができない。開発者は、一般的でない物体、照明、オクルージョン、障害に対して圧縮と選択を検証しなければならない。

モデルはリクエストレートも適応できる。単純な動作は完全にオンボードで実行し、未知のシーンではリモート支援を起動できる。このカスケードにより、高価な推論を最も大きな価値を生む場面に集中させられる。

このようなシステムは、デバイス上推論とデータセンター推論の境界を曖昧にする。配置は恒久的なものではなく、動的なものになる。ロボットはリスク、利用可能な帯域幅、モデルの信頼度、タスクの複雑さに基づいて経路を選択する。

その柔軟性は魅力的だが、検証を難しくする。エンジニアはより多くの動作モードと遷移をテストしなければならない。リモートリクエストが正常に始まったにもかかわらず、完了前に接続が失われた場合の明確な挙動が、システムには必要となる。

ローカルへのフォールバックは、完全な能力を維持しているかのように装うことなく、安全性を保つべきだ。ロボットは停止し、物体を安全に置き、後退し、人間の支援を求めることができる。古いリモート指示を基に動作を続けることには、別種のリスクがある。

したがってネットワークの壁は、エンジニアリングと製品設計の境界でもある。これを解決する開発者は、プールされた知能を利用できるようになる。顧客は、その恩恵を受けるためにどこまでインフラを導入するかを決めなければならない。

導入の進展がジェネラリストとスペシャリストを分ける

業務の多様性が高いほどリモート推論の必要性は強まり、制約されたタスクではより小規模なローカルポリシーが有利になる。

工場には、予測可能な反復作業と扱いにくい変動の両方が存在する。従来の自動化は、環境、部品、動作が安定している場合に効果を発揮する。一方、製品構成や指示が頻繁に変わると、コストがかさむ。

SemiAnalysisによると、1台の車両には数万点の部品が含まれる可能性がある。1本の生産ラインで、多数の色にまたがる5〜10種類のモデルを扱うこともある。年式変更により、さらなる再構成が必要になる。

汎用ヒューマノイドは、固定された1つの軌道を再生するのではなく、こうした変化する条件を解釈しなければならない。この要件により、大規模な計画モデル、長いコンテキスト、集中型アップデートの価値が高まる。

Boston Dynamicsは、より広い能力を得るためにネットワーク依存を受け入れる姿勢を示しているようだ。ローカルのSystem 1が移動を担い、リモートのSystem 2が指示、翻訳、監督を処理する。

スペシャリスト向けの導入では、別のトレードオフが成立する。倉庫でのピッキング、梱包、限定的な組立作業は、数十億パラメータ規模のモデルで対応できるほど範囲を絞れる場合がある。そうすれば、完全な実行ポリシーをJetsonクラスまたはワークステーション由来のハードウェアに収められる。

ローカル実行はプライバシーと障害分離を向上させる。また、顧客側のネットワーク要件も簡素化する。外部サービスに到達できなくなっても、導入環境は動作を継続できる。

ただし、スペシャリストモデルは能力の上限に直面しうる。1つの製品ファミリーから自由度の高い業務へ広げるには、追加モデル、再学習、またはより多くのリモート支援が必要になる可能性がある。ローカルでの確実性が、汎化の限界となりうる。

家庭用ロボットは、特殊な組み合わせに直面する。家事は多様であり、より大規模な推論モデルに有利だ。一方で、ネットワークや物理的なレイアウトは制御できず、オンボード推論に有利となる。

提供事業者は、顧客ごとにルーターの配置を再設計することはできない。また、ユーザーがプライベートなセルラーインフラを導入するとも想定できない。機械は、電波の届かない領域、混雑、共有ブロードバンドに適応しなければならない。

自動運転車は、ローカル優先が最も明確に求められるカテゴリーに属する。制御不能な無線環境と厳しい応答期限の下、広大なエリアを移動する。安全上重要な認識と制御は、データセンターでの推論を待つことができない。

リモートサービスは依然として、マッピング、フリート分析、学習、ソフトウェア配信を支える。これらの機能は、認識から行動までの即時ループの外側で動作する。接続性は製品を改善するが、安全な制御の唯一の基盤にはならない。

このパターンは、NVIDIAのロボット推論が複数の層に広がることを示唆している。Jetsonクラスのモジュールはリアルタイム自律性を守る。ローカルエッジサーバーは、機密性が高い、あるいは現場固有の推論を処理する。大規模データセンターは、最も重い共有モデルを提供する。

商業的な競争は、チップと同じくらいオーケストレーションを巡るものになる。各リクエストのルーティング、レイテンシーの監視、フリートの同期、データ保護、ローカル能力で十分かどうかの判断を、誰かが担わなければならない。

ロボットメーカーがその層全体を担うこともできる。クラウドプロバイダーは、マネージドインフラとして販売できる。ネットワークベンダーは、ロボットを認識するスケジューリングをアクセスポイントやプライベートセルラーシステムに組み込める。

NVIDIAは、組み込み機器とデータセンターのハードウェアを両方供給しているため、優位性もある。共通のソフトウェアスタックにより、開発者はすべてのコンポーネントを作り直さずに、Thor、ワークステーションGPU、B300サーバーの間でワークロードを移動できる。

その優位性は自動的に得られるものではない。異なるハードウェアターゲットは依然として、量子化、メモリ、熱、スケジューリングの制約を課す。サーバー上で検証されたポリシーは、組み込みデバイス向けに最適化した後では異なる挙動を示す可能性がある。

したがって競争では、導入の実証が重要になる。購入者は、単発のモデルデモではなく、現実的な負荷下でのタスク成功を確認する必要がある。また、接続性が低下した際の透明性ある挙動も求められる。

最も信頼できる提供事業者は、介入率、ネットワーク障害からの復旧、生産的な稼働時間、エネルギー消費、完了タスク数を報告するだろう。こうした測定値は、モデルの知能を事業価値へと結び付ける。

ここで、ジェネラリストとスペシャリストの分岐が実践的な意味を持つ。ジェネラリストは、多くの専用システムを置き換えるなら、より多くのインフラを正当化できる。スペシャリストは、価値の高い1つのタスクを信頼性高く実行できるなら、ローカルの簡素さを正当化できる。

勝つアーキテクチャは、現場ごとに異なりうる。数十台のロボットを運用する管理された工場では、プーリングによる強い経済性が得られる。接続性が弱い遠隔作業現場では、より小さなモデルであっても、完全ローカル実行が有利になる可能性がある。

ロボットがどこで考えるかを決める3つのシグナル

次の段階を決めるのは、再びピーク演算性能を発表することではなく、導入の実証、フリート利用率、ネットワーク信頼性である。

第1のシグナルは、本番フリートから得られる独立したレイテンシーデータだ。ベンダーは、完全なシフト全体にわたる高パーセンタイルの応答時間、ハンドオフ中断、リクエスト消失率、復旧動作を開示すべきである。

一貫したテールレイテンシーは、リモート計画の根拠を強める。平均応答時間やサーバースループットが優れていても、頻繁な停止や人間の介入があれば、その根拠は弱まる。

第2のシグナルは、複数のロボットフリートにまたがる実際のB300利用率だ。SemiAnalysisは、約90%のサーバー利用率をモデル化しており、これが予測される経済的優位性の大部分を支えている。

運用者は、需要を実際にその水準でプールできるかを示さなければならない。ロボットからのリクエストが過度に同期する、タスクごとにばらつく、あるいは初期導入時にはあまりに少ない可能性がある。

タスクレイテンシーを安定させながら利用率を維持できれば、共有データセンターという仮説を支えることになる。クラスターが十分に活用されなければ、経済的な分岐点はローカル推論とより小規模なオンサイトサーバーへ移る。

第3のシグナルは、Jetson Thorの制約内で得られるモデル能力だ。RoboTTTは、アーキテクチャとテスト時適応によって、巨大モデルに依存せずより長いコンテキストを実現できることを示唆している。

より小規模なローカルポリシーがリモート推論の品質に近づけば、ネットワーク依存を正当化することは難しくなる。能力が引き続きモデルサイズとメモリに追随するなら、より多くの計画処理が共有アクセラレーターへ移ることになる。

購入者は、ベンダーに境界を明確に定義するよう求めるべきだ。どのループがローカルに残るのか。どのリクエストが現場の外へ出るのか。接続が遅くなった場合に何が起き、ロボットはどれだけの間、安全に動作を続けられるのか。

また、ワークロードに基づく経済性も求めるべきである。理論上の演算能力1単位あたりのコストでは、タスク完了、バッテリーへの影響、介入、ダウンタイムは明らかにならない。生産的な自律稼働時間は、より有用な分母となる。

開発者も関連する設計上の選択に直面する。限られたエンジニアリングリソースをモデルの縮小に投じることもできるし、信頼できる分散推論システムの構築に充てることもできる。最終的には、ほとんどのチームが両方をある程度行うことになるだろう。

NVIDIAのロボット推論は現在、その選択全体にまたがっている。Jetson Thorは高度なローカル制御を現実的なものにし、B300はフリート規模でのプールされた推論を魅力的にする。未解決なのは、それらを結ぶ経路だ。

浮上しつつある答えは、絶対的なものではなく階層的なものだ。安全性、動作、フォールバックポリシーは機械上に保持する。ネットワークとデータに関するルールが許す場合には、より遅く、より複雑な推論を外部へ送る。

この設計はトレードオフをなくすものではない。トレードオフを可視化し、責任を割り当て可能にするものだ。あらゆるリモート機能には、期限、フォールバック動作、データ境界、測定可能な経済的便益が必要となる。

フィジカルAIを評価するチームにとって、当面の問いは単に推論をどこで実行するかではない。最大の頭脳に一時的に到達できなくなっても、すべての層が有用であり続けるかどうかである。

 
 

無料で始めましょう

ローカルファーストのパーソナル知識管理付きAIアシスタント

より良いAI体験のために、

remio は現在、 Windows 10+ (x64)M-Chip Mac のみをサポートしています。

仕事のAIパートナー
remioでもっと仕事が進む

計画・作成・仕上げまで
すべてをひとつに

bottom of page