top of page

MiniCPM-Robot、1.5B VLAと0.9Bトラッカーをオンデバイス・ロボティクスへ導入

7月20日
読了時間: 19分

ModelBestとOpenBMBは7月19日、物理世界を認識し、判断し、行動するために構築された同社初のオープンモデルファミリー、MiniCPM-Robotをリリースした。このリリースでは、15億パラメータの操作モデルと9億パラメータのターゲットトラッカーが組み合わされている。

この組み合わせが生み出すのは、単なる新たなベンチマーク競争よりも興味深い対決だ。MiniCPM-Robotは、小型のオープンモデルが大規模サーバー、独自のアクセスプログラム、常時ネットワーク接続に依存せず、有用なロボット動作を実現できるかを検証する。

このファミリーは、Physical Intelligenceのπ0.5、Qwen-VLA、Google DeepMindのGemini Roboticsモデルといった意欲的なシステムが先導する分野に参入する。これらのプロジェクトは、タスクや機体をまたぐ幅広い汎化を追求しているが、規模、利用可能性、デプロイ戦略には大きな違いがある。

MiniCPM-Robotは、より限定的な道を選んだ。操作と追跡を分離し、コンパクトなモデル、ローカル実行、メモリ効率、再現可能なデプロイに注力している。このアプローチは一つの障壁を引き下げるが、選定されたテスト以外での信頼性という、より難しい問題に決着をつけるものではない。

MiniCPM-Robot、物理知能を2つの小型モデルに分割

中心的な変化は、単にModelBestがロボティクス分野へ参入したことではない。異なる2つの物理タスクに対応する重みと実装コードを公開したことだ。

最初のモデルであるMiniCPM-RobotManipは、15億パラメータの視覚言語行動モデルだ。VLAは、視覚的な観測情報と言語指示を、ロボットが実行できる行動へ変換する。

ModelBestはRobotManipを汎用ポリシーと説明しており、これは一組の重みで複数の操作タスクに対応できることを意味する。公開された例には、物体の取り扱いや、サンドイッチの調理といった長い一連の作業が含まれる。

同社によると、RobotManipはMiniCPM-V 4.6を基盤としている。従来のマルチモーダルシステムを、画像と言語の解釈から物理的な行動の予測へと拡張したものだ。

2番目にリリースされたMiniCPM-RobotTrackは、移動しながらのターゲット追跡に重点を置く。自然言語の指示を解釈し、対象となる人物を特定したうえで、障害物や視覚的な妨害に対応しながら移動コマンドを生成する。

RobotTrackはMiniCPM4-0.5Bの言語バックボーンを使用するが、完全なポリシーは9億パラメータで構成される。このバックボーンに視覚コンポーネントとナビゲーション用の制御パイプラインを組み合わせている。

この区別が重要なのは、操作と追跡ではモデルに求められる能力が異なるためだ。ロボットアームには物体との精密なインタラクションが必要だが、移動型トラッカーは人や障害物の移動に応じて継続的に更新しなければならない。

ModelBestは、一つの汎用ポリシーがすでに両方の作業を処理できると主張するのではなく、一つのファミリーの下で専用システムを公開した。これによりプロジェクトは検証しやすくなった一方で、統合された物理知能に関する主張は限定される。

公式のMiniCPM-Robotリポジトリには、チェックポイント、推論コード、トレーニングのエントリーポイント、評価スクリプト、デプロイガイドが含まれる。コードとモデルの重みにはApache 2.0ライセンスが適用される。

リポジトリには、PhyAIと呼ばれる補助的な推論フレームワークについても記載されている。ModelBestによると、その最適化によってNvidia H20上でのRobotManipのスループットは10ヘルツから37ヘルツへ向上した。

この数値は、指定されたソフトウェアおよびハードウェア構成に適用されるものだ。異なるロボット、GPU、制御システム全般に対する速度保証と解釈すべきではない。

今回のリリースは、ローカル利用向けの小型モデルに注力してきたModelBestの幅広い方針に沿っている。MiniCPM-Robotは、レイテンシ、ネットワークの可用性、オンボード計算能力が動作へ直接影響するシステムにも、同じ設計思想を適用している。

同社の発表によると、これはModelBest初の一般公開された身体化モデルファミリーだ。同社が身体知能専門チームを設立したのは2026年1月と報じられており、リリースのわずか数カ月前にすぎない。

この短い開発期間は注目に値するが、外部検証に求められる水準も高くなる。公開コードによって精査は可能になるものの、結果が実演されたプラットフォーム以外にも適用できるかどうかは、継続的な実環境テストによって決まる。

1.5B VLAがメモリを効率性の問題に変える

MiniCPM-RobotManipの主な主張は、過去のすべてのフレームを繰り返し処理することなく、ロボットが有用な視覚履歴を保持できるというものだ。

多くのロボットポリシーは、主に最新の観測情報へ反応する。この設計は単純な動作には有効だが、長時間にわたるタスクでは、完了した手順、変化する物体の位置、以前の指示を記憶する必要がある。

RobotManipは、過去の観測情報をストリーミングコンテキストに格納する。ストリーミング推論では、新しい判断のたびに視覚履歴全体を再構築するのではなく、以前に計算した情報を再利用する。

ModelBestによると、従来の再計算によって60フレーム分の履歴を処理する場合、1回の判断につき125兆回の浮動小数点演算が必要になる。同社のストリーミング方式では、この数値が3.3兆回まで削減されるという。

同社はまた、RobotManipが最大1分間の視覚コンテキストを保持できると主張している。ドキュメントによると、オンライン処理コストは、現在の1フレームを使用するリアクティブポリシーと同程度に保たれる。

これらの主張は、このモデルで最も重要な仕組みを示している。拡大し続ける視覚履歴の処理にロボットが毎回膨大な計算資源を費やすのであれば、パラメータ数が少ないことの重要性は薄れる。

また、このシステムは各フレームを256個の視覚トークンから64個へ圧縮する。トークンは画像をエンコードした後にモデルが処理するコンパクトな単位であるため、一般的にトークン数が少ないほど計算量も減少する。

BF16精度と1入力フレームを使用したNvidia H100上で、ModelBestは1回の判断につき120ミリ秒のモデル順伝播レイテンシを報告している。π0.5について記載された比較対象の数値は234ミリ秒だ。

この測定値には、自己回帰的な行動デコーディングが含まれていない。そのため、カメラによる観測から物理的な動作までの時間ではなく、完全な制御ループの一部分のみを示している。

提供された推論例では、RobotManipは80の行動次元を持つ30ステップのチャンクを返す。行動のチャンク化により、システムは動作を一つずつ生成する代わりに、短いシーケンスを予測できる。

ベンチマーク結果も同様に特定の条件に基づく。リポジトリによると、RobotManipはLIBEROで97.5、Calvin ABC-to-D評価で4.1を記録している。

RoboTwin2では、easy設定で91.3、hard設定で91.6を記録した。記載された評価構成の範囲内では、これらの数値は複数のより大規模なシステムに匹敵するか、それを上回っている。

報告された最大の優位性は、ロボット操作における文脈記憶を検証するRMBenchで見られる。ModelBestが公開した比較では、RobotManipのスコアは53.3で、π0.5は10.4だった。

Physical Intelligenceは、オープンワールドでの汎化を目的としてπ0.5を設計した。その研究では、ロボットデータ、ウェブ情報、意味的なサブタスク予測、複数の身体形態にわたる異種混合トレーニングを組み合わせている。

この幅広い設計によってπ0.5は重要な比較対象となるが、両システムを一つのスコアだけで評価すべきではない。トレーニングデータの組み合わせ、評価設定、アーキテクチャ、想定されるデプロイ環境が異なるためだ。

RobotManipは、ModelBestの比較に記載された50億パラメータ超のQwen-VLAシステムよりも小さい。Qwen-VLAの研究は、身体形態を考慮した条件付けによって、操作、ナビゲーション、軌道予測を統合している。

Qwenは、実機ロボット、シミュレーター、ナビゲーションタスク、変化する環境にわたる結果を報告している。一方、MiniCPM-RobotManipは、コンパクトな操作、視覚履歴、自由にダウンロードできる重みを重視する。

したがって、本当の対決は15億パラメータ対50億パラメータではない。対象を絞った効率性と、物理タスクおよびロボット形態の統合を目指す、より幅広い試みとの対決だ。

RobotManipの結果は、公開されたベンチマークの範囲内で効率性の主張を裏付けている。しかし、この小型モデルが、あらゆる身体形態、環境、長期タスクにおいて、より大規模な競合モデルに匹敵することを証明するものではない。

MiniCPM-RobotTrack、競争の舞台をロボット本体へ移す

RobotTrackは、市販の四足歩行ロボット上で視覚情報のみに基づく完全な追跡ループを実行するため、より具体的なデプロイ事例となっている。

ModelBestは、16GBのメモリを搭載したJetson Orin NXを備えるUnitree Go2 EDU上で、このモデルを検証した。記載されたセットアップでは、Intel RealSense D435iカメラも使用されている。

モデルはカメラ入力を処理し、言語で指定されたターゲットを認識し、ウェイポイントを予測して、レート制限された移動コマンドを送信する。ModelBestは、毎秒5フレームを超える安定動作を報告している。

公開されたエンドツーエンドのレイテンシは約180ミリ秒だ。RobotManipの部分的なレイテンシ測定とは異なり、この数値にはデプロイドキュメントに記載された、より広範な認識および制御パイプラインが含まれる。

システムはローカルで動作し、クラウド接続を必要としない。そのため、接続が途切れる可能性のある駐車場、エレベーター、産業施設、屋外といった場所に適した設計となっている。

また、ローカル動作により、画像をリモートサービスへ送信する際の遅延と不確実性が軽減される。ただし、それだけでシステムのプライバシー、セキュリティ、安全性が自動的に保証されるわけではない。

RobotTrackは、Dataset Aggregationの略称であるDAggerに基づくデータプロセスを使用する。この手法では、ポリシーを環境内で動作させてその誤りを明らかにし、修正された例を後続のトレーニングラウンドへ追加する。

ModelBestによると、このパイプラインは、急旋回、短時間の遮蔽、ターゲット同士の交差、混雑した交差地点といった困難な状況を対象としている。自動チェックと手作業によるレビューで、無効なインタラクションや異常な軌道を除去する。

これは、通常の実演では失敗例が十分に含まれないことが多いため重要だ。追跡モデルは、2人が交差したり、選択したターゲットが障害物の背後へ一時的に隠れたりするまでは、有能に見える可能性がある。

同社は、EVT-Benchの3つのカテゴリーでRobotTrackを評価している。これらは、標準的なターゲット追跡、妨害対象による干渉、曖昧なターゲット条件を対象とする。

結果には、成功率、追跡率、衝突率が使用される。成功率と追跡率は高いほど良く、衝突率は低いほど望ましい。

RobotTrackは、標準追跡で89.8パーセントの追跡率を記録している。妨害対象が存在する追跡では73.4パーセント、曖昧な条件下では80.4パーセントだった。

ModelBestの比較に含まれるオープンウェイトシステムの中で、RobotTrackは標準追跡における報告済みの3指標すべてで首位となっている。また、妨害対象が存在する場合の成功率と追跡率でも、記載されたオープンモデルを上回っている。

これらの選定された比較以外では、状況はより複雑になる。Qwen-RobotNavは標準追跡で90.0パーセントを記録し、RobotTrackをわずかに上回っているが、その重みは公開されていない。

また、RobotTrackは妨害対象が存在する追跡で13.6パーセントの衝突率を記録している。これはOmTrackVLAについて記載された11.3パーセントを上回っており、物理環境へのデプロイ時には注意が必要だ。

曖昧な条件下でのRobotTrackの衝突率は9.0パーセントだ。同じ公開表では、OmTrackVLAが7.6パーセントと報告されている。

これらの結果は、トレードオフを明確に示している。RobotTrackは、小さなフットプリント、オープンウェイト、ローカル実行を兼ね備えるが、安全性に関わるすべての指標で優位に立っているわけではない。

リポジトリでは、実機ロボットのセットアップがデフォルトでドライランモードに設定されており、移動コマンドがロボットへ送信されないようになっている。ドキュメントでは、ライブ制御を有効にする前に、レイテンシ、カメラ、緊急停止を検証するようオペレーターへ指示している。

その注意は不可欠です。見た目には説得力のある追跡デモであっても、子ども、作業員、交通、階段、あるいは未知の機械の周辺で安全に動作できることを証明するものではありません。

オープンウェイトが非公開ロボティクスへのアクセスに圧力をかける

MiniCPM-Robotが競合に圧力をかけるのは、普遍的なロボット能力が実証されたからではなく、検証可能性とデプロイへのアクセスを提供するからです。

Google DeepMindも、ローカルロボティクスを主要テーマに据えています。Gemini Robotics On-Deviceは、ネットワーク接続に依存せず、言語による指示に従って器用な操作を行います。

Googleによれば、開発者は50~100回のデモンストレーションを用いて、オンデバイスモデルを新しいタスクに適応させられます。同社は衣類をたたむ、バッグのファスナーを開ける、ドレッシングを注ぐといったタスクを公開しています。

ただし、アクセスは信頼できるテスター向けプログラムとSDKを通じて開始されました。ModelBestはダウンロード可能なチェックポイントとコードを提供しており、独立系開発者に異なる出発点を与えています。

オープンアクセスにより、研究所は入力を検証し、制御ロジックを変更し、レイテンシをプロファイリングし、評価を再現し、障害ケースをテストできます。また、小規模なロボティクスチームがリモートのモデルプロバイダーに依存することを避ける助けにもなります。

その自由がインフラ要件をなくすわけではありません。RobotManipの文書化された環境では、Python 3.10、PyTorch 2.6、CUDA 12.4が想定されています。

RobotTrackの評価には、シミュレーターのアセットに加えて、DINOv3やSigLIPを含む追加のビジョンモデルが必要です。Go2へのデプロイには、TensorRT、ROS 2、Jetsonソフトウェア、カメラ、ハードウェア固有の設定が伴います。

このプロジェクトはオープンですが、経験の浅いユーザーがすぐに使えるプラグアンドプレイ製品ではありません。ロボティクスには依然として、一般的な言語モデルのデモではほとんど見えない統合作業が必要です。

オープンウェイトは責任の所在も変えます。開発者は、元のチームがその結果生じる挙動を確認することなく、モデルを変更したり、サポート対象外の環境にデプロイしたりできます。

そのため、ドキュメント、ライセンス、安全上の制約、再現可能なテストが特に重要になります。リポジトリでデフォルトとなっているドライランは妥当な出発点ですが、完全な安全システムではありません。

確立されたロボティクス研究所にとって、MiniCPM-Robotは検証すべき新たなベースラインとなります。小規模なチームにとっては、ダウンロードしたウェイトから計測可能な実機テストまでの道のりを短縮できる点に価値があるかもしれません。

今回のリリースは、ローカルでのロボット推論へ向かう、より広範な動きも示しています。クラウドモデルは豊富な計算資源を提供しますが、ネットワークの遅延や障害は継続的な物理制御と相容れません。

最近の身体化ランタイムに関する論文では、このデプロイ上の問題を、モデル固有のPythonスタック、バックエンド、ロボット統合が断片化した集合として説明しています。物理制御では、レイテンシを最優先したバッチサイズ1での実行も求められます。

MiniCPM-Robotは、業界全体にわたるその断片化を解決するものではありません。別々の環境、依存関係、デプロイ経路が存在すること自体、なお多くの統合作業が残されていることを示しています。

それでも、このプロジェクトは、そうした作業のより多くを公開の場に移しています。研究者はチェックポイントだけでなく、周辺の推論、データ、評価、デプロイに関する選択も検証できます。

この透明性こそ、今回のリリースがもたらす最も強い競争圧力です。非公開システムは今や、アクセス制限や非公開の実装詳細を正当化するメリットは何かという、より明確な問いに直面しています。

公開されたベンチマークには重要な疑問が残る

今回のリリースにはテストするだけの信頼性がありますが、その証拠は、信頼できる汎用ロボットについて広範な結論を導くにはまだ不十分です。

主な結果の大部分は、ModelBest自身のリポジトリと発表に由来しています。複数の研究所、ロボット本体、制御されていない環境にわたる独立した再現は行われていません。

ベンチマークスコアは、評価設定の大きな違いを隠すこともあります。汎用モデルとして分類されたモデルは単一のチェックポイントを使用する一方、特化モデルにはより限定されたタスク向けに設計された学習が施されている可能性があります。

ハードウェア測定にも同様の注意が必要です。RobotManipのレイテンシ比較ではH100が使用され、アクションのデコードは除外されています。一方、RobotTrackのエンドツーエンドの結果は、Jetsonベースの四足歩行ロボットスタックから得られたものです。

どちらの数値も、一般的なノートパソコン上での性能を示すものではありません。また、消費電力、発熱上の制約、連続稼働、ソフトウェア障害後の復旧についても明らかにしていません。

RobotManipの最も優れた結果であるRMBenchスコア53.3は、ストリーミング履歴が有効であるという主張を裏付けています。しかし、この絶対値には依然として大幅な改善の余地があります。

家庭や産業現場で長い手順を遂行するロボットには、中断、置き場所を誤った物体、把持の失敗、人間の介入から回復する能力が必要です。メモリベンチマークが扱うのは、その問題の一部にすぎません。

サンドイッチのデモンストレーションは、今回のリリースに具体的なシナリオを与えています。しかし、さまざまなキッチン、物体の配置、照明条件、道具、予期しない変化にわたる完了率を証明するものではありません。

RobotTrackにも同様の隔たりがあります。エレベーターや駐車場で選択した人物を追跡できることは、接続性の低い環境への耐性を示しますが、安全なデプロイにはターゲットを見失わないこと以上の要件が必要です。

公開されたRobotTrackの3つのカテゴリーすべてで、衝突率はゼロではありません。報告された最高値は、妨害対象が存在するシナリオでの13.6パーセントです。

その実用上の意味は、ベンチマークにおける衝突の定義とエピソード設計によって異なります。運用者は、この割合を実際の建物で予想される事故件数に直接置き換えるべきではありません。

同社はまた、RobotTrackを、この種のものとして初の完全ローカル、ビジョンのみ、自然言語対応の追跡モデルだとしています。この位置付けはカテゴリーの定義に左右されるため、企業側の主張として扱うべきです。

いかなる公開リリースも悪用を完全には防げません。ローカルトラッカーは点検や支援に活用できる一方、同様の機能は監視、同意、事情を知らない周囲の人々の近くでの運用に関する懸念を引き起こします。

視覚追跡は、カメラやエンコーダーの弱点も引き継ぎます。暗い照明、反射面、似た服装、遮蔽、カメラの妨害は、ターゲットの識別に影響を与える可能性があります。

デプロイガイドには、緊急停止装置と現場のオペレーターが明記されています。これらの制御措置は、現在のロボティクスに関する重要な事実を示しています。モデルの知能は運用上の安全策に取って代わるものではありません。

RobotManipは、メモリを通じて別の未解決問題をもたらします。視覚的コンテキストを保持することでタスクの連続性は向上しますが、より長いコンテキストは初期の誤解を保持してしまう可能性もあります。

システムが物体や指示を誤認すると、その後のアクションがその誤りの上に積み重なる可能性があります。したがって、効率的なメモリは、訂正や忘却の挙動と併せて評価する必要があります。

中国での発表に関する報道によると、同社は1月に身体化チームを発足させました。迅速な実行は心強いものですが、成熟には繰り返しのテストと現場からのフィードバックが必要です。

適切な受け止め方は、否定でも無条件の受容でもありません。MiniCPM-Robotは、開発者がその主張をテストするのに十分な成果物を提供しており、次の証拠は外部によるテストから得られるべきです。

MiniCPM-Robotの重要性を示す3つのシグナル

次の段階は、再現性、ハードウェア対応範囲、長期間の実機デプロイから得られる証拠にかかっています。

第1のシグナルは、独立したベンチマークの再現です。研究者は、公開されたチェックポイント、スクリプト、評価設定を使用して、RobotManipとRobotTrackを再実行すべきです。

公開された数値と一致すれば、ModelBestの効率性に関する主張が強化されます。大きな差が生じれば、隠れた前提、脆弱な依存関係、不完全な報告が存在する可能性を示します。

独立したテストでは、最終的な平均値だけでなく、タスクごとの結果、失敗したエピソード、レイテンシ分布、衝突の種類、回復時の挙動も含めるべきです。それにより、モデルがどこで破綻するのかが明らかになります。

第2のシグナルは、初期のハードウェアとベンチマーク環境以外への対応です。現在、RobotTrackで最も明確なデプロイ経路が用意されているのは、Unitree Go2 EDUとJetson Orin NXです。

より広範なリリースでは、異なるカメラ、計算モジュール、移動ベース、環境条件にわたって予測可能な挙動を示す必要があります。RobotManipにも、より多くのロボットアームと制御形式にわたる同様の証拠が必要です。

移植に成功すれば、コンパクトなモデルが移転可能なデプロイ価値を提供することが示されます。移植が困難であれば、結果の多くが特定のハードウェアに合わせたシステム調整に依存している可能性を示します。

第3のシグナルは、オープンな開発によって有用な改善が生み出されるかどうかです。これには、コミュニティによる学習レシピ、検証済みチェックポイント、安全性テスト、統合、障害ケースに対する文書化された修正が含まれます。

リポジトリの活動だけでは不十分です。スターやフォークは注目度を測るものですが、マージされた貢献と再現可能なデプロイは、プロジェクトが共有インフラへと発展しているかどうかを明らかにします。

競合他社の対応も、これら3つのシグナルを評価するうえで有用な基準となります。Qwen-VLAはより大規模な統合モデルを追求し、π0.5は複雑な家庭内タスクにわたるオープンワールド汎化に重点を置いています。

Googleのオンデバイスプログラムは、ローカル推論がニッチな嗜好ではないことを示しています。競争上の問いは、どのアプローチがアクセス、汎化、レイテンシ、物理的な信頼性を最もよく両立できるかです。

現在、MiniCPM-Robotはアクセス性とコンパクトさの面で最も明確な強みを持っています。メモリ効率、追跡、選択された操作ベンチマークについても、同社が報告した有望な証拠があります。

最も弱いのは、広範な独立検証です。パラメータ数やオープンライセンスがどのようなものであっても、変化する環境内の未知のロボットで繰り返し成功することの代わりにはなりません。

プロジェクトを評価する開発者は、シミュレーションまたはドライランモードから始めるべきです。動作を有効にする前に、レイテンシ、ターゲットの喪失、衝突、アクションエラー、回復試行を記録する必要があります。

チームは、モデルのフォワード処理性能とシステム全体の性能も分けて考えるべきです。カメラ、エンコーダー、ネットワーク、制御制限、アクチュエーター、緊急システムのすべてが、実際の挙動を形作ります。

今回のリリースが重要なのは、ロボティクスに関する主張を外部の人々が検証できるものに変えたからです。その長期的な重要性は、外部の人々が何を再現し、拡張し、安全にデプロイできるかに左右されます。

MiniCPM-Robotの1.5B VLAと0.9Bトラッカーは、小規模なオープンモデルを身体化AIにおける有力な参加者にしました。しかし、コンパクトな汎用ロボットを、すでに解決済みの工学的課題にしたわけではありません。

今問うべき実用的な問題は、独立したチームがこれらの結果を再現し、障害ケースを明らかにし、同じモデルを異なる機械上で安全に動作させられるかどうかです。

 
 

無料で始めましょう

ローカルファーストのパーソナル知識管理付きAIアシスタント

より良いAI体験のために、

remio は現在、 Windows 10+ (x64)M-Chip Mac のみをサポートしています。

仕事のAIパートナー
remioでもっと仕事が進む

計画・作成・仕上げまで
すべてをひとつに

bottom of page