top of page

HiPHI人型モーションデータセット、ロボット学習における「動画優先」路線に疑問を投げかける

16 時間前
読了時間: 21分

HiPHIは、ロボット学習における重要な前提に異を唱える617.5時間の人型モーションデータセットを公開した。動画の量を増やしても、必ずしも物理的な学習データの質が高まるわけではないという前提だ。このリリースは、高精度な全身動作に追跡済み物体、意味ラベル、実機人型ロボットでのテストを組み合わせている。その根底にある考えは、ロボットには膨大な視覚観測だけでなく、計測された物理状態が必要だというものだ。

この主張により、HiPHI人型モーションデータセットは、既存の二つのアプローチの中間に位置づけられる。インターネット動画は例外的に多様な行動を提供する一方、信頼できる関節、接触、物体の状態を欠く。研究室でのモーションキャプチャはこれらの状態を提供するが、多くの既存コレクションは行動の幅が狭い、あるいは同期された物体データを省いている。

HiPHIは、単なる生データ量ではなく、構造化された収集によってこの隔たりを埋めようとしている。研究チームは、イベントの意味を整理する言語学的システムであるFrameNetを使い、モーション群を定義してバリエーションを生成した。さらに、そのデータで強化学習ポリシーを訓練し、選定した行動をUnitree G1ロボットへ転移した。

HiPHI人型モーションデータセットが学習基盤を拡張

HiPHIは、規模、物理的精度、物体を考慮したモーションを一つの公開研究リリースに統合し、利用可能な学習基盤を変えようとしている。

このプロジェクトは2026年8月17日にarXivへ投稿され、9月8日に改訂された。研究記録によると、論文はConference on Robot Learning 2026に採択されている。

公開データセットには617.5時間のモーションと約2億0010万フレームが含まれる。研究者らは、光学式モーションキャプチャシステムを用い、132人の演者から90ヘルツで素材を取得した。チームは、マーカートラッキング精度が1ミリメートル未満だと報告している。

ただし、見出しとなる収録時間には文脈が必要だ。このリリースでは、308.7時間の元キャプチャに左右反転を適用し、報告上の617.5時間を生成している。左右反転は、適切な左右の動作要素を入れ替えて有効な対応データを作成するため、独立した二つ目のキャプチャではなく、有用な拡張手法である。

合計は、身体のみの動作371.8時間と、人と物体のインタラクション245.7時間に分かれる。インタラクション部分はリリース全体の39.8%に当たる。追跡された実物体を使った運搬、押す、引く、もたれる、座るといった動作が含まれる。

人のモーションには、標準化された55関節のBVH階層が使われている。BVHは、骨格構造と時間経過に伴うその動きを保存する一般的なファイル形式だ。各インタラクションパッケージでは、身体記録が同期された物体軌跡と高解像度の物体メッシュにも接続されている。

公開されているデータセット文書では、40種類の正規物体メッシュと、その左右反転版を特定している。物体トラックは対応する身体ファイルとタイムスタンプを共有しており、実験前に必要なアラインメント作業を減らす。

データは12カテゴリーにまたがる40種類の実物体を対象とする。家具や容器から、清掃用具、スポーツ用品までが含まれる。報告されている質量は0.45~6.25キログラムの範囲だ。

この質量範囲が重要なのは、軽い容器を運ぶ場合と重い物体を動かす場合では、必要なバランス戦略が異なるためだ。腕の軌道が見た目には似ていても、足、胴体、重心は異なる振る舞いをする可能性がある。

HiPHIは、クリップに自然言語の説明と意味識別子も付与している。その結果得られたパッケージは、モーション検索、模倣学習、リターゲティング、モーション生成、物体認識型制御の研究を支援する。

これは単に大規模なアニメーションアーカイブではない。このリリースは、モーションコレクションが多様性を維持しつつ、ロボットのポリシーが実行できるだけの物理的構造を保てるか、という特定の問いを軸に設計されている。

インターネット動画が残す物理データの空白

動画は行動の見た目を捉えるが、人型制御は、ピクセルからは間接的にしか分からない物理状態に依存する。

大規模な動画コレクションには、明確な魅力がある。家庭、職場、街路、未知の環境で人々が無数の作業を行う様子を含んでいる。この多様性をモーションキャプチャスタジオ内で再現するのは難しい。

しかし、動画が通常記録するのは完全な物理状態ではなく外観だ。学習システムは、深度、関節位置、隠れた四肢、接触、物体運動を推定しなければならない。こうした推定の誤差は、ロボットポリシーの学習が始まる前から蓄積し得る。

荷物を詰めたスーツケースを引く人を考えてみよう。カメラは人とスーツケースを記録するが、力、摩擦、正確な接触形状、あるいはクリーンな骨格軌跡を直接提供するわけではない。衣服は関節を隠し、遠近法は深度を不確かにする。

モーションキャプチャは、身体動作を正確に計測することで、この問題の一部に対処する。AMASSのような従来のコレクションは、アニメーションや人型制御にとって重要なリソースとなっている。しかし、多くは物体に制約されたロボット学習ではなく、モーション合成、復元、グラフィックス向けに構築された。

欠けた物体があると、他は現実的なクリップであっても、物理的には不完全になり得る。人が座っているように見えても、身体データには椅子の状態が伴わない。演者が前方にもたれても、支持面や接触関係が存在しない。

その身体軌跡から訓練されたポリシーは、動きを安定させた制約を理解しないまま、姿勢だけを模倣できる。これは視覚的なもっともらしさと実行可能な制御の違いだ。

実ロボットのデモンストレーションは、より直接的な教師信号を提供する。すでに機械の関節、センサー、制約を反映している。一方で、収集コストが弱点であり、得られるデータは多くの場合、一つのロボット構成に結び付いたままとなる。

そのためHiPHIは中間的な位置を占める。人間の演者が行動の幅を提供し、光学式キャプチャが正確なモーション状態を提供する。同期された物体記録は、身体のみのデータセットが捨ててしまうインタラクション構造の一部を保持する。

比較すべきなのは、あらゆる状況での動画とモーションキャプチャの優劣ではない。動画は依然として、意味的文脈、視覚認識、自然環境での行動に価値がある。モーションキャプチャにも、スタジオ、マーカー、計画済みセッションに制約されるという限界がある。

本当の争点は、どのデータが実行可能なモーション事前分布として機能すべきかだ。モーション事前分布とは、身体が通常どのように動くかを学習したモデルである。人型制御では、その参照データは、人間の身体から、異なる体格とアクチュエータを持つロボットへのリターゲティングに耐えなければならない。

HiPHIの研究者らは、この段階では精度と物理的な接地性をより重視すべきだと主張する。彼らのベンチマークは、複数のソースを共有身体表現へ変換し、一貫した評価手順を適用した後のデータを比較している。

このアプローチは、主に再構成されたインターネット動画に依存するチームへ圧力をかける。より大きな視覚データセットは多くの状況を説明できるが、推定された物理状態は、計測された軌跡と競合できるほど正確にならなければならない。

同時に、従来のモーションキャプチャプロジェクトにも圧力をかける。演者が狭い範囲の慣れた行動を繰り返すなら、高精度だけでは不十分だ。より困難な目標は、意図的に設計されたモーション空間全体で正確なカバレッジを実現することである。

FrameNetが言語をモーション収集計画へ変える

HiPHIの中心的な仕組みはカメラシステムではなく、どの動きを記録すべきかを決めるために言語構造を利用する点にある。

大半のモーションデータセットは、活動のリストから始まる。設計者は歩行、走行、着座、手を振る動作、持ち上げを依頼し、新たなニーズが生じるたびに台本を加えるかもしれない。このプロセスは理解しやすいクリップを生むが、何がまだ欠けているかを測る信頼できる尺度は提供しない。

異なる物語でも、ほぼ同じ動きを生み出す可能性がある。額の汗を拭う動作と、日光から目を守る動作は、似た関節軌跡を用いるかもしれない。両者を別々の活動として数えると、物理的カバレッジを過大評価する可能性がある。

逆の問題もある。「歩く」のような一つの単語でも、速度、経路、歩幅、旋回半径、姿勢、方向を通じて多くのモーションを生み出せる。一つの活動ラベルが、大きな運動学的多様性を隠してしまうことがある。

HiPHIは、この不一致を扱う枠組みとしてBerkeley FrameNetを使用する。FrameNetは、イベント、状況、それらを喚起する語義を軸に言語を整理する。「フレーム」はイベントの種類を表し、語彙ユニットは単語の特定の意味をそのフレームへ結び付ける。

例えば、「run」は人の移動を表す場合もあれば、企業を経営することを表す場合もある。Frame-LUペアは、これらの意味を分離する。HiPHIは物理的な動作に結び付くペアを選び、それをキャプチャ指示の種に変換する。

このコレクションには22のFrameNetフレームと214のFrame-LUモーションユニットが含まれる。これらのユニットは、移動、姿勢変化、身体部位の動き、物体の操作、移送、関連するインタラクションパターンをカバーする。

各意味的な種は、観測可能な物理的次元に沿って展開される。演者は、方向、速度、振幅、姿勢、リズム、身体部位の関与、接触位置、荷重、物体軌跡を変化させる。

押すという種からは、複数の物体、荷重、接触点、方向が生み出される。歩くという種では、経路、ペース、旋回行動、歩幅、身体の高さを変えられる。これらの変化は、説明を変えるだけでなく、モーション自体を変える。

これは、WordNetがImageNetの構造化で果たした役割に似ている。分類体系そのものがデータを生成するわけではない。何を収集し、どこでカバレッジが薄いかを判断するための、整理された地図を提供する。

結果として得られた分布には、一般的な行動と意図的なロングテールが含まれる。最も頻度の高い50のFrame-LUラベルが、公開期間の53.7%を占める。残りの46.3%は、これらの一般的なユニットの外側にある。

演者の違いもラベル内に現れる。HiPHIは、Frame-LU当たりの演者数の中央値が24人であり、154ユニットには少なくとも10人の演者が含まれると報告している。これにより、モーションカテゴリーが単に一人のスタイルを反映する可能性を抑える。

HiPHIプロジェクトのベンチマークは、共有の教師なしモーションエンコーダを使ってカバレッジを測定する。研究者らはデータセットを共通の23キーポイント表現へ正規化し、毎秒30フレームにリサンプリングしたうえで、バランスの取れたサンプルを比較した。

この手順では、HiPHIは投影されたモーション空間で1,620セルを占めた。最も近い大規模ベースラインであるBONES-SEEDは1,438セルだった。HiPHIは、有効占有数も1,443と報告しており、BONES-SEEDの1,114を上回った。

有効占有数は、サンプルがカバー済み領域をどの程度均等に満たしているかを反映する。HiPHIが報告した優位性は、遠く離れた領域に少数の外れ値だけを配置して、より広いカバレッジを実現したわけではないことを示唆する。

ロングテールの比率は14.1%に達し、BONES-SEEDの10.7%と比べて高かった。研究者らは、複数のランダムシード、投影設定、グリッド解像度にわたって分析を繰り返し、テストしたすべての構成で正のカバレッジ差を報告している。

こうした結果は依然として、選択した表現と評価設計に依存する。二次元投影では、複雑なモーション多様体を完全には記述できない。しかし、バランスの取れたサンプリングにより、この比較は単純な収録時間だけよりも有益なものとなる。

物体軌跡がインタラクションデータを物理的に有用にする

ロボットは身体動作だけから運搬、押す、引くことを学ぶことはできない。物体によって、ロボットが実行すべき動作そのものが変わるためだ。

HiPHIは、演者のスケルトンとともに、物体の位置と向きを記録する。各トラックには身体動作の各フレームに対応するエントリーがあり、メッシュは共有座標系における物体形状を提供する。

これにより、人と物体が結び付いた表現が生まれる。身体は単に箱を持つ動作をまねるだけではない。演者が姿勢を変え、把持する高さを変え、体重を移動させた際に、箱がどのように動くかをデータセットは記録している。

この違いは、全身制御にとって重要だ。重い物体を押すには、前傾姿勢、より広いスタンス、異なる足の配置が必要になる場合がある。スーツケースを引く際には、抵抗の変化に応じて胴体や支持脚の位置が変わることがある。

物体メッシュはジオメトリも明確にする。椅子の表面は、座る際にどこで接触すべきかを決める。容器の寸法は、手の位置、腕の間隔、そして胴体を曲げる必要があるかどうかに影響する。

HiPHIは、このアライメントを2つの指標で評価している。非衝突率は、サンプリングされた人間のスケルトンが物体を貫通していないかを確認する。近表面接地度は、もっともらしい相互作用が成立するのに十分な近さを人物が物体に対して保っているかを測る。

データセットは、非衝突率98.1%、近表面接地度95.7%を報告している。HIMOはそれぞれ97.6%、79.0%だった。OMOMOは90.6%、50.4%を記録した。

これらの数値は、選定された幾何学テストにおいてHiPHIが有利であることを示すが、接触のあらゆる側面を測定するものではない。手が物体の近くにあっても、現実的な力を加えているとは限らない。これらの指標は、摩擦、触覚応答、把持の安定性も検証しない。

規模も注目すべき違いである。HiPHIは245.7時間の相互作用データを報告している。論文では、HIMOで評価された物体トラック時間は21.6時間、OMOMOは9.8時間として比較している。

チームは、動作の滑らかさと一般的な接触アーティファクトも評価した。床面の扱いが比較可能なデータセットの中で、HiPHIは選定された5つの指標すべてで最も低い値を報告した。

95パーセンタイルの地面貫通量は8ミリメートルで、BONES-SEEDの18ミリメートル、AMASSの111ミリメートルと比較された。支持されない浮遊は評価対象時間の0.015%を占め、支持点のドリフトは毎秒64ミリメートルだった。

これらはデータセット全体の測定値であり、すべてのクリップを保証するものではない。それでも、方策最適化で重要となる誤差を対象としている。足の滑りや一貫しない床面接触は、物理法則が許容しない参照動作を追うようコントローラーに学習させてしまう可能性がある。

この相互作用ベンチマークは後段で、リターゲティング後のキック、運搬、押す動作、寄りかかる動作のシーケンスをテストする。HiPHIは複数の比較でより低い身体追従誤差を達成したが、すべてではなかった。

押す動作は、結果を慎重に読む必要がある理由を示している。HiPHIの押す動作における身体MPJPEは99.20ミリメートルで、OMOMOの66.09ミリメートルより悪かった。MPJPEは、対応する関節間の平均位置差を測る指標である。

同時に、HiPHIはこのカテゴリにおいて、物体の位置と向きの誤差を大幅に低く抑えた。この結果は、物体の動きを一致させることと、人間の姿勢を一致させることが競合する要求になり得ることを示唆する。

運搬では別の混合した結果が得られた。HiPHIの身体誤差は両方の比較結果より低かった一方、物体位置誤差は高かった。こうしたばらつきが、1つのデータセットがすべての下流タスクで勝つという単純な主張を妨げている。

HiPHIが加えるのは、こうしたトレードオフを検証するためのはるかに大きなテストベッドである。研究者は、身体追従、物体追従、物理的安定性がいつ整合し、ある要素を最適化すると別の要素をいつ損なうかを調べられる。

強化学習がHiPHIの動作をUnitree G1へ移植する

HiPHIが重要なのは、研究者らが静的なデータセット統計の先へ進み、学習済み方策が選定された動作を実機で実行できるかを検証したためだ。

チームは人間の動作を、異なる体型比と駆動限界を持つヒューマノイド、Unitree G1へリターゲティングした。リターゲティングは、ソーススケルトンの動作をターゲットロボットに適合する参照動作へ変換する。

身体のみを対象とするテストでは、研究者らはDeepMimicスタイルの強化学習パイプラインで方策を学習させた。DeepMimic researchは、参照動作から物理ベースのスキルを学習するために広く使われるアプローチを確立した。

ベンチマークでは、同一のデータ予算の下でHiPHIをAMASS、LAFAN1、Motion-X++、BONES-SEEDと比較している。各ソースは同じリターゲティングおよび方策学習プロセスを通過した。

HiPHIは、3時間および20時間の両方の学習設定で、最も高い成功率と最速の収束を達成したと報告されている。この比較では5回の独立した学習実行を用い、学習中の失敗率を測定した。

別のスケーリング実験では、左右反転を含まないHiPHIの学習データを3時間から300時間へ増やした。得られた方策は、他の4つのデータセットから取り分けた未学習動作で評価された。

論文によると、HiPHIの学習セットが大きくなるにつれ、データセット横断の関節位置誤差は一貫して低下した。この実験は10回繰り返され、結果は平均曲線と分散バンドとして報告されている。

このパターンは、追加の構造化された動作データが、一般的な行動を単に繰り返すのではなく、汎化性能を継続的に改善するというプロジェクトの中核的な主張を支持する。また、データセット規模を実際の制御指標と結び付けている。

最後に、方策は実機のG1へ移された。ロボットは走行、着座、這行、箱の運搬、宙返り、スーツケースを引く動作を行った。これらの試験では、方策がアクチュエータの限界、センシングノイズ、シミュレーションと現実の差異にさらされた。

多くの動作データセットは再構成品質やシミュレーションで終わるため、これらのデモンストレーションは意味を持つ。実機への展開は、少なくとも選定された参照動作がリターゲティングとハードウェア制約を乗り越えられることを示す、より強い証拠となる。

ただし、「現実世界への転移」という表現を汎用自律性として解釈すべきではない。報告された試験は、制御された条件下で選ばれた行動を対象としている。未知の物体をロボットが自律的に認識したり、タスクを計画したり、制約のない職場環境へ適応したりすることは示していない。

追従方策が解く問題も、完全なロボットエージェントより狭い。物理的な安定性を維持しつつ、参照動作に従うものだ。どの行動を実行すべきかを決めたり、人がなぜその動作を行ったのかを理解したりするとは限らない。

したがってG1のデモンストレーションが検証するのは、完全なタスク知能ではなく実行可能性である。フィジカルAI企業が印象的な動作動画を有用な労働に関するより広範な主張と結び付ける機会が増える中、この区別は重要だ。

HiPHIの最も強い貢献は、スタックのより下位にある。方策が協調、バランス、物体条件付きの移動を学習するために役立つ参照データを提供する。その上に、計画および知覚システムを構築できる。

実務的なワークフローも要求が厳しい。研究者はBVHファイルをリターゲティングし、ロボットの関節限界を考慮し、シミュレーションで学習させ、実機展開前に安全性を検証しなければならない。

プロジェクト文書は、選択した実体に応じて動作にはリターゲティングとチェックが必要であると明示的に警告している。G1で機能する参照動作が、すべてのヒューマノイドへそのまま転移するわけではない。

エンジニアリングチームにとって、これはデータセットの精査と実験追跡を不可欠にする。検索可能なengineering knowledge baseは、基盤となるロボティクスのワークフローを変えることなく、動作識別子、学習構成、失敗、ハードウェア観察結果を結び付ける助けになる。

HiPHIの結果が依然として測定していないもの

HiPHIは動作データのギャップを縮めるが、汎用ヒューマノイド行動に必要な完全な物理、知覚、社会的文脈を捉えているわけではない。

第1の制約は、環境の多様性である。すべての元の動作はスタジオで収集された。この設定は精密な測定を支える一方、管理された施設の外にある雑然とした環境、照明の変化、不均一な地面、予期しない障害物を取り除いてしまう。

インターネット動画は対照的な特性を持つ。正確な物理状態を犠牲にする一方で、雑多な環境変化を提供する。HiPHIは、このトレードオフの一方を強化するのであって、解消するものではない。

第2の制約は力に関わる。このリリースが記録するのは運動学、すなわち身体と物体がどのように動くかである。接触力や触覚信号を直接測定するものではない。

この欠落はマニピュレーションにとって重要だ。2つのクリップは似た軌跡を示していても、把持圧、摩擦、抵抗が異なることがある。壊れやすい、変形する、あるいは滑りやすい物体を扱うには、コントローラーはこれらの隠れた量を必要とする可能性がある。

第3の制約は社会的相互作用である。HiPHIは現在、1人の人物による動作を対象とする。複数人の行動や、人間同士の直接的な接触は含まれない。

人の周囲で作業するヒューマノイドは、最終的には受け渡し、共同での運搬、協調的な移動、衝突回避をモデル化する必要がある。こうしたタスクには、2つの身体と変化する意図を表現するデータが必要だ。

第4の問題は拡張である。報告されたリリース時間のほぼ半分は、左右反転によるものだ。特に片側性の行動について有用なカバレッジを増やすが、新しい演者や収録セッションを追加するわけではない。

したがって読者は、公開された時間と独立して収録された時間を区別すべきである。どちらの数値も異なる目的には有効だが、答える問いは異なる。

第5の懸念は、ベンチマークの独立性である。公開された比較と実機展開の証拠の大半は、データセットの作成者によるものだ。CoRLでの採択は査読を意味するが、より広い信頼を得るには外部チームによる結果の再現が必要になる。

独立した研究者は、異なるリターゲッター、方策アーキテクチャ、ロボットの身体、評価指標の下でもHiPHIが優位性を維持するかを検証すべきだ。より小型のプラットフォームや、異なる関節配置を持つ機械での結果は、特に参考になるだろう。

ライセンスも実用的な採用に影響する。データセットはCC BY-NC 4.0ライセンスを使用しており、帰属表示付きの研究利用は認める一方、商用利用を制限している。企業は、ファイルを製品学習へ組み込む前にこの制約を評価しなければならない。

公開パッケージにおけるプライバシーへの露出は限定的に見える。リリースには動作、軌跡、メッシュ、匿名化された演者属性が含まれる。収録されたRGB動画、音声、顔画像、音声録音は含まれない。

ただし、動作自体が個人固有のパターンを含む可能性がある。著者らは数値のアクター識別子と一般化された人口統計メタデータを用いており、直接的な識別リスクを抑えながら分析を可能にしている。

最後に、物理的に実行可能な模倣は、タスクの成功と同義ではない。ロボットは、正しい箱を認識したり、目的地を選んだり、誰かが経路を塞いだ際に回復したりせずに、運搬動作を再現できる。

HiPHIは動作インフラとして評価すべきである。ヒューマノイドが多様で接地された動作参照を獲得する方法に取り組む。知覚、言語条件付き計画、安全認証、オープンワールドでの自律性を解決すると主張するものではない。

このより限定的な位置付けは、研究の信頼性を高める。未解決の問いは、このデータセットが研究グループをまたぐ再利用可能な基盤となるのか、それとも作成者の評価スタックと密接に結び付いたままなのか、という点だ。

HiPHIがヒューマノイド学習を変えるかを示す3つのシグナル

次の試金石は採用である。独立した再現、より幅広い実体への転移、そしてより豊かな物理センシングが、HiPHIの持続的な価値を決める。

第1のシグナルは、独立したベンチマーク再現である。研究グループはリリースをダウンロードし、比較可能な方策を再学習させ、文書化された条件下で結果を報告する必要がある。

再現は、HiPHIのカバレッジと精度が性能を左右するという主張を強化する。大きな差異があれば、学習の選択、リターゲティング、あるいは公開されていない運用上の詳細が、データセットそのものより大きく寄与したことを示唆する。

2つ目のシグナルは、Unitree G1を超えた転移性です。HiPHIから導出されたポリシーは、異なる体格比、関節可動域、アクチュエータ出力、制御周波数を持つヒューマノイドで評価されるべきです。

複数ロボット間での転移に成功すれば、このリリースが再利用可能な人間動作の構造を捉えているという考えを裏付けることになります。転移性が低ければ、エンボディメント固有の適応が依然として主要なボトルネックであることが示されます。

3つ目のシグナルは、補完的なセンシングです。今後のデータセットや拡張では、精密な動作を力覚、触覚、一人称視点の視覚コンテキストと結び付ける必要があります。

これらのモダリティは、HiPHIの最も明確な盲点に対応します。力覚データは軽い接触と荷重を支える支持とを区別でき、一人称視点の動画は動きと演者が見ていたものを結び付けられます。

最も有望な道筋は、データソースを置き換えるのではなく組み合わせることかもしれません。高忠実度のモーションキャプチャは、実行可能な物理的参照を提供できます。インターネット動画は、環境面・行動面での幅広さを提供できます。ロボットによるデモンストレーションは、その両方を特定のハードウェアに結び付けられます。

HiPHIは、構造化され検索可能なモーションレイヤーを公開しているため、このハイブリッドな方向性を評価しやすくします。Frame-LUシステムは、ソースをまたいで関連例をサンプリングまたはリンクするための意味的な手掛かりも提供します。

研究者はいま、具体的な問いを立てるべきです。ロングテールの動作で訓練されたポリシーは、外乱からより良く回復するのでしょうか。同期されたオブジェクト記録は、キャプチャスタジオの外でもタスク成功率を向上させるのでしょうか。その意味構造は、言語コマンドから適切な動作を選択する助けとなるでしょうか。

HiPHIのヒューマノイド動作データセットは、動画規模と物理的精度のどちらが優れるかという議論に決着を付けるものではありません。収集設計、測定可能なデータ品質、ポリシー訓練、実機ロボットでの実行を結び付けることで、その議論の基準を引き上げています。

次に有用なのは、直接的な実験です。サブセットをダウンロードし、ミラーリングされたシーケンスと元のシーケンスを監査し、複数のインタラクションカテゴリをリターゲティングし、成功したデモンストレーションとともに失敗例も公開してください。その結果によって、構造化された人間動作がフィジカルAIの共通インフラとなるのか、それともロボットが未知の環境へ持ち出すのに苦労する、もう一つの印象的なベンチマークにとどまるのかが明らかになるでしょう。

 
 

無料で始めましょう

ローカルファーストのパーソナル知識管理付きAIアシスタント

より良いAI体験のために、

remio は現在、 Windows 10+ (x64)とM-Chip Mac のみをサポートしています。

仕事のAIパートナー
remioでもっと仕事が進む

計画・作成・仕上げまで
すべてをひとつに

bottom of page