top of page

労働者がモーショントラッカーを装着し、人間がすでに知る仕事をロボットに教える

労働者はカメラやモーショントラッカーを身に着け、AIシステムが人間の習得に何年もかかった動きを学べるようにしている。最近のBloombergの報道は、肉体労働を支えるデータをめぐる競争の激化を浮き彫りにした。

この取り組みは、現代ロボティクスに残る根強い弱点を狙っている。言語モデルはデジタルソースから数兆語を吸収できる。一方、ロボットはインターネットをスクレイピングするだけで、物理世界における判断力を学ぶことはできない。

ロボットには、視覚、動作、触覚、力、タイミング、そして周囲の物体の変化する状態を結び付ける実演が必要だ。そのため企業は、ホテル、倉庫、店舗、工場、家庭で稼働するよう設計された機械に向け、熟練労働者を生きたデータソースとして活用している。

そこに生じる緊張は見過ごしがたい。労働者の専門性はデータ収集の場面で価値を増す一方、その成果として生まれるシステムは、まさにその労働者の仕事をより多く担うことを目指している。

労働者自身が訓練データセットになる

最新のロボット訓練パイプラインは、人々が通常の仕事を並外れた監視の下で行うところから始まる。

ソウルのロッテホテルでは、ベテラン従業員のDavid Park氏が、カメラに頭部、胸部、手元を記録されながら宴会用ナプキンの折り方を実演した。Associated Pressの調査によると、Park氏はこの作業を9年間行ってきた。

この取り組みで記録されたのは、ナプキンの最終的な形だけではない。動作の順序、Park氏が素材をどのように配置したか、そして布地がずれた際に手をどう調整したかも記録された。

韓国のロボティクススタートアップRLWRLDは、こうした実演を機械が読み取れる訓練データに変換している。同社はCJの物流従業員やLawsonの店舗スタッフとも協力している。

CJの従業員は、倉庫内で商品をつかみ、持ち上げ、移動させる方法を実演する。Lawsonの従業員は、商品の陳列や食品売り場の管理方法を示す。

こうした事例は、職場データがなぜ重要なのかを示している。ロボットに必要なのは、箱がある棚から別の棚へ移動したことを示す動画だけではない。その動作がどのように行われたのかを、利用可能な形で把握する必要がある。

そこにはカメラ画像、関節位置、手のポーズ、動作軌跡、物体の位置、加えられた力などが含まれ得る。同期された各信号が、観測された場面と物理的な行動を結び付ける助けとなる。

RLWRLDのエンジニアは、VRヘッドセット、カメラ、モーショントラッキング用グローブを用いて作業を繰り返すことで、さらに別の層を加えている。人間の操作者は、その後、テスト用ロボットに関連する動きを案内できる。

このプロセスは、AIシステムがすべてを手書きのルールに頼るのではなく、実演から行動を学ぶ模倣学習に似ている。原理は単純だが、信頼できる事例を生み出すには多くの労力が必要となる。

ロボットの身体は、人間の指導者とは異なる。関節の可動域は異なり、手の指はより少ない場合があり、センサーも異なる方法で世界を捉える。

そのためエンジニアは、人間の動きをロボットが利用可能な身体へと再ターゲティングしなければならない。再ターゲティングでは、体格、関節、バランス上の制約、機械的な限界の違いを考慮しながら、動作の本質的な部分を対応付ける。

労働者は布を折る際に手首を回すかもしれない。特定のロボットは、似た効果を生むために腕全体を動かし直す必要がある可能性がある。

整った実演であっても、それだけで自律的に動く機械が生まれるわけではない。エンジニアは記録にラベルを付け、データストリームを整列させ、使えないシーケンスを取り除き、モデルを訓練し、得られた行動をテストしなければならない。

さらにロボットは、物体がわずかに異なる位置に現れたときにも対応できなければならない。この最後の要件こそ、暗記した手順と、職場で役立つ技能を分けるものだ。

RLWRLD自身の実演は、その隔たりを示している。観察されたあるテストでは、車輪付きロボットがミニバーの近くでカップを動かしたものの、皿を倒してしまった。別の映像では、ヒューマノイドが箱を開け、コンピューターマウスを入れ、閉じた箱をコンベヤーに載せていた。

この進展には意味があるが、同じシステムがどちらの作業においても、あらゆる変化に確実に対応できることを証明するものではない。実演が、ますます複雑になるテストをどのように支え得るかを示している。

労働者は、画像にカップが含まれているかどうかをラベル付けしているだけではない。手、物体、環境が時間の経過とともにどのように相互作用するかを明らかにするシーケンスを提供している。

これにより、人間の動きはAI訓練素材の新たなカテゴリーとなる。同時に職場は、潜在的なデータ収集の場へと変わる。

フィジカルAIにはインターネットだけでは解決できないデータ問題がある

ロボットハードウェアの進歩は、現実に根ざし、多様で、法的に利用可能な実演の供給を上回っている。

現代のAI開発は、すでにオンラインで入手可能だった膨大なテキスト、画像、音声、動画の蓄積から恩恵を受けてきた。フィジカルAIには、ロボットの制御と結び付いた行動の同等の記録は存在しない。

オンライン上の料理動画では、誰かがタマネギを刻む様子が映っているかもしれない。しかし通常、手首の正確な向き、加えた圧力、刃の位置、各カット後にタマネギがどう変化したかを示す同期データは欠けている。

ロボットポリシーには、観測と行動の関係が必要となる。ポリシーとは、現在の状況を解釈した後に動作を選択する、学習済みのコンポーネントを指す。

研究者はロボットを直接操作することで、こうした関係を収集できる。しかしロボットの遠隔操作には、機材、訓練を受けた操作者、管理された環境、高価なハードウェアを使う時間が必要だ。

人間による実演は別の道筋を提供する。労働者はすでに、その作業に必要なタイミングと判断力を備えており、職場には現実的な物体や条件がそろっている。

課題は、その振る舞いを機械が使える信号へ変換することにある。カメラは目に見える動きを捉えるが、力、接触、物体の背後に隠れた動きは見逃す可能性がある。

モーショントラッカーは身体部位の位置と向きを推定する。センサー付きグローブは指の動きを追加でき、力センサーは圧力や接触を測定する。

物理的な技能の本質を完全に捉える単一の装置はない。見た目には似た動作でも、力やタイミングが変わればまったく異なる結果になり得るため、エンジニアは複数の信号を組み合わせる。

たとえば、棚にグラスを置く場面を考えてみよう。カメラは腕の軌跡を記録するが、安全に置くためには握る力、減速、棚の高さ、手を離す瞬間が重要となる。

人間はこうした変数をほとんど無意識に調整する。ロボットは機械的な限界の範囲内にとどまりながら、それらを推定または測定しなければならない。

Google DeepMindのOpen X-Embodimentプロジェクトは、この問題の別の側面を示した。研究者らは33の大学研究室との協力を通じ、22種類の異なるロボットから得たデータを統合した。

このロボティクスデータセットには、500以上の技能と15万件のタスクが含まれていた。その目的は、異なるロボットの身体や環境をまたいで、モデルが知識を転移できるようにすることだった。

このプロジェクトは、労働者を単に記録するのではなく、ロボットが生成した経験を用いた。それでも、業界の中心的な課題を裏付けている。役立つロボット行動は、多様で構造化された物理データに依存している。

一つのアーム、一つの部屋、一組の物体で訓練されたモデルは、別の場所ではしばしば苦戦する。同じ行動でも、カメラの角度、照明、ツール、ロボットの身体が変われば見え方は異なる。

したがって、量と並んで多様性も重要だ。開発者には、異なる労働者、場所、物体の配置、タスクの結果に関する事例が必要となる。

失敗した実演も必要だ。完璧な動きだけを含むデータセットでは、ロボットに問題の検知や安全な復旧方法を教えられない可能性がある。

この要件により、職場での収集は魅力的になる。現実の環境には、しわ、雑然とした状態、中断、損傷した梱包、珍しい物体など、研究室では再現が難しい無数の条件が存在する。

しかし、現実性はプライバシーと品質に関するリスクも高める。頭部装着型カメラは、同僚、会話、文書、コンピューター画面、顧客、立入制限区域を記録する可能性がある。

データ収集者は、何を訓練セットに入れるかを決めなければならない。また、誰が同意したのか、何が記録されたのか、その映像をどのように再利用できるのかを示す信頼できる記録も必要となる。

このプロセスは、言語・視覚モデル向けデータアノテーションの初期の成長に似ている。違いは、物理的な実演が、個人や環境に関する情報とともに実践的な専門知識を捉える点にある。

記録された動きは、特定の労働者が問題をどう解決するかを明らかにし得る。繰り返し撮影された映像は、生産性のパターン、身体的な制約、手順書には一度も記されなかった非公式な技法を露呈する可能性がある。

このため、フィジカルAIのデータ競争は、職場にカメラを追加するだけの話ではない。人々が完全には説明せずに使っている専門知識、すなわち暗黙知を形式化しようとする試みなのだ。

いったん形式化されれば、その知識は多くの機械を訓練できる。その価値は、元のタスクや場所だけにとどまらなくなる。

本当の競争は人間の技能と機械のスケールの間にある

本質的な競争は、現在の労働者対ロボットではなく、人間の専門性と再利用可能なロボットモデルが約束するスケールとの間にある。

熟練した従業員は、長年にわたる反復作業を通じて向上する。その知識は一人の人間に結び付き、通常は一度に一つの職場に利益をもたらす。

ロボットモデルは異なる経済的な提案をもたらす。開発者は一度だけ事例を記録し、訓練を通じて洗練させ、得られた能力を多くの機械に配布したいと考えている。

この可能性が、人間による実演データへの強い需要を説明している。一つのホテルや倉庫で捉えられた動きが、別の場所に配備されるモデルへの入力になり得る。

Nvidiaは、Isaac GR00Tロボティクスプラットフォームを通じてこの戦略を説明している。同社によると、GR00Tモデルはインターネット動画、現実世界での遠隔操作、合成データを組み合わせる。

同社のGR00T-Mimicワークフローは、遠隔操作による実演を模倣学習向けのモーションデータへ変換する。別のワークフローでは、シミュレーション内で少数の人間による事例を拡張できる。

同社が報告したあるテストでは、Nvidiaは11時間で78万本の合成軌跡を生成した。同社はこの量を、人間による実演データ6,500時間分に相当すると説明した。

Nvidiaはまた、合成軌跡を実データと組み合わせた場合に、性能が40%向上したと報告している。これらの数値は業界全体を対象とした独立ベンチマークではなく、Nvidia自身のモーションパイプラインによるものだ。

それでも、この結果は実演が戦略的価値を持つ理由を説明している。合成データは事例を増幅できるが、開発者にはまず、現実に根ざした動きと現実的なタスク定義が必要となる。

シミュレーションでは、物体の位置、カメラアングル、動作経路を変化させられる。しかし、基礎となる行動が実際の職場にある微妙な制約を反映していることまでは保証できない。

こうして、ロボット訓練にはハイブリッドモデルが生まれる。労働者が本物の事例を提供し、遠隔操作者がそれらの事例をロボット制御に結び付け、シミュレーションが得られたデータセットを拡張する。

ロボット開発者はその後、物理ハードウェア上でポリシーをテストする。失敗は新たなデータを生み、システムが未知の条件に遭遇したときには人間が介入する。

したがって、人間の労働はあらゆる段階に存在する。労働者がタスクを実演し、アノテーターが記録を整え、操作者がロボットを制御し、安全チームが失敗を評価する。

自動化は、機械学習だけから生まれるものではない。人間による指示と修正の長い連鎖から生まれる。

商業的に最も強い主張は、この連鎖が最終的にはより効率的になるというものだ。新たな実演の一つひとつが、複数のロボットやタスクで使われるモデルを改善できる。

懐疑的な見方は、最後の詰めの部分に焦点を当てる。実演では成功するロボットでも、材料や照明、人の往来が変われば失敗する可能性がある。

ホテル業務は有用な例だ。ナプキンを1枚折るには器用さが必要だが、宴会の準備を完了するには、移動、手順の管理、目視検査、例外処理、同僚との連携も求められる。

倉庫業務にも同様の複雑さがある。箱は重量や状態が異なり、通路には人がいて、一見単純な把持でも中身の不安定さに左右されることがある。

ロボットには、操作能力と状況判断の両方が必要だ。前者を満たすモデルが、後者まで自動的に満たすわけではない。

この隔たりは二つの集団に圧力をかける。ロボット企業は、大規模な実演データセットが、洗練された試験結果ではなく、信頼できる現実世界での性能を生み出すことを示さなければならない。

雇用主は、データ収集が労働者を支援するのか、職務を再設計するのか、あるいは選定した業務の自動化に向けた準備なのかを判断する必要がある。これらの結果は、一つの組織内で共存し得る。

最も大きな不確実性に直面するのは労働者だ。彼らの専門性は不可欠な入力となる一方、そこから生まれるモデルに対する権利は依然として十分に定義されていない。

従来の雇用契約では、業務成果物は雇用主に帰属することが多い。動作データは、労働者の身体、習慣、蓄積された技能を記録するため、より難しい問題を提起する。

手の軌跡は単なる業務データなのか。完全な実演は個人データ、職場における知的財産、あるいはその両方なのか。

その答えは、同意、報酬、保存期間、再利用に影響する。また、労働者が本来の目的を超えて展開されたデータセットに異議を申し立てられるかどうかにも関わる。

組織はすでに、文書化された手順や組織の記憶を保持するためにナレッジマネジメントを活用している。モーションキャプチャはこの目的を身体的な行動へと拡張するが、その境界はまだ定まっていない。

その結果として生まれるデータベースは、提供した従業員より長く残る可能性がある。また、専門性を、それを培った本人から切り離すこともできる。

この分離こそが中心的な逆転である。自動化が最も困難と見なされてきた技能は、依然として自動化に不足している実例を生み出すため、非常に価値の高いものになりつつある。

より良い実演でも労働リスクは解消されない

より豊富なデータセットはロボットの性能を向上させ得る一方、記録される人々にとっては監視、同意、交渉力に関する懸念を強める可能性がある。

職場のカメラは、対象となる動作だけを映すわけではない。顔、声、コンピュータ画面、顧客情報、セキュリティ手順、ロボット訓練とは無関係な場面まで記録する可能性がある。

モーショントラッキングシステムは、作業技法以上の情報を明らかにし得る。繰り返しの記録は、疲労、身体的な違い、作業速度、けが、あるいは管理側が望む方法からの逸脱を示す可能性がある。

ここで目的の問題が生じる。ロボット訓練のために収集されたデータが、後に労働者の評価、生産性の監視、安全調査、その他の管理判断に使われるかもしれない。

意味のある同意には、従業員にデバイスの装着を求めるだけでは不十分だ。労働者は、システムが何を記録するのか、誰がデータを受け取るのか、いつまで利用可能なのかを知る必要がある。

また、拒否が勤務割り当て、昇進、継続雇用に影響するかどうかも知る必要がある。収入を失う危険を冒さずに拒否できない場合、同意の正当性は疑わしくなる。

2026年の労働者中心の倉庫ロボットに関する研究では、有用な自動化への幅広い関心が確認された一方、プライバシーと同意に関する懸念も記録された。参加者は、ロボットが人々に個人的な空間が必要な時を認識することを望んだ。

倉庫に関する研究は、設計における労働者の関与についても強調している。その結果は、技術の受容が制御、透明性、職場の文脈に部分的に左右されることを示唆している。

ロボット訓練プログラムにも同様の保護措置が必要だ。データ収集には明確な目的、限定的なアクセス、記録された保存期間、無関係な素材を削除するプロセスが求められる。

周囲にいる人々も別の課題となる。顧客や同僚は、訓練データセットへの参加に同意していなくても、一人称視点の映像に映り込む可能性がある。

顔のぼかしは一部の露出を減らせるが、すべての問題を解決するわけではない。制服、声、場所、作業ルーティンによって、間接的に個人が特定される可能性がある。

動作データ自体も識別性を持ち得る。データセットは、氏名を削除した後でも、身体的特徴や行動パターンを明らかにする可能性がある。

したがって企業は、来歴管理を中核的な機能として扱う必要がある。来歴は、データの出所、適用される許可、各資産が処理中にどのように変化したかを記録する。

来歴がなければ、ロボット開発者は、人や場所について適切な許可が得られているかを知らないまま、有用なファイルを受け取る可能性がある。

報酬は別の争点となる。労働者は、作業を実演している間に通常の賃金を受け取る場合もあれば、一時金を受け取る場合、追加報酬を受け取らない場合もある。

そのデータセットは、元の勤務時間をはるかに超える価値を持つモデルを支え得る。既存の賃金体系は、記録された専門性が繰り返し商業利用されることをほとんど考慮していない。

これは、すべてのロボット動作についてすべての労働者がロイヤルティを受け取るべきだという意味ではない。だが、雇用主と開発者は収集を始める前に明確な立場を示す必要がある。

団体交渉はその立場に影響を与え得る。労働者の代表者は、デバイスの制限、報酬、アクセス規則、安全性試験、記録を懲戒に利用することへの制約を交渉できる。

韓国労働組合総連盟は、ロボットの広範な導入が将来の熟練労働者の育成を妨げる可能性があると警告している。その懸念は、目先の雇用喪失を超えている。

若手従業員は、経験豊富な同僚を観察し、監督のもとで練習することで学ぶ。自動化が初級レベルの業務を排除すれば、より深い専門性が育まれる役割へ進む人が減る可能性がある。

訓練データセットは、専門家の現在の手法を保存できる。しかし、材料、道具、顧客の期待が変化した時に、システムが新たな技能知識を生み出すことを保証するものではない。

人間は継続的に技法を変えていく。静的な訓練コーパスは、現実の仕事が進化し続ける一方で、仕事の一つのバージョンを固定してしまう可能性がある。

RLWRLDは、AIが既存の能力を再現する場合でも、人間の熟達は重要であり続けると主張している。この区別には注意を払う価値がある。

再現と創造は同一ではない。ロボットは、専門家がなぜ標準手順から外れたのかを理解せずに、実演された一連の動作をコピーする可能性がある。

安全性も別の限界を加える。平均的な行動で訓練されたロボットは、通常期待される動作が危険になるまれな状況に遭遇する可能性がある。

開発者には、異常な物体、近くにいる人、機械的摩耗、センサー故障、敵対的な条件を対象とする評価手法が必要だ。成功した実演は、そうした極端な状況についてほとんど証拠を提供しない。

労働者は、ベンチマーク設計者が見落とし得る職場の危険を認識しているため、こうした評価に参加すべきだ。彼らの貢献は、カメラの記録が止まった時点で終わるべきではない。

労働者中心のアプローチでは、従業員を設計、試験、導入の全過程における領域専門家として扱う。彼らを匿名の動作提供源へと還元するものではない。

モーションキャプチャの転換の先にあるもの

次の段階は、ロボットの信頼性、文書化されたデータ権利、そしてモデルが管理された実演を超えて移転できることを示す証拠によって測られる。

最初に注目すべきシグナルは、実際に稼働している職場での性能だ。慎重に編集された実演や実験室での試験では、システムが勤務シフト全体にわたって機能するかを確立できない。

開発者は、完了率、人間による介入、復旧性能、安全上の事故を報告する必要がある。結果は、変化する物体や現実的な中断を含むべきだ。

独立した評価は、こうした主張を強めるだろう。企業による実演も有用ではあるが、当然ながら開発者が選んだタスクと条件を示すものだ。

監督下でナプキンを1枚折れるロボットは、まだ汎用的なホテル従業員ではない。一つの箱を閉じられるシステムは、まだ自律的な倉庫運営ではない。

二つ目のシグナルは、身体形態と場所をまたぐ移転だ。再利用可能な基盤モデルは、限定的な再訓練で、あるロボットや拠点から別のロボットや拠点へ学びを適用できるべきだ。

DeepMindのロボット間研究とNvidiaの混合データ戦略はいずれも、この問題を対象としている。進歩には、一つの収集プログラムを拡大する以上のことが必要だ。

開発者は、一組の労働者による訓練が、未知のタスク、物体、環境を改善することを示さなければならない。移転が弱ければ、大規模な実演ライブラリを集める経済的な利点は小さくなる。

強い移転が実現すれば、データ所有権の重要性はさらに増す。一つの記録されたワークフローが、その発生元の職場をはるかに超える機械に影響を与え得るからだ。

三つ目のシグナルは、執行可能なデータ規則の出現だ。企業は、同意、プライバシー、来歴を収集パイプラインの機能として説明することが増えている。

重要な試金石は、これらの約束が契約条件、監査記録、削除プロセス、労働者の権利へと具体化されるかどうかだ。公の保証だけでは、データがどのように再利用されるかは決まらない。

規制当局も、記録が生体情報または個人情報に該当するかを検討する可能性がある。その答えは、管轄区域や記録手法によって異なり得る。

通常の動画、詳細な手のモデル、腱の超音波画像は、同一の情報を明らかにするものではない。雇用主はそれらを交換可能なものとして扱うべきではない。

技術的進歩はこの区別をさらに複雑にする。MITの研究者は、人が手を動かす際に筋肉、腱、靱帯を画像化する超音波リストバンドを開発した。

AIモデルは、それらの画像を手のひらと5本の指の位置情報へ変換する。研究チームは8人のボランティアでシステムを試験し、22自由度を追跡した。

研究者らは、簡単なピアノ曲を弾くロボットハンドと、デスクトップのバスケットボールゲームを操作する様子を実演した。現在、さらに多様な手の形とサイズからデータを収集している。

MITのXuanhe Zhao教授は、この手法が器用なヒューマノイドロボットのために大量の訓練データを提供できると述べた。超音波リストバンドはまた、将来の動作データセットがいかに親密なものになり得るかを示している。

ヘッドカメラは労働者が見ているものを記録する。超音波デバイスは、皮膚の下の内部運動を記録する。

この技術的な進展は、明確な方針をより急務にする。デバイスが人間の動作をより正確に捉えるほど、その出力はより価値が高く、潜在的により機微なものとなる。

今後数か月で、フィジカルAI企業がより良い実演を繰り返し可能な運用へ転換できるかが明らかになるはずだ。短期試験ではなく、持続的な性能を報告する導入事例に注目したい。

ウェアラブルによる記録をめぐる労働協約にも注目すべきだ。同意、二次利用、保存期間、報酬に関する詳細な規定があれば、労働者のデータ権利が運用上の要件になりつつあることを示すだろう。

最後に、ロボットモデルが拠点や機械をまたいで汎化するかを見守る必要がある。もし実現すれば、人間による実演は主要なAI訓練コーパスに匹敵する戦略的資産となる。

実現しなければ、フィジカルAIは高コストな拠点別エンジニアリングと継続的な人間の介入に依存し続けるだろう。

労働者は、機械に孤立した動作以上のことを教えている。一つひとつの把持、回転、修正、復旧を通じて、身体労働の暗黙の構造を明らかにしている。

重要な問いはもはや、その知識を記録できるかどうかではない。それを生み出した人々を消し去ることなく、組織が利用できるかどうかである。

開発者、雇用主、そして労働者は、広範な主張を受け入れる前に同じ根拠を求めるべきだ。すなわち、信頼できる運用、透明性のあるデータ来歴、そして収集される専門知識に対する実質的な管理である。

その基準はロボット学習を妨げるものではない。むしろ、物理AI経済が最も重要な知能の源泉――すでに現場で働いている人間――を適切に評価することを促す。

 
 

無料で始めましょう

ローカルファーストのパーソナル知識管理付きAIアシスタント

より良いAI体験のために、

remio は現在、 Windows 10+ (x64)M-Chip Mac のみをサポートしています。

仕事のAIパートナー
remioでもっと仕事が進む

計画・作成・仕上げまで
すべてをひとつに

bottom of page