Skild AI S1、1本の動画からロボット作業を学習するも、信頼性がなお試金石
Skild AI S1は、最長10分に及ぶ未知のロボット作業であっても、再訓練なしに1本の動画を見て実行を試みられるとされる。これまで産業用ロボットを新たな作業に適応させるには、通常、新しいデモンストレーション、作業固有の訓練、そして再度の検証サイクルが必要だった。Skildは、その作業の大部分を視覚プロンプトで置き換えようとしている。
同社によると、S1は植木鉢への植え付け、パンケーキ作り、コーヒー抽出、キット組み立てを含む複数工程の作業を完了した。これらは管理されたデモンストレーションだが、コップを持ち上げるといった単発の動作よりも難しい目標を示している。各作業では、ロボットが意図を把握し、進行状況を記憶し、多くの動きを協調させ、状況変化があった際に回復しなければならない。
この違いは、生産工程の変更をその都度新たなエンジニアリングプロジェクトとして扱う従来型のロボット導入に圧力をかける。またSkildは、Generalist AI、Google DeepMind、Physical Intelligence、そしてNVIDIA独自のロボットモデルプログラムと並ぶ位置にある。どのグループも、より適応性の高い機械を追求しているが、Skildの主張は特に直接的だ。動画は新たな訓練データセットではなく、プロンプトとして機能すべきだという。
Skild AI S1、1本の動画をロボット向けプロンプトに変換
重要なのは、ロボットが動画を模倣したことではない。S1がモデルの重みを変更せずにそうしたと報告されている点だ。
Skildは、S1をロボットマニピュレーション向けのインコンテキスト学習システムとして発表した。インコンテキスト学習とは、モデルが基礎となるパラメータを更新せず、稼働中に与えられた情報を利用する方式を指す。この手法は、言語モデルがプロンプト内に含まれる例に従う仕組みに似ている。
オペレーターは人間の視点から望ましい作業を記録し、その映像をS1に与える。モデルはその後、意図された結果、関連する物体、動作の順序、作業の進捗を解釈する。その文脈を、現在のシーンで動作するロボットへのコマンドへと変換する。
公開されたS1 robot modelの説明によれば、紹介されたすべての例は同じモデルの重みから生成された。Skildによると、このシステムは新しい作業を試みる前に、作業固有のファインチューニングや追加訓練を受けていない。
紹介された作業は最長10分に及び、数十のマニピュレーション工程を含んでいた。ある一連の作業では、小さな植物を植え、土を移動させ、植物を配置し、水を加える必要があった。他のデモンストレーションでは、パンケーキ作り、ハンドドリップコーヒーの抽出、キットの組み立てが行われた。
こうした例が重要なのは、長時間の作業では誤差が積み重なるためだ。各工程を個別に90%の確率で成功できるロボットでも、独立した10工程をすべて完了できる確率は約35%にとどまる。現実の工程は独立していないが、この計算は長期的な性能が急速に低下する理由を示している。
Skildによると、植木鉢への植え付けテストでは、記録から自律実行まで11分で移行した。記録は午後9時16分に始まり、デモンストレーションは午後9時22分に終了、S1は午後9時27分に動作を開始した。従来の適応プロジェクトの大半は、データ収集、訓練、評価、導入を伴うため、より長い時間を要する。
このシステムは、実行中の限定的な変化にも対応したとされる。Skildは物体を動かし、照明を変え、似た機能を持つアイテムに置き換えた。他の例では、ロボットは失敗した動作を再試行したり、デモンストレーションで使われたじょうろが利用できない場合にコップを使ったりした。
これらの挙動は、S1が記憶した座標を単に再生していたわけではないことを示唆する。デモンストレーションで示された目標を、自身のカメラ映像、身体、利用可能な物体と結びつける必要があった。ただし、公開された結果と解釈はすべてSkildまたはそのインフラパートナーであるNVIDIAによるものだ。
そのため、この発表は明確な検証課題を生む。外部評価でこれらの能力が再現されれば、視覚プロンプティングはロボットチームによるデータ収集とポリシー再訓練の頻度を変える可能性がある。性能が選別された環境の外で低下するなら、S1は新たな導入モデルではなく、印象的な研究デモンストレーションにとどまる。
工場の変化がプログラム済みロボットの限界を露呈する理由
S1が狙うのは、一度作業を実行できるロボットと、職場環境の変化後も稼働し続けるシステムとの間にある高コストな隔たりだ。
従来の自動化は、エンジニアが環境を制約できる場合に優れた性能を発揮する。ロボットは数カ月にわたり、同じ溶接を繰り返し、同一の部品を移送し、同じ組み立てを締結できる。治具、安全柵、校正済みの工具、予測可能なタイミングによって、その反復は信頼できるものとなる。
現代の生産環境が完全に固定された状態を保つことはめったにない。サプライヤーは部品を変更し、メーカーは新製品を投入し、倉庫の運営者はステーションを再配置する。わずかな変更でも、物体の位置、必要な力、作業順序、サイクルタイムに影響を与え得る。
従来のシステムでは、こうした条件が変わると、新たなプログラミングやデモンストレーションが必要になることが多い。その後、エンジニアは更新された挙動をテストし、安全性と品質の要件を満たすことを確認しなければならない。このプロセスは安定した大量生産には合理的だが、頻繁に変化する作業全体に適用するのは難しくなる。
Skildによると、商業運用での経験が同社をインコンテキスト学習へと向かわせた。同社は9月9日の更新で、製造、物流、検査、警備、食品調理、工場、データセンターにまたがる60社超の有償顧客または導入パートナーを抱えると主張した。
同社はまた、最初の商業導入から10カ月後に年間換算売上高が1億ドルに達したと報告した。年間換算売上高は現在の事業実績を年換算する指標であり、完了した1年間ですでに回収した売上高を必ずしも表すものではない。Skildはこの数字を裏付ける監査済み財務諸表を公開していない。
それでも、付随するdeployment claimsにより、S1は研究室のベンチマークより具体的な文脈を得ている。Skild、NVIDIA、Foxconnは、Blackwellシステム組み立て向けに、双腕ロボットへSkild Brainを導入している。説明されたワークフローの一つでは、16本のねじを締結する前にバスバーとリミットブロックを取り付ける。
Skildは、Sumitomo Wiring Systemsとのワイヤーハーネス生産に関する取り組みも公表している。このカテゴリーは、柔軟なワイヤーが変形し、重なり合い、繊細な取り扱いを要するため、自動化に抵抗してきた。さらに同社は、Mitsuiと商業用キッチンにおける汎用ロボットの試験導入を進めている。
こうした環境で問われるのは、マニピュレーション能力だけではない。工場の購入者は、サイクルタイム、障害復旧、設備稼働率、製品品質、作業者の安全、統合コスト、保守を重視する。ロボットが必要なすべての動作を完了できても、動作が遅すぎれば商業的には使えない可能性がある。
Skild自身もこの違いを認めている。同社によると、基盤となるシステムの成功率が5%であっても99%であっても、成功したデモンストレーションは同じように見える。また創業者らは、信頼できる性能の最後の数パーセントを引き出すには、不釣り合いに大きな労力が必要だと主張している。
この認識により、S1の位置づけはより明確になる。同社は、視覚プロンプティングが導入エンジニアリングを不要にすると主張しているのではない。むしろ、作業が変わるたびに必要となる反復的なデータ収集と訓練を、プロンプトによって削減できると論じている。
この区別は購入者にとって重要だ。動画プロンプトは初期適応を短縮できるかもしれないが、安全審査、ツーリング、校正、プロセス承認は依然として必要となる。これらの残る工程は単なる事務的な摩擦ではない。製品の損傷、生産ラインの停止、人の周囲で起こる危険な動きを防ぐためのものだ。
したがって短期的な機会は、適応にかかる高コストな層の一つを削減することにある。S1は産業用自動化を取り巻く物理的要件を取り除くものではない。その要件が変化した際に、モデルが作業指示を受け取る方法を変えるものだ。
その仕組みは再訓練をコンテキストに置き換える
S1は作業適応を訓練パイプラインからロボットの稼働コンテキストへ移すが、広範な事前訓練がなお隠れた作業の大部分を担っている。
「1本の動画」という表現からは、S1が関連する経験をまったく持たずに始めるような印象を受けるかもしれない。しかし、システムはそのようには動作しない。モデルはまず、ロボット軌道、シミュレーション、人間の動画、その他の行動データにわたる広範な事前訓練を受ける。
この事前訓練により、再利用可能な技能と物理的なパターンが与えられる。動画プロンプトはS1に対し、どの技能が重要か、それらをどのように順序づけるべきか、オペレーターがどのような結果を期待しているかを伝える。したがって、新しい作業では、訓練に存在しなかった動きや順序を導入しながら、既知の能力を組み合わせることができる。
Skildはこのプロセスを内側のループと外側のループとして説明している。事前訓練が外側のループを形成し、ポリシーにデモンストレーションの解釈方法を学ばせる。稼働中には、動画がモデルの重みを変更せずに内側のループの例を提供する。
この違いにより、S1は作業固有のファインチューニングと区別される。ファインチューニングでは、対象の挙動のために集めた新しいデータを用いてモデルを変更する。一方S1は、単一のパラメータセットを維持し、現在コンテキストに保持されているデモンストレーションに応じて行動を決定する。
SkildはNVIDIAのインフラを使ってモデルを訓練・評価した。NVIDIA Cosmosモデルは、バリエーションの生成と動画の構造化された説明への変換を支援する。Cosmos Curatorはデータを整理・フィルタリングし、Isaac Simは物理的な導入前に挙動をテストするための仮想環境を提供する。
Isaac Labは強化学習をサポートしており、シミュレーションで得た経験を通じて、より良い結果に結びつく行動へポリシーを導く。Newton物理エンジンは、接触、力、衝突、その他の物理的相互作用をモデル化する。これらのツールを組み合わせることで、物理ロボット群では経済的に収集できないほど多くの状況にポリシーをさらすことができる。
このデータの組み合わせは、ロボティクスにおける中心的な問題に対応する。遠隔操作されたロボットのデータは、導入ハードウェアに近い一致を示すが、収集は遅い。人間の動画ははるかに大きな多様性を提供するが、人の手とロボットグリッパーは異なる動きをする。シミュレーションは効率的に拡張できるものの、シミュレートされた物理があらゆる現実の表面、物体、失敗を一致させることはない。
Skildによると、これらのソースを組み合わせるのは、理想的な規模、多様性、ハードウェア類似性を単独で提供できるものがないためだ。動画プロンプトはその後、モデルの事前訓練と導入時に提示される作業の橋渡しとして機能する。
同社のin-context learning resultsは、S1を言語条件付きのvision-language-actionモデルと比較している。vision-language-actionモデル、すなわちVLAは、視覚的な観測と指示を物理的な動作へ変換する。
両システムは、作業プロンプトの埋め込み方法を除き、同じデータ、アーキテクチャ、計算資源を使用したとされる。訓練データセットは1,000時間から100,000時間に及んだ。Skildは、4分から8分続く既知および未知の作業を対象とする社内スイートで評価した。
最大のテスト済みデータ規模における未知の作業で、S1は累積工程別成功率66%に到達した。言語プロンプトによるベースラインは9%だった。Skildはこの結果を7倍の向上と説明した。
既知の作業では、比較はそれほど一方的ではなかった。訓練時間1,000時間では、言語条件付きシステムは53%を記録し、インコンテキスト学習の43%を上回った。Skildによると、事前訓練を拡大することで、S1は最終的に約96%に達した。
同社はまた、プロンプト付きの1件のデモンストレーションを、従来のポリシーに対する追加訓練と比較した。S1の動画1本は、約380件の作業固有デモンストレーションに相当する性能を生み出したと推定している。これらの長時間のデモンストレーションの収集には、遠隔操作で50時間から100時間を要したと報告されている。
この比較は、1本の動画が常に380件の事例を置き換えることを意味するものではない。Skildはこの数値を内部曲線から補間しており、結果は同社が選定したモデル、タスク、採点方法に適用される。ポストトレーニング済みのポリシーは最終的に2,000件のデモンストレーションで86%に達し、S1の66%を上回った。
したがって実際の仕組みは、準備と適応のトレードオフにある。Skildは幅広い事前学習に大きく投資することで、顧客が後から提供するタスク固有データを減らせるようにしている。このトレードオフが有効かどうかは、事前学習された能力がどれだけ広く転移するかに左右される。
汎用モデルの競合も同じ目標を追っている
Skildはタスクごとに再学習するワークフローと競合しているが、他の基盤モデル開発企業も異なる方向から同じ制約に取り組んでいる。
Generalist AIはS1の直前にGEN-1.5を発表した。同社も、勾配更新なしに1件または少数のデモンストレーションからロボットタスクを学習するとしている。構成的な行動、人からロボットへの転移、未知のツール、物理条件の変化を強調している。
Skildは、S1が最大10分間に及ぶ未見タスクへこのアプローチを拡張したと主張している。同社の投稿は、同時期のシステムが主により短い活動、あるいは学習分布に近い行動に焦点を当てていると位置づける。一方、Generalistも自社システムを幅広いワンショット学習機として提示している。
競合するGEN-1.5の結果は、「初」の主張には慎重な境界設定が必要である理由を示している。両社は新規性、タスクの長さ、物理的な変動、成功の定義をそれぞれ独自の評価で定めている。共通ベンチマークがなければ、両社の動画から明確な優劣を導くことはできない。
Google DeepMindはGemini Roboticsで別の道を進む。同社のシステムは、異なるロボット機体にまたがるマルチモーダル推論とロボット動作生成を組み合わせる。Gemini Robotics 2は、器用さ、全身制御、ロボット間の協調を重視している。
2026年7月のGemini Robotics 2リリースも、機体間でスキルを転移することが依然として困難であると認めている。Googleは一部のロボティクスシステムを選定されたテスターにのみ提供しており、広範な外部比較を制限している。
以前のDeepMindプロジェクトは、必要なデータ量がどれほど急速に減少してきたかを示している。RoboCatは数百件のデモンストレーションを用いてタスクに適応したが、新しいシステムは少数ショットまたはワンショットの行動を目指している。この分野は、タスク固有の学習から、経験を再利用する汎用モデルへと移行している。
Physical Intelligenceは、ロボットデータ、ウェブ上の知識、高水準の意味的プランニングを組み合わせた汎用VLAに注力してきた。同社のπ0.5研究は、未知のキッチンや寝室の清掃といった長時間にわたる作業を扱う。このシステムは階層的なガイダンスを用いて、新しい環境で複雑な一連の作業を完了する。
NVIDIAはSkildのサプライヤーであると同時に、モデル開発企業でもある。同社のGR00T N1研究は、ロボット軌跡、人間の動画、合成データで学習したオープンな基盤モデルを説明している。GR00Tは、ヒューマノイド制御向けに視覚言語コンポーネントと拡散ベースのアクションシステムを組み合わせている。
この立場により、NVIDIAはフィジカルAIへの複数の参入経路を持つ。GPU、シミュレーション、データツール、導入用ハードウェア、自社の参照モデルを提供できる。Skildはこのインフラにアクセスでき、NVIDIAは顧客がS1、GR00T、あるいは同社スタック上で構築された別のモデルを選ぶかを問わず利益を得る。
NVIDIAのCosmos Policyは、1社が競合する技術アプローチを支援できることをさらに示している。Cosmos Policyは、対象ロボットのデモンストレーションによるポストトレーニングを通じて、事前学習済み動画モデルを適応させる。計画のために、アクション、予測される将来状態、期待報酬を生成する。
S1は、導入後にタスクごとのポストトレーニングを避けようとしている。一方のCosmos Policyは、動画生成の知識をアクションポリシーへ変換するためにポストトレーニングを用いる。両アプローチは幅広い動画事前知識に依存するが、適応を異なる段階に配置している。
この競争はロボット購入者に利益をもたらすはずだが、購買判断を複雑にもする。洗練されたモデルのデモンストレーションからは、統合作業、対応ハードウェア、エラー処理、サービス責任についてほとんど分からない。購入者は推論モデルだけでなく、完全な運用システムを評価しなければならない。
したがって決定的な競争は、Skildと特定のスタートアップ1社との対決ではない。文脈的適応と、繰り返されるタスク固有のエンジニアリングとの競争である。S1が優位に立つのは、環境、ハードウェア、運用上の制約がデモンストレーションから乖離した後も、1本の動画が有用であり続ける場合に限られる。
デモはまだ工場での実証ではない
S1が報告した改善は大きいが、その証拠は依然として企業主導であり、介入を伴い、独立したシステムとの比較も難しい。
Skildのベンチマークは、完全で支援のないタスク完了ではなく、ステップごとの累積成功率を使用している。人間のオペレーターは失敗後に介入し、各ポリシーが残りのステップを継続できるようにした。Skildによれば、言語条件付きベースラインは、そうしなければ未見タスクを完了できなかったため、これは特に必要だったという。
この手法は、長い一連の作業のどこでエラーが生じるかを明らかにできる。ただし、導入済みロボットが支援なしで完全な作業をどの程度の頻度で完了できるかには直接答えない。回復されない1回の失敗がステーションを停止させ得るため、工場オペレーターには両方の測定値が必要である。
66%という数値も、評価された各ステップでの成功を示すものであり、エンドツーエンドの完了率66%を意味するわけではない。読者はこれらの値を同一視すべきではない。相互に依存するアクションを多く含む長いタスクでは、完全成功の確率が大幅に低くなる可能性がある。
Skildは、S1に関する完全な技術論文、モデルカード、公開チェックポイント、独立して再現されたベンチマークを公開していない。最初の投稿では、後の公開物で学習についてより詳しく説明するとしている。モデル規模、学習構成、評価回数、ハードウェア対応範囲、失敗カテゴリに関する重要な詳細は未開示のままである。
ベースラインの設計についても精査が必要である。Skildは、他の大半のコンポーネントを一定に保ちながら、視覚的デモンストレーションのプロンプティングと言語プロンプティングを比較している。これは同社の設定内でデモンストレーション文脈の価値を切り分けるものだが、競合するすべてのVLAや適応手法を対象にしているわけではない。
プロンプトを記録する際には、オペレーターも性能に影響を与える。カメラアングル、ペース、物体の視認性、手の配置、タスクの明確さは、モデルが観測する内容を変え得る。顧客には、有効なデモンストレーションの要件と、S1が不十分な事例にどの程度敏感かについてのガイダンスが必要になる。
分布シフトも別の制約として残る。Skildは、物体の移動、置換、照明の変更、反対側の腕による実行をテストした。プロンプトが実質的に異なる実行計画を示唆した場合、より大きな性能低下が報告された。
この結果は理にかなっている。デモンストレーションは意図と順序を指定できるが、機械的制約を取り除くことはできない。異なるグリッパー、リーチ範囲、可搬重量、カメラ位置、制御周波数を持つロボットは、事例を実行可能な動きに変換しなければならない。
物理的な安全性は、視覚的なもっともらしさより高い基準を要求する。言語モデルは近くの設備を損傷せずに不適切な回答を出せる。しかしロボットは、部品を破損させる、熱い液体をこぼす、作業者に衝突する、過度な力を加えるといった事態を起こし得る。
そのため産業導入には、不確実性に対する制約された挙動が必要となる。システムは、プロンプトが曖昧な場合、物体が欠けている場合、タスクが能力を超える場合を認識しなければならない。そして安全でない即興行動を取るのではなく、停止するか支援を求める必要がある。
S1の見かけ上のエラー回復は心強いが、回復そのものがリスクを生むこともある。柔らかい物体を扱う場合、失敗した把持を繰り返すことは妥当かもしれない。同じ再試行ポリシーが、コネクターを損傷させたり、食品を汚染したり、締結部品を締めすぎたりする可能性もある。
商業データについても独立した確認が必要である。Skildが報告した売上ランレートと顧客数は需要を示すが、契約期間、本番環境での利用率、更新率、粗利益率は明らかにしない。パイロット導入と提携は、運用の深さにおいて大きく異なり得る。
Foxconnでの導入は、Blackwellの組み立てに精度と工程追跡が求められるため、有意義な実証の場となる。しかし公開資料には、スループット、介入頻度、不良率、稼働率が開示されていない。これらの指標が、文脈的学習が生産現場の圧力に耐えられるかを決定する。
したがってS1は、検証が不完全な、信頼に足る技術的主張として理解すべきである。デモンストレーションは、新しいタスクごとに別の学習実行が必要だという前提に疑問を投げかける。しかし、1本の動画であらゆるロボットをあらゆる産業作業向けに安全に設定できることを証明するものではない。
S1の価値を決める3つのシグナル
次の段階は測定可能である。S1には透明性の高い評価、持続的な生産実績、一般的なオペレーターが視覚的プロンプトを安全に使えることを示す証拠が必要だ。
第1のシグナルは、詳細な技術公開である。SkildはS1の学習方法を説明する追加投稿を約束している。有用な開示には、評価試行回数、完全タスク成功率、介入ルール、失敗カテゴリ、レイテンシ、対応ハードウェア、より強力な外部ベースラインとの比較が含まれるだろう。
独立したアクセスが得られれば、証拠はさらに強化される。研究者や顧客は、未知のレイアウトや物体の下でタスクを再現できるべきだ。結果では、特に接触、繊細な部品、長時間にわたる一連の作業を含むタスクについて、成功した実行とともに失敗した実行も報告すべきである。
第2のシグナルは、生産性能である。Foxconnのプロジェクトは、S1が品質を保ちながら実際のサイクルタイム内で稼働できるかを明らかにするはずだ。有用な指標には、稼働率、シフト当たりの人間による介入回数、タスク変更の準備時間、不良率、部品ばらつきからの回復が含まれる。
Sumitomoのワイヤーハーネス作業からの証拠は、別の能力を検証することになる。柔軟な材料は予測困難な形状を生み、精密な接触制御を必要とする。この環境で一貫した動作が実証されれば、幅広い事前学習が卓上デモンストレーションを超えて転移するというSkildの主張を裏付けることになる。
業務用キッチンでのパイロット導入も、別の厳しい環境を提供する。食材にはばらつきがあり、道具は移動し、表面は汚れ、人々が近くで働く。導入を成功させるには、正しいタスク順序だけでなく、知覚、衛生管理、安全な動作、信頼できる取り扱いが必要となる。
第3のシグナルは、競合他社の対応である。Generalist AI、Google DeepMind、Physical Intelligence、NVIDIAはいずれも、ロボット適応に必要なデータを減らしている。共通テストによって、同一条件下で動画プロンプティングが言語指示、少数ショットのファインチューニング、階層的プランニングを上回るかが明らかになる可能性がある。
競合他社が長時間タスクでS1に匹敵しても、このアプローチが無効になるわけではない。それは、インコンテキストのデモンストレーションがロボット基盤モデル全体で標準的な能力になりつつあることを示唆する。逆に、タスク固有のポストトレーニングがより強い結果を示せば、視覚的プロンプティングが速度のために信頼性を犠牲にしすぎていることが示されるかもしれない。
企業の購入者は、人間のワークフローにも注目すべきである。Skildの最大の約束は運用の簡潔さにある。作業者がタスクを記録し、動画を提供し、数分以内にテストを開始するというものだ。このプロセスは、Skildの研究チーム以外の技術者にも機能しなければならない。
最良の証拠は、モデル固有の指導を受けずにオペレーターがプロンプトを作成するケースだろう。その結果は、シフト、拠点、ロボット機体をまたいでも一貫しているべきである。システムは実行前に不十分なデモンストレーションを特定し、なぜ進められないのかを説明すべきだ。
Skild AI S1が重要なのは、作業が変わる瞬間に適応を置くためである。そこでは従来の自動化がエンジニアリングコストと遅延を積み上げる。1本の動画によるプロンプティングは、有意義な内部結果と初期の商業プロジェクトに支えられ、その負担を軽減するもっともらしい方法を提示している。
残る問いは、S1が印象的なデモを実現できるかどうかではない。Skildはすでにそれを示している。問われるのは、工場が運用速度で、文書化された安全限界の範囲内において、同じ挙動を繰り返し得られるかどうかだ。
Skild AI S1を評価する読者は、映像クリップではなく測定値を追うべきだ。全工程での成功率、介入率、サイクルタイム、予定外の変更後の性能に注目してほしい。こうした指標によって、一本の動画が実用的なロボットインターフェースへと進化したのか、それとも有望な研究課題にとどまっているのかが明らかになる。



