Skild AI S1ロボットモデル、ロボット訓練をプロンプトの中へ
Skild AIは、たった1本の動画によるデモンストレーションを受け取るだけで、最大10分に及ぶ未経験のタスクに取り組むというロボットモデル「S1」を発表した。Skild AI S1ロボットモデルは、動作前に重みを更新したり、タスク固有の追加学習を行ったりしない。これはロボット学習の中心的な問いを、エンジニアが機械をどう再訓練するかから、作業者が新しい仕事をただ見せるだけで済むのかへと変えるものだ。
Skildはこのプロセスを「in-context learning」と呼び、基盤モデルを変更せずにデモンストレーションが行動を導くことを意味する。同社によれば、S1は異なるシーンやロボットの身体構造をまたいで、意図、物体、タスクの順序を解釈できるという。報告されている例には、植物の植え付け、コーヒーの抽出、パンケーキ作り、キットの組み立てなどが含まれる。
重要なのは、Skildと単一のロボットメーカーとの競争ではない。プロンプトベースの適応と、タスクデータを収集し、ポリシーをファインチューニングし、すべての導入を検証するという確立された慣行との競争である。NVIDIA自身のGR00Tプラットフォームも、特定のロボットや環境向けの追加学習を引き続きサポートしている。一方、Physical Intelligenceもロボットモデルを通じて幅広い汎化を追求している。
Skild AI S1ロボットモデルは1本の動画から作業を学ぶ
S1は、記録されたデモンストレーションを新たな学習データセットではなく、一時的なタスク仕様へと変換する。
まず作業者が人間の視点からタスクを記録する。S1は、その動画をコンテキストウィンドウ、すなわち1回の実行セッション中に利用できる情報として受け取る。その後、ポリシーは実演された目標と手順を、ロボット、そのカメラ視点、目の前の物体へと対応付ける。
デモンストレーションはロボットの実際の状況と異なり得るため、この変換は重要だ。カメラアングル、シーンのレイアウト、利用可能なツール、物理的な身体構造は、完全に一致する必要がない。Skildの詳細なS1 researchによると、事前学習は固定された軌道を再生するのではなく、機能的な関係を推論するようポリシーを学習させる。
Skildによれば、初回リリースのすべての例は同一のモデル重みから生成された。各デモンストレーション後にタスク固有のファインチューニングは行われていない。同社は、この点こそが新しいワークフローを処理する前に追加学習を必要とするシステムとS1を分ける本質的な違いだとしている。
最長の例は、単発のピック・アンド・プレース動作にとどまらない。最大10分間に及び、数十の操作ステップから成るタスクが含まれる。この種の作業では、ロボットが進捗を記憶し、既知の動きを新しい順序で組み合わせ、動作が失敗した際に復旧する必要がある。
植物の植え付けは、報告された例の中で最も分かりやすい。Skildはデモンストレーションを記録してS1に提供し、11分以内に自律ハードウェア実行を開始した。この時間には、プロンプトの記録からタスク実行までのプロセスが含まれると、協業に関するNVIDIA accountは説明している。
同社は、実行内容がプロンプトと合理的に異なるケースも示した。デモンストレーションではじょうろを使っていたものの、利用可能だったのがカップだけの場合、S1はカップを選んだと報告されている。グラスがすでにほぼ満たされていた場合には、残りの必要量だけを追加した。
別のデモンストレーションでは、人間が卵を早く落としすぎた。Skildによれば、S1はそのミスを再現するのではなく、制御された動きで意図されたステップを完了した。これらの例は、モデルが動画をフレームごとの台本ではなく、目標の証拠として扱っていることを示唆する。
この解釈は、物理的なプロンプティングを従来の模倣と区別する。ロボットの身体、視点、周囲の環境が人間の例と異なるたびに、文字どおりのコピーは失敗するだろう。代わりにS1は、実演者が意図した結果と、新しいシーンでなお実行可能な行動を推論する必要がある。
この主張は重要だが、その範囲は慎重に表現する必要がある。Skildが示したのは、選別されたデモンストレーションと社内評価結果であり、工場全体にわたる完全な独立評価ではない。こうした条件を超えてS1が汎化できるかどうかは、依然として同社が報告した結果である。
それでも、運用モデルは明確だ。プロンプトは実行時にタスク固有の情報を運び、モデルの重みは固定されたままである。このアプローチは、柔軟な産業オートメーションを制約してきた高コストな適応ループに直接挑戦する。
なぜ物理的プロンプティングは再訓練モデルに圧力をかけるのか
動画プロンプトが信頼性高く機能すれば、導入チームはロボットプログラミングの一部を専門家から現場の作業者へ移せる。
従来の産業オートメーションは、製品、治具、動作が安定している場合に優れた性能を発揮する。エンジニアは、1つの反復可能な手順にロボットを最適化し、制御された設備で囲むことができる。製品やレイアウトが頻繁に変わると、経済性は低下する。
学習済みロボットポリシーはより大きな柔軟性を約束するが、多くの場合、導入サイクルの負担を維持する。チームは対象環境からデモンストレーションを集め、モデルをファインチューニングし、更新されたポリシーをテストし、変更後にこのプロセスを繰り返す。各ステップには専門知識、設備へのアクセス、時間が必要となる。
Skildは、中程度に複雑なポリシーでも、導入環境から数十時間から数百時間のデータを必要とし得ると主張する。事前学習済みモデルであっても、顧客ごとのタスクに大規模な追加学習キャンペーンが依然として必要なら、経済的な優位性の多くを失う可能性がある。
S1は、その適応負担をプロンプトへ移す。プロセスを理解する作業者はデモンストレーションを記録し、既存のポリシーにその解釈を求められる。モデルには、通常は学習時に用いられる数学的調整である勾配更新をもう一度行う必要がない。
Skildは、短い動画プロンプト1本が、手作業で収集した約380件の例に匹敵する有用性を提供できると見積もっている。それらの例の収集には50〜100時間を要する可能性があるという。どちらの数値も同社によるものであり、独立した検証は受けていない。
報告された性能差も大きい。Skildの新しいマルチステップテスト全体で、S1はステップごとに約66%の成功率を平均した。比較システムはステップごとに約9%にとどまり、7倍を超える差が生じた。
ステップごとの成功は、タスク全体の完了と同じではない。多くの依存関係のあるステップからなる手順では、単一の動作が失敗するだけで全体が失敗し得る。そのため、平均値が高くても、長いワークフロー全体では期待外れの完了率になり得る。
たとえば、タスクが10ステップから成り、各ステップが独立して66%の確率で成功すると仮定する。すべてのステップを完了する確率は依然として非常に低い。実際の結果が必ずしも独立しているわけではないが、この例は指標に文脈が必要な理由を示している。
復旧行動はその計算を変え得る。置き間違えた物体に気づき、知的に再試行するロボットは、すべてのエラーを最終結果として扱うロボットより価値が高い。Skildは、S1が物体の移動に合わせて調整し、ミスから復旧するとしているが、幅広い信頼性比較に十分な運用上の詳細は公開していない。
商業的な圧力は、競合する基盤モデルだけでなく、タスク固有の統合作業に向かう。システムインテグレーターはしばしば、ハードウェアとソフトウェアを1つのラインに適応させるために大きな労力を費やす。より高速なプロンプティングは、再利用可能なモデル、検証システム、導入支援へと価値を移すだろう。
メーカーには依然として安全制御とプロセス認定が必要だ。動画によるデモンストレーションでは、荷重制限、衝突境界、衛生規則、製品公差を確立できない。物理的プロンプティングはタスクがポリシーに届く方法を変えるが、産業エンジニアリングを不要にするわけではない。
短期的に最も有望なのは、固定的なプログラミングに適さない多品種少量の作業だ。こうした環境は、反復的なエンジニアリングが高コストになるほど頻繁に変化する一方、監督を支えられるほどには構造化されている。小ロット組み立て、キッティング、食品調理、検査がこのパターンに合致する。
Skildによれば、現在60社を超える有償導入顧客と取り組んでいる。同社は、最初の商業導入からわずか10カ月後に年間経常収益ランレートが1億ドルに達したと報告した。commercial updateによれば、売上の約90%はマニピュレーションから生まれ、残りはモビリティによるものだという。
これらの数字は同社報告であり、ロボティクス分野としては異例の速さである。契約期間、顧客集中度、導入マージン、あるいはサービスへの収益依存度は明らかにしていない。ただし、Skildが技術的な仮説を、研究室でのデモンストレーションだけでなく、有償の実運用環境で検証していることは示している。
Skild S1はNVIDIAのPhysical AIスタック全体でどう機能するのか
S1は、新しいタスクごとに追加学習を避ける一方で、完全なデータ、シミュレーション、学習、導入パイプラインに依存している。
シンプルなユーザー体験の裏には、膨大な準備が隠れている。事前学習がすでに多様なタスク、シーン、物体、失敗、ロボットの身体構造に触れていなければ、モデルは1つのデモンストレーションを解釈できない。1本の動画プロンプトは、学習後の適応作業を減らすのであって、基盤モデルの構築コストを減らすものではない。
Skildによれば、単一のデータソースが、ハードウェアの現実性、多様性、規模を同時に提供することはない。遠隔操作されたロボットのデモンストレーションは導入ハードウェアと密接に一致するが、人が時間をかけて収集しなければならない。人間の動画は豊富で多様だが、ネイティブなロボット動作を含んでいない。
シミュレーションは、大量の経験とまれな失敗を生成できる。その弱点はシミュレーションと現実のギャップであり、仮想環境の接触、摩擦、照明、センサー動作が物理的条件と異なる場合に生じる。S1は、いずれか1つを十分とみなすのではなく、これらのソースを組み合わせる。
NVIDIAのインフラは各段階を結び付ける。高速コンピューティングは、シミュレーション、人間の動画、遠隔操作、許可された導入データにまたがるモデル学習を支える。Cosmosモデルは動画を処理し、多様な学習入力の作成を支援する一方、Cosmos Curatorはアノテーション、フィルタリング、整理を支援する。
OmniverseとIsaac Simは、物理法則に基づく仮想環境を提供する。Skildは、データを生成し、エッジケースをテストし、ハードウェアへ移す前に行動を検証できる。これにより、工場の現場であらゆる失敗モードを学習するコストと危険を減らせる。
Isaac Labは、ポリシーがシミュレートされた相互作用とフィードバックを通じて改善する強化学習環境を提供する。Newton物理エンジンは、力、衝突、圧力、接触をモデル化する。SkildとNVIDIAは、把持および固体物体の操作に向けたGPUアクセラレーション対応ソルバーも開発している。
Nsightツールは、学習中のコンピューティング上のボトルネックをエンジニアが特定するのに役立つ。TensorRTは推論、すなわち学習済みモデルを実行して行動を選択するプロセスを最適化する。物体、人、ロボット自身の身体が動き続ける中で物理ロボットは応答しなければならないため、低レイテンシは重要である。
このインフラは、もう1つの重要な区別も明らかにする。SkildはNVIDIAのシステムでS1を学習させているが、S1は単にNVIDIAのロボットモデルを改名したものではない。Skildがポリシーとデータ戦略を所有し、NVIDIAはコンピューティングと幅広い開発ツール群を提供する。
NVIDIAは、Isaac GR00Tを通じてモデル層でも競合している。同社はGR00T 1.7を、30億パラメータのベースチェックポイントを備えた、オープンで商用利用可能な視覚・言語・行動モデルとして説明している。
視覚・言語・行動モデルは、視覚的な観察と指示をロボットの行動へと結び付ける。GR00T 1.7は画像、言語、ロボットの状態を受け取り、動作コマンドを生成する。NVIDIAによると、約3万2,000時間の実データと8,000時間のシミュレーションデータで事前学習されたという。
GR00Tは対照的な適応経路を提供する。開発者は事前学習済みチェックポイントから始め、特定のロボット、環境、タスク向けに追加学習できる。S1の最大の訴求点は、こうした追加のモデル更新を行わずに、動画プロンプトで新しいタスクを定義できることだ。
これらのアプローチは相互排他的ではない。安定して大量に発生する作業では、追加学習によって性能を最大化できる。タスクの変化がエンジニアによるポリシー再構築より速い場合は、インコンテキスト学習が柔軟性を高められる。
NVIDIAはどちらの経路でも恩恵を受ける。同社はコンピューティング、シミュレーション、データ処理、デプロイメントソフトウェア、そして独自の基盤モデルを提供している。したがって、顧客がGR00TではなくS1を選んだとしても、Skildの成功はNVIDIAのインフラを実証することになる。
この関係は、技術的な境界が重なり合いながら協業するプラットフォーム企業とアプリケーションベンダーに似ている。Skildには基盤となる開発スタックが必要であり、NVIDIAは商業的に目に見えるワークロードを得る。両社は、フィジカルAIの導入を孤立したデモの段階から拡大したいと考えている。
Blackwell組立プロジェクトは、その提携に具体的な場を与えている。Skild、NVIDIA、Foxconnは、NVIDIA Blackwellシステムの生産に使われる双腕マニピュレーターにSkild Brainを導入している。
実演されたワークフローでは、ロボットはバスバーとリミットブロックを取り付け、その後16本のねじを締結する。作業順序を追跡し、接触を精密に制御し、物理的な条件が計画と異なる場合に対応しなければならない。
これは、動画のためにコーヒーを淹れるよりもはるかに意味のある試験だ。ハードウェア組立には明確な公差、高コストのエラー、測定可能なスループットがある。同時に、プロンプト駆動の柔軟性が生産レベルの一貫性と共存できるのかという厳しい問いも生まれる。
Skild S1とGR00Tの比較は、本質的には適応性と信頼性の比較である
中心的なトレードオフは、S1が新しいタスクを一度実行できるかではなく、それを有用なスループットで安全に繰り返せるかどうかだ。
洗練されたデモは能力を示すが、信頼できる運用を証明するものではない。工場では、完成ユニット数、サイクルタイム、介入頻度、不良、停止時間、安全事故が測定される。モデルは適応力があるように見えても、これらの指標のいくつかで経済的に不利になる可能性がある。
Skildが報告したステップごと66%の成功率には、特に慎重な解釈が必要だ。引用されたベースラインに対する大幅な改善を表す一方、成熟した固定自動化に期待される信頼性にはなお大きく及ばない。実用上の閾値は、復旧、監督、タスクの価値、失敗コストによって異なる。
再試行を許容できる用途もある。倉庫ロボットなら、物品がずれた後に把持を再試行できるかもしれない。一方で、部品の損傷、食品汚染、作業員の危険につながる失敗もある。したがって、同じモデルスコアでも、ある環境では導入を支え、別の環境では導入を阻むことがある。
長い時間軸のタスクは、この問題を増幅させる。S1は、どの工程が成功したかを追跡しながら、数十の動作にわたって文脈を維持しなければならない。初期のエラーは状況を変え、残りのデモの関連性を低下させる可能性がある。
その後、モデルは再試行するか、別の物体に置き換えるか、工程を飛ばすか、人間の支援を求めるかを判断しなければならない。判断のたびに、誤った解釈が生じる機会が増える。選ばれた事例での常識的な振る舞いは、信頼できるエラーポリシーを証明するものではない。
ロボット基盤モデル分野全体で、独立した評価は依然として限定的だ。各社は異なるハードウェア、タスク、学習分布、成功の定義、編集手法を用いている。見出しを飾る比較が、あるポリシーが別のポリシーより優れて一般化するという統制された証拠を示すことはほとんどない。
Physical Intelligenceは有用な比較対象となる。同社のロボットモデル研究には、オープンワールドでの一般化、人間からロボットへの転移、長期記憶、10分を超えるタスクが含まれる。π0.7モデルもまた、未知の環境や複数段階の作業における、すぐに使える性能を目標としている。
NVIDIAのGR00T研究は、オープンなチェックポイント、標準的なワークフロー、シミュレーション、追加学習を重視している。Figureは独自のヒューマノイドハードウェアと並行してHelixを開発している。各経路は、一般化、身体性に特化した設計、データ収集、デプロイメント制御のバランスを異なる形で取っている。
Skild独自の賭けは、タスクの意図を実行時に動画プロンプトで伝えられるという点にある。これにより、複数のロボット種にまたがる共有ポリシーを維持しつつ、カスタマイズ作業を削減できる可能性がある。同時に、プロンプトの解釈が運用上の安全境界の一部となる。
曖昧、あるいは欠陥のあるデモは、解釈の余地を生み出しうる。Skildは、S1が人間のミスを修正する場合があるとしており、これは有用に聞こえる。しかし修正とは、提供された例からいつ逸脱するかをモデルが選ぶことも意味する。
その裁量には制限が必要だ。オペレーターは、モデルが目標を正しく認識したか、そしてなぜ異なる動作を選んだのかを理解できなければならない。そうでなければ、一見知的な修正が予測不能な逸脱になりうる。
研究文献は、より広範な未解決の問題を指摘している。査読済みのロボティクス調査は、ロボットデータの不足、安全保証、不確実性の測定、リアルタイム実行を、基盤モデルにとって継続的な課題として挙げている。
S1の発表は、これらの制約を取り除くものではない。これは、適応のための異なるインターフェースと、そのインターフェースを中心に設計された学習戦略を提示するものだ。生産現場の証拠は、この手法が多様な設備、照明、摩耗、材料、人間の振る舞いに耐えられることを示さなければならない。
商業面の報告にも同様の精査が必要だ。収益ランレートは、現在の継続的な事業を1年分に外挿したものだ。監査済みの年間収益、回収済みの現金、あるいは収益性のある導入と同じではない。
Skildは、導入開始から最初の10か月で5,000万ドルを認識したとしている。また、物流、セキュリティ、検査、食品調理、データセンター、製造にまたがるプロジェクトを挙げている。これらの詳細は実際の顧客活動を裏付けるが、ユニットエコノミクスは明らかにしない。
同社の導入戦略は、時間とともにS1を強化する可能性がある。顧客の許可を得れば、運用経験をより広範なモデルに還元できる。導入が増えれば、より優れたポリシーが生まれ、それが適応作業を減らして、さらなる導入を支える可能性がある。
このループはガバナンス上の問題も生む。顧客は、どの運用データが施設外に出るのか、どのようにフィルタリングされるのか、他所で使用されるモデルの改善に使われるのかを明確に知る必要がある。機密性の高い製造動画は、製品設計、手順、セキュリティ体制を露出させる可能性がある。
NVIDIAへの依存は、別の戦略的な考慮事項を生む。同社のスタックは学習、シミュレーション、最適化、デプロイメントをカバーしており、開発を加速できる。深い統合は、後からインフラの選択を変更しにくくする可能性もある。
これらの懸念のいずれも、S1のアプローチを無効にするものではない。柔軟な研究モデルと信頼できる産業インフラを区別するために必要な証拠を定義するものだ。Skildは魅力的な仕組みを示したが、顧客はそれを取り巻く運用システムを評価することになる。
S1が拡大するかを示す3つのシグナル
次の段階は、生産完了率、より幅広いハードウェアでの証拠、独立して再現可能な評価を通じて測定されるべきだ。
第1のシグナルは、Blackwell組立導入における持続的な性能だ。Skildは、2本のアーム、複数の部品、16本のねじを含む具体的なワークフローを特定している。これにより観察者は、曖昧に定義された家庭内デモ以上のものを評価できる。
有益な開示には、タスク全体の成功率、平均サイクルタイム、人間の介入頻度、不良率が含まれる。結果は、選ばれた1回の実行ではなく、長期間の生産を対象とすべきだ。安定した性能は、フィジカルプロンプティングが精密製造を支えられるという主張を強めるだろう。
完了率が低ければ、別の方向性を示す。それは、S1の柔軟なプロンプティングになおタスク固有のエンジニアリング、追加学習、またはより厳格な環境制御が必要であることを示唆する。モデルには価値が残りうるが、経済的な優位性は狭まる。
第2のシグナルは、顧客とロボットボディをまたぐ再現可能な転移だ。Skildは、その広範なシステムをオムニボディ型ロボットブレインと呼んでおり、1つの知能レイヤーで異なる物理プラットフォームを制御できることを意味する。同じポリシーがアーム、移動マニピュレーター、その他の機械を扱えるなら、S1の価値は大幅に高まる。
同社はFoxconn、Sumitomo Wiring Systems、Mitsuiとの取り組みを挙げている。これらのプロジェクトは、電子機器組立、ワイヤーハーネス製造、商業用厨房にまたがる。また、モデルを異なる材料、安全要件、成功の定義にさらすことにもなる。
複数の導入からの証拠は、Skild S1が発表時のデモ以外でどのように機能するかを検証するだろう。重要な問いは、ハードウェア、カメラ、ツール、職場の規則が同時に変化しても、1本の動画による適応が迅速に維持されるかどうかだ。
頻繁なエンジニアリング介入は、汎用性の主張を弱める。それは、目に見えるプロンプトが導入作業のごく一部にすぎないことを示すだろう。反対に、モデル更新なしでオペレーターが新たなワークフローを教えられるなら、Skildの中核的な主張を裏付けることになる。
第3のシグナルは、より明確な評価フレームワークだ。Skildはステップごとの結果とベースライン比較を提供しているが、外部の読者にはタスク定義、試行回数、失敗カテゴリ、全体の完了率が必要だ。また、事前学習分布からどれだけ離れているかについての情報も必要となる。
この最後の点は不可欠だ。タスクは新しく見えても、多くの学習例と物体や動作を共有している場合がある。強力なインコンテキスト学習は、見慣れた場面を再結合するだけでなく、タスク構造と導入条件の両方の変化を扱うべきだ。
GR00T、Physical Intelligenceのモデル、または専門ポリシーとの統制された比較は役立つだろう。目的は単一のリーダーボード指標ではない。評価では、適応性、精度、復旧、レイテンシー、安全性を分けるべきだ。
Skildは、後続の技術投稿でS1の学習をより深く説明すると発表している。こうした開示により、データセットの構成、アーキテクチャ、評価設計、データ汚染の制御が明確になる可能性がある。再現可能な手法は、研究者に同社の主張を評価するためのより確かな基盤を与えるだろう。
開発者にとって、S1はデモが言語やコードと並ぶ実用的なロボットインターフェースになり得ることを示唆している。企業の購買担当者は、ワンショット学習を導入可能とみなす前に、完了の経済性、安全制御、データ権利に注目すべきだ。
Skild AI S1ロボットモデルが重要なのは、ロボットが再学習ではなく文脈を通じて新しい仕事を受け取れるかを検証するからだ。次の節目は、さらに洗練されたタスク動画ではない。通常のオペレーターが変化する作業を教えながら、システムが予測可能な品質を維持できるという証拠である。
今後数か月にわたり、Blackwellの導入、顧客間の転移、評価の詳細を注視したい。3つすべてが裏付けられれば、動画プロンプティングは繰り返しのポリシーカスタマイズに代わる信頼できる選択肢となる。あなたの業務では、どのタスクがこの主張を最も明確かつ安全に検証できるだろうか。



