top of page

Safeworldのロボット安全性、シミュレーションだけでは決着しない試練に直面

3 日前
読了時間: 20分

Safeworldは、1,200万ドル超の資金を得てステルス状態を脱し、難しい約束を掲げた。確率的で生成AIを搭載するロボットを、人の周囲に配備できるほど安全にするというものだ。Safeworldのロボット安全性に関する提案は、シミュレーション、独立評価、そして実運用の承認前に購入者が検証できる証拠を中心に据えている。

この約束が示される背景には、ロボット開発者が汎用AIモデルに知覚、計画、物理的行動へのより大きな制御権限を与えていることがある。こうしたモデルは固定的なアルゴリズムより幅広い状況に対応できる一方で、その振る舞いは予測しにくい。見慣れない場面、未知の人物、あるいはソフトウェア更新によって、ロボットの応答が変化する可能性がある。

Safeworldは、この不確実性が専門的な安全性試験市場を生むと見込む。しかし同社が直面するより大きな課題は、単にシナリオを増やすことではない。試験結果が物理的リスクを予測できること、システム変更後も有効であり続けること、そして顧客や安全専門家から信頼に値すると認められることを示さなければならない。

創業者は、Carnegie Mellon UniversityのSafe AI Lab所長であるDing Zhao、スタートアップ経営者のKyle Wong、機械学習エンジニアのSimo Rachidiだ。彼らの経歴は、安全性研究、エンタープライズソフトウェア、サイバーセキュリティ、企業創業にまたがる。この組み合わせはSafeworldに技術的な信頼性を与えるが、信頼性は認証ではない。

したがって中心となる競争は、Safeworldと他のスタートアップの対決にとどまらない。ロボットメーカーが予測不能なシステムを自社の開発プロセスだけで完全に検証できるという前提に対し、独立したシナリオベースの証拠が問われている。

Safeworld、ロボットのデモと実配備の間にある空白へ参入

Safeworldが提供するのは、高性能なロボットが管理されたデモ環境を離れ、一般の人々と空間を共有し始める瞬間のための証拠だ。

元のSafeworld launchによると、同社のシードラウンドは1,200万ドルを超える。Shine Capitalとa16z Speedrunが資金調達を主導し、Box Group、Carnegie Mellon University Endowment、Innovation Endeavors、SV Angelも参加した。

この資金調達が重要なのは、Safeworldが新たなロボット本体や汎用制御モデルを提案しているわけではないからだ。同社の製品は、ロボット開発者と、そのシステムを従業員、顧客、住民の周囲で稼働させられるか判断する組織との間に位置する。

創業者らは、相互に関連する2つの問題を挙げる。1つ目は、入力や文脈によって出力が変化しうる確率的システムのリスク評価だ。2つ目は、組織がそのシステムを配備できるだけの信頼を得ることである。

Safeworldの答えは、人の近くで働くロボット向けの安全性試験・評価プラットフォームだ。同社によれば、人を元の危険にさらすことなく、危険または予想外の状況を再現できるという。

Safeworldの安全性プラットフォームは、観測された環境または事故から始まる。その場所のデジタル版を構築し、実際の制御ソフトウェアを動かすシミュレーションロボットを配置したうえで、遭遇条件を変化させる。

たとえば、工場内の見通しの悪い曲がり角に移動ロボットが近づく場面を考えてみよう。安全チームは、その検知範囲、速度、停止距離、障害物で見えにくい歩行者への応答を理解する必要がある。

歩行者が箱を運ぶ、しゃがむ、走る、転倒する、あるいは一部が隠れて見える場合、変数はさらに複雑になる。従来の試験では複数のケースを抽出できるが、あらゆる変化を物理的に繰り返すには時間がかかり、ときには危険でもある。

Safeworldは、そのソフトウェアが可能な経路を生成し、相互作用リスクを予測し、試験の証拠を保存できるとしている。同社のsafety testing platformは、こうした試験を関連する要件や安全慣行に対応付けることも約束している。

同社が参入するのは、まだ初期段階の市場だ。普遍的な認証スキーム、公的なベンチマーク、または独立して検証された性能結果は提示していない。また、事業の重点を顧客が運用するソフトウェアに置くのか、Safeworldの専門家が提供するサービスに置くのかも検討中である。

この不確実性は、根底にある必要性を弱めるものではない。何が変化したかを明確にするものだ。ロボット開発者は今、振る舞い、ソフトウェア、稼働環境が絶えず変化するシステムに追随できる評価手法を必要としている。

Safeworldは、そうした変化するリスクを再現可能な証拠へ変換する独立レイヤーになることを目指す。購入者がその証拠を受け入れるかどうかが、同社が不可欠なインフラとなるのか、あるいは単なるエンジニアリングツールにとどまるのかを決めるだろう。

生成AIが従来のロボット安全性の前提を不十分なものにする

生成AIはロボットが試みられることを広げる一方で、エンジニアが評価すべき振る舞いの数も増やす。

従来の自動化は、多くの場合、厳密に定義された境界内で稼働する。産業用アームは保護されたセルの内部でプログラム済みの動作に従う。エンジニアはその経路、アクセス、速度、稼働シーケンスを制限できる。

AI搭載の移動ロボットやヒューマノイドは、異なる環境に直面する。視覚的な場面、言語、物体、人の動き、不完全な指示を解釈する。周囲の状況は、安全チームがすべての条件を列挙できる速度より速く変化する可能性がある。

視覚・言語・行動モデルは、視覚と言語の入力を物理的行動へ結び付ける。ロボットは固定シーケンスを再生するだけでなく、依頼を解釈して動作を選択できるようになる。

この柔軟性が、汎用ロボットの商業的な魅力を生み出す。1台の機械が、あらゆる行動ごとに個別のプログラミングを行わなくても、より多くの作業を実行できる可能性がある。同じ柔軟性は、安全性保証を複雑にする。成功したデモがカバーするのは、可能な振る舞いのごく狭い一部にすぎないためだ。

ソフトウェア更新は別の層を加える。新しいモデルチェックポイント、改訂されたプロンプト、変更された知覚コンポーネント、または調整された計画ポリシーは、異なる応答をもたらす可能性がある。ロボットの金属製ボディが変わらなくても、試験結果は古くなる場合がある。

稼働場所も同様に重要だ。倉庫の通路、太陽光発電設備、病院の廊下、個人宅には、それぞれ異なる物体、人、視認条件、許容される稼働速度がある。

単一の結果で、こうしたすべての環境における安全性を確立することはできない。責任ある主張はより限定的だ。定義された構成が、文書化された条件下で指定された危険に対して評価されたというものである。

既存の規格は依然として不可欠な基盤を提供する。リスク評価、機械設計、機能安全、産業用ロボット統合を導くものだ。しかし新しいシステムは、移動性、操作、AIによる意思決定、人との近接接触を組み合わせている。

最近のhumanoid safety standardsに関するガイドは、単一の規格ですべての汎用ロボットを網羅することはできないと結論付けた。適用される枠組みは、作業、環境、移動性、人のアクセス、AIの振る舞い、対象市場に依存する。

この断片化は、Safeworldのロボット安全性試験に機会を生む。シナリオの証拠を複数の要件に結び付けるプラットフォームは、エンジニアリング、運用、安全チームが同じリスクについて議論する助けになりうる。

ただし、ソフトウェア評価は物理的な安全対策に取って代わることはできない。人が危険領域に入った場合、ロボットには力、速度、到達範囲、動作を制限する工学的制御がなお必要である。

また、故障がけがにつながる可能性がある場合、AIの推論は安全認証済みの機構から分離しておくべきだ。モデルは行動を推奨できるが、それを上書きできない境界を下位レベルの制御が強制する。

Google DeepMindは、robotics safety approachで同様の階層的な立場を示している。同社のロボティクスモデルは下位レベルの安全対策と連携でき、敵対的評価はモデルの脆弱性を探索する。

DeepMindはまた、その人検知機能が安全認証済みシステムを保証するものではないと警告している。この留保は業界の中核的な問題を捉えている。評価中にモデルが安全に振る舞うことは、認証された保護機能と同一ではない。

Safeworldは、この区別をなくそうとしているわけではない。同社の機会は、AI制御ロボットがどのように振る舞うかを文書化し、その後に別個の安全対策、運用ルール、配備判断が安全性の根拠を完成させることにある。

Safeworldのロボット安全性、まれなエッジケースを再現可能な試験へ変える

Safeworldの最も強い発想は、異例の遭遇を1回の成功した再現を証明として扱うのではなく、関連する試験群へ変換することだ。

同社が提案するワークフローは、自動運転で用いられる加速評価に似ている。エンジニアは、まれな事象が自然に発生するのを待つのではなく、重大な影響をもたらす相互作用に試験を集中させる。

Zhaoはこの問題を長年研究してきた。Carnegie Mellonでの彼の研究は、信頼できるAI、自律システム、人間とロボットの安全な物理的相互作用を対象としている。

彼の公式research profileには、強化学習、人間中心ロボティクス、AI推論、物理的な人間・ロボット相互作用の安全性が記載されている。また、交通、コンピューティング、産業技術にまたがる組織とも協働してきた。

Safeworldは、この研究の方向性を商用評価プラットフォームに適用している。顧客はGenesisやMuJoCoなどのシミュレーターで場所を再構築し、ロボットの制御ソフトウェアを接続できる。

試験では、その後、危険な相互作用に関する詳細を変化させる。人の位置、動き、外見、視認性、物体の配置、タイミングはいずれもロボットの応答に影響しうる。

ロボットの近くで起きる転倒は、その価値を示す例だ。人間のテスターに移動中の機械の前で繰り返しつまずくよう求めるのは現実的ではない。シミュレーションなら、テスターを危険にさらすことなく、転倒がどのように、いつ起きるかを変化させられる。

見通しの悪い曲がり角も、もう1つの具体例となる。問題は、ロボットが1人の見えている歩行者に対して停止するかだけではない。エンジニアは、遮蔽、接近速度、検知のタイミング、運搬物、人の代替経路を調べる必要がある。

Gritt Roboticsは初期顧客の例を提供する。同社は、産業規模の太陽光発電所で太陽光パネルを設置する作業員を支援するロボット向けAIシステムを開発している。

同社のロボットは建設環境で人のそばを稼働する。作業員は立つ、ひざまずく、しゃがむ、走る、物を運ぶ、転倒することがあり、服装や身体的特徴もさまざまである。

Grittは、両社が安全性シミュレーションを開発するなかでSafeworldと提携している。この関係により、Safeworldの安全性プラットフォームには、演出されたヒューマノイドのデモを超える現実の運用文脈が与えられる。

同時に、それは中心的な技術的限界も明らかにする。シミュレーションは現実のモデルであって、現実そのものではない。その結果は、ロボットの動力学、センサー、制御ソフトウェア、人間の行動、環境再構築の正確性に依存する。

シミュレーション上のカメラが物理センサーより鮮明に見える場合、評価はリスクを過小評価する可能性がある。人間モデルが重要な動きを省いていれば、数千回の実行でも同じ危険を繰り返し見逃すおそれがある。

シナリオ生成は第2の課題を生む。多数の変化を作ることが有用なのは、それらの変化が意味のある故障モードをカバーする場合に限られる。試験回数だけでは、そのカバレッジの質についてほとんど分からない。

したがってSafeworldのロボット試験は、各結果について3つの問いに答えなければならない。このシナリオはなぜ選ばれたのか、どの程度忠実に表現されたのか、そしてどのような配備判断につなげるべきなのか。

保存された証拠には、設定の詳細、シナリオのパラメータ、モデルのバージョン、検出された危険、ロボットの応答、結果として得られた安全指標などが含まれうる。この記録は、アップデート後にとりわけ価値を持つ。

顧客は、改訂されたソフトウェアに対して同じシナリオ群を再実行し、変化した挙動を特定できる。この回帰アプローチにより、実際のインシデントやニアミスを恒久的なテスト資産へと転換できる。

これは、一度限りの安全性デモよりも説明可能性が高い。リリース間のトレーサビリティを生み、アップデートがリスクを高めたかどうかをチームで議論するための共通基盤となる。

Safeworldはなお、生成したシナリオによって、顧客が他の方法では見逃す問題を発見できることを示す必要がある。製品の価値はシミュレーションの量ではなく、発見の質にかかっている。

独立検証が業界の自己テストモデルに問いを投げかける

Safeworldは、ロボットの購入者がいずれメーカー自身の評価プロセスの外で生み出された証拠を求めるようになると見込んでいる。

ロボット開発企業はすでに、シミュレーション、ハードウェア試験、社内レッドチーム、管理されたパイロット運用を利用している。新しいテスト企業は、有能なメーカーがすでに保有するツールを再現するだけでは成功できない。

Safeworldの差別化は、独立性、専門的な知見、共有される安全知識に基づく。創業者らは、ロボットメーカーが第三者によるシステム評価を求め、導入事例をまたいで得られた教訓の移転を望むと主張している。

この役割は、サイバーセキュリティや安全性が重視される他業界における独立評価に似ている。製品チームは自らのシステムを徹底的にテストできる一方で、異なるインセンティブと失敗事例の蓄積を持つ評価者からなお利益を得られる。

外部テストは、隠れた前提に疑問を投げかけられる。メーカーはシステムがどのように動作する意図で設計されたかを知っている。独立した評価者は、その意図が未知の挙動と衝突したときに何が起きるかに焦点を当てられる。

購入者もまた、情報の非対称性に直面する。倉庫の運営者は自社のワークフローを理解していても、モデルの学習データ、アーキテクチャ、完全な失敗履歴にはアクセスできない場合がある。

ロボットベンダーはシステムを熟知しているが、その能力を強調する商業的な理由も持つ。独立した証拠は、購入者に導入を承認、制限、または延期する別の判断材料を与えられる。

だからといって、Safeworldが自動的に中立になるわけではない。顧客はその業務に対価を払い、同社はロボット開発企業からの継続的な取引に依存する可能性がある。方法論、報告の範囲、不利な結果の扱いが重要になる。

「検証」という言葉にも異なる意味がある。第三者レポートは、定義済みのテストが完了したことを確認できる。しかし、将来のあらゆる条件下での安全な性能を保証することはできない。

ここでSafeworldの信頼に関する課題は、技術的な課題よりも難しくなる。エンジニアはシナリオの構築、指標、ソフトウェアのバージョンを精査できる。一方、経営幹部、保険会社、作業者、規制当局には、確実性を過度に主張せずに理解できる結論が必要だ。

有用なレポートは、観測された証拠と前提を区別すべきである。テストした構成、未テストの条件、既知のモデル上の欠落、運営者が受け入れた残存リスクを特定すべきだ。

同社は、安全性の見せかけの層になることも避けなければならない。洗練されたダッシュボードと大量のシナリオは、最も重要な危険が正確に表現されたことを証明せずに、安心感を生む可能性がある。

独立評価が権威を得るのは、透明な方法と再現可能な結果を通じてである。Safeworldは、業界規模でそのいずれかを確立するのに十分な公開情報をまだ開示していない。

その商業モデルも未確定のままだ。ソフトウェアプラットフォームはより容易に拡張でき、継続的なテストを支援できるが、顧客がそれを正しく運用しなければならない。

サービスモデルは、専門家によるより深い関与を提供する。一方で、提供は遅くなり、規模拡大のコストが高く、専門スタッフに依存する。

ハイブリッド型のアプローチはもっともらしい。顧客はソフトウェアを通じて定常的な回帰テストを実行し、Safeworldが危険分析、困難な環境、独立レビューを担うことができる。

同社は、その正確なモデルに公にはコミットしていない。最終的な提供形態は、主にインフラ、テストラボ、あるいは独自ソフトウェアを持つ安全コンサルティング企業のどれを目指すのかを明らかにするだろう。

ロボットメーカーも、より強力な社内ツールを開発していくだろう。Tesla、Wayve、大手ロボティクス研究所はすでに、シミュレーションを開発の中核能力として扱っている。

大規模モデルの開発企業も、自らの敵対的評価システムを構築している。安全専門家、標準化コンサルタント、認証組織も、この問題と重なる部分に取り組んでいる。

Safeworldの防御可能な立場は、「私たちはシミュレーションを使う」であってはならない。「私たちの独立した方法論は重大なリスクを発見し、導入を決定する人々が認める証拠を生み出す」でなければならない。

Safeworldのロボットテストでは証明できないこと

シミュレーションは失敗を明らかにし、構成を比較できるが、確率的に動作するロボットが誰も傷つけないことを証明することはできない。

形式的証明は、システムとその境界を正確に規定できる場合に最も有効に機能する。現代のAIコンポーネントは統計的パターンを学習し、設計者が完全には列挙できない入力に応答する。

ロボットには物理的な複雑さが加わる。センサーノイズ、摩擦、ペイロードの変化、摩耗、照明、ネットワーク遅延、人の動きが、行動の結果に影響を及ぼしうる。

したがって、シミュレーションで安全な結果が得られても、それはモデルの適用範囲内での主張を支持するにとどまる。現場における普遍的な安全性を確立するものではない。

この制約は、生成AIでより鮮明になる。モデルは、ソフトウェア更新後、あるいはプロンプト、カメラアングル、物体配置が変化した場合に、異なる応答を示すことがある。

Safeworldはこの変動する対象を認識している。同社の公開資料では、新しい環境やソフトウェアアップデートごとに新たなリスクが生じうると述べている。

継続的なテストは合理的な対応だ。それでも組織は、どの変更が再テストを必要とするのか、どれだけの証拠で十分なのか、誰が導入を承認できるのかを決める必要がある。

第1の大きなリスクは、シミュレーションの忠実度である。デジタル環境は、その結果が実際の導入の指針となるために、関連する物理的挙動を十分に近く表現しなければならない。

第2は、シナリオの網羅性である。ジェネレーターは無数のケースを作成できる一方、自身の前提の外にある稀な相互作用を見逃す可能性がある。

第3は、指標の選定である。ロボットは衝突を回避しながらも、不安定な動作、落下物、塞がれた出口、紛らわしい信号によって危険を生み出す可能性がある。

第4は、システム統合である。AIポリシーのテストは、ブレーキ、アクチュエーター、センサー、ネットワーク、バッテリー、アタッチメント、職場の手順を自動的に検証するものではない。

第5は、人間の適応である。作業者は機械の周囲で行動を変え、反復的な安全運用の後には近道を選ぶことがある。ソフトウェアが変わらなくても、導入はより危険になりうる。

これらの限界がSafeworldのロボットテストを無意味にするわけではない。それらは、そのテストが有用になる条件を定義する。

プラットフォームは、物理的な制御、運用上の制限、訓練、インシデント報告、現場監視を含む、より広範な安全性の論拠を支えるべきだ。シミュレーションはそのシステム内で証拠を供給する。

Safeworldは、何を販売しているのかを正確に示さなければならない。「この構成は、定義されたこれらのシナリオに合格した」は信頼できる。「このロボットは安全だ」は範囲が広すぎる。

同社はまた、楽観的なモデル前提からの独立性を示さなければならない。顧客がロボットモデル、人間モデル、選定シナリオを提供するなら、評価は既存の盲点を形式化するだけになる可能性がある。

Safeworldは、自社の危険ライブラリを維持し、モデルの不確実性を文書化し、シミュレーションの知見を実際のインシデントと比較することで、その懸念に対応できる。公開された方法論は、さらに信頼を強めるだろう。

繰り返しの現場相関は、とりわけ価値が高い。シミュレーションによるリスクスコアが、パイロット運用中のニアミスや介入を予測できるなら、購入者はこのツールが運用上意味のある何かを測定しているという証拠を得る。

否定的な結果は、ビジネスモデルを試すことになる。顧客からの圧力にもかかわらず、評価者が制限、追加の安全策、導入延期を推奨できるときに信頼は高まる。

投資家の資金を受け、急速に進むロボティクス企業に販売するスタートアップは、成長と独立性のバランスを取らなければならない。この緊張関係は構造的なものであり、Safeworldに固有の批判ではない。

企業は安全のために費用を支払う必要があるというZhaoの主張は、現実的な市場の可能性を反映している。それはあくまで同社の予測であり、確立された購買ルールではない。

一部のメーカーは社内で構築する。一部の購入者は既存の安全コンサルタントに依存する。標準や責任に関する期待がより明確になるまで、高度なロボットの導入を延期する企業もあるだろう。

Safeworldは緊急性の高い問題を特定した。しかし、その特定のアプローチが受け入れられる答えになることは、まだ示されていない。

Safeworldが信頼を得られるかを示す3つのシグナル

Safeworldの次の試練は、もう一つの劇的なロボット実演ではない。顧客、評価者、標準化の専門家が同社の証拠に依拠するかどうかである。

第1のシグナルは、文書化された導入成果だ。Gritt Roboticsとの提携は、Safeworldにとって、シミュレーション上の危険を実際の建設現場環境と結び付ける機会となる。

最も強力な証拠は、シミュレーションがロボットの挙動、現場の管理策、または導入制限をどのように変えたかを示すものだろう。また、どの残存リスクがテストの対象外に残ったかも説明すべきだ。

曖昧な顧客の推薦はほとんど意味を持たない。前後の知見と定義された運用条件を備えた、追跡可能な事例は、Safeworldの中心的な主張を裏付けるだろう。

その証拠が現れれば、独立評価の主張はより強くなる。提携が探索段階にとどまるなら、Safeworldは依然としてプロダクトマーケットフィットを探る初期段階のテストベンダーに見えるだろう。

第2のシグナルは、透明で再現可能な方法論である。購入者は、Safeworldがどのようにシナリオを選び、人をモデル化し、不確実性を表現し、結果に意味があると判断するのかを知る必要がある。

信頼できる方法論は、生成された可能性と検証済みの危険を区別すべきである。また、導入判断に対してシミュレーションの忠実度が不十分な場合も明示すべきだ。

Safeworldは、すべての独自技術を明らかにする必要はない。しかし、安全の専門家が前提に異議を唱え、重要な結論を再現するのに十分な透明性は必要だ。

同社は、外部の技術レビュー、ベンチマークの公開、シミュレーションと物理テストの相関の文書化を通じて、このシグナルを強化できる。だが、これらのいずれもまだSafeworldを業界の権威として確立してはいない。

方法論の開放性を示す証拠は、第三者レビューが信頼を高めるという主張を補強するだろう。独自スコアを中心とした閉鎖的なプロセスは、その主張を弱める。

第3のシグナルは、調達、保険、または標準化プロセスにおける認知である。同社の長期的な価値は、その成果物がロボティクスのエンジニアリングチームを超えて活用されるかどうかにかかっている。

工場運営者は、ロボットを受け入れる前にSafeworldのレポートを求めるかもしれない。保険会社はリスク評価の際にその証拠を考慮する可能性がある。標準化団体は、互換性のあるシナリオ手法を参照するかもしれない。

こうした展開は、Safeworldのロボット安全テストが導入ガバナンスの一部になったことを示すだろう。そうならなければ、製品は任意の開発支援ツールにとどまる可能性がある。

標準化での認知には時間がかかる。直近の証拠は、顧客がテスト結果を用いてリリースを承認したり、運用上の制限を課したりするなど、より実務的なものになりうる。

今後1〜3カ月で、同社の製品形態は明確になるはずだ。Safeworldは、顧客自身が行うテストの割合と、専門家に依存する割合を決めなければならない。

その決定は、規模、説明責任、信頼に影響する。セルフサービスのプラットフォームは迅速に広がるが、顧客により大きな責任を負わせる。サービスは監督を提供するが、成長はより遅い。

Safeworldは、確率的に振る舞う機械が共有空間に入る前に、誰がそれを検証するのかを問うには適切なタイミングを選んだ。ロボットの能力は、単一の安全フレームワークが取り込める速度を上回って進化している。

それでも、恐怖だけでは信頼は生まれない。信頼には、モデルが変わり、環境が異なり、顧客が導入の継続を望む状況でも有用であり続ける証拠が必要だ。

Safeworldの技術は、危険なケースをより検証しやすくできる。その一方で、より困難な課題は、その検証が現実的で、十分に包括的であり、意思決定に影響を与えられるほど独立していることを証明する点にある。

開発者とエンタープライズの購買担当者は、シミュレーション実行後に何が起きるかを注視すべきだ。顧客はシステムを変更するのか、導入を制限するのか、そしてソフトウェアのリリースをまたいで知見を保持するのか。

そうした行動は、生成されたシナリオの数よりも重要になる。それによってSafeworldが構築したのがシミュレーターなのか、保証プラットフォームなのか、あるいは独立した安全機関の萌芽なのかが明らかになる。

 
 

無料で始めましょう

ローカルファーストのパーソナル知識管理付きAIアシスタント

より良いAI体験のために、

remio は現在、 Windows 10+ (x64)とM-Chip Mac のみをサポートしています。

仕事のAIパートナー
remioでもっと仕事が進む

計画・作成・仕上げまで
すべてをひとつに

bottom of page