SIMA 2: Google DeepMindの汎用AIエージェントの次のステップ
- Aisha Washington

- 6月6日
- 読了時間: 11分
人工知能に関する会話は、通常、テキスト生成や画像作成を中心に展開されます。私たちはチャットボットに質問をし、それが回答を吐き出します。しかし、Google DeepMindは「SIMA 2」で異なるアプローチを推進しています。これはブラウザのサイドバーに存在するツールではなく、世界に住み、周辺を認識し、意図を持って行動する方法を理解するエージェントを構築する試みです。
最近研究プレビューとして発表されたSIMA 2 は、「汎用」AIへのアプローチにおける明確な変化を表しています。初代のSIMA 1は、人間のようにビデオゲームをプレイでき、コードフックではなく視覚入力から学習できる点で興味深いものでした。しかし限界もありました。指示に従うことはできましたが、タスクが複雑になるとしばしば失敗していました。新しいバージョンはGemini 2.5 flash-liteモデルを搭載し、前世代の生の機械的スキルに本物の推論のレイヤーを追加することで、これらのギャップを埋めようとしています。
この開発が重要である理由は、目標地点を移動させるからです。私たちは単により優れたビデオゲームボットを見ているのではありません。仮想世界におけるembodied AI in virtual worldsの試験場を見ており、最終的にデジタル脳と物理ロボットの間のギャップを埋める可能性のある技術です。
スクリプト化されたボットを超えて:SIMA 2を際立たせるもの

なぜSIMA 2 が研究界で話題になっているのかを理解するには、新しい環境をどのように扱うかを見る必要があります。ほとんどのAI agentsは専門家です。チェスをプレイするように訓練されたエージェントはポーカーでは役に立ちません。倉庫をナビゲートするように訓練されたエージェントは、キッチンに置かれると混乱します。このプロジェクトにおけるDeepMindの目標は汎用化です。Google DeepMind generalist AI agent は、景色が変わるたびにゼロから再訓練する必要がないものです。
SIMA 1からSIMA 2 への飛躍は、主に精神的な柔軟性に関するものです。以前のモデルは複雑なタスクで31%の成功率でした。指示と実行に必要なステップの間の点を結ぶのに苦労していました。SIMA 2 はGeminiの言語および推論能力を使用して、そのパフォーマンスを2倍にします。
DeepMindの研究者Jane Wangは、システムが今や「ピクセルをボタン押下にマッピングする」のではなく、「何が起こっているかを理解する」よう求められていると指摘しました。これは、ルートに従うGPSと、道路封鎖を見て脇道をショートカットすると決める運転手の違いです。大規模言語モデル(LLM)を制御ループに直接統合することで、エージェントは抽象的または視覚的な指示を処理できます。
視覚的推論と「常識」
SIMA 2 の最も示唆に富むデモンストレーションの1つは、ビデオゲーム内の単純なタスクでした:「熟したトマトの色をした家まで歩く」。
従来のボットでは、その指示を座標または特定のオブジェクトタグに翻訳する必要があります。SIMA 2 は内部で分解しました。熟したトマトは赤であると推論し、視野内の赤い家を特定し、そこに向かって移動しました。これは、人間の認知プロセス(トマト=赤という概念の連想、家の知覚、キャラクターの移動という行動)を模倣しています。
この能力は、絵文字を指示として理解することにも拡張されます。エージェントに「🪓🌲」と伝えると、木を切り倒します。これは、人間と機械のインターフェースがコードではなく、自然で意図に基づくコミュニケーションになりつつあることを示唆しています。
AIの自己改善を促進するGeminiの役割

SIMA 2 における最も重要なアップグレードは、学習方法です。過去には、エージェントの訓練に人間のゲームプレイの膨大なデータセットが必要でした。AIに資源の採掘や船の操縦を教えるために、No Man's Sky をプレイする人々の数千時間が必要でした。このアプローチは、人間のデータが高価で有限であるため、うまくスケールしません。
SIMA 2 は、AI self-improvement のメカニズムを導入しています。Gemini model to generate its own tasks を使用し、別個の報酬モデルでパフォーマンスを判断します。本質的に、自分自身と対戦し、人間の手助けなしに目標を設定し、達成する方法を見つけ出します。
シリコン内での進化の加速
この機能に対するコミュニティの反応は、速度と規模に焦点を当てています。AIが独自のカリキュラムを定義し、自分の宿題を自分で採点できる場合、人間の監督というボトルネックは消えます。あるオブザーバーがこのニュースについて指摘したように、this allows for training at speeds orders of magnitude greater than reality です。AIは理論上、私たちが数分と認識する時間で100年分の試行錯誤の訓練をシミュレートできます。
この概念は、合成データに向けた業界全体の推進と一致しています。インターネットが高品質なテキストをLLMの訓練に使い果たすと、合成テキストに目を向けます。ロボットを訓練するための人間が洗濯物を畳むビデオがなくなると、SIMA 2 は合成環境を使ってその経験を生成できることを示唆しています。
強力な初期モデル(人間のデータに基づく)を使用し、サンドボックス内で反復させることで、システムはフィードバックループを作成します。より良い推論がより良い自己生成タスクにつながり、それがより堅牢な学習につながります。これが、Genie(DeepMindの世界モデル)によって生成されたフォトリアリスティックな世界をナビゲートし、見たことのないベンチや蝶を正しく識別できるエージェントを生み出す方法です。
仮想世界から実ロボットへ:Embodied AIの訓練

DeepMindは、SIMA 2 が踏み石であることを明確にしています。この技術の最終目的地はビデオゲームのリーダーボードではなく、物理世界です。
Training robots in realistic worlds は、ロボット工学における主要な物流上の問題、つまり安全性とコストを解決します。皿を割って食器洗い機の積み込み方を学ぶために、100万台の物理ロボットがキッチンでつまずき回ることはできません。遅すぎ、高すぎ、危険すぎます。しかし、クラウドサーバー内の仮想キッチンでSIMA 2 のインスタンスを100万個 stumbling aroundさせることは可能です。
転移の問題
大きな疑問は転移可能性です。ビデオゲームで訓練されたGoogle DeepMind generalist AI agent は、実際に物理ロボットを操作できるでしょうか?研究者やテック愛好家の間のコンセンサスは慎重ながら楽観的です。エージェントが3Dシミュレーションで「戸棚を開ける」という高レベルの概念(ハンドルの識別、ヒンジの物理の理解、動作の計画)を学べば、その認知マップは理論上、物理的な身体に転移するはずです。
DeepMindの研究エンジニアFrederic Besseは、SIMA 2 が「高レベルの理解」を扱うと指摘します。what をする必要があるか(戸棚の中の豆を見つける)を判断します。低レベルの実行(ロボットの腕のサーボモーターにどれだけのトルクを適用するか)は別の問題で、しばしば異なる基盤モデルによって処理されます。
しかし、その分離は狭まりつつあります。SIMA 2 が混沌としたスクリプトのないビデオゲーム環境での相互作用のロジックを習得できれば、物理ロボットが現在欠いている「常識」データベースを構築しています。シミュレーションで学んだルールのために「トマトは赤い」「ガラスは落とすと割れる」を知っているロボットは、事前にプログラムされたパスに従うことしか知らないロボットよりもはるかに有用です。
ビデオゲームのNPCの未来にとってSIMA 2が重要な理由
ロボット工学が長期的な目標である一方、SIMA 2 の即時的な応用は私たちの目の前、ビデオゲームにあります。数十年にわたりゲームに登場してきた静的で予測可能なNon-Player Characters(NPC)は、刷新されるべき時が来ています。
ゲーマーは単純な決定木で動作するNPCに慣れています。攻撃すれば反撃し、歩いて行けば止まります。彼らには目標がなく、「推論」することもありません。Gemini-powered AI agent のようなSIMA 2 は、ダイナミクスを完全に変えます。
ダイナミックな世界と創発的ゲームプレイ
Skyrim やGrand Theft Auto のようなオープンワールドゲームを想像してください。ただし、市民は単なる背景の装飾ではありません。彼らは独自の指示を持ち、プレイヤーから独立して計画し、世界をナビゲートできるエージェントです。
SIMA 2 をめぐるコメントは、この未来の興奮と潜在的な混乱の両方を強調しています。あるユーザーは、プレイヤーがスタートダンジョンを探索している間にNPCがゲームのメインクエストを解決するジョークを言いました。面白いですが、これは実際のデザイン上の課題に触れています。NPCがあまりに賢く自律的になりすぎると、開発者が設計したナラティブの流れを壊す可能性があります。しかし、没入感の可能性は比類ありません。自然言語の指示を理解し、プレイヤーの不規則な行動に適応し、複雑な地形を壁にぶつかることなくナビゲートできるNPCは、メディアに革命をもたらすでしょう。DeepMindのプレビューは、人間のプレイヤーと同じルールで住人がプレイする「生きている」世界に向かっていることを示唆しています。
SIMA 2を物理的現実にもたらす課題
楽観的なプレビューにもかかわらず、

SIMA 2 はまだ研究プロジェクトです。 DeepMindは商用リリースや物理的実装のタイムラインを提供していません。家庭用ロボットでこのロジックが動作するまでには、依然として重大なハードルが残っています。レイテンシとコンピュートバリア
Gemini 2.5 flash-liteのような複雑なモデルを実行するには、 substantial manufacturing compute powerが必要です。ビデオゲームやシミュレーションは、AIが「考える」間のわずかな遅延を許容できます。または大規模なサーバーファームで実行できます。物理ロボットは、限られたオンボードハードウェアで、しばしばミリ秒単位で決定を下す必要があります。
「flash-lite」という指定は、Googleが効率に取り組んでいることを示唆していますが、
embodied AI in virtual worlds のリアルタイム処理は、物理学を騙せない物理世界のリアルタイム処理とは大きく異なります。ゲームではAIがジャンプを誤算してもリスポーンします。現実ではロボットが階段から落ちます。Embodiment Gap
DeepMindの研究者は、
SIMA 2 が低レベルのモーター制御ではなく高レベルの推論に焦点を当てていることを認めています。この「脳」を物理的な「身体」と統合することは些細なことではありません。柔らかい物体(その豆の袋など)を操作したり、凹凸のある地形をナビゲートしたりするために必要な運動スキルは、非常に複雑です。現在のロボット工学の基盤モデルは別々に訓練されています。高レベルのストラテジストである
SIMA 2 と低レベルのモーターコントローラーの収束が業界の向かう方向ですが、まだ実現していません。汎用的な未来の glimpse
SIMA 2 は、AIがもはやチャットボックス内の disembodied voiceではない未来の概念実証として機能します。 大規模言語モデルの推論能力を視覚的でインタラクティブな環境に grounding することで、DeepMindはAIに存在することを教えています。
これが来年の超スマートなゲームコンパニオンにつながるか、10年後の汎用家庭用ロボットにつながるかにかかわらず、軌道は明確です。1つのことに優れ、それ以外には盲目な専門家ボットの時代は終わっています。私たちは、学習し、適応し、その場で物事を理解できる汎用者の時代に入っています。
FAQ: SIMA 2を理解する
SIMA 1とSIMA 2の主な違いは何ですか?
SIMA 2はGemini 2.5 flash-liteモデルを統合し、SIMA 1と比較して大幅に優れた推論と言語能力を提供します。初代バージョンは基本的なコマンドに従うことができましたが、SIMA 2 can understand complex, abstract instructions and generalize its knowledge to environments it has never seen before 。
SIMA 2はどのようにAI自己改善を使って学習しますか?
人間のゲームプレイデータにのみ依存するのではなく、SIMA 2はGeminiモデルを使用して仮想環境で新しいタスクや課題を自分で生成します。その後、それらのタスクに挑戦し、報酬モデルを使ってミスから学習することで、人間の監督に頼るよりもはるかに速く練習し、改善できます。
SIMA 2は物理ロボットを制御できますか?
まだ直接的にはできません。SIMA 2 は現在、高レベルの推論と計画に焦点を当てた3D環境向けの仮想エージェントです。しかし、DeepMindはこの研究を、将来の汎用ロボットの「脳」を訓練するための重要なステップと見なしており、現実世界で試す前にシミュレーションで安全にタスクを学習できるようにします。
SIMA 2がビデオゲームにとって重要な理由は何ですか?
ゲームの世界を実際に理解し、相互作用できるNPC(ノンプレイヤーキャラクター)への道を開きます。これにより、キャラクターが自然言語の指示を受け、プレイヤーの不規則な行動に適応し、複雑な地形をインテリジェントにナビゲートし、人間のプレイヤーのように振る舞う、より没入感のあるゲームにつながる可能性があります。
SIMA 2の文脈で「embodied AI」とは何を意味しますか?
Embodied AI とは、仮想または物理的な身体を通じて環境と相互作用し、一人称視点から世界を認識する人工知能を指します。SIMA 2 は、「目」で仮想世界を見て、「身体」を使って移動し、その空間内での物理的行動の結果から学習するため、embodied agentと見なされます。


