top of page

SIMA 2:Google DeepMind 通用 AI 代理的下一步

已更新:6月17日

关于人工智能的讨论通常围绕着文本生成或图像创建展开。我们向聊天机器人提出问题,它便会给出答案。但 Google DeepMind 正在通过 SIMA 2 推动一些不同的东西。这并不是一个存在于浏览器侧边栏的工具;它是一次构建智能体的尝试,旨在让其理解如何栖息于一个世界、感知周围环境并有目的地采取行动。

作为研究预览版于近期发布,SIMA 2 代表了我们处理“通用型”AI 方式的显著转变。第一代版本 SIMA 1 非常有趣,因为它能像人类一样玩视频游戏,从视觉输入而非代码钩子中学习。但它也有局限性。它能遵循指令,但在任务变得复杂时往往会失败。由 Gemini 2.5 flash-lite 模型驱动的新版本试图通过在其前身的原始机械技能之上增加一层真正的推理能力,来弥补这些差距。

这一进展至关重要,因为它移动了终点线。我们不仅仅是在看一个更好的视频游戏机器人。我们是在看一个虚拟世界中具身智能 (embodied AI)的试验场,这项技术最终可能弥合数字大脑与物理机器人之间的鸿沟。

超越脚本机器人:是什么让 SIMA 2 与众不同?

Moving Beyond Scripted Bots: What Makes SIMA 2 Different?

要理解为什么 SIMA 2 在研究界引起轰动,你必须观察它如何处理新环境。大多数 AI agents 都是专家型的。一个被训练下国际象棋的智能体在扑克面前毫无用处。一个被训练在仓库导航的智能体,如果你把它放进厨房,它就会感到困惑。DeepMind 在这个项目上的目标是通用化——构建一个 Google DeepMind generalist AI agent,使其不需要在每次场景变换时都从头开始重新训练。

从 SIMA 1 到 SIMA 2 的飞跃很大程度上在于思维的灵活性。之前的模型在复杂任务上的成功率仅为 31%。它很难将指令与执行该指令所需的步骤联系起来。SIMA 2利用 Gemini 的语言和推理能力将性能提升了一倍。

DeepMind 研究员 Jane Wang 指出,现在的系统被要求去“理解正在发生的事情”,而不仅仅是将像素映射到按钮操作。这就像是只会遵循路线的 GPS 与看到路障并决定走小路绕行的司机之间的区别。通过将大语言模型 (LLM) 直接集成到控制循环中,智能体可以处理抽象或视觉指令。

视觉推理与“常识”

关于 SIMA 2 最具说服力的演示之一涉及视频游戏中的一个简单任务:“走向那座颜色像熟透番茄的房子。”

传统的机器人需要将该指令转换为坐标或特定的对象标签。SIMA 2 则在内部对其进行了分解。它推理出熟透的番茄是红色的,在视野中识别出一座红色的房子,并向其导航。这模拟了人类的认知过程——将概念(番茄 = 红色)与感知(看到房子)和行动(移动角色)联系起来。

这种能力扩展到将表情符号理解为指令。告诉代理“🪓🌲”会导致它砍倒一棵树。这暗示了人机交互界面正从代码转向更自然、基于意图的沟通方式。

Gemini 在推动 AI 自我改进中的作用

The Role of Gemini in Fueling AI Self-Improvement

SIMA 2 中,最重要的升级在于它的学习方式。过去,训练一个代理需要海量的人类游戏数据。你需要数千小时人们玩 No Man's Sky 的数据来教 AI 如何开采资源或驾驶飞船。这种方法难以扩展,因为人类数据既昂贵又有限。

SIMA 2 引入了一种 AI 自我改进。它使用 Gemini 模型生成自己的任务,并使用一个独立的奖励模型来评判其表现。它本质上是在与自己博弈,设定目标并弄清楚如何在没有人类指导的情况下实现这些目标。

在硅基环境中加速进化

社区对这一功能的反应主要集中在速度和规模上。如果 AI 能够定义自己的课程并为自己的作业评分,人类监督的瓶颈就会消失。正如一位观察者针对该新闻所指出的,这使得训练速度能够比现实情况快出几个数量级。从理论上讲,AI 可以在我们感知的几分钟内模拟 100 年的试错训练。

这一概念与整个行业向合成数据推进的趋势相一致。当互联网上用于训练 LLM 的高质量文本耗尽时,它们会转向合成文本。当我们用于训练机器人的“人类折叠衣服”视频耗尽时,SIMA 2 建议我们可以利用合成环境来生成这些经验。

通过使用一个强大的初始模型(基于人类数据),然后让它在沙盒中进行迭代,系统创建了一个反馈循环。更强的推理能力带来更优质的自生成任务,从而实现更稳健的学习。这就是为什么一个智能体能够导航由 Genie(DeepMind 的世界模型)生成的写实世界,并正确识别出它从未见过的长凳或蝴蝶。

从虚拟世界到现实机器人:训练具身智能

From Virtual Worlds to Real Robots: Training Embodied AI

DeepMind 已经明确表示 SIMA 2 是一个跳板。这项技术的终极目标不是电子游戏的排行榜,而是物理世界。

在现实世界中训练机器人 解决了机器人学中一个主要的物流问题:安全与成本。你不能让一百万台物理机器人在厨房里跌跌撞撞,通过打碎盘子来学习如何装载洗碗机。这太慢、太贵且太危险。但你可以让一百万个 SIMA 2 实例在云端服务器的虚拟厨房里摸索。

迁移问题

核心问题在于可迁移性。一个在视频游戏中训练的 Google DeepMind 通用 AI 智能体 真的能操作物理机器人吗?研究人员和科技爱好者的共识是审慎乐观的。如果一个智能体在 3D 模拟中学习了“打开橱柜”的高层概念——识别把手、理解铰链的物理特性、规划动作——那么从理论上讲,这种认知图谱应该可以迁移到物理实体上。

DeepMind 的研究工程师 Frederic Besse 指出,SIMA 2 负责处理“高层理解”。它负责弄清楚什么是需要做的(在橱柜里找到豆子)。而底层执行(例如给机器人手臂的伺服电机施加多少扭矩)则是一个独立的问题,通常由不同的基础模型来处理。

然而,这种界限正在缩小。如果 SIMA 2如果能够掌握混乱、无剧本的游戏环境中的交互逻辑,它就在构建物理机器人目前所缺乏的“常识”数据库。一个因为在模拟中学习了规则而知道“番茄是红色的”和“玻璃掉落会碎”的机器人,远比一个只知道遵循预设路径的机器人更有用。

为什么 SIMA 2 对游戏 NPC 的未来至关重要

虽然机器人技术是长期布局,但 SIMA 2 的直接应用就摆在我们面前:电子游戏。几十年来一直存在于游戏中的那些静态、可预测的非玩家角色(NPC)正面临一场彻底的变革。

游戏玩家已经习惯了基于简单决策树运行的 NPC。如果你攻击他们,他们会反击;如果你走开,他们就会停止。他们没有目标,更不会进行“推理”。而一个由 Gemini 驱动的 AI 智能体,例如 SIMA 2,则彻底改变了这种动态。

动态世界与涌现式游戏玩法

想象一下在玩像 SkyrimGrand Theft Auto 这样的开放世界游戏,但其中的市民不仅仅是背景装饰。他们是拥有自己指令的智能体,能够独立于玩家进行规划并在世界中导航。

围绕 SIMA 2 的评论既突显了对未来的兴奋,也揭示了潜在的混乱。一位用户开玩笑说,当玩家还在探索初始地下城时,某个 NPC 可能已经完成了游戏的主线任务。这虽然是个笑话,但却触及了一个真实的策划挑战:如果 NPC 变得过于聪明或过于自主,他们可能会破坏开发者设计的叙事流程。

然而,这种沉浸感的潜力是无与伦比的。一个能够理解自然语言指令、适应玩家反复无常的行为、并在复杂地形中导航而不会卡进墙里的 NPC,将彻底改变这一媒介。DeepMind 的预览表明,我们正迈向“活生生”的世界,那里的居民与人类玩家遵循相同的规则。

将 SIMA 2 引入物理现实所面临的挑战

The Challenges of Bringing SIMA 2 to Physical Reality

尽管预览前景乐观,SIMA 2目前仍是一个研究项目。DeepMind 尚未提供商业发布或物理落地的路线图。在我们将这种逻辑应用于家用机器人之前,仍存在巨大的障碍。

延迟与算力壁垒

运行像 Gemini 2.5 flash-lite 这样复杂的模型需要巨大的制造算力。视频游戏和模拟环境可以容忍 AI 在“思考”时产生的轻微延迟,或者可以在大型服务器集群上运行。但物理机器人需要在毫秒内做出决策,且通常受限于有限的机载硬件。

“flash-lite”这一命名表明 Google 正在致力于提升效率,但针对虚拟世界中的具身智能的实时处理,与物理世界中的实时处理截然不同——在物理世界中,物理定律是无法规避的。在游戏中,如果 AI 误判了跳跃,它可以重新生成;而在现实中,机器人会从楼梯上摔下来。

具身智能鸿沟

DeepMind 研究人员承认,SIMA 2 侧重于高层推理而非底层运动控制。将这个“大脑”与物理“身体”整合并非易事。操纵软物体(如那袋豆子)或在崎岖地形导航所需的运动技能极其复杂。

目前的机器人基础模型正在被分开训练。像 SIMA 2 这样的高层策略制定者与底层运动控制器的融合是行业的发展方向,但目前尚未实现。

窥见通用智能的未来

SIMA 2 作为一个概念验证,预示着 AI 不再只是聊天框中虚无缥缈的声音的未来。通过将大语言模型的推理能力植入视觉化、交互式的环境中,DeepMind 正在教会 AI 具备“临场感”。

无论这会在明年带来超智能的游戏伙伴,还是在十年后带来通用家用机器人,其发展轨迹已清晰可见。专才机器人的时代——即只擅长一件事而对其他事物一无所知——正在终结。我们正在进入通用型机器人的时代,它们能够即时学习、适应并解决问题。

常见问题:了解 SIMA 2

SIMA 1 和 SIMA 2 之间的主要区别是什么?

SIMA 2 集成了 Gemini 2.5 flash-lite 模型,使其具备了比 SIMA 1 显著更强的推理和语言能力。虽然第一版可以执行基础指令,但SIMA 2 能够理解复杂、抽象的指令,并将其知识泛化到从未见过的环境中

SIMA 2 是如何利用 AI 自我改进来学习的?

SIMA 2 不再仅仅依赖人类的游戏数据,而是利用 Gemini 模型在虚拟环境中为自己生成新的任务和挑战。随后,它会尝试这些任务,并通过奖励模型从错误中学习,这使其练习和进步的速度远快于依赖人工监督的情况。

SIMA 2 可以控制物理机器人吗?

目前还不能直接实现。SIMA 2目前是一个专为 3D 环境设计的虚拟智能体,专注于高级推理和规划。然而,DeepMind 将这项研究视为训练未来通用机器人“大脑”的关键一步,使其能够在尝试进入现实世界之前,先在模拟环境中安全地学习任务。

为什么 SIMA 2 对视频游戏很重要?

它为 NPC(非玩家角色)铺平了道路,使其能够真正理解游戏世界并与之互动,而不是遵循预设脚本。这可能会带来更具沉浸感的游戏体验,角色可以接受自然语言指令,适应玩家的各种行为,智能地在复杂地形中导航,并表现得更像人类玩家。

在 SIMA 2 的语境下,“具身智能 (embodied AI)”是什么意思?

具身智能 (Embodied AI)是指通过虚拟或实体躯体与环境互动的 AI,它从第一人称视角感知世界。SIMA 2被认为是一个具身智能体,因为它通过“眼睛”观察虚拟世界,使用“身体”移动,并从该空间内物理行为产生的后果中学习。

 
 

免费开始

一款本地优先的AI助手,具备个人知识管理功能

为了获得更好的人工智能体验,

remio 目前仅支持Windows 10+ (x64)M-Chip Mac

在你的大脑里添加一个搜索栏

Ask remio

记住一切

​无需整理

bottom of page