top of page

测试 NVIDIA Nitrogen:视觉到动作 AI 游戏的现实

6月6日
讀畢需時 6 分鐘

已更新:6月17日

Testing NVIDIA Nitrogen: The Reality of Vision-to-Action AI Gaming


NVIDIA Nitrogen 的发布标志着我们在虚拟环境中处理机器智能的方式发生了显著转变。多年来,游戏 AI 严重依赖强化学习——费力地定义奖励函数或直接挂钩游戏 API 以读取状态数据。NVIDIA Nitrogen 尝试了一种截然不同的方法:它直接观察屏幕。

通过处理原始视频帧并将其直接转化为控制器输入,这一 vision-to-action AI 模型 以人类的方式对待游戏。它不读取代码,而是观察像素。虽然一个能够玩转从 Rocket LeagueSuper Mario 等任何游戏的通用智能体的愿景非常诱人,但早期的社区测试和技术文档揭示了理论架构与在家庭电脑上运行的现实情况之间存在差距。

现实表现:在消费级硬件上运行 NVIDIA Nitrogen

Real-World Performance: Running NVIDIA Nitrogen on Consumer Hardware

在剖析架构之前,我们需要探讨该模型的实际使用体验。这不仅是一篇理论论文,而是一个你可以下载并运行的 1.97GB 权重文件。然而,早期采用者在测试 NVIDIA Nitrogen 时遇到了第一代基础模型经常面临的瓶颈:推理延迟。

Vision-to-Action AI 中的延迟挑战

的核心主张是 Vision-to-Action AI 它能对其所见做出反应。但反应时间至关重要。在涉及较旧但性能尚可的硬件(如 RTX 2080 Super)的测试场景中,性能开销是巨大的。

一个记录在案的测试案例突显了严重的瓶颈:在长达一小时的运行时间内,该模型仅生成了约五分钟的有效游戏画面。目前,处理时间与动作执行的比例严重失衡,普通消费者无法进行实时游戏。当你要求模型摄取高分辨率 RGB 帧,通过 vision transformer 进行处理,并通过 diffusion 生成离散的游戏手柄 token 时,计算成本会瞬间累积。

这产生了一种“滞后感”,使得快节奏动作游戏在非顶级企业级硬件上无法实时运行。模型捕捉帧、进行思考并输出按键指令——但当按键指令被注册时,游戏状态已经发生了改变。

硬件瓶颈与优化需求

NVIDIA Nitrogen 文档明确指出了对 CUDA 加速的需求,但部署的现实情况远不止于此。与早期 AI 方法中使用的简单策略网络相比,该模型在动作生成方面对 Diffusion Transformer (DiT) 的依赖带来了沉重的计算负担。

目前,NVIDIA Nitrogen的表现与其说像一名玩家,不如说更像是一个被迫玩动作游戏的策略游戏玩家。对于希望集成这种 vision-to-action AI 的开发者来说,眼前的障碍并非模型的智能程度,而是推理流水线的优化。在量化或蒸馏技术降低开销之前,这仍然是适用于 H100 集群而非游戏笔记本电脑的工具。

NVIDIA Nitrogen 如何重新定义 Vision-to-Action AI

How NVIDIA Nitrogen Redefines Vision-to-Action AI

要理解为什么该模型需要如此高的资源,需要研究其架构。NVIDIA Nitrogen不仅仅是在“观看”视频;它通过一个两阶段的过程,同时合成理解与行动。

SigLip2 与 DiT 架构

该模型摒弃了标准的卷积神经网络 (CNNs)。相反,它采用了 SigLip2,一种先进的视觉编码器。该组件将输入的 RGB 帧分解为易于处理的嵌入(embeddings)——本质上是将视觉数据翻译成系统能够理解的数学语言。

一旦建立了视觉上下文,它就会被传递给 DiT (Diffusion Transformer)这就是 NVIDIA Nitrogen 与传统的 actor 不同。它不只是简单地对“最佳下一步”进行分类,而是利用扩散过程生成动作序列,类似于图像生成器从噪声中创建图片的方式。其结果是对动作更细致的理解,允许摇杆输入采用连续值,而不仅仅是二进制的上/下/左/右命令。

从像素到游戏手柄 Token

尽管输入非常复杂,但 NVIDIA Nitrogen 的输出规范却出奇地精简。它产生一个形状为 21x16 的张量。这可以转化为:

  • 两个代表摇杆(瞄准和移动)的连续向量。

  • 十七个代表按钮(触发器、肩键、功能键、方向键)的二进制值。

这一设计选择证实了 Vision-to-Action AI 的构建秉持着“通用接口”的理念。通过将输出标准化为通用的控制器架构,模型无需了解新游戏的具体控制绑定。它只需要将视觉线索(如跳板)与特定的控制器输出(如按下“A”键)联系起来,从而模拟人类通过试错或模仿来学习控制的过程。

超越游戏:视觉到动作 AI 的应用

Beyond Gaming: Applications for Vision-to-Action AI

虽然玩 Minecraft 或赛车游戏是视觉演示,但 NVIDIA Nitrogen 扩展到了开发流水线和辅助功能技术领域。仅通过视觉界面与软件交互的能力,开启了基于 API 的机器人无法逾越的大门。

自动化游戏 QA 测试中的 NVIDIA Nitrogen

最直接的商业应用场景是 NVIDIA Nitrogen 处于质量保证 (QA) 领域。现代开放世界游戏和实时服务型游戏需要数千小时的压力测试来发现 Bug。当 UI 发生变化或特定像素坐标偏移时,脚本化机器人往往会失效。

一个 vision-to-action AI 不依赖于硬编码坐标。只要视觉逻辑保持一致,它就可以有效地在游戏世界中“漫游”,在地形中导航并与菜单交互,即使底层代码发生了变化。这使得工作室能够部署 AI 代理集群来进行服务器压力测试,在庞大的地图中运行碰撞检测,或验证 NPC 交互功能是否正常,而无需人类测试员每天对着墙跑八小时。

无障碍环境与“第二玩家”概念

社区讨论强调了对这项技术的一个迫切需求:即“沙发合作”伙伴。许多游戏拥有单人玩家无法进入的合作模式。NVIDIA Nitrogen 这样的通用代理可以充当“玩家 2”的角色,在无需针对该游戏进行特定编程的情况下,即可管理队友的各项机制。

此外,这与无障碍游戏的更广泛目标相一致。对于无法操作标准控制器的肢体残障玩家,一个 vision-to-action AI 可以充当桥梁——通过解读用户的简化输入并在游戏中执行复杂的控制器操作,有效地充当一个能够理解屏幕上下文的智能“辅助瞄准”或导航副驾驶。

局限性与未来:Vision-to-Action AI 的瓶颈

Limitations & Future: Where Vision-to-Action AI Stumbles

尽管拥有先进的架构,NVIDIA Nitrogen 并非万能。它的训练数据(视频文件)带来了特定的行为局限,使其区别于基于逻辑的 AI。

策略游戏难题

该模型在快速反应和连续导航方面表现出色——这些任务能很好地映射到摇杆移动和视觉流。但在长远规划方面,它的表现非常吃力。用户尝试将 NVIDIA Nitrogen 应用于策略游戏 (RTS) 或像 Civilization会发现它力有不逮。

这些游戏类型需要鼠标的精准操作和抽象规划(例如,“我现在需要建造一个农场,以便在 20 分钟后获得食物”)。由于该模型基于即时视觉反馈和模仿运行,它缺乏复杂策略通常所需的内部逻辑状态来进行规划。它模仿的是游戏的表象,这对于驾驶汽车有效,但在管理经济时则会失效。如果所需的操作没有在当前帧中得到视觉提示,模型就会偏离目标。

通往自我修正智能体之路

对于 NVIDIA Nitrogen 及类似的 vision-to-action AI 模型来说,“智能体模式 (Agentic Mode)”是终极目标。目前的许多实现版本仍处于开环状态——它们能观察并行动,但未必会反思 为什么 某个动作失败了。

未来的发展需要闭合这一环路,让 AI 能够将“游戏结束”画面或卡住的角色模型识别为负面反馈。使模型能够编写自己的纠错逻辑——例如识别出撞墙时没有产生视觉流变化,并据此改变输入——是下一步的关键。一旦 NVIDIA Nitrogen 能够自我诊断失败而不仅仅是模仿成功,延迟问题将退居其次,其强大的适应能力将成为核心。

自适应常见问题解答

在本地运行 NVIDIA Nitrogen 需要什么硬件?

为了有效地运行该模型,您需要一块具有大容量显存的 NVIDIA GPU。虽然从技术上讲它可以在 RTX 2080 Super 等显卡上加载,但实际使用中需要更新的架构(RTX 30/40 系列),以便在处理 DiT 和 SigLip2 组件的重度推理负载时,避免出现严重的延迟。

NVIDIA Nitrogen 是否需要游戏的源代码才能工作?

不需要。该模型是一个“视觉到动作”系统,这意味着它只需要来自游戏的视频输出(RGB 帧)。它与软件的交互方式与人类完全相同,即通过查看屏幕并发送虚拟控制器信号,这使其能够兼容闭源游戏。

为什么模型在游戏过程中运行缓慢或有延迟?

延迟源于两步处理流水线:使用 vision transformer 分析图像以及通过 diffusion 生成动作。这一计算过程需要时间(取决于硬件,从毫秒到秒不等),从而在屏幕画面与 AI 反应之间产生了延迟。

NVIDIA Nitrogen 可以玩键鼠游戏吗?

它针对手柄输入(摇杆和按钮)进行了优化。虽然技术上可以将输出映射到键盘按键,但该模型是基于控制器固有的运动(如连续的模拟转向)进行训练的。在需要高精度鼠标点击的游戏(如 RTS 或 MOBA 类游戏)中,它的表现较差。

该模型是否使用了强化学习 (RL)?

不,NVIDIA Nitrogen 使用的是基于视频数据的模仿学习。 与通过最大化奖励分数(如分数)进行学习的 RL 不同,Nitrogen 通过观看海量的人类游戏画面并预测与视觉上下文匹配的正确动作来进行学习。

 
 

免费开始

一款本地优先的AI助手

为了获得更好的人工智能体验,

remio 目前仅支持Windows 10+ (x64)M-Chip Mac

你的 AI 工作伙伴

remio 一起高效工作

规划、创作、交付

一站式完成

bottom of page