top of page

NVIDIA 机器人推理走向机载,但数据中心仍在追求更大的模型

9月10日
讀畢需時 13 分鐘

尽管多年来 AI 的发展重心一直围绕远程数据中心,NVIDIA 机器人推理如今已大幅靠近机器本体。Jetson Thor 为机器人制造商提供了足够的机载算力,可运行多个高要求模型,无需让每一个决策都跨越网络完成。

这一转变并不意味着云端已经过时。它让即时物理控制与计算成本高昂的推理之间形成了更清晰的分工。机器人需要本地反射能力,而数据中心仍能提供更大的模型、共享记忆、更便捷的更新方式和更高的资源利用率。

因此,核心竞争并非边缘硬件与云基础设施的对抗,而是本地自主性与集中式智能之间的取舍,每一家机器人公司都在决定这条边界应画在哪里。Google DeepMind、NVIDIA 和机器人制造商已经围绕这种分工的不同版本展开布局。

NVIDIA 机器人推理已进入机器本体

NVIDIA 已将机载推理从受限的备选方案,转变为支撑复杂机器人行为的可信基础。

最明确的硬件信号出现在 2025 年 8 月 Jetson AGX Thor 正式上市时。NVIDIA 为人形机器人、工业机器、医疗设备及其他需要实时处理传感器数据的系统设计了这款紧凑型计算机。

该公司称,Jetson Thor 的 AI 算力是 Jetson AGX Orin 的 7.5 倍。NVIDIA 还表示,其能效比前代产品高出 3.5 倍。

这些对比仍属于厂商说法,实际性能取决于模型、精度、内存使用情况和软件配置。不过,该平台的基本规格也说明了为何机器人推理的位置已成为一个紧迫的架构问题。

据 NVIDIA 介绍,Jetson AGX Thor 配备 128GB 内存,最高可提供 2,070 FP4 teraflops 算力。FP4 是一种紧凑的四位数值格式,可降低模型存储和计算需求,但会牺牲部分精度。

内存容量与醒目的算力数字同样重要。机器人可能同时运行感知、语言、建图、运动规划和安全工作负载。每项工作负载都会争夺内存带宽、处理时间和有限的功耗预算。

NVIDIA 表示,其机器人软件社区拥有超过 200 万名开发者。该公司列出的 Thor 早期采用者包括 Amazon Robotics、Boston Dynamics、Figure、Agility Robotics、Caterpillar 和 Medtronic。

这份名单覆盖仓储、人形机器人、重型设备和医疗保健领域。它表明,机载 AI 正成为一项共同的基础设施决策,而非某一类机器人的专属功能。

Google DeepMind 则从模型端发力。其本地机器人模型于 2025 年 6 月推出,是一套经过优化、可直接在机器人上运行的视觉-语言-动作系统。

视觉-语言-动作模型通常称为 VLA,可将图像和指令转化为物理动作。它在一个学习系统中结合视觉感知、语言理解和运动控制。

DeepMind 将该模型定位为适用于网络延迟或连接性会限制依赖云端机器人的场景。该公司称,该模型还可借助额外示范适应新任务。

这些发布改变了机器人架构的实际起点。开发者不再必须假定,先进感知和通用操控能力需要永久连接数据中心。

不过,NVIDIA 和 Google 都未证明机器人智能的每一层都应留在机载端。相反,它们的产品使混合式设计成为可能,也由此带来了更棘手的问题:哪些计算应留在本地。

机器人不能等云端来接住它

物理系统为智能设定了最后期限,而错过这些期限的影响,可能比给出最复杂的答案更严重。

聊天机器人可以在远程模型生成回复时暂停。双足平衡、避让工作人员或抓取易碎材料的机器人,却不能把不可预测的网络延迟视为小小的不便。

每一次云端请求都会增加多个环节。机器人必须编码传感器信息、传输信息、等待远程处理、接收结果,并确认指令仍然适用。

物理世界可能在这一过程中发生变化。有人可能走入路径,物体可能滑落,车辆可能驶入路口。正确但迟到的响应,在功能上可能已是错误的。

这一限制有利于本地控制回路。控制回路会反复测量系统、计算校正措施并施加校正,以保持运动稳定。

底层平衡、碰撞规避、关节控制和紧急停止应尽可能靠近硬件。这些功能需要确定性行为,也就是其响应时间保持在已知范围内。

即使平均延迟看似可以接受,连接性仍会引入波动。拥塞、覆盖较弱、路由问题和服务中断都会造成平均值所掩盖的长尾延迟。

离线运行的重要性也不止体现在偏远地点。工厂可能为安全起见隔离生产网络。医院可能限制向外部传输数据,农场和施工现场则常常缺乏可靠连接。

隐私进一步强化了相同的架构压力。机器人可能收集视频、音频、空间地图、医疗信息以及来自私人住宅的观察数据。将每一条原始传感器流发送至远程服务,会扩大暴露面。

本地处理可在传输前丢弃不必要的信息。仓储机器人或许可以发送简洁的异常报告,而不是持续上传工作人员周边环境的视频。

带宽构成另一项限制。多台摄像头、麦克风、深度传感器和激光雷达系统能够生成连续数据流。在数据中心开始推理工作之前,上传全部数据就可能耗尽网络容量。

设备端过滤让机器人可以决定哪些观察结果值得提交远程分析。它可以将常规导航保留在本地,并通过选定图像、状态摘要或压缩上下文升级处理陌生情况。

能耗使情况更复杂。本地计算会消耗电池电量并产生热量,但无线传输同样需要能耗。哪种方案更优取决于无线条件、工作负载规模和可用加速器。

安全性使这不再只是基础设施优化问题。当云端连接消失时,机器人仍应保持可控。这一要求将关键反射能力、运行限制和后备行为推向机器本体。

云端仍可为机器人提供建议,但不应成为唯一能够让它停下来的组件。

因此,对 NVIDIA 机器人推理而言,机会是明确的。即使更大的远程模型处理审慎推理工作,机载处理器也可掌控时间敏感的路径。

数据中心仍占据智能能力上限

本地芯片提升了机器人的响应能力,但当任务需要规模、内存或共享计算时,数据中心仍保有决定性优势。

机器人计算机运行在严格限制之下。它的内存、散热能力、电池续航、物理空间和制造成本都有限。增加一种资源往往会加剧另一项约束。

数据中心可以将一个模型分布到多个加速器上。高速互连使这些加速器能够共享无法装入单台机器人的参数和中间数据。

这种差异设定了智能能力上限。紧凑型模型或许能够处理常见物体和熟悉指令,而远程模型可以借助更广泛的知识和更长的上下文审视罕见情况。

模型规模并非衡量能力的完美指标。针对狭窄任务优化时,较小系统可以优于较大系统。不过,大型远程模型对于陌生请求、多步骤规划和广泛世界知识仍然很有价值。

数据中心还受益于批处理。批处理将来自多个用户或机器的请求组合起来,使昂贵的加速器能够更高效地处理它们。

SemiAnalysis 描述了由此产生的推理权衡:系统吞吐量与单个用户交互性之间的取舍。大批量处理可提高硬件利用率,而较小批量通常能为每位用户提供更快响应。

单台机器人无法复制这种经济性。其处理器可能在常规运行期间处于利用不足状态,却仍需具备应对最苛刻本地时刻的充足能力。

集中式基础设施可在整个机群中汇聚这类需求。一个远程集群能够服务许多机器人,而它们的困难请求会在不同时间到来。

数据中心中的更新也更简单。运营方可一次部署新模型、监控其行为,并在无需接触每台机器的情况下回滚。

本地模型则需要分发管线。团队必须管理硬件差异、存储限制、固件兼容性、版本追踪和安装过程中的故障。

机群学习同样有利于集中化。当一台机器人遇到不寻常的包裹、工具或房间布局时,共享服务可将这一案例纳入其他机器人的能力体系。

训练则更坚定地属于集中式基础设施。NVIDIA 描述了一种三计算机架构,将训练、仿真和机载执行分离开来。

在该模型中,DGX 系统训练 AI,服务器生成模拟经验,Jetson 计算机则在机器人内部执行选定能力。该架构按照工作在物理和计算层面的需求分配任务。

这种分工说明,为何纯边缘的叙事并不完整。机器人智能依赖于一条用于创建、测试、部署、观察和更新模型的管线。

数据中心不只是回答实时请求的遥远大脑。它也是机器人本地大脑得以构建和改进的工坊。

远程推理在这条管线中仍有价值。机器人可以请求更大的模型来解释陌生指令、比较多个方案,或搜索广泛的技术知识库。

响应不必直接控制电机。它可以提供由本地系统在当前安全约束下验证并执行的方案。

这种区分可保护机器人免受延迟或不恰当指令的影响,同时保留对无法装入机载端能力的访问。

制胜架构将反射能力与推理分开

实际可行的答案是一种层级结构:本地系统控制即时行为,远程系统处理高成本推理和全机群学习。

开发者已经在机器人领域使用层级控制。快速组件负责稳定性和运动,而较慢的组件选择目标和动作序列。

生成式 AI 扩展了这一结构,而不是取而代之。VLA 模型可以将指令与动作连接起来,但它仍与控制器、安全监控器、感知系统和规划器协同运行。

最安全的边界取决于紧迫性。具有严格截止时间的计算应留在本地。能够容忍延迟的任务,则可在远程处理能力更强时移交数据中心。

配送机器人提供了一个很好的例子。本地系统应能在没有互联网连接的情况下识别行人、沿路缘行驶、避开障碍物并保持平衡。

远程系统可以解读新的配送指令、重新规划路线,或评估陌生建筑的入口。随后,机器人可根据本地条件核查该方案。

工业机器人也呈现出类似的分工。机载处理可在装配过程中检查零件并修正动作。中央服务则可分析多个设施之间的生产模式。

人形机器人让这条边界更具挑战,因为它们的任务更难预测。它们既需要快速的全身控制,用户也可能要求它们完成漫长且新颖的操作序列。

Google 最初的 Gemini Robotics research 描述了旨在跨任务和机器人形态泛化的模型。泛化能力很重要,但实验室评估无法覆盖每一种部署条件。

混合架构为升级处理留出了空间。当置信度低于阈值时,机器人可以停止、请求协助,或将选定上下文发送给能力更强的远程模型。

仅靠置信度还不够。学习型模型可能依然会自信地犯错,因此系统还需要明确的运行限制和独立检查。

远程服务应返回结构化意图,而不是不受限制的执行器指令。例如,它可以提出“将蓝色容器放到第三层货架上”这样的目标。

如果货架被堵塞、物体不稳定,或有人进入工作区域,本地规划软件可以拒绝该目标。

这种设计让数据中心成为顾问,而不是操纵者。它保留了集中式智能,同时避免将网络可靠性置于每一个控制回路之中。

工作负载路由成为核心产品能力。系统必须判断哪种模型能够在时间、能耗、隐私和安全预算内解决每个请求。

简单请求可以留在机载端。复杂请求可使用远程推理,而敏感请求即使本地结果能力较弱,也可能必须在本地处理。

缓存可以减少重复的云端调用。机器人可为新任务获取远程指导,然后存储紧凑策略以供日后使用。

车队运营方也可安排非紧急分析。已完成任务的日志可以在安全时段上传,使数据中心模型能够识别故障而不影响实时行为。

这种方法类似于将本地应用与云服务结合的计算架构。机器人技术的风险更高,因为结果会改变实体物体和共享环境。

NVIDIA 的优势在于同时供应这种分工的两端。其数据中心加速器支持模型开发和远程推理,而 Jetson 则在边缘端运行选定工作负载。

这一定位也会为客户带来张力。纵向整合的技术栈可以简化开发,但也可能增加对单一供应商硬件、软件和模型工具的依赖。

Google 通过模型和云服务切入这一问题,而机器人制造商掌握最终硬件集成。其他芯片厂商则可以凭借更低功耗或更开放的部署选项展开竞争。

真正重要的竞争,不是谁宣称自己是机器人的大脑,而是哪一套技术栈能在层级之间迁移工作负载,同时不牺牲延迟、安全性或经济性。

设备端 AI 的宣称没有说明什么

供应商规格证明更多计算能力可以装进机器人,但并不能证明其在不受控环境中具备可靠的自主能力。

峰值吞吐量数字很少能描述完整的已部署系统。真实机器人必须在摄像头、传感器、网络、规划、日志记录和安全功能之间分配资源。

宣传的精度同样重要。FP4 性能代表低精度计算,但部分模型或操作需要更高精度。它们的有效吞吐量可能与宣传的头条数字不同。

内存容量也不等于可用模型容量。操作系统、感知管线、缓存和并发应用都会占用部分可用空间。

热量会降低持续性能。处理器可能短暂达到峰值,随后因散热无法从紧凑外壳中带走足够热量而降速。

依靠电池供电的机器人还面临另一项权衡。更多机载推理可以减少对网络的依赖,但持续使用加速器可能缩短运行时间,或要求配备更大的电池。

模型压缩也会带来自身风险。量化会减少模型权重所使用的比特数,让模型更小、更快。

然而,压缩可能造成不均衡的性能下降。罕见物体、细微视觉细节或异常指令所受影响,可能大于常见基准任务。

实验室演示通常在受控任务集合内运行。商业部署则会遇到眩光、灰尘、噪音、损坏物体、拥挤空间,以及表达请求方式难以预测的用户。

通用模型仍可能在其训练分布的边缘失效。关键问题并不是它是否完成了一场精心打磨的演示。

运营方需要长期部署中的故障率数据。他们还需要了解恢复行为、人工干预频率,以及硬件温度稳定后的性能。

远程推理也面临类似缺口。更大的模型可以生成更好的计划,但仍可能受到过时传感器信息或模糊指令的影响。

云端可用性统计同样无法反映每一台机器人的连接质量。服务可以保持运行,而某台机器却可能在电梯内或金属墙体设施中失去本地覆盖。

安全性是一把双刃剑。本地处理减少了数据传输,但把有价值的模型和运行记录放在设备上,也形成了物理攻击目标。

攻击者可能盗取机器人、检查其存储内容,或利用未修补的本地服务。集中式系统更易更新,尽管一次入侵可能影响更大的机器人车队。

混合系统继承了两种攻击面。它们需要设备认证、加密通信、签名模型更新、访问控制,以及明确的离线运行规则。

供应商锁定同样值得审视。一家机器人公司可能围绕某一种加速器、运行时和部署工具链优化模型。

更换供应商随后可能需要模型转换、性能重新测试和新的安全验证。这些成本可能贯穿机器人的整个商业生命周期。

NVIDIA 表示,其 physical AI stack 将 Jetson Thor 与 Isaac 机器人软件及相关传感器处理工具连接起来。客户必须判断,这种整合是否值得为依赖性付出代价。

Google DeepMind 的设备端发布还带来了另一项不确定性:可获得性。早期或受信任测试者计划可以展示技术方向,但并不能证明已广泛投入生产使用。

无论是令人印象深刻的硬件,还是能力强大的 VLA,都无法解决责任归属问题。当混合机器人发生故障时,调查人员必须确定是设备、网络、远程模型还是路由策略导致了错误。

这一诊断挑战将影响保险、采购和监管。买方将要求日志能够重建每个组件观察到的内容及其做出的决策。

最强的部署不会用一个单一的自主性评分掩盖这种复杂性。它们会分别衡量本地行为、云端升级和人工干预。

三个信号将揭示机器人真正在哪里思考

下一阶段将由已部署系统的行为决定,而不是又一轮峰值算力公告。

第一个信号是无需远程推理即可完成的机器人任务占比。供应商应披露机器升级处理的频率、这些升级耗时多久,以及断开连接时会发生什么。

本地完成率上升,将加强 NVIDIA 机器人推理及其他边缘平台的论据。这表明机载系统能够处理的不只是紧急反射动作。

但该指标需要稳定的任务定义。一台在本地处理较简单任务的机器人,并不一定优于把更难问题发送到云端的机器人。

第二个信号是在真实功耗和散热限制下的持续性能。买方需要看到完整机器人连续运行多个班次的结果,而不是孤立处理器进行短时测试的结果。

如果 Jetson Thor 和竞争系统能够持续运行多个模型,且不会带来不可接受的发热或电池代价,更多规划将迁移到机器上。持续限频则会保留更大的云端角色。

第三个信号是生产级机器人车队架构的设计。应关注主要机器人制造商是否将本地优先运行、远程升级和可审计的回退行为作为明确产品功能推出。

清晰的层级结构将验证混合架构论点。一个暗中依赖持续连接的系统,则表明其最重要的智能依然存在于别处。

数据中心提供商同样有理由支持这种层级。他们可以销售更高价值的推理、车队分析、仿真和训练服务,而无需处理每一帧传感器数据。

当本地工作负载扩大时,边缘芯片厂商将受益。机器人制造商则能受益于为每项任务选择成本最低且安全的执行位置。

客户在选择平台前应直接向供应商提问。哪些功能能在网络中断时继续运行?哪些数据会离开机器?每一项决策由哪个模型产生?

他们还应询问机器人如何拒绝过时的云端指令。几秒前生成的远程计划,可能已不再适合当前场景。

对开发者而言,核心设计任务已不再是选择单一推理位置,而是构建一个将延迟、置信度、隐私和安全视为一等约束的路由器。

知识工作者将通过办公室机器人、自主设备和观察物理空间的 AI 系统遇到同样的决策。数据位置对信任的影响,将与模型能力同样重要。

NVIDIA 机器人推理让本地优先架构更具可行性,但并未决定更大范围的竞争。数据中心仍提供最大的模型和共享学习闭环。

因此,更好的问题不是机器人在哪里思考,而是哪些思考必须立刻发生,哪些需要更大规模,以及当二者意见不一致时,谁仍然负责。

 
 

免费开始使用

一款本地优先的AI助手

为了获得更好的人工智能体验,

remio 目前仅支持Windows 10+ (x64)和M-Chip Mac 。

你的 AI 工作伙伴

和 remio 一起高效工作

规划、创作、交付

一站式完成

bottom of page