NVIDIA 机器人推理已超出机器人的承载能力
尽管 Jetson Thor 能在 40 至 130 瓦的功耗范围内提供 2,070 FP4 TFLOPS,NVIDIA 机器人推理如今仍面临一道明确的分界线。快速控制依然必须留在机载端;然而,规模最大的推理模型越来越需要数据中心 GPU、共享内存以及移动机器人无法携带的散热能力。
这种分化改变了机器人领域的核心问题。问题不再是本地推理还是远程推理能在所有场景中胜出,而是哪些决策必须留在机器内部,哪些决策可以跨越网络传输而不损害机器的可靠性。
SemiAnalysis 于 9 月 14 日发布的一份机器人推理分析,以异常具体的方式说明了其中的经济账。其复现的基准测试显示,一块 B300 可在 500 毫秒的动作块截止时间内服务 12 台机器人。但这些节省依赖于批处理、利用率、可预测的流量,以及大多数建筑目前并不具备的无线网络基础设施。
Boston Dynamics 代表了这条分界线的一端。其报道所述的架构将 Atlas 的运动控制置于 Jetson Thor 上,同时通过其 Orbit 平台将更高层级的规划发送至 Google 基础设施。其他开发者则将从感知到动作的完整技术栈保留在本地,接受较小的模型,以避免对无线连接的依赖。
结果并非一场简单的边缘计算与云计算之争,而是集中式智能与运营确定性之间的较量。数据中心可以让更大的模型在整个机群中变得更经济;但当连接停滞时,机器人仍必须保持安全。
机器人智能正分离为两套系统
重要变化在于架构:机器人的推理与运动不再需要在同一地点运行。
通用机器人会以截然不同的速度执行多类计算。底层安全与伺服控制环路负责估计状态、维持平衡,并向执行器发出指令。这些环路每秒可运行数百次。
在 100 赫兹下,下一次输出必须在 10 毫秒内到达。即使是普通的无线网络往返,也可能在推理开始前耗尽整个时间窗口。因此,底层控制不能依赖远程 GPU。
动作层同样受到严格的时序要求约束。视觉-语言-动作模型,即 VLA,会将图像和简短指令转化为物理动作。语言响应迟到或许令人烦躁,但随着场景变化,迟到的电机指令可能已经失效。
规划则运行在更慢的时钟上。规划器可能会解读一张工单,将其拆分为多个子任务,并向运动策略发送简洁指令。如果它以 5 赫兹运行,每次决策便拥有 200 毫秒的时间窗口。
更宽裕的预算为离机推理创造了空间。规划器可以使用更大的模型、更深的上下文以及数据中心级内存,而本地策略负责即时运动。即便高层推理耗时更长,机器人仍能保持物理上的响应能力。
SemiAnalysis 报道称,Boston Dynamics 为 Atlas 采用了这种分层模式。其 System 1 层在 Jetson Thor 上处理视觉运动控制;System 2 则通过 Orbit 和 Google 的基础设施远程执行规划。
一张制造工单可能要求 Atlas 完成某项工作,并将结果放入特定库存箱。System 2 会将这一抽象请求转换为 System 1 可执行的更小指令。
这种转换还可包含视觉引导。远程规划器可能会在机器人的视野中用标记识别正确的箱位。本地 VLA 随后便会获得一条与可见物体相关联的具体指令。
据报道,System 2 还会监督执行过程。它观察进展,并在底层策略行为异常时进行检测。这一职责需要比偶发任务请求更频繁的通信。
SemiAnalysis 表示,实际假设的频率可以从每 10 秒一次查询,到每秒一两次查询不等。这样的频率让网络直接进入运营工作流之中。
这种架构提供了一种务实的折中方案。Atlas 不必等待一个同时结合前沿推理能力与嵌入式效率的单一模型。Boston Dynamics 可以将确定性控制环路保留在本地,同时远程调用更强大的规划能力。
这种折中也确立了本文的核心冲突。每增加一次远程决策,机器人的智能就会扩展一步,但也会多出一个连接中断并打断有效工作的时刻。
另一种选择是完全本地执行。专注于较窄范围仓储、制造或家庭任务的公司,可以围绕受限环境训练更小的策略。这些系统牺牲部分通用性,以从执行路径中移除远程推理。
两条路线都无法彻底摆脱网络。本地智能机器人仍会上传训练数据、接收软件更新、上报机群遥测数据,或请求远程操控。区别在于,网络故障是否会中断当前动作。
这一差异比基准测试分数更重要。它区分了一台暂时失去机群服务的机器人,与一台暂时失去部分“大脑”访问能力的机器人。
NVIDIA 机器人推理正遭遇内存上限
Jetson Thor 抬高了嵌入式平台的上限,但模型增长速度快于移动平台能够承受的速度。
NVIDIA 将 Jetson Thor 定位为其面向物理 AI 的领先平台。已发布的 Jetson Thor 规格显示,它配备 128 GB 内存、每秒 273 GB 的内存带宽,以及 2,070 FP4 TFLOPS。
该模块可在 40 至 130 瓦之间运行。NVIDIA 称,其性能为 AGX Orin 的 7.5 倍,能效为其 3.5 倍。这些是公司自身对比,并非独立部署结果。
对于机器人而言,这一功耗范围意义重大。移动平台必须在运动、传感器、执行器、通信与计算之间分配电池电量。散热硬件同样会占用空间和能源。
数据中心 B300 则属于另一类物理形态。它专为机架式系统设计,拥有高容量内存、高密度供电与液冷条件。它无需面对步行机器人的重量、振动或热限制。
差异并不只是原始算力。大型模型会反复在内存中移动参数和中间数据。内存容量决定模型是否放得下,而带宽决定其生成答案的速度。
Jetson Thor 搭载的内存多于前代产品。Xavier 使用 32 GB,AGX Orin 达到 64 GB,Thor 则将这一数字翻倍至 128 GB。
机器人模型仍远小于最大的语言模型,但它们正在扩张。SemiAnalysis 提到,通用策略模型的规模约从 30 亿到 140 亿参数不等。架构、精度、上下文和运行时设计使参数数量成为不完美的比较指标。
一些当前系统已经超出嵌入式模块的实际承载范围。NVIDIA 的 DreamZero 是一个围绕视频扩散构建的 140 亿参数世界动作模型。SemiAnalysis 报道称,实时运行需要两块离机 GB200 GPU。
NVIDIA 的另一项目 RoboTTT 则指向相反方向。它采用带测试时训练的小型策略,在运行期间更新临时权重。据报道,这种设计能够提供更长的可用上下文,同时仍足够小,可部署在机载端。
这些形成对比的项目说明,NVIDIA 机器人推理不能被简化为单一路线图。更好的芯片推动开发者将更多智能迁至本地;更大的模型又会消耗这些收益,并重新强化卸载计算的理由。
这种压力同样延伸至半导体供应链。Jetson 产品与数据中心加速器越来越依赖领先制程节点。每台配备专用高端计算能力的机器人,都会永久占用一份硅片与内存资源。
共享数据中心推理改变了这种分配方式。同一块加速器可以服务在不同时间发出请求的多台机器人。当单台机器长时间等待,或在不调用最大模型的情况下移动时,这种资源池化尤其有吸引力。
SemiAnalysis 估计,共享 GPU 的硅效率交叉点约在每块 GPU 服务 7 台机器人附近;其内存估算的交叉点则约为每块 GPU 服务 5 台机器人。这些数字取决于其模型、工作负载和硬件假设。
方向比精确的交叉点更重要。专用计算提供可预测的资源归属,而共享计算能从昂贵的硅片中榨取更多工作量。机群规模会放大这种差异。
嵌入式硬件的使用环境也很严苛。它会振动、承受冲击、接触灰尘,有时还需要在液体或温度波动环境中运行。数据中心加速器则位于受控机架中,并由专门维护体系支持。
机载设备的更换影响的不只是计算预算。维修模块可能使整台机器人退出运行。一块故障服务器 GPU 可以被隔离,而其他机器仍可继续使用集群中剩余的资源。
但数据中心并不会消除本地硬件的必要性。每台机器人仍需要足够的计算能力来支持感知、安全与回退行为。卸载计算改变的是容量目标,并不会让机器人变成远程控制的外壳。
这正是 Jetson Thor 与 B300 并非直接替代品的原因。Thor 在移动功耗范围内提供有边界的本地自主能力;当工作负载和网络条件允许时,B300 则提供池化的推理容量。
B300 的经济性取决于繁忙的机群
共享 B300 的吸引力来自许多机器人让它持续繁忙,而不只是因为芯片更快。
由于公开代码和模型权重尚不可得,SemiAnalysis 复现了一个类似 NVIDIA RoboTTT 的工作负载。该复现匹配的是论文的计算与内存特征,而非其任务准确率。
这一限制至关重要。该基准衡量的是服务代表性工作负载的成本,并不能证明复现系统在机器人任务上的表现与未公开模型同样出色。
测试在 32 个动作头模块中插入了 16 个测试时训练模块。每台机器人还携带 151 MB 临时快速权重状态。服务器必须围绕批处理调用收集并重新分发这些状态。
据报道,在这些条件下,一块 B300 能在 500 毫秒的动作块截止时间内支撑 12 台机器人。一台 RTX 6000 Pro Server Edition 可支撑 4 台。该比较采用高分位延迟标准,因此较慢的响应比平均值更重要。
随后,SemiAnalysis 对服务 96 台机器人的三种部署方案进行了建模。一种将 B300 容量置于数据中心,另一种使用 RTX 服务器,第三种则为每台机器人安装 Jetson Thor 硬件。
在利用率调整之前,Jetson Thor 仍具竞争力。该分析计算得出,Thor 与 B300 每单位密集 FP4 算力的每小时成本几乎相近。在这一特定工作负载下,RTX 硬件的表现相对不利。
利用率改变了结果。服务器可以在整个机群中汇聚需求,并在全天处理来自不同机器人的工作。机载模块则始终绑定于一台机器,即使该机器人正在充电、等待或执行轻量任务。
该模型假设 B300 利用率约为 90%,机载 Thor 模块的利用率约为 40%。经过这一调整后,B300 每单位密集 FP4 算力的成本降至 Thor 对应数值的约 46%。
家庭部署进一步拉大了模型中的差距。SemiAnalysis 报告称,某家公司已部署的家用机器人目前每天仅工作一到两小时。这大约只占全天时间的 4% 到 8%。
据报道,该公司预计随着能力提升,使用时长将增加至每天四到五小时。即便如此,家务本身也构成天然上限。机器人不会持续不断地接到家庭任务队列。
工业机器人可以工作更长时间。SemiAnalysis 援引 Figure 在 BMW 的部署数据称,约 11 个月内累计运行约 1,250 小时。据报道,这些机器每天工作约 10 小时,利用率约为 40%。
这些观察结果解释了资源池化的优势。一块数据中心 GPU 可以服务于跨班次、跨地点或跨时区的机器人。一个部署中闲置的容量可以承接另一个部署的需求。
该模型发现,当每块 GPU 服务约五台工业机器人时,B300 的经济性开始占优。低于这一水平,专用服务器可能成为另一项利用不足的资本资产。
这正是 Jetson Thor 与 B300 总拥有成本比较背后的关键限定条件。B300 并不会仅仅因为放在服务器机房里就变得经济。它需要足够协调的需求,才能摊销机架、网络、电力和支持系统的成本。
云租赁可以降低小规模部署的风险,但也会引入独立变量。运营方必须考虑服务商利润率、区域容量、数据传输和服务可用性。SemiAnalysis 建模的是自建自营的经济性,而不是普通云租赁合同。
高密度 FP4 算力同样不是完整的商业指标。机器人买方付费购买的是成功完成的任务、可预测的班次以及可恢复的故障处理。如果网络中断降低吞吐量或需要人工介入,低成本计算的价值就有限。
同样的警示也适用于本地推理。一个满负荷运行的机载模块在纸面上可能显得高效,但它可能消耗原本用于有效移动的电池容量。更大的电池会增加重量,而这又可能提高移动所需的能耗。
因此,机器人集群运营方需要进行工作负载层面的比较。相关单位可能是完成的拣选次数、成功的装配步骤,或自主运行小时数。硬件吞吐量只是其中一个输入。
B300 的经济性给构建通用型机器人集群的公司带来压力。一旦部署达到足够密度,仅依赖本地的架构可能会让昂贵的算力被困在间歇使用的机器中。
反过来,远程优先的开发者也面临压力。他们必须证明,资源池化的节省能够经受真实建筑环境、真实无线电干扰和高分位延迟的考验。否则,理论上的利用率就会变成运营停机时间。
网络壁垒本质上是尾延迟问题
平均网络速度可能看起来可以接受,但罕见的延迟足以让远程机器人推理变得不安全或无法使用。
固定延迟通常是可管理的。系统可以估计场景将如何变化,并提前规划。通常被称为抖动的可变延迟,则会让机器人无法知道下一次更新何时到达。
破坏性最大的事件可能是偶尔出现的一秒延迟尖峰。仪表盘可以容忍它,但正在抓取部件、接近人员或恢复平衡的机器人,无法将其视为无害。
Microsoft Research 在其 2026 年的机器人任务卸载研究中得出了类似结论。研究人员测试了机载、边缘和云 GPU 平台上的移动操作工作负载。
研究发现,较小的机载 GPU 无法运行完整的工作负载栈。较大的机载 GPU 会将续航时间缩短数小时。任务卸载缓解了这些限制,但额外的网络延迟会降低任务准确性。
带宽形成了另一道障碍。将机器人观测数据发送至远程模型可能需要持续的上行传输。这种流量模式不同于面向相对静止设备、优先保障下载的消费级互联网服务。
机器人一边移动,一边上传摄像头视频流和传感器数据。其金属机身可能阻挡或反射无线电信号。电机和附近设备会引入电磁噪声,而朝向也会持续改变天线几何关系。
工厂还会增加密集货架、移动库存、机械设备和多个接入点。安装期间可用的连接,可能会在设备移动或另一台机器启动后恶化。
家庭环境则呈现不同的不确定性。墙壁会形成信号薄弱区域,消费级路由器的覆盖并不均匀,邻近用户还会竞争共享容量。家用机器人只需进入另一个房间,就可能抵达信号盲区。
接入点之间的切换尤其危险。SemiAnalysis 表示,普通路由器在切换期间可能会中断流量 100 毫秒至数秒。恢复连接还可能需要额外时间。
这些故障无法通过简单平均值体现。即使网络在 99 次请求中响应很快,只要第 100 次在机器人的截止时间之后到达,仍可能不可接受。
因此,在每次部署评估中,高分位延迟都应与模型准确性和硬件吞吐量并列。开发者需要衡量在运营上具有意义的最慢响应,而不仅仅是中位性能。
这篇Microsoft 测量论文得出结论:没有任何单一部署策略能够适用于所有场景。性能、带宽、能耗、延迟、货币成本和共享资源争用相互作用。
这些证据削弱了“机器人将全面迁移至数据中心”的任何说法。远程推理仅适用于其截止时间能够吸收网络波动的工作负载。安全关键闭环仍需要本地执行和明确的回退行为。
远程规划还可能引发数据治理问题。机器人摄像头可能拍摄到生产方法、员工、客户财产或住宅内部活动。将这些画面发送到场外会扩大安全边界。
SemiAnalysis 报告称,Boston Dynamics 为客户提供对共享数据的细粒度控制。Orbit 已获得 SOC 2 Type 2 认证,而 Google 基础设施则承载远程推理层。
认证和合同控制能够处理治理问题,但无法满足所有部署需求。军事设施、核设施及其他受限环境,无论技术保障如何,都可能禁止将数据移出现场。
这一限制为本地边缘集群创造了持久市场。附近的服务器可以提供比机器人更大的容量,同时将数据保留在设施内部。它缩短了网络路径,但仍依赖本地无线网络的可靠性。
开发者也可以更谨慎地拆分模型。机器人可以压缩图像、选择相关帧,或传输中间特征,而不是持续传输原始视频。每种技术都能降低带宽需求,但会增加本地计算量和系统复杂度。
冗余链路提供了另一种选择。机器人可以使用多个 Wi-Fi 频段,或将 Wi-Fi 与专用 5G 结合。重复传输可以提升可靠性,但额外的无线电设备会消耗电力,并需要协调调度。
审慎的结论很直接。数据中心推理具备可信的经济性和能力优势,但没有公开基准证明普通网络能够在所有场景下提供其所需的可靠性。
在部署方公布故障分布、人工干预率和已完成任务指标之前,总拥有成本比较仍是有条件的。网络是推理系统的一部分,而不是独立的公用设施。
机器人网络必须围绕上行流量设计
设备外推理需要从机器人摄像头到数据中心 GPU 的专用调度机制。
大多数无线基础设施假定用户下载的信息多于上传。机器人推理颠倒了这一模式。摄像头会持续生成观测数据,必须先上传,模型才能作出响应。
提高标称带宽无法解决全部问题。多台机器人可能同时传输,从而产生排队和冲突。即使是高容量信道,若缺乏接入控制和可预测的调度,仍会产生抖动。
具备机器人感知能力的接入点可以为每台机器预留周期性上行时隙。机器人无需争抢空中传输时间,而是在规定节奏下发送观测数据。其他流量则使用剩余容量。
这一调度必须理解模型的时间要求。每隔数秒调用一次的远程规划器,需要与每秒处理多帧的策略不同的资源预留。网络配置与推理设计因此变得相互耦合。
位置感知波束成形可以围绕移动机器提前准备无线覆盖。网络将利用位置和计划运动来引导信号,或在现有连接恶化之前发起切换。
集中式时序同样重要。只有来自多台机器人的请求在时间上足够接近、能够一起运行时,批处理才能带来数据中心节省。随机到达时间会迫使服务器等待或处理更小的批次。
共享时钟可以协调采集、编码、传输和推理。服务器将知道下一组观测数据何时应到达,并为其预留 GPU 容量。
迟到的观测数据不应无限期滞留在普通队列中。它们可能应归入下一批次,或者本地系统需要将其丢弃。过时帧可能比缺失帧更危险。
NVIDIA 的数据中心平台展示了服务器端已经发展到何种程度。一套 GB300 NVL72 system 在一个液冷机架中整合了 72 块 Blackwell Ultra GPU 和 36 颗 Grace CPU。
NVIDIA 列出了 20 TB 的 GPU 总内存和每秒 130 TB 的 NVLink 带宽。其 ConnectX-8 设计为每块 GPU 提供了充足的网络容量。这些指标描述的是一座集成式 AI 工厂,而非传统边缘设备。
因此,机架内部的数据中心网络只是整个路径的一部分。机器人流量在抵达加速器之前,仍必须穿过无线电链路、接入点、设施网络、广域连接和服务商边界。
每个边界都会增加一个队列或故障域。运营方需要端到端服务等级,而不是孤立的硬件宣称。快速 GPU 无法挽回已经在不可预测上行链路中损失的时间。
专用 5G 可以帮助覆盖户外路线或大型工业场地。Wi-Fi 则可在家庭和许多工厂中提供较高的本地容量。但两种技术都不会自动提供确定性行为。
最强的架构很可能会结合多种链路。调度器可以在本地条件良好时选择 Wi-Fi,故障时切换到蜂窝网络,并始终保持一个最小化的本地策略处于活动状态。
感知层面的变化还能进一步减少流量。机器人可以裁剪相关区域、在稳定阶段降低帧率,或编码任务专用特征。目标是传输有用信息,而不是每一个可用像素。
这些优化也会引入自身风险。如果本地过滤器丢弃了重要内容,远程模型便永远无法看到它。开发者必须针对不常见物体、光照、遮挡和故障情况,验证压缩与选择策略。
模型还可以调整请求频率。简单操作可以完全在机载端运行,而陌生场景则触发远程协助。这种级联机制将昂贵的推理集中到最能带来收益的地方。
这类系统模糊了设备端与数据中心推理之间的边界。部署位置变得动态,而非永久固定。机器人会根据风险、可用带宽、模型置信度和任务复杂度选择路径。
这种灵活性很有吸引力,但也让验证变得更加困难。工程师必须测试更多运行模式和状态转换。当远程请求成功发起、却在完成前连接中断时,系统需要有明确的行为机制。
本地回退机制应在不假装保留完整能力的前提下维持安全。机器人可以暂停、将物体安全放下、撤离,或请求人工协助。继续遵循过时的远程指引则会带来另一种风险。
因此,网络壁垒既是工程边界,也是产品边界。解决这一问题的开发者将获得接入共享智能的能力。客户则必须决定,为获得这一收益愿意部署多少基础设施。
部署正在拉开通才与专才的差距
工作越多样化,远程推理的理由就越充分;而受限任务则更适合较小的本地策略。
工厂中既有可预测的重复性工作,也有难以消除的变化。传统自动化在环境、零件和运动保持稳定时效果很好;当产品组合和操作指令频繁变化时,其成本便会迅速上升。
SemiAnalysis 指出,一辆汽车可能包含数万个零件。一条生产线可以处理五到十种车型,且覆盖多种颜色。每年车型更新还会迫使产线进行额外重构。
通用人形机器人必须理解这些不断变化的条件,而不是重复执行一条固定轨迹。这一要求提升了大型规划模型、长上下文和集中式更新的价值。
Boston Dynamics 似乎愿意为这种更广泛的能力接受网络依赖。其本地 System 1 仍负责运动,而远程 System 2 则负责指令、翻译和监督。
专用型部署做出了另一种取舍。仓储拣选、包装或有限装配等任务的范围可以足够狭窄,以至于数十亿参数规模的模型便可胜任。完整执行策略随后即可部署在 Jetson 级或源自工作站的硬件上。
本地执行能够提升隐私保护和故障隔离能力,也简化了客户的网络要求。当外部服务无法访问时,部署系统仍可继续运行。
然而,专用模型可能遭遇能力上限。从单一产品系列扩展至开放式工作,可能需要额外模型、重新训练或更多远程辅助。本地确定性可能成为泛化能力的限制。
家庭机器人面临一种不同寻常的组合。其家务任务多样,适合采用更大的推理模型;其网络和物理布局又不可控,因此更适合机载推理。
服务提供商无法重新设计每位客户的路由器摆放位置,也不能假设用户会部署私有蜂窝网络。机器必须适应信号盲区、网络拥塞和共享宽带环境。
自动驾驶汽车属于最明确的本地优先类别。它们行驶范围极广,无线电条件不可控,响应时限也极为严格。其安全关键型感知和控制无法等待数据中心推理。
远程服务仍可支持地图、车队分析、训练和软件分发。这些功能不处于即时的感知到行动闭环之中。连接能力可以改进产品,但不会成为安全控制的唯一来源。
这一模式表明,NVIDIA 机器人推理将分布在多个层级。Jetson 级模块将保障实时自主性;本地边缘服务器将处理敏感或特定场地的推理;大型数据中心则提供最重的共享模型。
商业竞争将不仅关乎芯片,也同样关乎编排。必须有人为每项请求进行路由、监控延迟、同步机器人集群、保护数据,并决定何时本地能力已经足够。
机器人制造商可以掌握这一完整层级。云服务商可以将其作为托管基础设施销售。网络设备供应商则可以将面向机器人的调度能力构建到接入点和私有蜂窝系统中。
NVIDIA 还具备一项优势,因为它同时供应嵌入式硬件和数据中心硬件。共享的软件栈能够让开发者在 Thor、工作站 GPU 和 B300 服务器之间迁移工作负载,而无需重建每个组件。
这一优势并非自动形成。不同硬件目标仍会带来量化、内存、散热和调度方面的限制。在服务器上完成验证的策略,经过针对嵌入式设备的优化后,行为可能有所不同。
因此,竞争将围绕部署证据展开。买家需要看到真实负载下的任务成功表现,而非孤立的模型演示。他们还需要了解连接质量下降时系统的透明行为。
最可信的供应商将报告人工干预率、网络故障恢复情况、有效工作时长、能源消耗和完成任务数。这些指标将模型智能与商业价值联系起来。
正是在这里,通才与专才的分野变得切实可见。如果通用系统能够替代许多专用系统,它们就足以证明部署更多基础设施的合理性;如果专用系统能可靠完成一项高价值任务,本地部署的简洁性就具有充分理由。
获胜的架构可以因场地而异。拥有数十台机器人的受控工厂具备很强的资源池化经济性。网络连接薄弱的偏远工地则可能更适合完全本地执行,即便采用的模型更小。
三项信号将决定机器人在哪里思考
下一阶段将由部署证据、车队利用率和网络可靠性决定,而不是又一次峰值算力公告。
第一个信号是来自生产车队的独立延迟数据。供应商应披露高分位响应时间、交接中断、请求丢失率,以及跨完整班次的恢复行为。
稳定的尾延迟将增强远程规划的合理性。即使平均响应时间和服务器吞吐量表现出色,频繁暂停或人工干预也会削弱这一论点。
第二个信号是 B300 在多个机器人车队中的实际利用率。SemiAnalysis 以约 90% 的服务器利用率建模,而这驱动了预测经济优势中的很大一部分。
运营方必须证明,需求是否真的能够以这一水平被池化。机器人请求可能过于同步、因任务而变化,或在早期部署阶段过于稀疏。
在任务延迟稳定的前提下,持续高利用率将支持共享数据中心的论点。集群利用不足则会使经济性拐点转向本地推理和更小的现场服务器。
第三个信号是在 Jetson Thor 性能边界内的模型能力。RoboTTT 表明,架构和测试时自适应能够在不依赖超大模型的情况下提供更长上下文。
如果较小的本地策略接近远程推理质量,网络依赖就更难以证明其合理性。如果能力仍持续随模型规模和内存增长而提升,更多规划工作将转向共享加速器。
买家应要求供应商明确界定边界。哪些闭环保留在本地?哪些请求会离开现场?当连接变慢时会发生什么?机器人能够安全持续运行多久?
他们还应要求基于工作负载的经济性数据。每单位理论算力的成本无法体现任务完成情况、电池影响、人工干预或停机时间。有效自主工作时长提供了更有用的衡量分母。
开发者面临类似的设计选择。他们可以投入稀缺的工程资源来缩小模型,也可以构建可靠的分布式推理系统。大多数团队最终都会在两方面同时投入。
NVIDIA 的机器人推理如今覆盖了这一完整选择范围。Jetson Thor 让复杂的本地控制变得可行,B300 则让车队规模下的共享推理具备吸引力。尚未解决的部分,是连接两者的路径。
正在形成的答案是分层的,而非绝对的。将安全、运动和回退策略保留在机器上;当网络和数据规则允许时,将较慢、更复杂的推理发送到外部。
这种设计并不能消除取舍,但能让取舍变得可见且可分配。每一项远程能力都需要一个截止期限、一项回退动作、一条数据边界和可衡量的经济收益。
对于评估物理 AI 的团队而言,眼下的问题不只是推理运行在哪里,而是当最大的大脑暂时无法连接时,每个层级是否仍然有用。



