Skild AI S1 机器人模型将机器人训练带入提示词时代
Skild AI 推出了 S1,这是一款仅接收一段视频演示后,就能尝试完成时长最长达 10 分钟的未见任务的机器人模型。Skild AI S1 机器人模型在执行前不会更新权重,也无需接受任务特定的后训练。这将机器人学习的核心问题,从工程师如何重新训练机器,转变为操作员能否只需向它展示新工作。
Skild 将这一过程称为上下文学习,即演示在不改变底层模型的情况下引导其行为。该公司表示,S1 能够在不同场景和机器人本体之间理解意图、物体和任务顺序。其公布的案例包括盆栽种植、冲煮咖啡、制作煎饼和组装套件。
真正重要的竞争并非 Skild 与某一家机器人制造商之间的较量,而是基于提示词的适应能力与既有实践之间的竞争:后者需要收集任务数据、微调策略,并验证每一次部署。NVIDIA 自己的 GR00T 平台仍支持针对特定机器人和环境进行后训练,而 Physical Intelligence 也通过其机器人模型追求广泛泛化能力。
Skild AI S1 机器人模型如何从一段视频中学习工作
S1 将录制的演示转化为临时任务规格,而非新的训练数据集。
操作员首先从人类视角录制任务。S1 会在其上下文窗口中接收这段视频,即单次执行会话期间可用的信息。随后,该策略会将演示中的目标和步骤映射到机器人、其摄像头视角以及面前的物体上。
这种转换至关重要,因为演示可能与机器人的实际处境不同。摄像机角度、场景布局、可用工具和物理本体无需完全一致。根据 Skild 详细介绍的 S1 research,预训练让该策略学会推断功能关系,而不是重放固定轨迹。
Skild 表示,在其首次发布中,所有示例均由相同的模型权重生成。每次演示后均未进行任务特定微调。该公司认为,这一区别正是 S1 与那些在处理新工作流程前需要额外训练的系统之间的本质差异。
最长的案例不止涉及孤立的抓取和放置动作,还包括持续最长 10 分钟、跨越数十个操作步骤的任务。这类工作要求机器人记住进度,以新顺序组合已知动作,并在操作出错时恢复。
盆栽种植是目前最清晰的案例。Skild 录制了一段演示,将其提供给 S1,并在 11 分钟内开始自主硬件执行。据一篇介绍此次合作的 NVIDIA account 称,这段时间涵盖了从录制提示到运行任务的全过程。
该公司还展示了执行结果与提示合理不同的案例。当演示中使用浇水壶、但现场只有杯子可用时,据称 S1 会选择杯子。当玻璃杯已接近满水时,系统只会补充剩余所需的水量。
另一段演示中,人类过早地把鸡蛋放下。Skild 表示,S1 通过受控动作完成了预期步骤,而非复现这一失误。这些示例表明,该模型将视频视为目标的证据,而不是逐帧执行的脚本。
这种理解将物理提示与传统模仿区分开来。只要机器人的身体、视角或周边环境与人类示例不同,字面复制就会失败。相反,S1 需要推断演示者希望达成的结果,以及在新场景中哪些动作仍切实可行。
这项主张意义重大,但其适用范围需要谨慎表述。Skild 展示的是经过筛选的演示和内部评估结果,而非覆盖各类工厂的完整独立评估。S1 超出这些条件后的泛化能力,仍属于该公司报告的结果。
不过,其运行模式是明确的。提示词在执行时携带任务特定信息,而模型权重保持固定。这种方法直接挑战了限制灵活工业自动化的高成本适应循环。
为什么物理提示对重新训练模式构成压力
如果视频提示能够稳定可靠地发挥作用,部署团队可将部分机器人编程工作从专家转移给一线操作员。
当产品、夹具和动作保持稳定时,传统工业自动化表现出色。工程师可以针对某一可重复的动作序列优化机器人,并用受控设备围绕其部署。当产品或布局频繁变化时,其经济性就会变得不那么有吸引力。
学习型机器人策略承诺提供更高灵活性,但通常仍保留着要求严苛的部署周期。团队需要从目标环境中收集演示数据,微调模型,测试更新后的策略,并在环境变化后重复这一过程。每一步都需要专业知识、设备访问权限和时间。
Skild 认为,中等复杂度的策略可能需要来自部署条件的数十或数百小时数据。即使是预训练模型,如果每个客户任务仍需要大规模后训练,其经济优势也会大幅削弱。
S1 将这种适应负担转移到了提示词中。了解流程的工作人员可以录制一段演示,然后要求现有策略对其进行理解。模型无需再次进行梯度更新——这通常是训练期间采用的数学调整方式。
Skild 估计,一段短视频提示可提供大致相当于约 380 个人工收集示例的效用。该公司表示,收集这些示例可能需要 50 到 100 小时。这两项数字均来自该公司,尚未获得独立验证。
其报告的性能差距也很显著。在 Skild 新的多步骤测试中,S1 的平均单步成功率约为 66%。对比系统的单步成功率约为 9%,差距超过七倍。
单步成功率并不等同于任务完成率。由许多相互依赖步骤构成的序列,只要任一动作出错便可能失败。因此,即便平均表现强劲,在长工作流程中也可能产生令人失望的完成率。
假设一项任务包含十个步骤,且每一步独立成功的概率均为 66%,那么完成全部步骤的概率仍会很低。现实结果不一定相互独立,但这个例子说明了为何这一指标需要结合背景理解。
恢复能力可能改变这一计算结果。能够发现物体放错位置并智能重试的机器人,比将每个错误视为最终结果的机器人更有价值。Skild 表示,S1 能在物体移动时作出调整并从错误中恢复,但尚未公布足够的运行细节,供外界进行广泛的可靠性比较。
商业压力落在任务特定的集成环节,而不只是在竞争性的基础模型上。系统集成商通常需要投入大量精力,将硬件和软件适配到一条产线。更快的提示能力会将价值转向可复用模型、验证系统和部署支持。
制造商仍需要安全控制和工艺认证。一段视频演示无法确定载荷限制、碰撞边界、卫生规范或产品公差。物理提示改变了任务传递给策略的方式,但并未消除工业工程的需求。
近期最具潜力的机会是难以通过固定编程应对的高混合度工作。这类环境变化足够频繁,使反复工程投入成本高昂,但其结构化程度仍足以支持监督。小批量装配、套件分装、食品制备和检验符合这一模式。
Skild 表示,目前已与超过 60 家付费部署客户合作。该公司称,在首次商业部署仅 10 个月后,其年度经常性收入运行率已达到 1 亿美元。其 commercial update 表示,操作业务约占收入的 90%,移动业务贡献其余部分。
这些数字由公司自行报告,对于机器人行业而言增长异常迅速。它们并未披露合同期限、客户集中度、部署利润率,或有多少收入依赖服务。不过,这些数据表明,Skild 正在付费运营场景中检验其技术主张,而不仅仅依靠实验室演示。
Skild S1 如何贯穿 NVIDIA 的 Physical AI 技术栈
尽管每项新任务无需后训练,S1 仍依赖完整的数据、仿真、训练和部署管线。
简洁的用户体验背后隐藏着大量前期准备。除非预训练已让模型接触过多样化的任务、场景、物体、失败案例和机器人本体,否则模型无法理解一次演示。一段视频提示降低的是训练后的适应工作,而非构建基础模型的成本。
Skild 表示,没有任何单一数据源能够同时提供硬件真实感、多样性和规模。遥操作机器人演示与部署硬件高度匹配,但必须由人们缓慢收集。人类视频丰富且多样,但不包含原生机器人动作。
仿真可以生成大量经验和罕见故障案例。其弱点在于仿真到现实的鸿沟,即虚拟接触、摩擦、照明或传感器行为与物理条件存在差异。S1 结合这些来源,而非将其中任何一种视为充分条件。
NVIDIA 基础设施连接了各个阶段。加速计算支持模型在仿真、人类视频、遥操作和获准使用的部署数据上进行训练。Cosmos 模型处理视频并帮助创建多样化训练输入,而 Cosmos Curator 支持标注、筛选和组织。
Omniverse 和 Isaac Sim 提供基于物理的虚拟环境。Skild 可以生成数据、测试边缘情况,并在将行为迁移至硬件前对其进行验证。这降低了在工厂车间通过实际试错学习每一种故障模式的成本和风险。
Isaac Lab 提供强化学习环境,策略可通过模拟交互和反馈得到改进。Newton 物理引擎模拟力、碰撞、压力和接触。Skild 和 NVIDIA 还在开发针对抓取和实体物体操作的 GPU 加速求解器。
Nsight 工具帮助工程师识别训练期间的计算瓶颈。TensorRT 优化推理,即运行训练后模型来选择动作的过程。低延迟至关重要,因为物理机器人必须在物体、人员和自身身体持续移动时作出响应。
这套基础设施也揭示了一个重要区别。Skild 在 NVIDIA 系统上训练 S1,但 S1 并非简单地改名后的 NVIDIA 机器人模型。Skild 拥有其策略和数据战略,而 NVIDIA 提供计算能力及广泛的开发工具集合。
NVIDIA 还通过 Isaac GR00T 在模型层面展开竞争。该公司将 GR00T 1.7 描述为一款开放、可商用的视觉-语言-动作模型,拥有一个三十亿参数的基础检查点。
视觉-语言-动作模型将视觉观察和指令连接到机器人动作。GR00T 1.7 接收图像、语言和机器人状态,然后生成运动指令。NVIDIA 表示,该模型已在约 32,000 小时的真实数据和 8,000 小时的模拟数据上完成预训练。
GR00T 提供了另一条适配路径。开发者可以从其预训练检查点开始,针对特定机器人、环境和任务进行后训练。S1 的核心承诺是:视频提示即可定义新任务,无需进行额外的模型更新。
这两种方法并不互相排斥。后训练可以在稳定、高吞吐量的工作中实现性能最大化。当任务变化速度快于工程师重建策略的速度时,上下文学习则可以提升灵活性。
无论采用哪种路径,NVIDIA 都能从中受益。它提供算力、仿真、数据处理、部署软件以及自有基础模型。因此,即便客户选择 S1 而非 GR00T,Skild 的成功依然将验证 NVIDIA 的基础设施价值。
这种关系类似于平台供应商与应用供应商之间的合作,尽管双方的技术边界存在重叠。Skild 需要底层开发技术栈,而 NVIDIA 则获得了一个具有商业可见度的工作负载。双方都希望实体 AI 的部署能够超越零散的演示项目,实现规模化扩展。
Blackwell 装配项目为这一合作提供了具体场景。Skild、NVIDIA 和 Foxconn 正在将 Skild Brain 部署到用于 NVIDIA Blackwell 系统生产的双臂机械臂上。
在已演示的工作流程中,机器人安装母排和限位块,然后拧紧 16 颗螺丝。它必须跟踪操作顺序、精准控制接触,并在实际物理条件偏离原计划时作出响应。
这比为视频制作咖啡更具实际意义。硬件装配具有明确的公差要求、高昂的错误成本和可衡量的吞吐量。它也提出了一个严苛的问题:由提示驱动的灵活性是否能够与生产级的一致性并存。
Skild S1 与 GR00T 的较量,本质上是适配性与可靠性之争
核心权衡并不在于 S1 能否一次完成陌生任务,而在于它能否以有用的吞吐量安全地重复完成该任务。
精心打磨的演示能够证明能力,却不能证明可靠运行。工厂衡量的是完成产品数量、周期时间、人工干预频率、缺陷、停机时间和安全事故。模型看似具有适应性,却仍可能在其中多项指标上失去经济性。
Skild 报告的 66% 单步成功率需要特别谨慎地看待。它相较于所引用的基线有显著提升,但仍远低于成熟固定式自动化所对应的可靠性水平。实际门槛取决于恢复能力、监督需求、任务价值和失败成本。
有些应用可以容忍重试。例如,仓储机器人可在物品发生移位后再次尝试抓取。其他失败则可能损坏组件、污染食品,或使工人面临风险。因此,同样的模型评分可能支持其在一种环境中部署,却阻碍其在另一种环境中应用。
长时程任务会放大这一问题。S1 必须在数十个动作之间保持上下文,同时追踪哪些步骤已经成功。早期错误可能改变现场状态,使后续演示内容的相关性降低。
模型随后必须决定是重试、替换另一个物体、跳过某一步,还是请求人工协助。每项决策都会带来新的误判机会。个别示例中表现出的常识性行为,并不能证明其拥有可靠的错误处理策略。
在机器人基础模型领域,独立评估仍然有限。不同公司采用不同的硬件、任务、训练分布、成功定义和剪辑方式。醒目的比较结果很少能提供受控证据,证明某项策略比另一项具有更好的泛化能力。
Physical Intelligence 提供了一个有益的对照。其 机器人模型研究 涵盖开放环境泛化、人类到机器人的迁移、长期记忆以及超过 10 分钟的任务。其 π0.7 模型也致力于在陌生环境和多阶段工作中实现开箱即用的性能。
NVIDIA 的 GR00T 研究强调开放检查点、标准工作流程、仿真和后训练。Figure 在自主研发的人形机器人硬件之外,也在开发 Helix。每条路径对泛化能力、具身形态专用化、数据收集和部署控制的权衡都不相同。
Skild 的独特押注在于,任务意图可以在执行时通过视频提示传达。这可能在保留跨多种机器人类型的共享策略的同时,减少定制工作量。但这也使提示解释成为运营安全边界的一部分。
模糊或存在缺陷的演示可能造成歧义。Skild 表示,S1 有时会纠正人类错误,这听起来很有用。然而,纠正也意味着模型需要自行决定何时偏离所提供的示例。
这种自主判断需要边界。操作人员必须了解模型是否正确识别了目标,以及为何选择不同的运动方式。否则,看似智能的纠正可能演变为不可预测的偏差。
研究文献指出了更广泛的未解决问题。一篇经过同行评审的机器人学综述强调,稀缺的机器人数据、安全保障、不确定性衡量和实时执行,仍是基础模型面临的持续挑战。
S1 的发布并未消除这些限制。它提出了一种不同的适配接口,以及围绕该接口设计的训练策略。生产证据必须表明,这一方法能够经受住不同设备、照明、磨损、材料和人类行为的考验。
商业报道同样需要受到严格审视。营收运行率是将当前的经常性业务按全年进行外推。它并不等同于经审计的年度营收、已收现金或实现盈利的部署。
Skild 表示,其在部署的前 10 个月中确认了 5,000 万美元收入。该公司还列举了涵盖物流、安防、检查、食品制备、数据中心和制造业的项目。这些细节支持其确实存在真实客户活动,但并未揭示单位经济效益。
公司的部署策略可能会随着时间推移强化 S1。在获得客户许可的情况下,运营经验可以反馈给更广泛的模型。更多部署随后可能产生更好的策略,从而减少适配工作并支持进一步部署。
这一循环也带来了治理问题。客户需要明确哪些运营数据会离开其设施、这些数据如何被过滤,以及它们是否会用于改进其他地方使用的模型。敏感的制造视频可能暴露产品设计、流程和安保安排。
对 NVIDIA 的依赖也带来另一项战略考量。其技术栈覆盖训练、仿真、优化和部署,能够加速开发。深度集成也可能使基础设施选择在未来更难改变。
这些担忧都不能否定 S1 路径。它们界定了区分灵活研究模型与可靠工业基础设施所需的证据。Skild 展示了一种有吸引力的机制,但客户将根据围绕它构建的运营体系作出判断。
三个将显示 S1 能否规模化的信号
下一阶段应通过生产完成率、更广泛的硬件证据和可由独立方复现的评估来衡量。
第一个信号是 Blackwell 装配部署中的持续表现。Skild 已明确指出一个涉及两只机械臂、多个组件和 16 颗螺丝的具体工作流程。这让观察者能够评估的内容,超出了定义模糊的家庭场景演示。
有价值的披露应包括完整任务成功率、平均周期时间、人工干预频率和缺陷率。结果应覆盖较长的生产周期,而非一次被挑选出来的运行记录。稳定的表现将强化实体提示能够支持精密制造的论点。
较低的完成率则会指向另一种结论。它们将表明,S1 的灵活提示仍需要任务专属工程、后训练或更严格的环境控制。该模型仍可能具有价值,但其经济优势将会缩小。
第二个信号是能否在不同客户和机器人机体之间实现可重复的迁移。Skild 将其更广泛的系统称为全机体机器人大脑,意即一个智能层可以控制不同的实体平台。如果同一策略能够处理机械臂、移动操作机器人和其他机器,S1 的价值将显著提升。
该公司已提到与 Foxconn、Sumitomo Wiring Systems 和 Mitsui 的合作。这些项目涵盖电子装配、线束制造和商用厨房。它们也使模型面对不同的材料、安全要求和成功定义。
来自多个部署项目的证据将检验 Skild S1 在其发布演示之外的表现。关键问题在于:当硬件、摄像头、工具和工作场所规则同时发生变化时,单视频适配是否仍能保持快速。
频繁的工程干预将削弱其通用模型的主张。这将表明,可见的提示只是部署工作的一小部分。反之,如果操作人员无需更新模型即可教授新的工作流程,将支持 Skild 的核心论点。
第三个信号是更清晰的评估框架。Skild 已提供单步结果和基线比较,但外部读者仍需要了解任务定义、试验次数、失败类别和完整完成率。他们还需要了解任务与预训练分布之间的距离。
最后一点至关重要。某项任务看起来可能是新的,却与大量训练示例共享对象和动作。强大的上下文学习应当能够处理任务结构和部署条件的双重变化,而非仅仅重新组合熟悉的场景。
与 GR00T、Physical Intelligence 模型或专用策略进行受控比较将有所帮助。目标不应是一个单一的排行榜数字。评估应将适应性、精度、恢复能力、延迟和安全性区分开来。
Skild 已宣布,后续技术文章将更深入解释 S1 的训练过程。这些披露可以澄清数据集构成、架构、评估设计和数据污染控制。可复现的方法将为研究人员评估公司主张提供更坚实的基础。
对开发者而言,S1 表明演示或许会成为与语言和代码并列的实用机器人接口。企业采购方在将一次学习视为可直接部署之前,应重点关注完成经济效益、安全控制和数据权利。
Skild AI S1 机器人模型之所以重要,是因为它检验了机器人能否通过上下文而非重新训练来接收新工作。其下一个里程碑不是另一段精心打磨的任务视频,而是证明普通操作人员能够教授不断变化的工作,同时系统仍保持可预测的质量。
未来几个月,请关注 Blackwell 部署、跨客户迁移和评估细节。如果这三项都经得起检验,视频提示将成为反复定制策略的可信替代方案。你们的业务中,哪项任务最能为这一主张提供清晰且安全的检验?



