Skild AI S1 通过一段视频学习机器人任务,但可靠性仍是关键考验

据称,Skild AI S1 只需观看一段视频,便能在无需重新训练的情况下尝试从未见过的机器人任务,即使该任务持续十分钟。此前,要让工业机器人适应新任务,通常需要新的示范、针对任务的训练,以及又一轮验证。Skild 希望用视觉提示取代其中的大量工作。
该公司表示,S1 已完成包括盆栽种植、煎饼制作、咖啡冲煮和套件组装在内的多步骤活动。这些仍是在受控条件下的演示,但相较于拿起杯子这类孤立动作,它们代表了更高难度的目标。每项任务都要求机器人识别意图、记住当前进度、协调大量动作,并在情况发生变化时进行恢复。
这种差异给传统机器人部署模式带来了压力:它将每一次生产变更都视为新的工程项目。这也让 Skild 与 Generalist AI、Google DeepMind、Physical Intelligence 以及 NVIDIA 自身的机器人模型项目并列。各方都在追求适应性更强的机器,但 Skild 提出了一个尤为直接的主张:视频应当像提示词一样发挥作用,而非成为新的训练数据集。
Skild AI S1 将一段视频转化为机器人提示
关键变化不在于机器人复制了一段视频,而在于据称 S1 在不改变模型权重的情况下做到了这一点。
Skild 将 S1 定位为用于机器人操控的上下文学习系统。上下文学习意味着模型利用运行期间提供的信息,而不更新其底层参数。这项技术类似于语言模型遵循提示词中包含的示例。
操作员从人类视角录制所需任务,并将该记录提供给 S1。模型随后解读预期结果、相关物体、动作顺序和任务进度,并将这些上下文转化为当前场景中机器人的控制指令。
根据已发布的 S1 robot model 描述,所有展示案例均由相同的模型权重生成。Skild 表示,在尝试这些新活动之前,系统未接受任何针对任务的微调或后训练。
展示的任务最长持续十分钟,涉及数十个操控步骤。其中一个流程要求种植小型植物、移动土壤、摆放植物并加水。其他演示包括制作煎饼、手冲咖啡和组装套件。
这些案例之所以重要,是因为长任务会不断累积误差。一个机器人若在每个独立步骤上的成功率为 90%,完成十个独立步骤的概率仅约为 35%。现实中的步骤并非相互独立,但这一计算说明了长时程任务的性能为何会迅速恶化。
Skild 报告称,其盆栽种植测试从录制到自主执行仅用了 11 分钟。录制于晚上 9:16 开始,示范在 9:22 完成,S1 于 9:27 开始操作。大多数传统适应项目耗时更长,因为它们涉及数据收集、训练、评估和部署。
据称,该系统还能在执行过程中处理有限变化。Skild 移动了物体、更改了光照,并用功能相近的物品进行替换。在其他案例中,当演示中的浇水壶无法使用时,机器人会重试失败动作,或改用杯子。
这些行为表明,S1 并非只是回放记忆中的坐标。它必须将演示目标与自身的摄像头视角、机体和可用物体联系起来。不过,所有公开结果和相关解读均来自 Skild 或其基础设施合作伙伴 NVIDIA。
因此,这次发布带来了明确的检验标准。如果外部评估能够复现这些能力,视觉提示可能会改变机器人团队收集数据和重新训练策略的频率。如果性能在精心策划的环境之外下降,S1 仍将是一项令人印象深刻的研究演示,而非新的部署模式。
为什么工厂变化会暴露编程式机器人的局限
S1 针对的是这样一道昂贵鸿沟:机器人能够完成一次任务,与工作场所变化后系统仍能持续正常工作之间的差距。
当工程师能够约束环境时,传统自动化表现出色。机器人可能数月重复执行同一道焊接工序、转运相同组件,或紧固相同的装配件。工装夹具、安全围栏、校准后的工具和可预测的节拍,使这种重复具备可靠性。
现代生产很少能始终保持完全固定。供应商会更换组件,制造商会推出新产品,仓库运营方会重新布置工位。微小变化都可能影响物体位置、所需力度、动作顺序或周期时间。
当这些条件变化时,传统系统往往需要重新编程或进行新的示范。工程师随后必须测试更新后的行为,并确认其符合安全与质量要求。对于稳定的大批量运营而言,这一过程或许合理;但面对频繁变化的工作环境,它就更难维持。
Skild 表示,其商业经验推动公司转向上下文学习。该公司在 9 月 9 日的更新中称,其在制造、物流、检测、安防、食品制备、工厂和数据中心领域拥有超过 60 家付费客户或部署合作伙伴。
该公司还表示,在首次商业部署十个月后,其年化营收运行率达到 1 亿美元。营收运行率是对当前业务表现的年化计算,因此不一定代表已在完整年度内实际收取的营收。Skild 尚未公布支持该数据的经审计财务报表。
不过,随附的 deployment claims 让 S1 比实验室基准测试拥有更具体的应用背景。Skild、NVIDIA 和 Foxconn 正在将 Skild Brain 部署于双臂机器人,用于 Blackwell 系统组装。所描述的一项工作流程是在固定 16 颗螺钉前安装母排和限位块。
Skild 还讨论了与 Sumitomo Wiring Systems 在汽车线束生产方面的合作。由于柔性导线容易变形、相互重叠,并需要精细操作,这一类别一直难以实现自动化。该公司还正与 Mitsui 在商用厨房中试点通用机器人。
这些场景检验的不只是操控能力。工厂买方关注周期时间、故障恢复、设备正常运行时间、产品质量、工人安全、集成成本和维护。即使机器人能够完成每项必要动作,如果运行速度过慢,仍可能不具备商业可用性。
Skild 自身也承认这种差异。该公司表示,无论底层系统的成功率是 5% 还是 99%,一次成功演示看上去都可能完全相同。其创始人也认为,要获取最后几个百分点的可靠性能,需要付出不成比例的努力。
这一承认让 S1 的故事更加清晰。该公司并未声称视觉提示可以消除部署工程,而是在主张,提示能够减少每次任务变化所需的重复数据收集和训练。
这一区别对买方十分重要。视频提示或许能缩短初始适应时间,但安全审查、工装、校准和流程批准仍然不可或缺。这些剩余步骤并非行政摩擦,而是为了防止产品损坏、生产线停摆,以及人员周边出现不安全动作。
因此,近期机会在于降低适应过程中的一个高成本层级。S1 并未消除工业自动化周边的物理要求;它改变的是当这些要求发生变化时,模型接收任务指令的方式。
该机制以上下文替代重新训练
S1 将任务适应从训练流程转移到机器人的运行上下文中,但广泛预训练仍承担了大部分隐藏工作。
“一段视频”这一表述可能让人以为 S1 起初没有任何相关经验,但系统并非如此运作。模型首先会在机器人轨迹、仿真、人类视频和其他行为数据上进行广泛预训练。
这种预训练提供了可复用的技能和物理模式。视频提示会告诉 S1 哪些技能重要、应如何排序,以及操作员期待的结果。因此,一项新任务可以组合熟悉的能力,同时引入训练中未曾出现的动作或序列。
Skild 将这一过程描述为内循环和外循环。预训练构成外循环,教会策略如何解读示范;在运行期间,视频则提供内循环示例,而不修改模型权重。
这种区别将 S1 与针对任务的微调区分开来。微调会使用为目标行为收集的新数据来改变模型;S1 则保留一套参数,并根据当前保留在上下文中的演示来调整其动作。
Skild 使用 NVIDIA 基础设施训练和评估该模型。NVIDIA Cosmos 模型有助于生成变体并将视频转换为结构化描述。Cosmos Curator 负责组织和筛选数据,而 Isaac Sim 则提供虚拟环境,用于在物理部署前测试行为。
Isaac Lab 支持强化学习,即通过模拟经验引导策略朝着与更好结果相关的动作发展。Newton 物理引擎模拟接触、力、碰撞及其他物理交互。这些工具结合起来,有助于让策略接触到比实体机器人群能够以经济方式收集到的更多情境。
这种数据组合解决了机器人领域的一个核心问题。遥操作机器人数据与部署硬件高度匹配,但收集速度很慢。人类视频提供了大得多的多样性,但人手与机器人夹爪的运动方式不同。仿真可高效扩展,但模拟物理永远无法匹配每一种真实表面、物体或故障。
Skild 表示,它结合这些来源,是因为没有任何一种来源能够同时提供理想的规模、多样性和硬件相似度。随后,视频提示便成为模型预训练与部署时呈现任务之间的桥梁。
该公司的 in-context learning results 将 S1 与一款由语言条件控制的视觉-语言-动作模型进行了比较。视觉-语言-动作模型,即 VLA,可将视觉观察和指令转化为物理动作。
据称,两套系统使用了相同的数据、架构和计算资源,区别仅在于任务提示的嵌入方式。训练数据集规模从 1,000 小时到 100,000 小时不等。Skild 在内部测试套件中对其进行评估,覆盖持续四至八分钟的熟悉和未见任务。
在最大测试数据规模下的未见任务中,S1 达到 66% 的累计逐步成功率;采用语言提示的基准模型达到 9%。Skild 将这一结果描述为七倍提升。
对于熟悉任务,这一对比并非如此一边倒。在 1,000 小时训练数据下,语言条件系统得分为 53%,而上下文学习为 43%。Skild 表示,随着预训练规模扩大,S1 最终达到约 96%。
该公司还将一次提示示范与对传统策略进行后训练进行了比较。其估计,一段 S1 视频产生的性能大致相当于约 380 次针对任务的示范。收集这些长示范据称需要 50 至 100 小时的遥操作。
这一比较并不意味着一段视频总能替代 380 个示例。Skild 根据内部曲线推算出这一数字,其结果仅适用于其所选模型、任务和评分方法。经过后训练的策略最终在 2,000 个演示示例下达到 86%,超过了 S1 的 66%。
因此,真正的机制是在前期准备与后续适应之间进行权衡。Skild 大力投入广泛预训练,使客户在后续能够提供更少的任务专属数据。这种权衡是否划算,取决于预训练能力的迁移范围有多广。
通用型竞争对手也在争夺同一目标
Skild 正在与“每项任务都重新训练”的工作流竞争,但其他基础模型开发商正从不同方向攻克同一限制。
Generalist AI 在 S1 发布前不久宣布了 GEN-1.5。该公司同样表示,其模型无需梯度更新,仅通过一次或少数几次演示就能学习机器人任务。其重点强调组合式行为、人与机器人之间的迁移、陌生工具,以及物理条件的变化。
Skild 表示,S1 将这种方法扩展到了此前未见、最长持续十分钟的任务。其文章将同期系统描述为主要聚焦于更短的活动,或更接近其训练分布的行为。不过,Generalist 也将其系统定位为广泛适用的一次学习系统。
竞争对手的 GEN-1.5 results 表明,“首次”之类的说法需要谨慎界定边界。两家公司均通过各自的评估定义新颖性、任务时长、物理变化和成功标准。在缺乏共享基准的情况下,这些视频无法确立明确的排名。
Google DeepMind 则通过 Gemini Robotics 采取另一条路径。其系统结合多模态推理与机器人动作生成,适配不同机体。Gemini Robotics 2 强调灵巧操作、全身控制,以及机器人之间的协作。
2026 年 7 月发布的 Gemini Robotics 2 也承认,不同机体之间的技能迁移依然困难。Google 仅向部分测试者提供某些机器人系统,这限制了广泛的外部比较。
早期 DeepMind 项目展示了数据需求下降的速度。RoboCat 通过数百个演示适应任务,而更新的系统正追求少样本或单样本能力。该领域正从任务专属训练转向能够复用经验的通用模型。
Physical Intelligence 专注于通用 VLA,将机器人数据、网络知识和高层语义规划相结合。其 π0.5 研究涉及清洁陌生厨房和卧室等长程任务。该系统利用分层引导,在新环境中完成复杂序列。
NVIDIA 既是 Skild 的供应商,也是模型开发商。其 GR00T N1 research 描述了一种开放基础模型,基于机器人轨迹、人类视频和合成数据训练。GR00T 将视觉语言组件与基于扩散的动作系统结合,用于人形机器人控制。
这一定位为 NVIDIA 进入物理 AI 提供了多条路径。它可以提供 GPU、仿真、数据工具、部署硬件,以及自有参考模型。Skild 获得这一基础设施的支持;而无论客户选择 S1、GR00T,还是基于其技术栈构建的其他模型,NVIDIA 都能受益。
NVIDIA 的 Cosmos Policy 进一步表明,一家公司可以支持相互竞争的技术路线。Cosmos Policy 通过在目标机器人演示数据上进行后训练,来适配预训练视频模型。它会生成用于规划的动作、预测未来状态和预期回报。
S1 试图避免部署后针对每项任务进行后训练。Cosmos Policy 则利用后训练,将视频生成知识转化为动作策略。两种方法都依赖广泛的视频先验,但将适应过程放在不同阶段。
这种竞争应会令机器人采购方受益,尽管它也会让采购决策更复杂。一段制作精良的模型演示,对于集成工作量、支持的硬件、错误处理或服务责任说明有限。采购方必须评估完整的操作系统,而不仅是推理模型。
因此,决定性的竞争并非 Skild 对阵某一家特定创业公司,而是情境适应对阵反复的任务专属工程。只有当环境、硬件和运行约束与演示内容发生偏离后,一段视频仍然有用,S1 才算领先。
演示尚不足以证明工厂可用性
S1 报告的提升幅度可观,但证据仍由公司自行运行、依赖人工干预,且难以与独立系统比较。
Skild 的基准采用累计单步成功率,而非完整、无人协助的任务完成率。失败后,人工操作员会介入,使每个策略能够继续完成后续步骤。Skild 表示,这一点尤为必要,因为其语言条件基线否则无法完成一项未见任务。
这种方法能够揭示长序列中错误出现的位置。但它不能直接回答已部署机器人在无人协助下完成整个工作的频率。工厂运营方需要同时掌握这两项指标,因为一次未能恢复的故障就可能让一个工位停摆。
66% 这一数字也描述的是每个被评估步骤的成功率,而不是 66% 的端到端完成率。读者不应将两者视为可互换的指标。一项包含许多相互依赖动作的长任务,其完整成功的概率可能低得多。
Skild 尚未发布关于 S1 的完整技术论文、模型卡、公开检查点,或独立复现的基准。其首篇文章表示,后续发布将更深入说明训练方式。模型规模、训练构成、评估次数、硬件覆盖范围和失败类别等重要细节仍未披露。
基线设计同样值得审视。Skild 在保持大多数其他组件不变的情况下,对视觉演示提示与语言提示进行了比较。这隔离出了其设置中演示上下文的价值,但并未涵盖所有竞争性 VLA 或适应方法。
录制提示时,操作员也会影响性能。摄像机角度、节奏、物体可见性、手部摆放和任务清晰度,都可能改变模型观察到的内容。客户需要了解什么构成有效演示,以及 S1 对低质量示例有多敏感。
分布偏移仍是另一项限制。Skild 测试了物体位移、替换、光照变化和使用相反机械臂执行任务。它报告称,当提示隐含了实质不同的执行方案时,性能下降更明显。
这一结果合乎逻辑。演示可以指定意图和顺序,但无法消除机械约束。夹爪、工作范围、负载、摄像头位置或控制频率不同的机器人,必须将示例转化为可行的运动。
物理安全的门槛高于视觉上的合理性。语言模型可以生成糟糕的回答,却不会损坏附近设备。机器人则可能压坏部件、洒出热液体、撞到工人,或施加过大的力。
因此,工业应用要求系统在不确定性下保持有边界的行为。系统必须识别提示何时存在歧义、物体何时缺失,或任务何时超出其能力范围。随后,它应停止或请求协助,而不是进行不安全的即兴操作。
S1 表现出的错误恢复能力令人鼓舞,但恢复本身也可能带来风险。处理柔软物体时,重复一次失败的抓取或许合理。同样的重试策略却可能损坏连接器、污染食品或过度拧紧紧固件。
商业数据同样需要独立确认。Skild 报告的收入运行率和客户数量表明存在需求,但并未揭示合同期限、生产利用率、续约率或毛利率。试点项目和合作关系在实际运营深度上可能差异很大。
富士康的部署提供了一个具有意义的验证场景,因为 Blackwell 组装需要精度和序列追踪。然而,公开材料并未披露吞吐量、人工干预频率、缺陷率或正常运行时间。这些指标将决定情境学习能否经受住生产压力。
因此,S1 应被理解为一项可信但尚未完整验证的技术主张。这些演示挑战了“每项新任务都需要再进行一次训练”的假设,但并未证明一段视频就能安全地为任意机器人配置任何工业工作。
将决定 S1 价值的三项信号
下一阶段可以量化:S1 需要透明的评估、持续的生产结果,以及普通操作员能够安全使用视觉提示的证据。
第一项信号是详细的技术发布。Skild 已承诺将通过更多文章解释 S1 的训练方式。一份有价值的披露应包括评估试验次数、完整任务成功率、人工干预规则、失败类别、延迟、支持的硬件,以及与更强外部基线的比较。
独立访问将进一步增强证据。研究人员或客户应能够在陌生的布局和物体条件下复现任务。结果应同时报告失败运行和成功运行,尤其是涉及接触、精细部件和长序列的任务。
第二项信号是生产表现。富士康项目应揭示 S1 能否在保持质量的同时满足实际节拍时间。有用指标包括正常运行时间、每班次人工干预次数、任务变更准备时间、缺陷率,以及从部件变化中恢复的能力。
住友的线束工作证据将检验另一种能力。柔性材料会产生不可预测的几何形态,并要求精细的接触控制。在这类场景中稳定运行,将支持 Skild 关于广泛预训练能够超越桌面演示进行迁移的主张。
商用厨房试点则提供了另一种严苛环境。食材会变化,工具会移动,表面会变脏,附近还有人员工作。成功部署需要感知、卫生控制、安全运动和可靠操控,而不仅是正确的任务顺序。
第三项信号是竞争对手的回应。Generalist AI、Google DeepMind、Physical Intelligence 和 NVIDIA 都在减少机器人适应所需的数据量。共享测试可以显示,在相同条件下,视频提示是否优于语言指令、少样本微调或分层规划。
竞争对手若在长任务上追平 S1,并不会否定这一方法。这将表明,情境内演示正成为机器人基础模型的标准能力。反过来,若任务专属后训练表现更强,则可能说明视觉提示为了速度牺牲了过多可靠性。
企业采购方还应关注人为工作流。Skild 最有力的承诺是操作简便:工作人员录制任务、提供视频,并在数分钟内开始测试。这一流程必须能让 Skild 研究团队之外的技术人员使用。
最有力的证据应来自操作员在没有模型专属指导下创建提示。其结果应在不同班次、地点和机器人机体之间保持一致。系统应在执行前识别不充分的演示,并说明无法继续的原因。
Skild AI S1 之所以重要,是因为它将适应过程置于工作发生变化的那一刻。这正是传统自动化不断累积工程成本和延迟的地方。单视频提示提供了一种降低这一负担的合理路径,并得到了有意义的内部结果和早期商业项目支持。
剩下的问题已不再是 S1 能否呈现令人信服的演示。Skild 已经证明了这一点。真正的问题在于,工厂能否以运行速度、在有据可查的安全限制内,反复获得同样的表现。
评估 Skild AI S1 的读者应关注测量数据,而非视频片段。应查看完整运行的成功率、人工干预率、周期时间,以及面对计划外变化后的表现。这些信号将表明,一段视频是否已成为实用的机器人接口,还是仍仅仅是一个充满前景的研究命题。