工人佩戴动作追踪器,教会机器人掌握人类早已熟悉的工作
- Sophie Larsen

- 8月14日
- 讀畢需時 14 分鐘
工人正佩戴摄像头和动作追踪器,让 AI 系统研究那些人类花费多年才掌握的动作。一篇最新的 Bloomberg 报道指出,围绕实体劳动数据的竞争正在加剧。
这项工作瞄准了现代机器人技术中一个顽固的弱点。语言模型可以从数字来源吸收数万亿词文本,但机器人无法仅靠抓取互联网来学习实体操作所需的判断力。
它们需要能够将视觉、动作、触觉、力度、时机,以及周围物体不断变化的状态联系起来的示范。因此,企业正把熟练工人转变为实时数据来源,以训练能在酒店、仓库、商店、工厂和家庭中工作的机器。
由此产生的张力并不难察觉。工人的专业技能在数据采集阶段变得更有价值,恰恰是因为最终系统的目标,是完成更多原本属于这名工人的工作。
工人正在成为训练集
最新的机器人训练流程,始于人们在非同寻常的严密观察下完成日常工作。
在首尔乐天酒店,资深员工 David Park 演示了如何折叠宴会餐巾,摄像头则记录下他的头部、胸部和双手。据一项 Associated Press 调查称,Park 已经从事这项工作九年。
这项演示捕捉的远不止餐巾最终的形状。它还记录了动作顺序、Park 如何摆放材料,以及布料移位时他的双手如何调整。
韩国机器人创业公司 RLWRLD 正将此类示范转化为机器可读的训练数据。该公司还与 CJ 的物流员工及 Lawson 的门店员工合作。
CJ 员工演示如何在仓库内抓握、抬起和搬运货物。Lawson 员工则展示如何摆放商品和管理食品陈列。
这些案例说明了工作场所数据为何重要。机器人需要的,不只是显示箱子从一个货架移动到另一个货架的视频。
它还需要关于这一动作如何完成的可用描述。
这类描述可以包括摄像头图像、关节位置、手部姿态、运动轨迹、物体位置和施加的力度。每一类同步信号都有助于将观察到的场景与实体动作联系起来。
RLWRLD 的工程师还会借助虚拟现实头显、摄像头和动作追踪手套重复执行任务。随后,人类操作员可以引导测试机器人完成相关动作。
这一过程类似模仿学习,即 AI 系统通过示范学习行为,而非完全依赖人工编写的规则。原理很简单,但要产出可靠的示例却十分耗费人力。
机器人与人类指导者的身体结构也不相同。它们的关节限制不同,双手可能手指更少,传感器感知世界的方式也不同。
因此,工程师必须将人类动作重新定向到机器人可用的身体结构上。重新定向是在兼顾不同身体比例、关节、平衡约束和机械限制的同时,映射出动作的关键部分。
工人在折叠布料时可能会转动手腕。某个特定机器人则可能需要调整整条手臂的位置,才能产生类似效果。
即使是高质量的示范,也不会自动造就能够自主工作的机器。工程师还必须标注录制内容、对齐数据流、剔除不可用片段、训练模型,并测试最终行为。
随后,机器人必须能够在物体出现在略有不同的位置时进行恢复。最后这一要求,正是死记硬背的流程与有用的工作场所技能之间的分界线。
RLWRLD 自身的演示也显示了这一差距。在一次被观察到的测试中,一台轮式机器人在迷你吧附近移动杯子时撞倒了一个碟子。之后的画面显示,一台人形机器人打开盒子、放入电脑鼠标,再将合上的盒子放到传送带上。
这种进展很重要,但并不能证明同一系统可以可靠地处理这两项任务的每一种变化。它表明,示范可以支持日益复杂的测试。
工人并不只是标注图像中是否包含一个杯子。他们提供的是能揭示双手、物体与环境如何随时间互动的动作序列。
这使人类动作成为一种新的 AI 训练材料。它也让工作场所成为潜在的数据采集地点。
实体 AI 面临互联网无法解决的数据问题
机器人硬件的发展速度,超过了具备现实基础、多样性且可合法使用的示范数据供给。
现代 AI 的发展得益于互联网中早已存在的大量文本、图像、音频和视频。实体 AI 却没有与之相当的、将动作与机器人控制相联系的记录。
一段在线烹饪视频可能展示某人切洋葱,但通常不会包含精确的手腕朝向、施加的压力、刀刃位置,以及描述洋葱在每一刀之后如何变化的同步数据。
机器人策略需要建立观察与动作之间的关系。策略是经过学习的组件,它会在理解当前情况后选择相应动作。
研究人员可以通过直接操控机器人来采集这些关系。然而,机器人遥操作需要设备、受过训练的操作员、受控环境,以及昂贵硬件的使用时间。
人类示范提供了另一条路径。工人已具备完成任务所需的时机把握和判断力,而工作场所则提供了真实的物体与环境条件。
难点在于,将他们的行为转换成机器能够使用的信号。摄像头能捕捉可见动作,但可能遗漏力度、接触情况,或被物体遮挡的动作。
动作追踪器可估算身体各部位的位置和朝向。传感器手套可补充手指动作,力传感器则可测量压力或接触。
没有任何单一设备能够捕捉实体技能的完整本质。工程师会组合多种信号,因为视觉上相似的动作,在力度或时机变化时可能产生截然不同的结果。
以将玻璃杯放上货架为例。摄像头会记录手臂路径,但安全摆放还取决于握力、减速度、货架高度和松手的瞬间。
人类几乎会在无意识中调整这些变量。机器人则必须在机械限制范围内推断或测量它们。
Google DeepMind 的 Open X-Embodiment 项目展示了问题的另一面。研究人员与 33 家学术实验室合作,整合了 22 种不同机器人类型的数据。
生成的 机器人数据集包含超过 500 种技能和 150,000 项任务。其目标是帮助模型在不同机器人身体和环境之间迁移知识。
该项目使用的是机器人生成的经验,而不只是录制工人操作。但它仍印证了行业的核心挑战:有用的机器人行为依赖多样化、结构化的实体数据。
在一条机械臂、一个房间和一组物体上训练的模型,往往难以适应其他环境。当摄像头角度、光照、工具或机器人身体发生变化时,同一个动作可能看起来截然不同。
因此,多样性与数据量同样重要。开发者需要来自不同工人、地点、物体摆放方式和任务结果的示例。
他们也需要失败的示范。一个只包含完美动作的数据集,可能无法教会机器人如何发现问题或安全恢复。
这一要求使工作场所采集颇具吸引力。真实环境中存在褶皱、杂物、中断、破损包装、异常物品,以及实验室难以重现的无数其他情况。
然而,真实性也增加了隐私与质量风险。头戴式摄像头可能录下同事、谈话、文件、电脑屏幕、客户和受限区域。
数据采集者必须决定哪些内容进入训练集。他们还需要可靠记录,以表明谁已同意、捕捉了什么内容,以及这些影像可以如何再利用。
这一过程与早期语言和视觉模型的数据标注行业发展相似。不同之处在于,实体示范在捕捉个人和环境信息的同时,也记录了实践经验。
一段录制的动作可以揭示某位工人如何解决问题。反复拍摄还可能暴露生产率模式、身体限制,或从未出现在操作手册中的非正式技巧。
这正是为什么实体 AI 数据竞赛不仅仅是给工作场所增加摄像头。它试图将隐性知识正式化,即人们会使用却无法完整描述的专业能力。
一旦被正式化,这些知识便能训练许多机器。其价值不再局限于原始任务或地点。
人类技能与机器规模之间才是真正的竞争
核心竞争并非当下的工人与机器人之争,而是人类专业技能与可复用机器人模型所承诺的规模化能力之间的较量。
熟练员工通过多年的重复工作不断提升。他们的知识依附于个人,通常一次只惠及一个工作场所。
机器人模型则提出了不同的经济命题。开发者希望一次录制示例,通过训练加以完善,并将最终能力分发到许多机器上。
这正是人类示范数据需求旺盛的原因。在一家酒店或仓库中捕捉到的动作,可以成为部署到其他地点的模型输入。
Nvidia 通过其 Isaac GR00T 机器人平台描述了这一策略。该公司称,GR00T 模型结合了互联网视频、真实世界遥操作和合成数据。
其 GR00T-Mimic 工作流程可将遥操作示范转换为用于模仿学习的动作数据。另一种工作流程则可在仿真环境中扩展一小组人类示例。
在一项由公司报告的测试中,Nvidia 在 11 小时内生成了 780,000 条合成轨迹。该公司称,这一数据量相当于 6,500 小时的人类示范数据。
Nvidia 还报告称,将合成轨迹与真实数据结合后,性能提高了 40%。这些数据来自 Nvidia 自己的动作流水线,并非覆盖全行业的独立基准测试。
不过,这一结果仍说明了真实示范为何具有战略价值。合成数据可以倍增示例数量,但开发者首先仍需要基于现实的动作和真实的任务定义。
仿真可以改变物体位置、摄像头角度和运动路径,却无法保证底层行为反映真实工作场所中的细微约束。
这为机器人训练形成了一种混合模式。工人提供真实示例,遥操作员将这些示例连接到机器人控制,仿真则扩展由此得到的数据集。
随后,机器人开发者会在实体硬件上测试策略。失败会产生新数据,而当系统遇到陌生情况时,人们会介入。
因此,人类劳动贯穿每一个阶段。工人示范任务,标注人员清理录制内容,操作员控制机器人,安全团队评估失败。
自动化并非仅靠机器学习实现。它源自一条漫长的人类指导与纠正链条。
最有力的商业论点认为,这条链条最终会变得更高效。每一次新的示范都可能改进一个可用于多种机器人和任务的模型。
质疑者则聚焦于最后一公里。即使机器人能在示范中成功完成任务,当材料、照明或人流发生变化时,它仍可能失败。
酒店工作提供了一个有用的例子。折叠一张餐巾需要灵巧性,但完成宴会布置还涉及导航、任务排序、视觉检查、异常处理以及与同事协作。
仓储工作也面临类似的复杂性。箱子的重量和状况各不相同,过道中有人经过,而看似简单的抓取动作可能取决于不稳定的箱内物品。
机器人既需要操控能力,也需要情境判断能力。能够满足前一项要求的模型,并不会自动满足后一项。
这一缺口给两类群体带来压力。机器人公司必须证明,大规模示范数据集能够带来可靠的现实表现,而不只是经过精心包装的试验。
雇主则必须决定,数据采集是为了支持员工、重新设计岗位,还是为特定任务的自动化做准备。这些结果可以在同一组织中并存。
员工面临着最尖锐的不确定性。他们的专业知识成为不可或缺的输入,但他们对由此产生的模型享有何种权利,仍缺乏明确界定。
传统劳动协议往往将工作成果归属雇主。动作数据带来了更棘手的问题,因为它记录了员工的身体、习惯和长期积累的技能。
一条手部轨迹是否只是运营数据?一段完整示范究竟属于个人数据、工作场所知识产权,还是两者兼具?
答案将影响同意、报酬、保存期限和再利用方式,也会影响员工能否质疑被用于原始目的之外的数据集。
组织已经利用知识管理保存书面流程和机构记忆。动作捕捉将这一目标延伸至实体行为领域,而这里的边界尚未明确。
由此形成的数据库可能比提供数据的员工存续更久,也可能将专业知识与培养它的人分离开来。
这种分离正是核心逆转。那些曾被认为最难自动化的技能,如今因能生成自动化仍然缺乏的示例而变得极具价值。
更好的示范并不能消除劳动风险
更丰富的数据集可以提升机器人性能,同时也会加剧被记录者在监控、同意和议价方面的担忧。
工作场所摄像头记录的不仅是目标动作。它还可能拍到面孔、声音、电脑屏幕、客户信息、安全流程,以及与机器人训练无关的片段。
动作追踪系统所揭示的也不只是任务技巧。反复记录可能暴露疲劳、身体差异、工作速度、伤病,或与管理层偏好方法不一致的做法。
这带来了用途问题。为训练机器人采集的数据,之后可能被用于员工评估、生产率监测、安全调查或其他管理决策。
有意义的同意,不只是要求员工佩戴设备。员工需要知道系统记录什么、哪些人会接收数据,以及数据会保留多久。
他们还需要知道,拒绝是否会影响排班、晋升或持续就业。当员工无法拒绝而不承担收入风险时,同意就值得质疑。
一项2026年关于以员工为中心的仓储机器人的研究发现,人们普遍对有用的自动化感兴趣,但也记录了隐私和同意方面的担忧。参与者希望机器人能够识别他人何时需要个人空间。
这项仓储研究还强调了员工参与设计的重要性。研究结果表明,技术接受度在一定程度上取决于控制权、透明度和工作场所情境。
机器人训练项目需要类似的保障措施。数据采集应有明确目的、受限访问权限、记录在案的保存期限,以及移除无关材料的流程。
旁观者带来了另一项挑战。即便他们从未同意加入训练数据集,客户和同事也可能出现在第一人称视频中。
模糊面孔可以减少部分暴露,但无法解决所有问题。制服、声音、地点和工作惯例都可能间接识别出个人。
动作数据本身也可能具有辨识性。即使姓名已被删除,数据集仍可能揭示身体特征或行为模式。
因此,公司必须将来源追溯视为核心能力。来源记录说明数据来自何处、适用哪些许可,以及每项资产在处理过程中如何变化。
缺乏来源追溯时,机器人开发商可能收到有用文件,却无法确定相关人员和场所是否已获得妥善授权。
报酬构成另一项争议。员工在示范任务时可能获得正常工资、一次性付款,或没有额外报酬。
而该数据集随后可能支撑一个价值远超原始班次的模型。现有工资安排很少考虑对被捕捉专业知识的反复商业再利用。
这并不意味着每位员工都必须从机器人的每一个动作中获得版税。但它确实意味着,雇主和开发商在采集开始前需要明确立场。
集体谈判可以影响这一立场。员工代表可以协商设备限制、报酬、访问规则、安全测试,以及限制将录音录像用于纪律处分的条款。
韩国民主劳总曾警告,大规模部署机器人可能中断未来熟练工人的培养。这一担忧不仅关乎眼前的岗位流失。
初级员工通过观察经验丰富的同事并在监督下练习来学习。如果自动化移除了入门级任务,进入能培养更深层专业能力岗位的人就会减少。
训练数据集可以保存专家当前的方法,但无法保证当材料、工具或客户期望发生变化时,系统能够产生新的工艺知识。
人类会持续调整技术。静态训练语料可能固化某一版本的工作方式,而现实工作仍在不断演变。
RLWRLD认为,即使AI能够复制现有能力,人类的精通仍然重要。这一区别值得关注。
复制与创新并不相同。机器人可能复现一段已示范的序列,却并不理解专家为何偏离标准流程。
安全性又带来一项限制。根据平均行为训练的机器人,可能遇到罕见情境,此时预期动作会变得危险。
开发商需要采用覆盖异常物体、附近人员、机械磨损、传感器故障和对抗性条件的评估方法。一项成功示范几乎无法证明系统在这些极端情况下的表现。
员工应参与这些评估,因为他们能识别基准设计者可能忽视的工作场所危险。他们的贡献不应在摄像头停止录制时结束。
以员工为中心的方法,应在设计、测试和部署的全过程中将员工视为领域专家,而非将其降格为匿名的动作来源。
动作捕捉转变之后会发生什么
下一阶段将由机器人可靠性、可记录的数据权利,以及模型能否超越受控示范而迁移的证据来衡量。
第一个值得关注的信号,是系统在实际工作场所中的表现。经过精心剪辑的示范和实验室试验无法证明系统能否覆盖完整班次。
开发商需要报告完成率、人工干预、恢复表现和安全事故。结果应涵盖变化的物体和真实的干扰情况。
独立评估将增强这些主张的可信度。公司示范仍有价值,但它们自然会呈现开发商挑选的任务和条件。
在监督下折叠一张餐巾的机器人,还不是通用酒店员工。能封上一只箱子的系统,也还不是自主仓储作业。
第二个信号是跨本体和跨地点的迁移能力。可复用的基础模型应能以有限再训练,将一个机器人或场地的经验应用到另一个机器人或场地。
DeepMind的跨机器人研究和Nvidia的混合数据策略都在应对这个问题。进展不仅仅意味着扩大单一采集项目的规模。
开发商必须证明,对一组员工进行训练能够改善陌生任务、物体或环境中的表现。迁移能力薄弱会削弱收集海量示范库的经济优势。
强大的迁移能力会使数据所有权变得更加重要。一条被记录的工作流程可能影响远超其原始工作场所范围的机器。
第三个信号,是可执行数据规则的出现。越来越多公司将同意、隐私和来源追溯描述为其采集流程的特性。
关键考验在于,这些承诺是否会成为合同条款、审计记录、删除流程和员工权利。仅有公开保证并不能解决数据如何被再利用的问题。
监管机构也可能审查记录是否构成生物识别或个人信息。不同司法管辖区和采集方式下,答案可能不同。
普通视频、精细手部模型和肌腱超声图像暴露的信息并不相同。雇主不应将它们视为可互换的数据。
技术进步将使这种区分更加复杂。MIT研究人员开发了一种超声波腕带,可在人移动手部时对肌肉、肌腱和韧带成像。
AI模型将这些图像转换为手掌和五根手指的位置。团队与八名志愿者测试了该系统,并追踪了22个自由度。
研究人员演示了控制机器人手弹奏简单钢琴曲,以及操作桌面篮球游戏。他们正在从更多不同手形和尺寸的人群中收集数据。
MIT教授Xuanhe Zhao表示,这种方法可为灵巧人形机器人提供大量训练数据。这款超声波腕带也展示了未来动作数据集可能变得多么私密。
头戴摄像头记录员工所见,而超声设备则记录皮肤下的内部运动。
这种技术演进使明确政策变得更加迫切。设备对人类动作捕捉得越精细,其输出就越有价值,也可能越敏感。
未来几个月将揭示,实体AI公司能否将更好的示范转化为可重复的运营能力。请关注报告持续表现、而非短期试验的部署案例。
也应关注围绕可穿戴采集的劳动协议。关于同意、二次使用、保存期限和报酬的详细条款,将表明员工数据权利正在成为运营要求。
最后,关注机器人模型能否在不同场地和机器之间泛化。如果能够,人的示范将成为可与大型AI训练语料相媲美的战略资产。
如果不能,实体AI仍将依赖成本高昂的现场定制工程和持续的人类干预。
员工教给机器的,不只是孤立的动作。他们正在一次次抓取、转动、纠正和恢复中,揭示实体工作的非书面结构。
关键问题不再是这些知识能否被记录,而是组织能否在使用它的同时,不抹去创造它的人。
开发者、雇主和劳动者在接受宏大主张之前,都应要求同样的证据:可靠运行、透明的数据来源,以及对被采集专业知识的实质性控制。
这一标准不会阻碍机器人学习。它会让实体 AI 经济体正视其最重要的智能来源——那些早已在从事这项工作的人类。


