HiPHI 人形运动数据集挑战以视频为先的机器人学习路径
HiPHI 发布了一套包含 617.5 小时数据的人形运动数据集,挑战了机器人学习中的一个核心假设:更多视频并不必然意味着更好的物理训练数据。这项发布将精确的全身动作与跟踪物体、语义标签及实体人形机器人的测试结合在一起。其核心判断是,机器人需要的是经过测量的物理状态,而非仅仅海量的视觉观察。
这一观点使 HiPHI 人形运动数据集处于两种既有路径之间。互联网视频提供了极其丰富的行为多样性,却缺乏可靠的关节、接触和物体状态。实验室动作捕捉能够提供这些状态,但许多现有数据集覆盖的行为较少,或未纳入同步物体数据。
HiPHI 试图通过结构化采集而非单纯堆叠原始数据量来弥合这一缺口。研究人员使用用于组织事件含义的语言系统 FrameNet,定义动作类别并生成变化组合。随后,他们利用这些数据训练强化学习策略,并将部分行为迁移至 Unitree G1 机器人。
HiPHI 人形运动数据集扩展训练记录
HiPHI 将规模、物理精度和具备物体感知能力的动作整合进一次公开研究发布,改变了可用训练数据的基础。
该项目于 2026 年 8 月 17 日提交至 arXiv,并于 9 月 8 日修订。根据其研究记录,论文已被 Conference on Robot Learning 2026 接收。
发布的数据集包含 617.5 小时运动数据及约 2.001 亿帧。研究人员通过光学动作捕捉系统,以 90 赫兹频率采集了 132 名表演者的源数据。团队称,标记点追踪精度达到亚毫米级。
不过,这一总时长需要结合背景理解。该发布对 308.7 小时原始采集数据应用左右镜像处理,形成报告中的 617.5 小时数据。镜像处理会交换相应的左右动作元素,生成有效的对应动作,因此它是一种有用的数据增强,而不是第二次独立采集。
数据总量分为 371.8 小时纯身体动作,以及 245.7 小时人机物交互。其中,交互部分占发布数据的 39.8%。其包括搬运、推拉、倚靠以及与被跟踪实体物体一同坐下等动作。
人体动作采用标准化的 55 关节 BVH 层级结构。BVH 是一种常见文件格式,用于存储骨骼结构及其随时间变化的动作。每个交互数据包还将身体记录与同步物体轨迹及高分辨率物体网格相连接。
公开的数据集文档列出了 40 个标准物体网格及其镜像版本。物体轨迹与对应身体文件共享时间戳,减少了实验前所需的对齐工作。
数据覆盖 12 个类别中的 40 件真实物体,范围从家具和容器到清洁工具与体育器材。这些物体报告中的重量介于 0.45 至 6.25 千克。
这一重量范围很重要,因为搬运轻型容器与移动重物需要不同的平衡策略。即使可见的手臂轨迹看起来相似,脚部、躯干和重心的运动也可能不同。
HiPHI 还为片段附加自然语言描述和语义标识符。由此形成的数据包支持动作检索、模仿学习、重定向、动作生成以及具备物体感知能力的控制研究。
这不只是一个更大的动画档案库。该发布围绕一个具体问题设计:一套动作集合能否在保持多样性的同时,保留足够的物理结构,让机器人策略能够实际执行?
为什么互联网视频留下了物理数据缺口
视频捕捉的是动作呈现出的样子,但人形控制依赖的物理状态,往往只能从像素中间接推断。
大型视频集合具有显而易见的吸引力。它们包含人们在家庭、工作场所、街道和陌生环境中执行的无数任务。这种多样性很难在动作捕捉工作室内复现。
然而,视频通常记录的是外观,而非完整的物理状态。学习系统必须估计深度、关节位置、被遮挡的肢体、接触关系和物体运动。这些估计误差可能在机器人策略开始训练前就不断累积。
以有人拖动装满物品的行李箱为例。摄像头记录了人物和行李箱,却无法直接提供力、摩擦、精确接触几何关系或清晰的骨骼轨迹。衣物可能遮挡关节,透视关系也会让深度判断变得不确定。
动作捕捉通过精确测量身体运动,解决了其中一部分问题。AMASS 等传统数据集已成为动画和人形控制的重要资源。但许多数据集最初面向动作合成、重建或图形学,而非受物体约束的机器人学习。
缺少物体,会让原本看似真实的片段在物理层面变得不完整。一个人似乎坐下了,但身体数据并未附带椅子的状态。表演者向前倾斜,但缺少支撑表面及接触关系。
基于该身体轨迹训练的策略可以模仿姿势,却无法理解令动作保持稳定的约束。这正是视觉合理性与可执行控制之间的区别。
真实机器人的示范提供了更直接的监督。它们已反映机器自身的关节、传感器和限制条件。但其弱点在于采集成本高,所得数据通常也仍与某一种机器人配置绑定。
因此,HiPHI 处于一个中间位置。人类表演者提供行为范围,光学捕捉则提供准确的运动状态。同步物体记录保留了纯身体数据集所丢弃的一部分交互结构。
这里的比较并非在所有情境下都将视频与动作捕捉对立起来。视频对于语义上下文、视觉感知和自然环境中的行为仍然很有价值。动作捕捉仍受制于工作室、标记点和预先规划的采集流程。
真正的争议在于,哪类数据应当作为可执行动作先验。动作先验是对身体通常如何运动所学习得到的模型。对于人形控制而言,其参考数据必须能经受从人体到比例和执行器不同的机器人的重定向过程。
HiPHI 的研究人员认为,在这一阶段,精度和物理落地性应得到更高权重。他们的基准测试将多个来源的数据转换为共享身体表示,并采用一致的评估程序进行比较。
这种方法对主要依赖重建互联网视频的团队形成压力。更大的视觉数据集能够描述更多情境,但其推断出的物理状态必须足够准确,才能与测量得到的轨迹竞争。
它同样对传统动作捕捉项目构成压力。当表演者反复执行狭窄的一组熟悉动作时,单有高精度并不足够。更难实现的目标,是在经过刻意设计的动作空间中实现精确且广泛的覆盖。
FrameNet 将语言转化为动作采集计划
HiPHI 的核心机制并非其摄像系统,而是利用语言结构决定哪些动作值得采集。
大多数动作数据集都从活动列表开始。设计者可能要求采集步行、跑步、坐下、挥手和抬举,然后随着新需求出现而增加脚本。这一过程能够产出易于理解的片段,但无法可靠衡量还缺少哪些内容。
不同的故事可以产生几乎相同的动作。擦拭额头上的汗水和遮挡阳光照向眼睛,可能使用相似的关节轨迹。将两者算作不同活动,可能夸大物理覆盖范围。
反向问题同样存在。“步行”这样的单个词,可以通过速度、路线、步幅、转弯半径、姿态和方向产生大量不同动作。单一活动标签可能掩盖显著的运动学多样性。
HiPHI 使用 Berkeley FrameNet 作为处理这种错配的框架。FrameNet 围绕事件、情境及唤起它们的词义组织语言。“框架”代表一种事件类型,而词汇单元则将某个词的特定含义与该框架关联起来。
例如,“run”可以表示人类运动,也可以表示经营一家公司。Frame-LU 对能够区分这些含义。HiPHI 选择与身体运动相关的配对,并将其转化为采集指令的种子。
该采集包含 22 个 FrameNet 框架和 214 个 Frame-LU 动作单元。这些单元覆盖移动、姿态变化、身体部位动作、物体操控、转移及相关交互模式。
每个语义种子都会沿可观察的物理维度扩展。表演者会改变方向、速度、幅度、姿态、节奏、身体部位参与方式、接触位置、负载和物体轨迹。
一个推动种子可以产生不同物体、负载、接触点和方向。一个步行种子可以改变路线、步速、转弯行为、步幅和身体高度。这些变化改变的是动作本身,而不只是改变其描述。
这与 WordNet 在构建 ImageNet 时发挥的作用相似。分类体系本身并不生成数据,而是提供一张有组织的地图,用以决定采集什么,以及哪些区域的覆盖仍然不足。
由此形成的分布既包含常见行为,也包含经过刻意设计的长尾。最常见的 50 个 Frame-LU 标签占已发布时长的 53.7%。其余 46.3% 位于这些常见单元之外。
表演者差异也体现在标签内部。HiPHI 报告称,每个 Frame-LU 的表演者中位数为 24 人,154 个单元至少包含 10 名表演者。这降低了某一动作类别仅仅反映单个人风格的可能性。
HiPHI 项目基准测试使用共享的无监督动作编码器衡量覆盖度。研究人员将数据集标准化为统一的 23 个关键点表示,以每秒 30 帧重新采样,并比较均衡样本。
在该流程下,HiPHI 在投影动作空间中占据了 1,620 个单元格。其最接近的大规模基线 BONES-SEED 占据了 1,438 个。HiPHI 还报告了 1,443 的有效占用率,而 BONES-SEED 为 1,114。
有效占用率反映样本在覆盖区域中的填充均匀程度。HiPHI 报告的优势表明,该集合并非只是在遥远区域放置少量离群样本,以此获得更广的覆盖度。
其长尾占比达到 14.1%,而 BONES-SEED 为 10.7%。研究人员在多个随机种子、投影设置和网格分辨率下重复分析,并报告称在每一种测试配置中均获得正向覆盖优势。
这些结果仍取决于所选择的表示方式和评估设计。二维投影无法完整描述复杂的动作流形。不过,均衡采样让这种比较比单看原始时长更具参考价值。
物体轨迹让交互数据具备物理实用性
机器人无法仅凭身体动作学习搬运、推动或拉动,因为物体会改变它必须执行的运动。
HiPHI 在记录表演者骨骼运动的同时,也记录物体的位置和朝向。每条轨迹都为每一帧身体动作提供一个条目,而网格则在共享坐标系中给出物体的形状。
这构建了一个人与物体相互关联的表征。身体并非只是模仿拿着箱子;数据集记录了表演者改变姿势、调整抓握高度或转移重心时,箱子如何随之运动。
这一差异对全身控制至关重要。推动重物可能需要身体前倾、站姿更宽以及不同的落脚位置。拉动行李箱时,随着阻力变化,躯干和支撑腿也会发生调整。
物体网格还明确了几何信息。椅子的表面决定坐下时应在何处发生接触;容器的尺寸则会影响手部位置、双臂间距,以及躯干是否需要弯曲。
HiPHI 使用两项指标评估这种对齐效果。无冲突率用于检查采样的人体骨骼是否避免穿透物体;近表面贴合度则衡量人与物体是否保持足够接近,以使交互看起来合理。
该数据集报告的无冲突率为 98.1%,近表面贴合度为 95.7%。HIMO 分别达到 97.6% 和 79.0%,OMOMO 则为 90.6% 和 50.4%。
这些数字表明 HiPHI 在所选几何测试中占优,但并未衡量接触的所有方面。手部可以停留在物体附近,却并未施加真实的力。这些指标也无法验证摩擦、触觉反馈或抓握稳定性。
规模依然是显著差异。HiPHI 报告了 245.7 小时的交互数据。其论文将这一数字与 HIMO 参与评估的 21.6 小时物体轨迹数据,以及 OMOMO 的 9.8 小时进行了比较。
团队还评估了运动平滑性和常见的接触伪影。在采用可比地面约定的数据集中,HiPHI 在五项选定指标上的数值均为最低。
其第 95 百分位地面穿透量为 8 毫米,而 BONES-SEED 为 18 毫米,AMASS 为 111 毫米。无支撑悬浮占评估时长的 0.015%,支撑点漂移则为每秒 64 毫米。
这些是数据集层面的测量结果,并不保证每段片段都如此。不过,它们瞄准了策略优化过程中至关重要的误差。脚部滑动或与地面接触不一致,可能会让控制器追逐物理规律不允许实现的参考动作。
后续交互基准在重定向后测试了踢、搬运、推动和倚靠序列。HiPHI 在多项比较中实现了更低的身体跟踪误差,但并非全部如此。
推动任务说明了为何需要谨慎解读结果。HiPHI 在推动时的身体 MPJPE 为 99.20 毫米,劣于 OMOMO 的 66.09 毫米。MPJPE 衡量对应关节之间的平均位置差。
与此同时,HiPHI 在该类别中产生了显著更低的物体位置和朝向误差。这一结果表明,匹配物体运动与匹配人体姿势可能会带来相互竞争的要求。
搬运任务也呈现出另一种混合结果。HiPHI 的身体误差低于两个对比结果,但物体位置误差更高。这些变化意味着不能简单宣称某一个数据集在所有下游任务中都获胜。
HiPHI 增加的是一个更大的试验场,用于研究这些权衡。研究人员可以考察身体跟踪、物体跟踪和物理稳定性何时相互一致,以及优化其中一项何时会损害另一项。
强化学习将 HiPHI 动作迁移至 Unitree G1
HiPHI 的重要性在于,其研究人员没有止步于静态数据集统计,而是测试了训练后的策略能否在真实硬件上执行选定动作。
团队将人类动作重定向至 Unitree G1,这是一款在身体比例和驱动限制方面均不同的人形机器人。重定向会将源骨骼的运动转换为适配目标机器人的参考动作。
对于仅涉及身体的测试,研究人员采用 DeepMimic 风格的强化学习流程训练策略。DeepMimic research 确立了一种广泛使用的方法,用于从参考动作中学习基于物理的技能。
该基准在匹配的数据预算下,将 HiPHI 与 AMASS、LAFAN1、Motion-X++ 和 BONES-SEED 进行了比较。每个数据源均经过相同的重定向和策略训练流程。
据称,HiPHI 在三小时和 20 小时两种训练设置中都取得了最高成功率和最快收敛速度。该比较采用五次独立训练运行,并测量训练过程中的失败率。
另一项扩展实验将未经镜像处理的 HiPHI 训练数据从 3 小时增加到 300 小时。随后,研究人员使用来自另外四个数据集的留出动作对所得策略进行评估。
论文称,随着 HiPHI 训练集扩大,跨数据集关节位置误差持续下降。该实验重复进行了 10 次,结果以均值曲线和方差带报告。
这一模式支持了该项目的核心主张:额外的结构化动作数据能够持续改善泛化能力,而不只是重复常见动作。它还将数据集规模与实际控制指标联系起来。
最后一步是将策略部署到实体 G1 上。机器人完成了跑步、坐下、爬行、搬运箱子、翻滚和拉行李箱等动作。这些试验使策略暴露于执行器限制、传感噪声以及仿真到现实的差异之中。
这些演示具有意义,因为许多动作数据集止步于重建质量或仿真结果。实体部署提供了更有力的证据,表明至少部分选定参考动作能够经受重定向和硬件约束。
不过,“现实世界迁移”不应被理解为通用自主能力。报告中的试验覆盖的是受控条件下选定的行为,并未展示机器人能够独立感知陌生物体、规划任务,或适应开放式工作环境。
跟踪策略解决的问题也比完整机器人智能体更为狭窄。它在维持物理稳定性的同时跟随参考动作,并不一定能够决定该执行什么动作,或理解人为何执行该动作。
因此,G1 演示验证的是可执行性,而非完整的任务智能。随着实体 AI 公司越来越常将令人印象深刻的动作视频与更广泛的实用劳动主张联系起来,这一区别尤为重要。
HiPHI 最强的贡献位于技术栈更底层。它提供的参考数据可帮助策略学习协调、平衡和受物体条件约束的运动。规划和感知系统随后可以在这些能力之上构建。
实际工作流程同样要求较高。研究人员必须重定向 BVH 文件,考虑机器人的关节限制,在仿真中训练,并在真实部署前验证安全性。
项目文档明确警告,动作需要针对所选具身平台进行重定向和检查。适用于 G1 的参考动作不会原样迁移到每一种人形机器人上。
对于工程团队而言,数据集检查和实验跟踪因此必不可少。可搜索的工程知识库可以帮助关联动作标识符、训练配置、失败情况和硬件观察结果,而无需改变底层机器人工作流程。
HiPHI 结果仍未衡量的内容
HiPHI 缩小了动作数据缺口,但它并未捕捉通用人形行为所需的完整物理、感知或社会语境。
第一个限制是环境多样性。所有源动作均在工作室中采集。这样的环境支持精确测量,却排除了受控设施之外常见的杂物、光照变化、不平整表面和意外障碍物。
互联网视频则呈现相反的特征:它提供杂乱的环境变化,却牺牲了精确的物理状态。HiPHI 强化了这一权衡的一端,而非将其消除。
第二个限制涉及力。该版本记录的是运动学,即身体与物体如何运动;它并未直接测量接触力或触觉信号。
这一缺失对操作任务至关重要。两段片段可能呈现相似轨迹,却涉及不同的抓握压力、摩擦力或阻力。控制器可能需要这些隐藏量,才能处理易碎、可变形或湿滑的物体。
第三个限制是社会交互。HiPHI 目前仅涵盖单人动作,排除了多人行为和直接的人与人接触。
在人类身边工作的人形机器人,最终必须建模交接物品、共同搬运、协作运动和避碰。这些任务需要能够表示两个身体及其不断变化意图的数据。
第四个问题是数据增强。报告中近一半的发布时长来自左右镜像。这提升了有效覆盖范围,尤其是单侧行为的覆盖,但并未增加新的表演者或采集会话。
因此,读者应区分发布时长与独立录制时长。两个数字针对不同目的都有效,但回答的是不同问题。
第五项顾虑是基准独立性。大多数已发布的比较与部署证据均来自数据集创建者。CoRL 的接收增加了同行评审环节,但更广泛的信心仍需要外部团队复现结果。
独立研究人员应测试 HiPHI 是否能在不同重定向器、策略架构、机器人身体和评估指标下保持优势。较小平台或采用不同关节布局机器人的结果将尤其具有参考价值。
许可协议也会影响实际采用。该数据集采用 CC BY-NC 4.0 许可,允许署名后的研究使用,但限制商业使用。公司在将这些文件纳入产品训练前,必须评估这一限制。
公开数据包中的隐私暴露似乎有限。该版本包含动作、轨迹、网格和匿名化的表演者属性,不包含采集的 RGB 视频、音频、面部图像或语音录音。
不过,动作本身可能携带个体特征。作者使用数字化演员标识符和概括性人口统计元数据,这既支持分析,也降低了直接识别风险。
最后,物理上可执行的模仿并不等同于成功完成任务。机器人可以复现搬运动作,却未必能够识别正确的箱子、选择目的地,或在有人挡住路径时恢复执行。
HiPHI 应被视为动作基础设施。它解决的是人形机器人如何获得多样、贴合地面的运动参考;它并不声称解决感知、语言条件规划、安全认证或开放世界自主性。
这一更收敛的定位让这项工作更可信。悬而未决的问题是,该数据集会成为跨研究团队可复用的基础,还是仍与其创建者的评估栈紧密耦合。
三个信号将揭示 HiPHI 是否改变人形机器人学习
下一个考验是采用情况:独立复现、更广泛的具身迁移和更丰富的物理感知,将决定 HiPHI 的长期价值。
第一个信号是独立基准复现。研究团队需要下载该版本,重新训练可比策略,并在已记录的条件下报告结果。
复现将加强这样一种主张:HiPHI 的覆盖范围和精度驱动了性能。若结果存在显著差异,则可能表明训练选择、重定向方式或未公开的操作细节,比数据集本身贡献更大。
第二个信号是超越 Unitree G1 的迁移能力。基于 HiPHI 得出的策略,应在具有不同身体比例、关节活动范围、执行器强度和控制频率的人形机器人上进行评估。
成功的多机器人迁移将支持这样一种观点:该数据集捕捉到了可复用的人类运动结构。迁移效果不佳则表明,针对具体具身形态的适配仍是主要瓶颈。
第三个信号是互补感知。未来的数据集或扩展版本应将精确运动与力觉、触觉及第一人称视觉环境联系起来。
这些模态能够弥补 HiPHI 最明显的盲区。力数据可以区分轻微接触与承重支撑,而第一视角视频则能将动作与表演者所见的环境关联起来。
最具前景的路径或许不是替代数据来源,而是将它们结合起来。高保真动作捕捉可提供可执行的物理参考;互联网视频可提供环境与行为的广度;机器人演示则可将两者锚定到特定硬件上。
HiPHI 通过提供结构化、可检索的运动层,使这一混合方向更易于评估。其 Frame-LU 系统也为跨来源采样或关联相关示例提供了语义抓手。
研究人员现在应提出具体问题:使用其长尾动作训练的策略,能否更好地从扰动中恢复?同步的物体记录能否提升捕捉工作室之外的任务成功率?其语义结构能否帮助模型根据语言指令选择动作?
HiPHI 人形机器人运动数据集并未终结关于视频规模与物理精度之间的争论。它通过连接采集设计、可量化的数据质量、策略训练和真实机器人执行,提高了这场讨论的标准。
下一步有价值的工作是直接实验:下载一个子集,审查其中镜像和原始序列,重定向若干交互类别,并在发布成功演示的同时公布失败案例。这些结果将揭示,结构化人类运动究竟会成为物理 AI 的共享基础设施,还是又一个令人印象深刻、却难以被机器人带入陌生环境的基准。



