top of page

世界人形机器人运动会测试:科技新闻热潮与自主现实的碰撞

世界人形机器人运动会在开幕日前便进入科技新闻视野,测试画面显示,这些机器在压力下奔跑、格斗、跌倒并重新站起。

第二届赛事定于 2026 年 8 月 22 日至 26 日在北京国家速滑馆举行。这个时间点很重要。赛前流传的片段展示的是彩排和训练,而非经核实的比赛结果。

因此,真正的较量远不止于一场赛跑或拳击赛。组织方希望提高自主性要求并增加更实用的项目,而机器则必须克服首届赛事中暴露出的、严重依赖人工干预的现实。

这种张力让这些测试比一组新奇的体育视频更有意义。它们提前展现了人形机器人能否从受控演示走向可重复执行实体工作的进展。

测试是预览,不是结果

这段热门画面记录的是赛前准备,而真正的竞赛证据将在 8 月 22 日赛事开幕后才开始出现。

引发当前关注的 Bilibili 搜索词大致可译为“世界人形机器人运动会运动员测试”。它并未指向某一项官方测试、某支队伍或经过验证的表现。

这种区分能避免一段热门视频被误当作正式纪录。完成彩排的机器人,仍可能使用与最终规则不同的条件、支持方式或控制方法。

已确认的活动是第二届世界人形机器人运动会。赛事将在通常被称为“冰丝带”的国家速滑馆举行,为期五天。

组织方称,活动已吸引来自六大洲 16 个国家的 666 支队伍和 2,056 台机器人。这些数字意味着相较首届赛事出现了显著扩张。

首届赛事于 2025 年 8 月举行,来自 16 个国家的 280 支队伍和超过 500 台人形机器人参与其中。据组织方称,参赛队伍数量因此增长了 138%。

已公布名单中,国内参与者占据主导地位。中国将有来自 157 家企业和 200 所大学或科研机构的 641 支队伍、1,975 台机器人参赛。

这样的规模改变了测试的含义。工程师们并非在为一场使用相同硬件、按统一标准进行的比赛做准备。

他们正在为数十种竞赛和实用任务调校不同的机体、控制系统、传感器、执行器与软件栈。每项任务都会暴露不同的故障模式。

跑步测试考验平衡、抗冲击能力和持续步态控制。足球则增加了感知、协同、接触以及围绕其他移动机器作出决策的要求。

举重考验关节与结构设计。跳远要求在起跳或落地时不失去平衡的爆发性动作。

乒乓球将感知和动作压缩到零点几秒之内。机器人必须定位球、估计轨迹、调整站位,并准确回球。

情景竞赛引入了不那么戏剧化、却更具商业相关性的问题。已公布类别包括工业作业、物流、零售、酒店服务、家务、消防和救援。

赛事规模和范围已在组织方的赛事说明中披露。不过,已宣布的报名不应被混同为已完成的起跑或成功表现。

同样的谨慎也适用于热门测试视频。它们的价值在于展示各队正在尝试什么,以及机器在正式计分开始前在哪些环节遇到困难。

它们并不能证明哪台机器人最快、最自主或最可靠。这些判断需要最终规则、可比条件、经验证的计时数据和干预记录。

这种验证缺口正是本报道的核心。测试是真实的,但得出最强结论仍为时过早。

为什么这则科技新闻的意义超越机器人体育

这些赛事正成为实体 AI 的公开压力测试,而不只是为娱乐现场观众而设计的表演。

实体 AI 指的是通过机器在现实世界中进行感知和行动的软件。与聊天机器人不同,人形机器人必须应对摩擦、动量、不均匀接触和机械磨损。

语言模型说错一句话不会因此摔倒。人形机器人一次错误的实体决策,就可能损坏自身、附近设备或伤及他人。

体育让这些失误格外显眼。一步踩空、一次反应延迟、一个薄弱关节或一次不稳定落地,几秒钟内就会一目了然。

这种可见性对工程师很有用,因为实验室演示常常会去除不便的变量。团队可以控制照明、地面、障碍物、时间安排以及机器人周围的人。

比赛则减少了这种控制。它引入时间压力、陌生对手、重复尝试和公开评分。

这种形式还会在机器工作范围的边缘产生数据。组织方认为,每多跳出一厘米、每多举起一公斤,都反映了设计和组件测试方面的改进。

这一说法需要谨慎解读。更好的比赛成绩可以体现工程进展,却不能证明同一台机器人已准备好从事无人监督的工作。

不过,与产业的联系正变得更直接。据报道,2026 年项目中超过 40% 由聚焦应用的情景赛事构成。

这些项目让机器更接近企业希望自动化的任务。例子包括物料搬运、工业装配、酒店服务、超市工作和应急响应。

应用项目反映出从奇观展示转向面向部署测试的刻意转变。

以酒店服务任务为例。在大堂中行走固然重要,但物体操作、路径规划、避让人员、沟通以及从意外中断中恢复同样重要。

仓库场景则提出另一组要求。机器人需要可靠抓取、载荷控制、导航、续航,以及在工作人员周围安全行动的能力。

这些任务在视觉上不如格斗刺激,却与企业买家判断人形机器人能否提供可靠工作更相关。

这也是赛事对开发者同样重要的原因。糟糕的结果可能揭示:感知、规划、控制或硬件仍是限制因素。

它对关注 AI 发展的知识工作者也有意义。软件智能正越来越多地与在屏幕之外运行的机器相连。

团队需要整合研究论文、日志、测试视频、硬件修订记录和事故笔记。可搜索的技术知识库可以帮助保留每次失败运行带来的经验。

因此,更广泛的科技新闻故事并不在于机器人能够模仿体育运动,而在于公开竞赛正在成为评估具身系统的一种方法。

这种方法能否预测商业成功仍未有定论。不过,它能提供比经过精心剪辑的产品演示更清晰的证据。

自主性如今是主要对手

决定性的较量不是机器人对机器人,而是自主表现对隐性人工协助。

自主性意味着机器能够感知条件、选择行动并执行,而无需持续的人类控制。它并不要求机器人在没有预先编程的情况下运行。

关键问题在于任务开始后会发生什么。机器人是依据自身传感器作出决策,还是由操作员远程指挥其动作?

首届赛事暴露了这种区别的重要性。机器人进行了赛跑、拳击、舞蹈和足球比赛,但人工支持始终紧贴现场。

美联社记录了机器跌倒、瘫倒、接受维修以及被从赛场抬走的情况。操作员也留在附近,提供引导、更换电池和机械调整。

这些比赛故障并未让首届赛事失去价值。它们为公开人形机器人竞赛实际需要什么建立了基线。

据报道,2026 年规则将更重视自主性。一些项目旨在限制或禁止遥控,从而提高感知和规划不可靠所付出的代价。

这一转变改变了成功表现的含义。遥控驾驶的机器人可以展示令人印象深刻的机械能力,同时规避最困难的决策问题。

自主机器人必须先理解不断变化的环境,身体才能作出反应。软件或硬件任一方面的薄弱都可能终止尝试。

足球清楚地说明了这一问题。机器人必须识别球、队友、对手、场地边界和球门位置。

随后,它必须在维持平衡的同时选择路径。接触或视觉遮挡可能会在机器人迈出下一步前使计划失效。

乒乓球形成了更快的循环。自主挑战赛称,参赛机器人必须在没有遥控、脚本或干预的情况下进行感知、预测、规划和击球。

这一标准与重放一段编排好的动作序列有实质区别。它测试的是机器能否在实时条件下将感知连接到动作。

自主性也能让比较更加公平,但前提是组织方清晰披露相关信息。观众仅凭短视频,无法可靠地区分遥控与机载决策。

流畅的表现可能依赖人工指令。动作笨拙的机器人可能正在独立解决更困难的任务。

科技新闻报道往往偏爱流畅的片段,因为它看起来更先进。如果评分奖励独立性并记录每次干预,赛事就能纠正这种激励。

干预日志应显示人类何时重置、扶持、维修或重新引导机器。它们还应区分紧急安全行动与控制协助。

没有这些记录,完赛时间可能会形成误导性的排行榜。一台多次获得操作员帮助的更快机器人,可能不如一台较慢的自主参赛者更有能力。

组织方已在相关赛事中展示了这一原则。据报道,北京 2026 年人形机器人半程马拉松对一台使用人类遥控的更快机器施加了处罚。

这种做法承认了一项基本现实:通过遥操作获得的速度,并不代表与自主导航相同的技术能力。

如果每项结果都附带自主性分类,赛事将更具价值。否则,经过精细打磨的机器与独立运行的机器仍然难以比较。

更大的参赛规模带来更好的数据,也带来更多噪声

更大规模的竞赛可以暴露罕见故障,但规模本身并不能证明技术成熟度。

已公布的增长幅度相当可观。2026 年赛事列出的机器人数量超过 2025 年赛事的四倍。

由 2,056 个参赛条目构成的阵容,提供了更多观察跌倒、组件故障、反应延迟、恢复行为以及不同轮次间表现差异的机会。

这种数据量很重要,因为可靠性无法通过一次成功尝试来衡量。一台完成过一次任务的机器人,可能会在电池升温或关节承受反复冲击后失败。

多个团队也鼓励不同技术路线之间的比较。有些可能偏好更轻的机身和更快的移动速度,另一些则优先考虑稳定性、载荷或抗跌倒能力。

高校可以测试实验性控制方法。制造商则可以评估面向客户、开发者或集成商的平台。

仅北京信息科技大学就计划派出49支队伍,参加119个竞赛项目。其参赛项目涵盖竞速、足球、体操、舞蹈、工业作业、零售、救援和灵巧操作等。

如此广泛的项目设置,能够揭示同一平台能否迁移至不同任务。迁移能力之所以重要,是因为一款具有商业价值的人形机器人,不能每接到一项任务就需要进行一次完整的工程重构。

不过,已公布的参赛数量存在重要歧义。它指的是已报名参赛的机器人数量,并不一定代表独特的硬件型号或已确认实际出场的参赛者。

同一机构可以注册多支队伍或多个单位。一些机器人可能参加多个项目,也有部分报名可能会在比赛开始前退出。

参赛阵容在地域上也并不均衡。尽管主办方称参赛者来自16个国家,但已公布的队伍和机器人大多来自国内机构。

这并不意味着赛事无效,但确实限制了将其结果视为人形机器人产业全球均衡比较的说法。

赛事还融合了科研、娱乐、教育和工业推广等目标。这些目标可以并存,但并不采用完全相同的评判标准。

观众希望看到戏剧性的动作和直观的对抗。科研基准则需要可重复的条件、透明的指标,以及足够细节供独立分析。

制造商希望展示有利的一面。企业买家则需要看到正常运行时间、安全性、维护需求和整体运营投入的证据。

如果赛事结果提供的不只是奖牌,便能产生最有价值的数据。完成率、人工干预次数、能耗、维修时间和可重复性,都会提供更完整的图景。

故障恢复尤其值得关注。能够安全跌倒并自行恢复运行的机器人,可能比动作更快、却每次出错后都需要技术人员处理的机器人更有实用价值。

同样的原则也适用于场景类比赛。一次完成酒店或仓库任务,对于其在完整工作班次中的表现几乎说明不了什么。

商业部署依赖于日常的重复执行。机器人必须能够应对变化,不能把每一个异常物体或障碍都变成一次工程事故。

这正是公共科技新闻与采购证据的分界所在。一段爆红视频只能回答一台机器能否完成某个动作。

买家需要知道它成功的频率、所需监督程度,以及失败后会发生什么。

这项赛事可以开始回答这些问题。但如果没有一致的信息披露,它无法彻底解决这些问题。

爆红视频仍无法证明什么

当前画面展示了物理能力,但并未验证自主性、可靠性、安全性或经济实用性。

短视频将漫长的工程过程压缩为最具戏剧性的几秒钟。它们通常省略失败尝试、准备时间、维修过程,以及一次运行周围的条件。

这种剪辑方式对社交媒体而言很正常。但当观众把一段视频当作完整的技术评估时,问题就出现了。

热搜词并不能证明每段流传视频的拍摄日期。一些素材可能来自当前训练、更早的彩排,或2025年的赛事。

来源页面也没有提供一篇带有已验证发布时间戳的底层报道。8月20日标注的是热搜背景,而不是搜索结果中每一段视频的拍摄时间。

因此,读者应谨慎看待那些标注了具体速度或纪录的说明。一项声称的测量结果,需要已知赛道、计时方法、机器人身份以及官方成绩作为支撑。

一项被广泛传播的社交媒体说法称,某台 Unitree 机器人超过了 Usain Bolt 的最高速度。在没有经过验证的计时结果和可比测量条件的情况下,这一比较仍不可靠。

机械峰值速度并不等同于人类短跑的计时成绩。跑步机测试、辅助起跑、短时冲刺和剪辑视频,可能产生无法相互比较的数据。

即便是官方赛事纪录,也需要放在具体背景中理解。机器人的尺寸、控制方式、场地、起跑程序、跌倒情况和人工干预罚则都会影响结果。

安全性仍是另一个尚未解决的问题。高速奔跑、格斗、举升和跳跃会给关节及周围空间施加巨大作用力。

比赛场地可以设置围栏、裁判、紧急停机系统和限制进入措施。家庭、工厂、医院和酒店的环境则更难预测。

一台能在受控跑道内工作的机器,并不意味着它已经证明能在儿童、患者、顾客或工业车辆周围安全导航。

耐久性同样尚不确定。高动态动作可能加速电机、减速器、轴承、电池和结构部件的磨损。

团队可能会针对几次竞赛运行优化机器人。商业运营方需要的是在数周或数月内保持性能,同时具备可控的维护成本。

能耗也将十分重要。运动表现可能在短时间内需要高功率,而工作场景中的价值取决于持续运行能力和实际可行的充电周期。

这些赛事曾因大型机器人活动的公共投资是否带来足够价值而受到批评。支持者认为,竞赛能够产生数据、培养人才、展示产品并支持出口。

两种立场关注的都是赛场之外的结果。一场成功的赛事并不保证产品具备商业可行性,但协调测试仍可能加速工程学习。

最有力的评估应避免两个极端。跌倒并不能证明人形机器人毫无用处,杂技般的表现也不能证明大规模部署已近在眼前。

去年的机器通常需要技术人员、电池更换和物理辅助。这段历史提供了评估2026年参赛阵容应有的标准。

进步将体现在更少的人工干预、更好的恢复能力、更长的自主运行序列,以及可重复的任务完成表现。单凭视觉奇观无法提供这些证据。

比赛开始后值得关注的三个信号

开赛后的首批结果,应从自主性披露、可重复性以及实际场景中的表现来评判。

第一个信号是主办方如何报告人工参与情况。每一项严肃的成绩都应说明控制方式是自主、监督式还是远程控制。

这一披露将决定观众能否公平比较不同机器。它也会揭示更严格的规则是否会改变领先队伍的格局。

如果自主参赛项目能够与远程控制机器相匹敌,那么具身 AI 的论据将得到加强。如果人类引导系统仍占主导,软件差距依然很大。

关注人工干预频率,而不只是完赛时间。一台速度较慢、却能独立完成任务的机器人,可能比一台需要多次重置的更快机器代表着更大的进步。

第二个信号是跨轮次的可重复性。一次干净利落的运行可能来自有利条件,而多次稳定完成则说明系统正变得可靠。

留意那些能在接触、意外障碍或失去平衡后恢复的机器。在技术人员无法立即进入场地的环境之外,独立恢复至关重要。

理想情况下,最终排名应纳入失败起跑和未完成尝试。删除这些结果会夸大最亮眼表现的稳定性。

第三个信号是体育项目与应用场景之间的差距。奔跑和格斗揭示了有用的物理极限,但工业和服务任务会测试更广泛的协调能力。

一台机器人可能跑得很好,却难以拆开一个箱子。另一台可能移动缓慢,却能以更少错误完成装配或物料搬运。

因此,实用类别应获得与奖牌项目同等的关注。它们将赛事与工厂、物流中心、酒店、商店和应急行动联系起来。

官方赛事网站列出了训练指南和赛事更新。读者应利用这些材料,将规则变化与附着在爆红视频上的说法区分开来。

本届赛事也延续了北京首届活动,后者最初是一项大型公共实验。一份官方的2025年赛事预览展示了这一赛制扩展得多么迅速。

关键问题已经不再是人形机器人能否吸引观众。去年已经证明,观众会为竞速、格斗、进球和恢复动作欢呼。

问题在于,第二届赛事能否产生娱乐之外仍具价值的证据。清晰的自主性分类、人工干预记录和可重复的结果,将强化这一论点。

披露不足则会产生相反效果。科技新闻受众将只能比较视频片段,却无从得知哪些机器面对了最严苛的技术约束。

赛前测试已经暴露出核心矛盾。人形机器人如今能够呈现令人信服的运动能力瞬间,而可靠的自主性仍更难验证。

正式比赛开始后,请忽略最喧闹的单一视频。应追踪哪些机器人能够反复完成比赛、独立恢复,并在没有隐性协助的情况下完成实际工作。

这些信号将表明,世界人形机器人运动会是否正在成为可信的物理 AI 基准,还是仍将是一场雄心勃勃的公共展示。当官方结果公布时,哪些证据会影响你的判断?

 
 

免费开始

一款本地优先的AI助手,具备个人知识管理功能

为了获得更好的人工智能体验,

remio 目前仅支持Windows 10+ (x64)M-Chip Mac

你的 AI 工作伙伴

remio 一起高效工作

规划、创作、交付

一站式完成

bottom of page