top of page

TableVerse 重建真实桌面,挑战凭空想象的机器人训练世界

TableVerse 发布了 10 万个重建的桌面场景,对可扩展机器人训练背后的一项基本假设提出挑战。它的流程并不让生成式模型凭空想象房间,而是根据真实互联网图像重建布局。

这一区别至关重要,因为一个好看的 3D 场景未必就对机器人有用。物体可能相互穿插、悬浮、比例错误,或处于在物理引擎中会坍塌的摆放状态。

TableVerse 论文提出了另一条路径。ByteDance 的研究人员将非结构化图像转换为机械稳定的场景,再在其中生成无碰撞的抓取与放置示范。

最终形成的 TableVerse-100K 数据集包含 100 万个物体实例,涵盖 35,000 个语义类别。其场景覆盖七类日常桌面主题,包括办公室、厨房、餐区、卧室和起居空间。

这些数字使 TableVerse 的规模明显超过若干早期桌面数据集。不过,规模并非其核心主张。真正的较量在于:基于真实场景的重建,对阵凭想象生成场景。

文本条件系统能以较低采集成本提供丰富变化,但其布局继承了模型对于人们如何摆放物品的假设。TableVerse 则将观察到的杂乱视为有价值的训练结构。

这一选择为项目带来了明确优势,也带来了同样明确的弱点。互联网图像提供了真实的物品摆放方式,但单张照片永远无法揭示场景完整的几何与物理信息。

TableVerse 将互联网图像转化为机器人训练场景

TableVerse 改变了仿真生成的输入:它采用观察到的摆放关系,而非对摆放关系的文字描述。

研究团队于 2026 年 7 月 23 日提交了论文首版。作者 Boyuan Wang、Yue Zhang、Xutao Xue、Xueyu Song 和 Yu Sun 均标注其隶属于 ByteDance。

其 Real2Sim 流程从一张展示桌上物品的普通图像开始。Real2Sim 指的是将真实场景重建为可交互的仿真环境,使软件能够检查、移动并测试其中的对象。

这样的输入可能包含合成示例通常会去除的棘手细节。碗中可能装着餐具,包装物可能彼此接触,小物件也可能被较大物体遮挡。

系统首先通过开放词汇检测识别可操作物体。与受限于固定标签列表的检测器不同,这种方法可借助语言引导的视觉识别,为此前未指定的物体命名。

TableVerse 在这一阶段使用 ByteDance 的 Seed-1.8 模型。提示词要求检测器区分普通物体与复合物体,例如装有可独立移动内容物的容器。

系统还会排除无关的视觉元素,包括手和身体部位。随后,分割步骤会为每个检测到的物体生成图像掩码,将其可见像素与背景隔离开来。

Depth Anything 3 估计场景几何结构并生成点云。点云以三维空间中的坐标表示可见表面,而不是以平面图像像素表示。

该流程会估计桌面平面,并利用其法线确定重力方向。这一步让重建环境与一致的垂直轴对齐,并恢复以真实尺度计量的位置和大小。

随后,SAM3D 根据分割出的物体生成单独的 3D 资产。流程会按照从源图像恢复的位置放置这些资产。

这一过程不同于仅仅生成一张外观相似的图像。每个重建资产都必须成为独立的仿真对象,具备几何形状、碰撞边界、位姿、质量和接触行为。

容器构成了尤其困难的一类情况。照片可能显示碗中装着苹果,但标准重建可能会将内容物和容器融合为一个装饰性网格。

TableVerse 分别重建容器和嵌套物体,再在模拟重力下将内容物落入容器中,在保留独立操作能力的同时生成有效接触关系。

由此可支持融合网格无法表达的任务。模拟机器人可以从碗中拿起一个苹果,而不会将碗和所有苹果视作同一个刚体。

这种对复合物体的处理支持了项目更广泛的目标。TableVerse 并不只是试图复现桌面看起来如何,而是要恢复机器人能够在那里做什么。

场景稳定后,多模态模型会检查渲染出的正视图和俯视图。它会提出包含合适源物体、目标物体和空间关系的抓取与放置任务。

系统为这些任务生成抓取候选,并选择无碰撞的机器人运动轨迹。这些轨迹将重建布局转化为操作策略可以学习的示范。

项目图库展示了场景及其模拟执行过程,包括将水果移入碗中、整理桌面物品,以及将物品放置到指定目标附近。

因此,TableVerse 在一条自动化流程中整合了三类数据产品:重建场景、物体级仿真资产,以及任务条件化的运动示范。

这种整合很重要。没有动作的大型场景集合可以支持感知研究,但操作训练还需要将观察、目标和机器人运动联系起来的示例。

真实杂乱让合成布局承受压力

TableVerse 认为,人类环境中不整齐的结构是训练数据,而不是应当去除的噪声。

自动化机器人训练环境通常遵循两条宽泛路线。一条从视觉证据中重建场景,另一条要求程序化系统或生成模型创建新的摆放方式。

生成式方法能够快速产出大量环境,也允许对物体类型、颜色、位置和任务难度进行可控调整。

不过,语言模型通常会通过简化的语义规则理解桌面。它可能把杯子放在笔记本电脑旁,或把水果放进碗里,因为这些组合在统计上十分常见。

这些布局看起来可能合理,但其密集程度仍可能低于真实住宅和工作场所。它们也可能遗漏局部遮挡、不规则堆叠、混合物体尺度和意外接触。

TableVerse 将这些不规则性置于核心位置。一张来自互联网图像的拥挤桌面保留了真实人类作出的决定,其中包括任何程序规则都未明确编码的决定。

流程的规模放大了这一差异。TableVerse-100K 包含 100,000 个独特环境,以及约 100 万个被放置的物体实例。

作者报告称,其中约有 35,000 个语义物体类别。这一长尾范围超出了经人工筛选的机器人数据集中常见的狭窄分类体系。

其七类场景主题涵盖办公桌、厨房、餐厅、卧室、起居室、书房及其他日常桌面环境。这些主题提供了可辨识的背景,同时不会强迫每个示例套入相同模板。

较早的一项对比有助于说明规模变化。2022 年推出的 TO-Scene 数据集采用 CAD 物体、扫描桌面、众包摆放以及模拟扫描。

TO-Scene 在其初始摘要中报告了跨三种变体的 20,740 个场景。其详细数据集则结合了 16,077 个桌面场景,覆盖 52 个常见物体类别。

这项工作弥补了桌面数据的重要缺口,并包含真实扫描测试集。不过,其构建仍依赖于将现有 CAD 物体转移到选定桌面上。

TableVerse 以从非受控图像中提取的证据取代了这一摆放过程。因此,该流程在保留观察到的空间关系的同时,扩大了场景数量和类别覆盖范围。

MesaTask 提供了另一个参照点。其任务驱动基准包含约 10,700 个桌面场景,覆盖六类室内桌面类别。

MesaTask 强调为指定操作任务创建的布局。人工专家参与校正位置、方向和尺度,这有助于保证质量,但限制了完全自动化的扩展。

TableVerse 则押注于相反的方向。它偏向自动化和互联网规模的数据来源,随后在重建后加入过滤和物理校正。

这一比较并非新旧数据集之间的简单竞赛。每个数据集都针对“有用的真实感来自何处”这一问题给出了不同答案。

TO-Scene 将扫描结构与精心筛选的 CAD 资产结合。MesaTask 围绕明确任务构建场景。TableVerse 则先观察真实摆放,再从中推导可能的任务。

这种顺序会影响机器人在训练中遇到的情形。任务优先的生成可以保证场景支持目标行为,但也可能让所有物品围绕基准测试而摆放。

场景优先的重建则捕捉并非为机器人设计的配置。任务生成器随后必须在这些约束内寻找可行操作。

对于泛化而言,这种额外摩擦可能具有价值。家用机器人不会进入按照其基准测试指令摆放的厨房。

它必须理解为人类而设的布局,选择可触及的物体,避开周围杂物,并处理不熟悉的组合。TableVerse 试图在任何实体机器人进入场景前复现这些条件。

然而,观察到的布局并不自动等同于具有代表性的布局。互联网照片反映的是人们选择拍摄、上传并使其在视觉上清晰可辨的内容。

风格化办公桌、烹饪演示、房地产图片和产品摄影可能主导特定搜索。私密、杂乱或光线不足的环境则可能代表不足。

数据集的 35,000 个类别衡量的是标签广度,而非均衡覆盖。少数常见物品仍可能占据 100 万个实例中的大部分,而许多类别只会很少出现。

这使数据分布与总规模同样重要。评估 TableVerse 的研究人员将需要了解类别频率、地理覆盖范围、来源多样性和重复项分析。

碰撞修复是 TableVerse 的核心机制

该项目最具决定性的技术步骤,是将看似合理的重建转化为物理引擎能够安全加载的几何结构。

单图像重建会根据不完整证据估计隐藏的三维结构。即使是强大的模型,也可能在放置后生成占据同一物理空间的资产。

这类相交在渲染图像中往往不可见。然而在模拟器中,物理求解器会将其视为无效接触,并施加作用力使其分离。

物体可能飞出场景、倾倒,或导致不稳定的计算。视觉上准确的重建随之变得无法用于操作训练。

TableVerse 研究人员在 100 个真实环境测试场景上测量了这一问题。他们的直接对齐基线产生了 79.0% 的碰撞率。

他们通过 Layout-Consistent Collision Rectification,即 LCCR,解决这一问题。该算法会分离相互穿插的物体,同时尽量保留源图像的整体布局。

“保持一致”一词承担了很大压力。把每个物体都大幅拉开可以消除碰撞,但也会破坏 TableVerse 希望保留的真实杂乱感。

LCCR 首先将彼此接触的物体组织为层级化接触组。当一个物体在水平方向上与另一个物体显著重叠时,系统可以将它们理解为堆叠关系,而非互不相关、彼此相交的资产。

论文采用 50% 的水平重叠阈值来做出这一分组判断。随后,堆叠物体会在后续校正中作为关联结构一同移动。

接下来,系统围绕一个中心组构建径向图。相邻组只会向外移动,直至其碰撞几何不再相交。

这种水平校正保留了近似拓扑关系,也就是哪些物体靠近、围绕或位于其他物体内部的相对模式。

垂直阶段则处理堆叠组中剩余的相交情况。较小的物体向上移动,直到不再穿透其下方表面。

作者报告称,在其评估中,LCCR 将体积重叠从直接对齐时 79.0% 的碰撞率降至 0.0%。

零重叠并不保证接触自然。刚性平移可能留下细小缝隙、悬浮物体,或在重力作用下仍不稳定的排列。

因此,TableVerse 会将校正后的场景载入用于机器人仿真的物理引擎 MuJoCo。一次前向仿真可让资产下落、稳定,并形成在机械层面有效的接触。

这一最终阶段至关重要,因为几何与物理彼此相关但并不相同。两个网格可以避免重叠,同时其中一个仍可能轻微悬浮在桌面上方。

该流程还通过近似凸分解创建碰撞几何。这项技术将复杂网格表示为更简单的凸形部件,使模拟器能更高效地处理它们。

稳定后,系统会分配推断出的物理属性,并过滤不合适的场景。Gemini 2.5 Pro 充当针对渲染场景视图的多模态评估器。

根据论文,该评估器会剔除退化布局或非桌面布局。它还会预测质量等属性,并标记包括带铰链物体在内的关节结构。

该模型会从物体多样性和几何合理性两个维度为场景评分。这种自动审查使流程能够扩展,而无需人工检查每一张重建桌面。

不过,它也引入了另一层不确定性。多模态模型的批准并不能独立证明某个物体的质量、关节属性或身份与现实相符。

该流程可以创建一个稳定的数字近亲,但无法还原一个完美的数字孪生。数字近亲会保留有用的结构,同时接受外观或物理参数上的差异。

这一差别应当成为理解 0.0% 碰撞结果的框架。它验证了经校正后,被评估的网格不再发生体积重叠。

它并不能表明每个重建物体都具有真实的重量、摩擦力、材质、隐藏形状或质心。

校正也可能改变具有意义的距离。即使是最小的径向移动,也会改变原始图像所捕捉的布局。

这些变化比导致仿真崩坏更可取,但它们在视觉保真度和机械可用性之间造成了可量化的权衡。

未来评估不应只报告碰撞率,还应量化相对于重建位置的位移、关系保留程度、稳定持续时间,以及对拥挤场景的敏感性。

最有力的证据将来自分别使用和不使用经 LCCR 校正的 TableVerse 数据训练的机器人策略。随后,真实世界测试可揭示校正是否提升了操作成功率。

这 100,000 个场景仍无法证明什么

TableVerse 提供了大规模仿真资源,但尚未解决更棘手的真实机器人泛化问题。

论文展示了广泛的场景重建比较,以及针对碰撞校正的消融研究。其发布形式仍是预印本,而非经过同行评审的最终出版物。

最重要的是,醒目的数据集规模本身并不能证明训练出的策略能更好地迁移到实体机器人。数量描述的是输入,而不是最终能力。

策略可能会比面对小数据集时更有把握地从大数据集中学到偏差。如果源分布较窄,自动化可以将这种狭窄性复制 100,000 次。

单视角输入构成首个重大限制。相机能看到可见表面,却无法直接观察物体背面、内部或被遮挡的接触关系。

SAM3D 必须推断这些缺失区域。作者承认,容器内的小物体可能只占据太少像素,无法实现忠实重建。

在这些情况下,生成的资产可能代表了完全不同的物体。场景或许仍然在机械层面稳定,但其语义会偏离源图像。

这一问题对操作指令很重要。被标注为移动某类物体的轨迹,可能使用了形似另一类物体的几何,从而削弱语言与物理行为之间的联系。

作者还表示,为每个场景物体生成 3D 模型很耗时。全自动化减少了人工劳动,但并未消除计算开销或模型延迟。

在 TableVerse 的规模下,这一成本变得尤为相关。100 万个物体实例可能需要反复进行分割、深度估计、资产生成、碰撞分解、评估和仿真。

论文并未证明每个物体实例都是独一无二的 3D 模型。它也没有提供足够公开证据来计算该流程的总计算资源占用。

数据权利同样需要关注。“互联网中的真实场景图像”描述的是一种来源类型,而不是完整的许可或溯源政策。

研究人员需要清晰记录,说明哪些图像可以重新分发、包含哪些衍生资产,以及商业使用受到何种限制。

当未经编排的媒体进入数据集流程时,隐私也是另一个问题。手会被作为无关几何过滤掉,但图像中可能包含人脸、文件、屏幕、地址或个人物品。

安全的发布流程需要超越桌面检测的过滤机制。在资产或源引用公开之前,它还应处理可识别个人身份的信息和敏感视觉内容。

项目页面链接了论文、代码和数据集资源,但下游用户应核查它们的实际可用性和许可证。一个链接并不等同于完整的可复现性包。

代码必须暴露足够的配置,以重建论文报告的结果。这包括检测器提示词、阈值、模型版本、校正参数和任务生成逻辑。

数据集访问应包含场景元数据、类别分布、来源政策、资产许可证和验证划分。否则,独立团队无法测试分布偏移,也无法公平比较方法。

基准设计同样存在风险。如果研究人员在由同一重建栈处理的场景上训练和评估,其策略可能利用特定于流程的伪影。

纹理、网格风格、碰撞近似或系统性的摆放误差都可能成为捷径。届时,TableVerse 内部的高性能将夸大其对未见实体环境的适应能力。

更强的评估应当分离来源域和重建工具。策略可以在 TableVerse 上训练,随后面对扫描场景、其他模拟器,以及由不同相机拍摄的真实桌面。

GraspNet-1Billion benchmark 提供了有益的历史比较。它将大规模抓取标注与真实 RGB-D 图像及实体机器人评估相结合。

TableVerse 针对的是更广泛的场景生成问题,并包含完整的抓取放置轨迹。不过,同样的经验依然适用:当仿真数量与真实世界成功相联系时,才更具说服力。

TableVerse 还依赖于多个在核心校正算法之外开发的学习型组件。它们的误差可能会叠加,而非相互抵消。

检测错误会漏掉物体或添加误检。分割错误会扭曲边界。深度错误会改变位置,而 3D 生成错误会改变形状和尺度。

LCCR 可以稳定结果,却无法确定上游哪一项推断出了错误。因此,机械有效性只是必要的质量门槛,而非完整的准确性测试。

任务生成引入了另一层因素。多模态模型从渲染视图中提出源对象—目标对象配对,随后运动工具搜索可行轨迹。

这一过程偏向于当前抓取和规划系统能够解决的任务。困难案例可能在过滤过程中消失,使数据集偏向于规划成功的情形。

这种偏差本身并非不可取。演示数据集通常需要有效动作。然而,研究人员需要失败日志,才能理解哪些物体、关系和杂乱模式被排除在外。

负例也能教授有用的边界。机器人应当知道何时物体被遮挡、无法触及、不宜抓取,或被周围物品阻挡。

TableVerse 侧重于无碰撞的成功演示。加入带标签的失败案例,可能使该数据集更适用于不确定性条件下的规划。

三个信号将决定 TableVerse 是否重要

当独立团队能够复现其流程、在其场景上训练策略,并将这些策略迁移到实体机器人时,TableVerse 才会产生重要影响。

第一个信号是完整且可用的公开发布。研究人员应关注可下载的场景资产、轨迹、元数据、许可证和固定评估划分。

代码可用性同样重要。独立复现需要版本化依赖项,以及从物体检测到 MuJoCo 稳定化每个阶段的清晰说明。

仅包含精选示例的发布可以支持可视化,却无法支撑论文更广泛的主张。完整的软件包将使其他实验室能够衡量长尾场景中的质量。

它还会揭示实际的存储和计算需求。这些成本决定了 TableVerse 是支持广泛的学术使用,还是主要惠及拥有大型基础设施预算的组织。

第二个信号是跨数据集评估。基于 TableVerse 训练的策略,应在通过无关流程创建的环境中接受测试。

有价值的目标包括扫描桌面数据集、程序化场景、人工构建的基准,以及配备不同相机和夹爪的机器人实验室。

在这些环境中取得成功,将强化互联网观察到的布局能提升泛化能力这一主张。失败则意味着模型学到了 TableVerse 的重建特征。

一项尤其有信息量的实验,是比较三个匹配的训练集。其中一个使用基于真实场景的 TableVerse 布局,另一个使用文本生成布局,第三个则将两者结合。

这些数据集应控制场景数量、物体库存、轨迹规模和训练计算量。否则,规模差异可能会伪装成更优布局来源的证据。

第三个信号是实体机器人性能。研究人员应报告针对熟悉物体、未见类别、密集杂乱、容器和变化后的相机视角的成功率。

他们还应测试 TableVerse 所强调的复合物体情形。从碗中取出物品,比在空桌面上移动孤立方块更能验证系统能力。

真实世界中的失败应分类报告,而非压缩为一个分数。感知、抓取、避碰、放置和指令理解会因不同原因失败。

这一细分将显示基于真实观测的布局在哪些方面发挥作用。例如,它们可能提升避障能力,却对抓取不熟悉的材料帮助不大。

未来一到三个月内,随着代码和数据集链接逐步完善,第一个信号应会更清晰。复现结果和机器人策略方面的证据,可能仍需更长时间的实验。

开发者应将 TableVerse 视为一种候选数据基础,而非已经完成的操作解决方案。其流水线依然提供了若干可立即借鉴的思路。

观测到的布局可作为合成数据增强的约束条件。物理校正可充当质量关卡,而组合式重建能够保留容器内彼此独立的物体。

团队还可在策略训练前,利用 TableVerse 场景对感知栈进行压力测试。密集的物体排列会暴露简单场景所掩盖的分割、深度和规划故障。

对于机器人采购方,这篇论文为评估供应商提供了一个实用问题:某个操作系统所训练的数据,是在视觉上更多样,还是在物理交互上更多样?

两者不可互换。一个能够识别数千种物体的模型,在这些物体彼此接触、视觉上重叠,或阻挡预定抓取位置时,仍可能失败。

关注具身 AI 的知识工作者,应像关注机器人硬件一样密切关注数据层。更好的电机和基础模型,仍依赖于能够呈现日常物理复杂性的环境。

因此,TableVerse 最重要的贡献并不在于其宣传的场景数量,而在于它提出:真实杂乱环境应当成为模拟训练的锚点,而非只在最终测试阶段出现。

这一论点仍可被检验。独立发布的质量、跨流水线评估以及实体机器人的结果,将要么增强这一论点,要么揭示单图像重建的局限。

下一步应检查已发布的资产,并提出三个问题:它们在多大程度上保留了观测到的关系?对真实环境的覆盖范围有多广?训练出的策略迁移效果如何?

如果 TableVerse 能以可复现的证据回答这些问题,基于真实观测的模拟将获得相对于想象布局的可信优势。在此之前,其 10 万个场景代表的是一项严肃实验,而非最终结论。

 
 

免费开始

一款本地优先的AI助手,具备个人知识管理功能

为了获得更好的人工智能体验,

remio 目前仅支持Windows 10+ (x64)M-Chip Mac

在你的大脑里添加一个搜索栏

Ask remio

记住一切

​无需整理

bottom of page