top of page

LDraw Nova LEGO 设计达到 2,175 块零件,但实体可拼搭性仍未获证实

4天前
讀畢需時 13 分鐘

尽管尚无人使用实体积木拼装其作品,LDraw Nova LEGO 设计已生成了一座由 2,175 块零件构成的虚拟花园。这个开源项目为通用 AI 智能体提供了规划、编程、渲染和修改复杂 LEGO 模型的工具。其输出采用真实在售零件和成熟的 CAD 格式。

这一区别使 LDraw Nova 不同于仅模仿 LEGO 外观的图像生成器。生成图像可以掩盖不可能的连接、虚构零件和缺乏支撑的结构。相较之下,LDraw Nova 会生成可编辑模型,其中每个可见元素都对应一个已放置的数字零件。

不过,该项目尚未跨越最关键的界限。开发者 Carlos Antelo 承认,其碰撞检测并未模拟结构稳定性。他还告诉记者,自己尚未尝试用实体零件拼装展示的设计。

这一结果为 AI 智能体带来了一项颇具启发性的测试。它们如今可以生成数千项结构化、机器可读的设计决策,而不必手动操作图形界面。然而,一个逻辑自洽的 CAD 文件并不自动等同于安全的拼装顺序或稳定的实体物体。

这一缺口使 LDraw Nova 与另一种截然不同的研究路径形成对照。Carnegie Mellon University 的 LegoGPT,后来与 BrickGPT 名称相关联,在生成过程中内置了物理约束。其研究人员已通过手工和机器人拼装样本输出。

LDraw Nova 选择了更广泛的路径。它让前沿 AI 模型编写程序,生成规模更大、表达力更强的场景。核心问题不再是智能体能否绘制一个看似合理的模型,而是软件能否将这种视觉雄心转化为经得起重力、拿取和搭建考验的结构。

LDraw Nova 将一条提示转化为 2,175 块零件的 CAD 模型

最直接的变化在于规模:通用 AI 智能体如今可以将大型 LEGO 场景生成为可编辑的源代码,而非一张平面图像。

Antelo 将 LDraw Nova 作为面向 AI 智能体生成 LEGO 模型的开源工具包发布。该项目接受模型构想,帮助 AI 智能体规划结构,并输出可由传统 LEGO CAD 软件检查的文件。

其代表性示例为 Sakura Garden。据报道,Claude Opus 5.5 在收到“想象中最美模型”的开放式请求后生成了这一场景。根据项目报道,最终设计包含 2,175 块零件。

场景包括一座五层宝塔、樱花树、鸟居和锦鲤池。这一构图需要重复的建筑元素、景观设计、色彩协调,以及多个可识别的子组件。它的复杂度远高于小型的文本转积木演示。

这项 2,175 块零件设计 并非项目唯一的示例。其图库还包括一座大教堂、Tidal Observatory、Copper Bean 公寓,以及尚未完成的 Atlas Crane。

不同的前沿模型因不同作品而获得署名。Claude Opus 5.5 生成了 Sakura Garden 和起重机。OpenAI 的 GPT-6 Astra 生成了大教堂和天文台,而较早版本的 Claude Opus 模型则创作了公寓场景。

这些示例使 LDraw Nova 成为一个智能体框架,而非专用生成模型。它并不依赖于一个专为 LEGO 搭建训练的神经网络。相反,它围绕通用模型打包了指令、工具、示例、搜索、渲染和验证能力。

这一区别很重要,因为通用智能体已经能够编写和修改软件。LDraw Nova 将实体设计视为另一种可编程产物。模型规划对象、编写描述对象的 Python 代码,并使用该程序输出最终 CAD 源文件。

这种方法避免要求模型通过鼠标操作放置数千块零件,也无需模型在对话回复中直接计算每一项旋转和坐标。

生成后,输出仍然可编辑。LDraw Nova 可以提供其 LDraw 源文件、渲染视图、交互式查看器以及供 Blender 使用的 glTF 文件。代码库还保留了与某次搭建关联的对话和智能体推理过程。

这一套资源为开发者带来的不只是一张精美图像。他们可以检查底层几何结构、修改代码、重新运行生成器,或在兼容应用中打开输出。它让一条提示成为设计工作流的起点。

不过,“真实零件”指的是数字目录,并不意味着已完成实体测试。系统可以选择真实零件的数字表示,同时将它们排列为仍不稳定的模型。这一区别推动了后续讨论。

LDraw Nova LEGO 设计流程如何运作

LDraw Nova 的成功在于让 AI 编写模型生成程序,再将该程序置于视觉反馈循环之中。

该项目建立在 LDraw 之上,后者是一套由社区维护、用于表示 LEGO 零件和组件的系统。在 LDraw 模型中,每个已放置的零件都可通过包含其标识、颜色、位置和方向的文本来表达。

官方 LDraw 零件库 在 2026-06 更新后包含 16,873 种独特形状或带图案零件。LDraw 并非 LEGO Group 赞助的产品,而是一个非官方、由社区运营的项目。

文本表示适合语言模型,因为设计会转化为类似代码的数据。不过,原始 LDraw 仍要求精确的三维坐标和变换矩阵。一个微小的位置错误就可能导致零件错位,或穿过另一块零件。

据报道,Antelo 早期的实验显示,当要求智能体直接生成全部几何信息时,它们会遇到困难。他最终的解决方案是为它们提供更高层级的 Python 工具和可复用的搭建模式。

当前工作流始于自然语言提示。智能体读取项目说明、研究相关示例,并创建涵盖模型及其子模型的 JSON 计划。随后,它会编写实现该计划的 Python 代码。

运行该程序会生成 LDraw 源文件。系统将源文件渲染为图像,供多模态智能体检查。智能体调整程序、再次渲染设计,并重复这一循环。

这一循环更像软件调试,而非手动 CAD 工作。图像充当反馈,而 Python 程序仍是可编辑的设计逻辑。智能体可以修改一个过程,并同时重新生成大量零件。

例如,一座宝塔不需要数百条彼此独立的对话指令。智能体可以为楼层、屋檐层、支撑、栏杆或重复装饰元素编写函数。参数可以控制尺寸、位置和颜色。

这一抽象说明了 AI LEGO 设计工具如何达到数千块零件的规模。模型并非将每一块积木作为孤立想法维护,而是在构建一套能够生成相关积木组的过程层级。

LDraw Nova 代码 包括用于寻找合适零件、定位示例模型、检测碰撞与间隙,以及在无可见桌面窗口的情况下渲染的工具。它通过基于 Docker 的 Web 应用运行。

该软件可连接包括 OpenAI、Anthropic 和 OpenRouter 在内的提供商。一个可选的语义重排序组件可帮助智能体搜索相关零件。若没有其 API 访问权限,项目会退回到全文搜索。

这一架构也使输出具备可移植性。支持 LDraw 标准的应用可以检查生成文件。LDR 和 MPD 文件 可通过 LeoCAD 打开,后者支持模型、子模型和多步骤搭建说明。

可移植性很重要,但它并不认证设计的可搭建性。一个文件可以在语法上有效、视觉上出色,却仍包含脆弱连接。CAD 兼容性回答的是软件能否读取模型,而不是人手能否可靠地将其拼装出来。

真正的较量是数字一致性与实体证据

LDraw Nova 最令人印象深刻的输出,也是其尚未解决的最大主张:设计看似可以搭建,但外观无法证明实体表现。

该项目会检测碰撞和间隙。这些检查可以发现零件占据同一空间或明显的位置错误,从而减少机器生成组件中常见的一类失败模式。

碰撞检测并非物理建模。两块积木可以连接,却无法为沉重的屋顶、长悬挑或狭窄塔楼提供足够支撑。一个完成的场景也可能依赖某个临时搭建步骤,而该步骤无法固定到位。

一座五层宝塔说明了这一问题。其上层在底座上方形成重量和杠杆作用。屋檐边缘可能延伸至支撑之外,而装饰树木和门楼则可能依赖细小连接。

仅凭数字几何无法确定,当搭建者将零件压合时,这些部分会如何响应。咬合力、重心、扭转、反复拿取以及搭建顺序都会影响结果。

Antelo 对这一限制一直坦率。据原始报道,他表示物理建模是 LDraw Nova 当前所缺少的能力。他还说,自己尚未尝试实体搭建展示的模型。

这一披露并未抹去该项目的软件成就,但确实缩小了现有证据所能支持的结论范围。LDraw Nova 已从目录中的零件生成了复杂的虚拟组件,但尚未验证其最大规模输出能否作为实用套装运作。

因此,“可搭建”需要通过多项测试。首先,每个指定零件都必须以所选颜色真实存在。其次,零件必须能在不发生相交或无支撑间隙的情况下连接。第三,完成后的物体必须能够站立,并承受正常拿取。

第四,人类需要能够完成这一搭建顺序。一些最终稳定的结构无法按其数字布局所暗示的顺序搭建。后续零件可能需要先前结构已经阻挡的操作空间。

第五,设计需要具备可接受的采购要求。包含罕见颜色或停产零件的物料清单,可能使技术上有效的模型难以复现。大型零件清单还会带来物流和核查工作。

由 2,175 块零件组成的 Sakura Garden 放大了每一项风险。一个错误连接可能隐藏在渲染场景中。重复过程还可能在多个楼层或屋顶部分复制同一种结构弱点。

模型规模使人工审查成本高昂。搭建者必须检查数千处放置、确认零件清单、规划子组件,并识别承力路径。这项工作构成了智能体快速生成所对应的实体层面工作。

这正是 LDraw Nova LEGO 设计的核心反转。编程让智能体能够更快扩大输出规模,而由此产生的规模则使现实验证变得更为苛刻,而非更轻松。

一座渲染的大教堂可能因其看起来已经完成而令人产生信心。然而,渲染奖励的是可见的完整性,而非隐藏的结构完整性。视觉结果越强,就越容易忽视缺失的工程证据。

LegoGPT 展示了物理感知生成带来的增益

LegoGPT 提供了最鲜明的对照,因为它将稳定性视为生成约束,而非留待渲染完成后才进行的测试。

卡内基梅隆大学及合作机构的研究人员于 2025 年推出了 LegoGPT。该系统重新定义了文本生成任务,让语言模型预测下一块积木,而不是下一个词。

团队创建了 StableText2Lego 数据集,其中包含逾 47,000 个结构,代表超过 28,000 个独特的三维物体。每个结构都配有详细的文本描述,并经过物理稳定性评估。

在生成过程中,LegoGPT 会执行有效性检查和物理感知回退流程。若预测的放置方式违反约束,系统会拒绝该选择,并返回到此前的有效状态。

相关的物理感知研究将稳定模型定义为具有良好完整性、不会出现悬空或坍塌积木的结构。研究还通过标准零件以及人类或机器人可按顺序组装来定义可建造性。

更重要的是,研究人员给出了实体证据。他们表示,生成的设计已通过人工和双臂机器人系统完成组装。这些实验并不能保证未来的每一个输出都可行,但确实弥合了数字到实体流程中的一部分缺口。

LDraw Nova 采取了不同策略。它为能力极强的通用模型提供广泛的零件词汇、可编程原语和视觉反馈。这一路径更偏向于表现力丰富的场景和更大型的组合结构。

LegoGPT 则采用专用模型和受约束的表示方式。其训练数据覆盖 21 类常见物体,结构源自体素化的三维形状。这种方法提供了更强的稳定性控制,但也限制了设计自由度。

两种方法并非在每个维度上都有绝对胜者。专用生成器可以深度融入物理规则,但应用范围较窄;通用编码代理能够组合出更丰富的场景,却依赖较弱的物理验证。

这一对比还凸显了设计中“智能”的两层含义:其一是发明和组织复杂物体的能力;其二是在整个创作过程中遵守材料约束的能力。

LDraw Nova 目前侧重前一种能力。LegoGPT 则将后一种能力置于核心位置。成熟的实体设计代理需要兼具两者。

这种结合很可能不只是增加一个最终稳定性评分。物理反馈必须影响规划、零件选择、子装配边界和修订过程。否则,系统可能在生成精细设计后才发现结构问题。

它还必须将建造视为一个过程。当中间步骤会坍塌或阻碍操作时,仅有稳定的最终布局并不足够。搭建顺序应成为生成产物的一部分,而不是事后补充。

LDraw Nova 已具备迭代循环,这为其提供了一条可能的前进路径。物理结果可以与渲染图像并列,成为另一种反馈形式。代理随后可在发现连接薄弱或局部失衡后修改其程序。

开源结构支持此类实验。开发者可以检查其假设、添加验证器并比较模型输出。该项目的价值最终或许既在于其架构,也在于任何单一的展示模型。

CAD 文件证明了什么,又未能证明什么

这些文件证明代理能够以不同寻常的规模生成可检查的设计逻辑,但无法证明其可制造性或结构可靠性。

一张扁平的 AI 图像几乎不具备工程可追责性。观察者无法可靠地判断哪些零件真实存在、表面如何连接,或物体背面是否合理。

LDraw Nova 用明确的数据取代了这种模糊性。每个零件都有身份和变换信息。子模型能够组织复杂结构,而源代码则揭示重复元素的生成方式。

这种可追溯性很有意义。设计师可以搜索可疑零件、隔离某个子装配,或修改某个函数。错误会成为可调试的对象,而不再是隐藏在像素中的视觉伪影。

这一原则同样适用于玩具之外的领域。工程代理需要传统软件能够解析、人类能够审计的表示形式。机器生成的文件应公开其决策,而不是只呈现一张令人信服的渲染图。

LDraw Nova 还说明了代码为何能充当语言与几何之间的桥梁。通用 AI 模型拥有丰富的程序生成经验。为它们提供设计原语,能让其通过熟悉的计算模式表达空间意图。

不过,代码也会引入系统性失效模式。一个存在缺陷的辅助函数可能会错误放置数百个零件;对某个连接关系的错误假设,可能在所有生成的子模型中不断扩散。

渲染反馈循环未必能发现这些错误。图像可以显示屋顶是否看起来对齐,却无法显示其隐藏支撑是否采用了足够的连接方式。视觉检查更关注表面而非受力。

零件目录也可能制造虚假的信心。选择真实的零件编号,并不能证明该零件以所需颜色或数量存在,也不能保证搭建者可以合理地采购到它。

因此,完整的验证体系需要多个层面。几何验证应检测相交、缝隙和非法朝向;连接验证应确认每个相互依赖零件之间的有效配合。

结构分析应估算载荷、平衡性和薄弱接头。顺序规划应确认每块积木都可在不需要不可能操作空间的前提下加入。库存检查应验证颜色和供应情况。

最后,实体原型必须检验软件遗漏的假设。即使是高质量模拟,也会简化摩擦、咬合行为、制造公差和人工操作。真实组装仍是决定性的评估方式。

这并不意味着每个 2,000 件的实验都需要立即建造。更小的代表性模型可以更早地测试流程。一个紧凑的宝塔层、树木、起重机接头或屋顶角落,都可能暴露反复出现的问题。

据报道,Antelo 曾考虑 3D 打印一个较小模型。实体 LEGO 搭建能提供更强的证据,因为它检验的是预期使用的零件和连接方式。无论采用哪种路径,都应记录失败过程,而不只是展示成功照片。

透明的测试记录将使未来的主张更易判断。开发者可以发布源文件、物料清单、说明书、组装时间、修订记录和失效点。视频也有助于确认结构能承受正常搬动。

在此类证据出现前,最稳妥的描述应当准确:LDraw Nova 能够利用真实目录中的零件生成详细的 LEGO CAD 模型。它尚未证明其展示的大型设计可以在现实中完成搭建。

首次发布 LDraw Nova 后值得关注的方向

下一阶段取决于三个信号:有文档记录的实体搭建、修订循环中的物理机制,以及跨模型的可重复结果。

第一个信号是依据发布的 CAD 输出完成真实组装。即使是小型测试也有意义,前提是开发者保留原始文件并记录每一项人工修正。Sakura Garden 会是更有力的基准,因为其 2,175 个零件代表了该项目主打的规模。

在没有结构改动的前提下成功完成搭建,将增强 LDraw Nova 的核心愿景。若搭建需要大幅重新设计,也不代表软件毫无价值;相反,它会揭示当前工作流缺少哪些验证层。

第二个信号是在生成过程中引入物理感知反馈。碰撞检查应保留,但在代理宣布模型完成前,稳定性分析必须对其决策产生影响。支撑图、重心、连接强度和脆弱接头都是合理的起点。

真正有价值的里程碑并不是在生成后附加“物理”标签,而是证明代理会因结构测试失败而修改其程序。这将使物理约束成为主动的设计信息。

第三个信号是跨 AI 提供商和提示词的可重复性。当前展示库表明,多种前沿系统都可以生成引人注目的模型。未来评估应使用共享提示词、固定零件库和一致的验证标准。

开发者应追踪完成时间、无效放置、人工干预、零件数量、采购冲突和实体失效。这些指标将揭示更好的模型是否真正改善了设计,还是仅仅产出了更复杂的渲染图。

对人仔、Technic 机械装置和引擎的支持仍在项目路线图中。这些新增功能将加重验证负担。Technic 零件引入了轴、插销、活动关节、扭矩和对齐约束,而静态场景通常能够避开这些问题。

VR 也已出现在当前应用中,尽管 Antelo 提到过性能和可用性问题。沉浸式查看或许有助于人类检查比例与难以触及的区域,但它仍无法取代机械分析或组装测试。

对开发者而言,更广泛的启示已经很有价值:当复杂几何通过结构化工具、示例和可执行抽象公开给代理时,代理的表现会更好。这一模式适用于电子、建筑、机器人和制造软件。

对搭建者而言,保持耐心是合理的。这些文件是很有吸引力的起点,而非经过认证的套装。任何尝试实体版本的人,都应预期需要进行库存检查、结构修订和定制说明书规划。

对于下一个 LDraw Nova LEGO 设计,正确的问题不是其渲染图是否看起来令人信服,而是是否有人能够采购零件、遵循搭建顺序、完成组装,并在不坍塌的情况下移动它。当项目能够以公开证据回答这四个问题时,它才算从生成式 CAD 迈向了实体设计自动化。

 
 

免费开始使用

一款本地优先的AI助手

为了获得更好的人工智能体验,

remio 目前仅支持Windows 10+ (x64)和M-Chip Mac 。

你的 AI 工作伙伴

和 remio 一起高效工作

规划、创作、交付

一站式完成

bottom of page