top of page

WorldWeaver 为多智能体视频模型引入共享记忆,但 Minecraft 只是第一场测试

7月29日
讀畢需時 13 分鐘

WorldWeaver 在一个双智能体视频模型中引入了显式共享记忆,挑战了仅凭近期帧重建世界的既有流程。该模型也被称为 W²,会在生成同步的 Minecraft 视角时,将不断演化的信息存储在世界状态寄存器中。其结果表明,对于一个持久且可交互的世界而言,视频看起来逼真还不够。

这项工作来自 UCLA 和 Adobe Research 的研究人员。他们于 2026 年 7 月 23 日提交了 WorldWeaver 论文。其核心对比在于架构选择:持久共享状态,还是压缩在滚动上下文窗口中的观测历史。

这种差异至关重要,因为多个智能体永远不会看到完全相同的场景。一名玩家可能走到墙后,另一名玩家则继续在外面建造。只记住可见像素的模型,必须在这些视角重新连通时重建被遮挡区域的变化。

WorldWeaver 则维护可学习的 token,用于概括共享环境以及每个智能体的状态。它会在生成每个片段后更新这些 token。随后生成的片段同时依赖近期帧和最新提交的状态。

在研究人员的双人 Minecraft 评估中,报告的提升幅度相当显著。WorldWeaver 的综合世界评分达到 105.1,而重新训练的 Solaris 基线为 81.0。不过,该实验范围仍然较窄,基于模拟器,并且依赖现实环境中鲜少能够提供的监督信号。

WorldWeaver 将共享状态置于生成器内部

关键变化并不是又一次改进视频记忆,而是一条独立的状态路径,可跨智能体和生成展开步骤持续存在。

流式自回归扩散模型会连续生成视频片段。每个片段通过近期帧和键值缓存来约束下一个片段,后者存储中间注意力信息。这种设计无需重新打开完整历史,也能让生成过程保持可控。

当某个观测从近期窗口中消失时,局限性便会显现。生成器必须从剩余像素中再次推断缺失信息。这种重建可能导致位置、对象状态、身份或关系出现不一致。

在多智能体环境中,这一问题会更加严重。每个摄像头都只是对同一个底层环境的局部投影。有效的模型必须协调这些投影,同时追踪发生在特定摄像头视野之外的变化。

WorldWeaver 增加了世界状态寄存器,即为环境演化状态预留的可学习 token。它们位于视觉 token 旁边,但承担不同职责。寄存器会概括那些即使单帧离开活跃上下文后仍应保留的信息。

在每个生成展开步骤中,生成器会读取此前的寄存器、近期帧和当前动作。生成新的视觉片段后,它会提交更新后的寄存器。该寄存器将约束后续片段。

这一过程形成了观测与状态更新交替进行的序列。近期帧提供细致的局部证据,寄存器则为跨时间与视角的连续性提供紧凑机制。

这种结构不同于单纯扩展帧缓存。更大的缓存可以保留更多观测,但这些观测仍然依赖摄像头,并以视觉形式编码。模型在需要相关信息时,依然必须从中提取状态。

WorldWeaver 要求模型持续维护这种抽象。研究人员将寄存器描述为既持久又可动态更新。随着生成展开推进,每个智能体都会为共享表示贡献证据。

该方法也限制了陈旧寄存器历史的累积。推理期间,系统会保留初始寄存器和最新提交的寄存器,而不是累积所有中间状态。这一选择让该机制更接近循环状态,而非不断扩展的记忆档案。

该项目的方法概览展示了同步的双人 Minecraft 生成展开过程。两名玩家在同一个生成环境中行动,而隐藏表示会追踪他们的位置和周围场景。

Minecraft 很有用,因为该环境会暴露精确的模拟器状态。研究人员可以测量智能体的位置、速度、朝向和控制器输入,也可以捕捉任何一名玩家都无法看到的俯视视角。

这些信号让隐藏状态变得可检验。它们使团队能够判断,生成的视频是否在两个摄像头视角下都对应同一个底层世界。仅凭像素质量无法回答这个问题。

因此,这项消息的重点并不只是更漂亮的 Minecraft 画面,而是将一致性从预期的副作用,转变为生成过程中的受监督组成部分。

为什么帧历史会成为多智能体的负担

观测历史记录的是摄像头看到了什么,而交互式世界模型必须保留的是:即使这些观测消失后,哪些事实依然成立。

单摄像头视频模型通常可以掩盖细小的逻辑错误。一个物体可能在相隔较远的帧之间略微移动,但整个序列仍可能看起来合理。多智能体生成则更容易暴露这些错误。

假设 Alpha 在 Bravo 看向另一个方向时放置了一个方块。当 Bravo 随后转回镜头时,画面中应该出现该方块。Alpha 的动作必须改变同一个共享环境,而不只是改变 Alpha 的视频流。

再假设两名玩家分开行动。他们近期的帧历史包含不同的地形、物体和摄像头运动。当他们再次相遇时,模型必须协调两段历史,而不能凭空生成互相矛盾的几何结构。

滚动视觉缓存对此类任务的支持较弱。它偏向近期观测,并将状态与外观纠缠在一起。随着新帧替代旧帧,关于未被看见的玩家或隐藏结构的信息可能逐渐淡化。

显式状态可以保留独立于当前摄像头的事实。位置、朝向、附近布局和已完成动作,即使其来源像素离开窗口后仍可继续使用。

WorldWeaver 使用三类目标监督其寄存器。智能体统计信息涵盖位置、速度和朝向。鸟瞰图约束全局布局,而场景文本则提供对当前行为的语义描述。

每种目标都针对不同的失败模式。智能体统计信息有助于保持局部运动和身份一致性。俯视表示则为两个智能体提供共同的几何参照。

场景文本鼓励寄存器保留有意义的关系,而不只是低层视觉特征。论文的标注过程会描述每名玩家的行为、相对位置、距离和观察方向。

这些标注使用同步的智能体视角、俯视帧和控制器输入。它们为每个生成片段中发生的事情提供了异常直接的知识。

这种监督很重要,因为视频生成目标并未规定寄存器应记住什么。无监督 token 可能吸收有用信息、无关纹理,或两者的混合,而后者会在生成展开过程中变得不稳定。

研究人员发现,状态目标同时改变了生成效果和可解释性。仅在训练时使用的解码头可以从寄存器中恢复智能体坐标、俯视特征和场景描述。这些头会在推理期间移除,因此不会为部署增加解码工作。

这也是该方法对现有流式流程施加压力的地方。扩展上下文窗口可以改善对既往观测的访问,但不会创建一个规范的共享状态。

这一比较尤其适用于 Solaris,这是一个于 2026 年 2 月发布的多人世界模型。Solaris 引入了同步多人数据采集,以及跨玩家视角的协调生成。

Solaris 报告称其数据集包含 1264 万帧多人游戏画面,并建立了涵盖移动、记忆、落地性、建造和视角一致性的评估类别。

WorldWeaver 采用了这一设定,并在相同训练数据上重新训练 Solaris 以进行比较。随后,它改变了生成过程中信息的持久化方式。

Solaris 通过视觉 token 上的跨玩家注意力同步观测。WorldWeaver 在保留这种交互的同时,引入了独立的共享状态通道。问题在于,显式状态是否比视觉上下文更可靠地跨越时间延续。

论文结果支持该实验中的有状态路线。不过,它们并未证明 token 寄存器总是优于更长的上下文、外部记忆或结构化地图。

它们展示的是一个更狭窄、但仍有价值的结论:当两条视频流必须描述同一个不断变化的环境时,显式状态监督可以改善可测量的逻辑一致性。

世界状态寄存器改变了生成机制

WorldWeaver 将视觉合成与状态维护分离,然后训练两条路径抵御各自累积的错误。

该模型遵循三阶段训练流程。第一阶段将预训练的单人视频模型适配为同步多人教师模型。双向注意力使该教师模型能够观察完整片段,同时学习跨智能体的场景结构。

第二阶段将教师模型转换为因果生成器。因果生成意味着每个输出仅依赖序列中该时刻可获得的信息。这对于无法查看未来帧的交互式流至关重要。

在这一阶段,帧 token 使用近期视觉上下文和最新寄存器。寄存器 token 则读取局部帧窗口和前一个寄存器。模型在预测观测与更新状态之间交替进行。

寄存器在每个提交步骤都会接收辅助监督。一个回归头预测智能体统计信息,另一个解码器预测与对齐鸟瞰图对应的特征。

一个文本头会预测场景描述。整体训练目标将这些状态损失与扩散模型的帧生成损失结合起来。

这一联合目标可能造成冲突。像素生成奖励细致的视觉重建,而状态建模奖励紧凑且稳定的信息。否则,同一组 Transformer 权重必须同时满足这两种角色。

WorldWeaver 通过 Mixture-of-Transformers 设计应对这一冲突。该架构为寄存器 token 和帧 token 提供独立的参数分支,同时保留二者之间的联合注意力。

这种分离并不等同于使用相互独立的模型。视觉 token 和状态 token 仍会在同一个交错序列中交换信息。不过,每种 token 类型都会获得适合其角色的权重。

随着寄存器监督变得更加丰富,这一设计会更有帮助。论文指出,当同一路径既必须生成像素,又必须编码可验证的世界语义时,密集共享权重可能难以胜任。

第三阶段处理了另一个失败来源。模型通常在正确的历史帧上训练,却在自身不完美的输出上部署。随后,小错误会不断累积,因为每一帧生成画面都会成为下一帧的上下文。

WorldWeaver 采用了 Self Forcing,这是一种让模型基于自身生成结果持续向前推演的训练方法。该技术使系统在推理前就接触到实际部署时的运行条件。

这里的问题同时包括画面漂移和寄存器漂移。一次错误生成的视图可能破坏下一次状态更新,而受损的状态又会扭曲所有智能体后续看到的画面。

因此,模型会在训练中同时展开生成画面和已提交的寄存器。它学习从自己实际产生的历史中继续,而不只是依赖干净的参考数据。

推理过程采用四个去噪步骤。每一帧完成去噪后,模型都会将其加入滚动视觉缓存;随后更新寄存器,再开始下一步生成。

这一循环是论文的核心机制。WorldWeaver 并非只是检索旧观察结果,或在生成后附加元数据;状态更新直接参与了自回归循环。

其他研究则通过更明确的外部记忆处理同一问题。例如,MultiGen 将记忆、观察和动力学分离,用于可编辑的多人扩散世界。

MultiGen 的外部表示允许用户改变环境结构。WorldWeaver 则将状态以学习得到的 token 保留在生成器内部。这让其记忆更加紧凑,但也更难直接编辑。

这种对比揭示了一项重要的设计选择。结构化外部地图提供了可检查的控制能力,但要求系统持续维护该表示;内部寄存器则更具灵活性,却可能隐藏模糊或错误的状态。

WorldWeaver 试图处于两者之间。其寄存器在推理过程中仍是潜在表示,但显式训练目标使其中内容可以被部分恢复。该系统学习内部状态,同时没有完全放弃验证能力。

这一机制也暗示了合成游戏之外的用途。机器人集群模拟器可以生成各自独立的观察结果,同时保持共享物体位置。训练环境也可以模拟一个智能体的行动如何改变其他智能体之后遇到的情况。

当不同传感器提供不完整视图时,数字孪生系统也面临类似问题。持久状态能够整合这些视图中的证据,同时让模拟环境持续演化。

不过,WorldWeaver 并未测试这些应用。其证据来自受控的 Minecraft 实验:两个智能体、同步操作,以及异常容易获取的真实状态。

该架构提出了一项明确的技术主张,而更广泛的应用主张仍有待验证。

得分有所提升,但真实世界数据鸿沟依然存在

报告中的提升支持显式状态建模,但尚未证明 WorldWeaver 能在没有模拟器监督的情况下恢复复杂状态。

研究人员评估了移动、定位、记忆、建造和一致性。他们使用视觉语言模型准确率,以及 Fréchet Inception Distance(FID);后者用于比较生成图像与参考图像的视觉分布。

他们还将这些指标合并为综合世界评分。WorldWeaver 在该指标上达到 105.1 分。重新训练的 Solaris 模型为 81.0 分,而帧拼接基线为 49.1 分。

最大的准确率提升出现在对状态敏感的类别中。定位准确率从 Solaris 的 81.3 提升至 WorldWeaver 的 93.8;建造则从 9.4 提升至 28.1。

一致性从 57.8 提升至 76.6。移动表现也有所改善,达到 82.8,高于 Solaris 的 79.7。

记忆方面的优势较小。WorldWeaver 得分为 46.9,Solaris 为 43.8,帧拼接基线为 37.5。

FID 结果则更为复杂。WorldWeaver 在移动和一致性等多个类别中有所改善,但并未在每项视觉比较中领先。其记忆 FID 为 64.8,而 Solaris 为 61.2。

这一差异很重要,因为逻辑状态与视觉质量相关,但并不完全相同。模型可能保留了正确事件,却将其呈现得很差;它也可能生成美观的画面,却与先前的行动相矛盾。

WorldWeaver 更高的综合得分表明,寄存器有助于改善综合目标,但并未消除所有质量权衡。

消融实验也为状态机制提供了支持。研究人员改变监督类型,并比较共享密集权重与分离式 Transformer 架构。

结果表明,不同的状态目标有助于不同的行为。没有任何单一信号在所有类别中占据主导;组合监督产生了报告中整体最强的配置。

半监督实验回应了最明显的扩展性担忧。团队将标注集固定为 1,000 个片段,然后逐步加入更多未标注视频。

没有未标注片段时,综合世界评分为 63.2;加入 5,000 个未标注片段后,升至 82.3;加入 10,000 个未标注片段后,达到 90.3。

这一结果表明,较小规模的标注数据集可以为寄存器语义提供锚点,而普通视频能够改善生成效果。它并未消除对标注状态的需求,但在这一受控环境中降低了所需标注数据的比例。

仍有若干需要谨慎看待之处。

首先,该论文是一篇 arXiv 预印本,尚未经过同行评审。其评估框架、综合评分和架构结论仍需独立复现。

其次,模型运行于 Minecraft。该环境具有离散方块、可获取的控制器输入、干净的同步机制以及精确的模拟器状态。现实场景很少提供同等质量的标注。

仓库机器人可能会看到反光表面、可变形物体、人员和移动设备,也可能不存在可靠的鸟瞰视图或隐藏交互的完整记录。

第三,实验仅涵盖两个智能体。增加更多视角会同时带来更多信息和冲突。寄存器必须保留额外的身份、观察和交互,而不能将它们压缩成模糊的摘要。

第四,寄存器本身也可能漂移。Self Forcing 让模型暴露于自身错误之中,但无法保证在一次错误更新后恢复。一个错误状态可能影响所有后续智能体。

第五,报告中的状态只能被部分解释。训练头能够解码选定目标,但这些探针并不能揭示寄存器中存储的一切。较高的探针准确率并不保证表示完整或具有因果正确性。

该模型还依赖自动化场景描述。这些描述在视觉观察之外,还使用了真实控制器输入。现实世界数据则需要更弱、更嘈杂或估计得出的动作标签。

作者在论文中承认了这一核心限制。他们的主要改进依赖额外的状态监督,而现实世界状态更复杂,也往往不可获得。

这一承认界定了该工作的真实前沿。WorldWeaver 在强可观测条件下提出了一种可信的状态架构,但尚未解决真相被隐藏的环境中的状态发现问题。

什么将证明共享状态能否扩展

下一步证据必须在双人 Minecraft 之外检验状态寄存器,厘清其计算权衡,并衡量其在错误更新后的恢复能力。

第一个信号是基于已发布代码和评估设置进行独立复现。研究人员应验证报告中的 105.1 世界评分,并考察各类别提升能否在不同随机种子下保持。

复现工作还应检查综合指标。合并评分可以说明整体表现,但也可能掩盖逻辑准确性与视觉保真度之间的权衡。

第二个信号是具有不完整监督的更广泛环境。一项有价值的后续研究应保留同步智能体,同时移除精确的俯视地图或模拟器坐标。

这项测试将揭示寄存器能否从估计几何、嘈杂语言和不完整动作记录中学习稳定状态。若成功,将加强其在机器人技术和具身模拟中的应用前景。

若失败,则表明 WorldWeaver 的提升更依赖特权标注,而非寄存器设计本身。这样的结果仍能为未来系统提供启发,但会缩小该架构的实际适用范围。

第三个信号是跨智能体数量和时间跨度的扩展。两个视图是重要起点,但随着更多参与者修改同一环境,共享状态会变得更困难。

未来评估应追踪当智能体数量达到四个或更多时,一致性如何变化。它们还应报告寄存器容量、缓存大小或累积误差开始构成限制的临界点。

更长的推演需要有针对性的压力测试。例如,一个智能体可以藏起物体、离开该区域,并在其最初画面退出缓存后返回;另一智能体则可在第一个智能体缺席时修改该物体。

这些测试能够区分持久状态与短期视觉回忆,也能揭示寄存器是否会更新未被直接看到的关系,还是仅仅存储压缩后的近期历史。

研究人员也应衡量纠错行为。如果一个视图生成了错误物体或位置,后续证据应当修复共享状态。否则,显式记忆可能将局部幻觉转化为全系统范围的既定事实。

外部记忆系统提供了有益的比较。结构化地图可以约束几何关系并支持直接编辑,但也承担自身的重建负担;学习得到的寄存器仍具灵活性,却更难审计。

一个有说服力的基准测试应在相同数据和计算条件下比较两种方法。它应包含长上下文、潜在寄存器和显式外部状态,而不是将某一个基线视为定论。

计算成本报告同样重要。论文称,仅用于训练的监督头不会增加推理工作量。然而,寄存器 token 和分离式 Transformer 权重仍会影响内存、训练成本和生成吞吐量。

实时交互系统必须在这些成本与一致性收益之间取得平衡。运行速度过慢的共享状态无法支持响应迅速的智能体、游戏或机器人模拟。

WorldWeaver 对一个狭窄问题给出了有用答案:近期视频帧并不足以定义一个共享世界。其寄存器为生成器提供了一个明确位置,用于跨视图维持事实。

更困难的问题是:当没有模拟器揭示答案时,这些事实能否被学习出来。评估多智能体世界模型的开发者应密切关注这条边界。

未来系统能否在特权标签消失后继续维持状态?当一个智能体引入错误后,它们能否修正共享记忆?随着智能体数量增长,它们能否保持一致?

这些测试将决定 WorldWeaver 是一种可复用架构,还是仅仅是一项强大的 Minecraft 成果。就目前而言,它让这场讨论更加精确:世界模型必须记住世界,而不只是记住自己最新的画面。

 
 

免费开始使用

一款本地优先的AI助手

为了获得更好的人工智能体验,

remio 目前仅支持Windows 10+ (x64)和M-Chip Mac 。

你的 AI 工作伙伴

和 remio 一起高效工作

规划、创作、交付

一站式完成

bottom of page