top of page

昆仑万维开源 Matrix-Game 3.5,但其实时性能主张仍需公开测试

7月21日
讀畢需時 15 分鐘

昆仑万维发布 Matrix-Game 3.5 时作出了一项异常具体的承诺:在单 GPU 上以约每秒 20 帧的速度生成交互式 720p 世界。昆仑万维 Matrix-Game 3.5 开源世界模型还加入了几何记忆,旨在跨越长达一分钟的视频序列保留位置信息。然而,公开发布的软件包尚未包含实现其标志性速度的蒸馏模型。

这一缺口使此次发布不只是又一次模型亮相。昆仑万维已经发布了代码、基础权重以及可供检查的记忆架构。开发者可以研究系统如何回忆场景和控制摄像机,但尚无法使用现有检查点复现完整的实时配置。

因此,眼下的竞争并非昆仑万维与所有世界模型开发者之间的较量,而是开放技术访问与 Google DeepMind 的 Genie 3 等封闭式集成系统之间的较量。Google 提供了完善的可导航体验,而昆仑万维则押注外部开发者愿意用更多配置工作换取对架构的控制权。

昆仑万维发布了开放世界模型,但并未开放完整的实时技术栈

Matrix-Game 3.5 将持久视觉记忆转变为交互式视频模型的核心功能。

昆仑万维在 7 月 19 日于上海举行的 2026 世界人工智能大会活动期间推出了该模型。天工智能首席科学家程煜将其作为 Matrix-Game 系列的最新版本进行了展示。

该公司的官方发布文章介绍了一个拥有 50 亿参数的模型,它能够以第一人称和第三人称模式生成可由摄像机控制的视频。昆仑万维表示,该模型可以在约一分钟的生成过程中保持有效记忆。

此次发布正值视频生成器开始突破孤立短片的阶段。传统视频模型会创建一个从一帧到下一帧看起来合理的序列。交互式世界模型还必须响应操作,同时保留位置、主体和先前事件。

当虚拟摄像机转身时,这种差异就会变得显而易见。视频生成器可以生成一次令人信服的转身,却悄然替换观看者身后的街道。交互式环境则必须记住原来的街道,并从新视角将其重建出来。

Matrix-Game 3.5 通过 Patch Memory 解决这一问题。图像块是从先前帧中提取的一小片区域。模型将该区域与估算深度和摄像机位置相关联,从而为这段记忆赋予三维空间中的位置。

当摄像机返回时,系统会检索预计能从当前位置看到的图像块。随后,它将这些图像块重新投影到新视图中,并把生成的拼接图提供给视频生成器。

昆仑万维将这套记忆系统与 Warped PRoPE 配合使用。位置编码会告诉 transformer 视觉 token 在时间和空间上的关系。Warped PRoPE 则将包括视点和透视变化在内的摄像机投影信息加入这些关系之中。

此次发布还将静态景物与移动主体分离。地形、建筑物和固定物体可以进入长期几何记忆。角色和车辆则会获得独立的参考 token,以便在保留其外观的同时,避免将其固定在过时的位置。

这种分离十分重要,因为不加区分的记忆会产生自身的问题。如果系统将汽车作为街道的一部分记住,那么汽车移动到其他位置后可能再次出现。结果可能是重复物体、视觉拖影或静止的幽灵影像。

公开代码仓库以 Apache 2.0 许可证提供第一人称和第三人称基础检查点。其中还包含记忆重投影组件、示例输入、配置文件和推理代码。

可用模型基于 Wan2.2-TI2V-5B 构建,这是一个文本与图像生成视频的基础模型。用户必须单独下载其文本编码器、视频自动编码器、transformer 组件和 tokenizer。该流水线还依赖 Depth Anything 3 提供度量深度估算。

这是一次颇具意义的发布。开发者可以检查实现方式、修改记忆行为并生成自己的序列。他们也可以研究系统的失败案例,而不必完全依赖经过筛选的演示视频。

然而,昆仑万维并未发布与其主要性能主张相关的全部组件。代码仓库表示,经过蒸馏的实时自回归模型将在之后发布。目前可用的基础模型采用速度较慢的双向生成过程。

这一区别改变了人们解读此次发布的方式。Matrix-Game 3.5 的开放程度足以支持架构评估,但其完整程度尚不足以独立验证所宣称的每秒 20 帧模式。

为什么 Patch Memory 是 Matrix-Game 3.5 的核心押注

昆仑万维将长期一致性视为检索问题,而不是要求单个视频上下文窗口记住整个世界。

大多数生成式视频系统使用有限的近期上下文。它们会保留足够数量的前序帧,以确保运动较为流畅。超出该窗口的细节则容易被替换或扭曲。

扩展上下文窗口并不能自动解决问题。每增加一帧都会消耗算力,其中还可能包含与当前视图无关的信息。旧帧同样是从已经过时的摄像机位置捕捉环境的。

Patch Memory 改用选择性回忆。系统会存储局部观察结果,并且仅检索与摄像机当前可视区域相关的内容。这为生成器提供了关于应当出现什么的针对性证据。

这一过程首先会估算较早帧的深度。深度表示每个可见点与摄像机的距离。系统将该估算结果与记录摄像机位置和朝向的摄像机位姿结合起来。

这些输入让 Matrix-Game 3.5 能够将图像块提升至共享的空间坐标系中。当摄像机改变位置时,模型便可识别哪些记忆中的图像块应继续可见。

随后,系统会将这些图像块重新投影到当前摄像机视图中。这样产生的是一幅局部拼接图,而非完整渲染的场景。空白或不确定区域仍需通过生成来补充。

这种分工十分重要。记忆不会刚性决定每个输出像素。它会为扩散 transformer 提供相关的历史证据,同时为底层视频模型留出生成运动和新内容的空间。

Warped PRoPE 提供了这套机制的另一部分。标准旋转位置编码帮助注意力层表示 token 的相对位置。具备摄像机感知能力的版本则将投影矩阵纳入这种编码。

从实际角度来看,Patch Memory 回答的是:“这个区域之前是什么样子?”Warped PRoPE 则有助于回答:“这段观察结果应当如何与当前视点关联?”

昆仑万维表示,这一设计不需要增加骨干网络参数。这一点很重要,因为更大的记忆机制很容易削弱效率主张。无参数的几何层可以在不扩展主模型的情况下增加结构信息。

该模型的静态和动态分支解决了另一组矛盾。几何信息对永久物体很有用,但如果不加谨慎地应用于移动主体,则会造成危害。

Matrix-Game 3.5 使用运动检测和分割,从几何记忆中过滤动态物体。随后,多视图参考 token 会跨帧携带主体的身份和外观信息。

这种方法同时支持第一人称世界和第三人称场景。第三人称检查点最多可以接收四张经过裁剪的主角参考图像。这些参考图有助于模型保留服装、体形及其他身份特征。

这一设计类似于可搜索知识库中的检索。AI 系统通常不需要一次性载入所有历史项目,而是需要检索与当前任务相关的证据。

不过,视觉记忆还增加了一项更困难的约束:检索到的信息必须在几何上对齐。即使建筑物图像块本身正确,如果被投影到道路的错误一侧,依然会造成危害。

因此,深度误差可能扩散为记忆误差。不准确的估算会把图像块放在错误的距离上。摄像机位姿漂移则可能使其发生错误的旋转或平移。

遮挡带来了另一项挑战。记忆中位于车辆后方的建筑物不应透过车辆显现出来。系统需要具备可见性逻辑,以区分有用的历史信息与当前被遮挡的内容。

动态物体过滤同样可能失败。细微运动、阴影、反射、植被和摄像机运动都会增加分割难度。错误分类可能会抹去有用的景物,或保留主体已经过时的位置。

该模型的技术报告将这些组件描述为场景回忆、摄像机控制和身份一致性的统一解决方案。这套架构直接针对长时间生成视频中的常见故障。

尽管如此,几何一致性并不等同于物理理解。系统可以记住一扇门的位置,同时在其周围生成不可能发生的碰撞。它也可以保留角色的夹克,却忽略该角色行为产生的后果。

因此,Patch Memory 是一种可信的机制,但并不能证明其已经构成完整的模拟引擎。它的价值取决于在困难的返回、反向移动、遮挡和环境变化情况下能否带来可衡量的改进。

单 GPU 主张给封闭式世界模型带来压力

Matrix-Game 3.5 具有战略意义,因为昆仑万维将可检查的架构与面向专业级单 GPU 部署的性能主张结合在了一起。

Google DeepMind 通过 Genie 3 建立了一个显眼的比较基准。根据 Google 的 Genie 3 详情,该系统能以每秒 24 帧的速度生成可导航的 720p 环境。

Google 还表示,Genie 3 可以在数分钟内保持一致性。它能根据文本提示创建环境,并支持用户实时导航生成的场景。

这些数字不应被简化为排行榜。Google 尚未披露 Genie 3 的模型规模、完整架构、训练数据或硬件要求。这些系统采用的控制方式、流水线和评估条件也有所不同。

Matrix-Game 3.5 宣称的速度略低,约为每秒 20 帧。它更具差异化的主张在于可访问性。昆仑万维表示,这套拥有 50 亿参数的系统可以在单个 GPU 上达到该速度。

“单个”一词需要结合具体情况理解。代码仓库要求使用至少拥有 40GB 显存的 Nvidia GPU。昆仑万维报告称,以 704×1280 像素生成内容时,显存占用峰值接近这一上限。

推荐环境还包括 Linux 和至少 64GB 系统内存。团队测试了 Nvidia A 系列和 H 系列硬件。这属于专业级基础设施,而不是普通笔记本电脑或主流游戏显卡。

即便如此,单卡配置仍能降低研究实验室和开发团队的门槛。它可以避免多 GPU 部署所需的协调、通信和内存需求。

开放获取还带来了另一项优势。研究人员可以调整记忆检索、替换相机轨迹、检查中间马赛克,并引入对抗性测试。封闭接口会限制此类实验。

Google 的优势依然显著。Genie 3 展示了更广泛的场景多样性,并提供了更加一体化的用户体验。Google 可以整合专有数据、专用基础设施和直接的产品分发渠道。

Kunlun Tech 提供了另一种选择。开发者获得了更多控制权,也承担了更多责任。他们必须自行组装依赖项、管理大型检查点、准备相机数据,并分析失败案例。

Nvidia 代表了世界模型竞赛的另一条分支。其 Cosmos 平台专注于合成数据、机器人、自动驾驶汽车和物理 AI 工作流。

Cosmos 与 Matrix-Game 类似游戏的交互式生成并不能直接比较。然而,它们争夺的是相同的开发者注意力和基础设施预算。两家公司都将世界模型定位为可复用的基础,而非单一用途的视频工具。

这些差异揭示出一个日益分化的市场。Google 强调通用型可导航体验。Nvidia 聚焦物理 AI 训练与仿真。Kunlun Tech 则试图将交互式媒体与更长期的机器人愿景连接起来。

Matrix-Game 的发展历程支撑了这种基础设施叙事。初代模型使用了大量 Minecraft 素材和动作标注。Matrix-Game 2.0 扩展到实时、长时间运行的交互式生成。

随后,Matrix-Game 3.0 强调高分辨率输出和长程记忆。其早期技术论文报告称,使用一个五十亿参数的模型,可以在 720p 分辨率下达到每秒 40 帧。

这一数字看起来高于 3.5 版本所报告的每秒 20 帧。但这并不能证明新模型在相同条件下速度更慢。

3.0 版本的结果采用了不同的推理配置,其记录的高速设置中包括多块 GPU。3.5 版本则增加了更明确的几何记忆、相机编码和主体处理能力。

帧率也只能反映交互性能的一部分。深度估计、图块检索、视频解码、输入处理和显示都会影响感知延迟。

一个系统可能生成帧的速度很快,但对变更后的命令响应缓慢。它也可能保持很高的平均帧率,却在生成块之间出现停顿。

当前的 Matrix-Game 3.5 基础模型以 80 帧为一组生成。其默认配置使用 25 个去噪步骤,并不是其承诺的少步实时流程。

尚未发布的蒸馏模型预计会减少这部分工作量。蒸馏是训练一个速度更快的生成器,使其逼近较慢教师模型的行为。Kunlun Tech 描述了一种分阶段流程,逐步迁移引导能力、相机控制和记忆条件。

如果外部开发者能够复现其声称的性能,此次发布将在效率和访问性方面给闭源提供商带来压力。如果蒸馏检查点延迟发布或表现不稳定,其宣传中的优势就会减弱。

开放代码尚不足以证明这是一个可部署的交互式世界

目前的主要不确定性已不再是 Kunlun Tech 是否发布了有用的代码,而是完整的公开系统能否在精心编排的演示之外持续兑现其主张。

现有的软件包支持严肃的审查。它包含两个基础检查点、一个推理入口、相机示例、深度依赖项和记忆可视化。

第一人称运行以一张锚点图像、一个文本提示和一条相机轨迹开始。轨迹包含相机内参和外参,用于描述镜头几何结构和相机运动。

第三人称生成可以加入主角参考裁剪图。输出目录包含生成的视频和马赛克记忆的诊断可视化。该诊断视图可以帮助开发者追踪对齐失败问题。

这些功能使 Matrix-Game 3.5 比仅有演示的系统更加透明。然而,透明并不能自动证明其可用性。

第一个缺失的测试涉及速度。要验证公布的配置,需要公开检查点、准确的硬件披露以及完整的延迟测量方法。

所报告的每秒 20 帧可能有多种含义。它可能只测量输入准备完成后的神经网络生成速度,也可能未计入深度处理、记忆更新、解码或显示。

更有力的测试应测量从用户命令到可见响应的整个闭环。还应报告平均延迟、最严重的停顿、内存使用情况,以及持续数分钟的性能表现。

第二个缺失的测试涉及长期一致性。只有在再次访问先前场景时仍能认出它们,一分钟长的序列才有意义。

独立评估应让相机穿过某个地点、离开,然后再次返回。测试应比较门、窗、路径、标志和物体位置等结构元素。

测试应包括相机反向移动,而不仅仅是向前移动。只要观看者不断进入新生成的空间,生成环境通常看起来很稳定。转身返回才能暴露系统是否保留了一个连贯的世界。

移动主体需要单独测试。角色在转身和被遮挡时应保持身份一致,同时又不能被冻结在几何记忆中。车辆穿过场景后不应出现重复。

第三个缺失的测试涉及动作。世界模型必须可靠地响应控制,而不仅仅是围绕相机路径生成美观的视频。

评估应衡量所请求的移动是否使输出朝预期方向变化。在相近条件下,重复命令应产生一致的效果。

第四个问题是物理行为。Patch Memory 可以回忆视觉表面,却无法维持一个权威的仿真状态。

传统游戏引擎会追踪对象、碰撞体积、物品栏、脚本事件和确定性规则。生成式视频模型则预测接下来的帧应该是什么样子。

这种预测可以支持灵活的视觉效果和快速原型设计。但它仍不适用于许多要求精确、可重复结果的机制。

混合应用提供了一条更可信的近期路径。传统引擎可以保留权威状态,而世界模型则生成背景、视觉变体或探索性内容。

游戏工作室可以使用 Matrix-Game 3.5 测试场景概念或制作交互式预演。研究人员可以用它研究记忆架构和相机感知生成。

仿真团队或许可以围绕受控状态探索生成式变体。机器人研究人员可以研究其记忆系统的部分能力能否迁移到传感器预测或合成数据生产。

这些用途都不要求相信该模型能够取代 Unreal Engine 或其他确定性平台。它们只需要一个在交互过程中仍具有视觉实用性的可控生成器。

硬件条件也限制了近期受众。40GB GPU 的要求排除了大多数消费级系统。单 GPU 的描述仍然准确,但读者不应将其理解为可在所有本地设备上部署。

许可条款同样需要审查。核心项目使用 Apache 2.0,而捆绑和下载的组件则各自拥有不同的条款。团队在商业使用前必须审查 Wan 基础模型、深度模型、示例资产和支持库。

此次公开发布还缺少广泛的第三方基准测试。Kunlun Tech 的演示展示了预期行为,但精心筛选的示例很少涵盖困难输入或持续性故障。

这些限制都不能证明该公司的主张是虚假的。它们表明,发布和验证是两个不同的里程碑。

Kunlun Tech 已通过发布架构和基础权重达成了第一个里程碑。当独立团队能够在公开披露的条件下运行蒸馏模型时,第二个里程碑才会开始。

Matrix-Game 3.5 将竞争焦点从视频质量转向基础设施

更深层次的转变在于,人们开始将世界模型视为包含记忆、控制、数据管线和部署约束的系统来评判。

视频质量仍然重要。模糊的表面、不稳定的主体和重复的运动都可能毁掉交互体验。然而,仅凭视觉质量已经无法定义这一类别。

一个可信的世界模型必须将动作与未来状态连接起来。它必须在不携带此前每一帧的情况下保留相关历史。它还必须以足够快的速度生成内容,以便用户或智能体作出反应。

Matrix-Game 3.5 围绕以记忆为中心的架构整合了这些要求。Patch Memory 负责局部场景回忆。Warped PRoPE 表示视角变化。参考 token 支持重复出现的动态主体。

Kunlun Tech 还将该模型连接到更宏大的数据战略。该公司称,其已构建三条自动化管线,用于生产视频、姿态、动作和语言数据。

据该公司称,这些管线已积累超过五百万个视频片段、超过 10,000 个有效训练小时,以及超过 1,200 个游戏环境。

这些数据来自 Kunlun Tech,尚未经过独立审计。尽管如此,它们仍明确了该公司的目标。Matrix-Game 被定位为数据和仿真层,而不仅仅是媒体生成器。

这一定位使该公司处于游戏生成与物理 AI 之间。交互式游戏素材提供了大量与动作关联的视觉数据。机器人则要求更强的因果准确性和物理准确性。

从一个领域迈向另一个领域并不会自动实现。游戏视频包含与物理世界不同的设计规则和视觉效果。相机运动并不等同于机器人动作。

然而,这两个领域都需要记忆和预测。机器人应在物体离开视野后仍记得它。交互式视频模型应在相机转向别处后仍记得一栋建筑。

这一共同的技术问题解释了为何许多公司使用同一个“世界模型”标签来描述不同的产品。该标签可以指可导航视频、合成训练系统、预测式传感器模型或智能体内部表征。

Matrix-Game 3.5 最明确地属于交互式视频这一分支。其公开输入包括图像、相机轨迹、文本提示和可选的主体参考。其输出则是生成的视频。

将其称为完整的仿真器会夸大现有证据。将其称为普通视频生成器,则会忽视其明确的记忆和控制机制。

此次发布最适合被理解为用于测试持久性交互式生成的开放基础设施。其重要性来自它公开了一种其他团队可以检查、质疑和扩展的具体设计。

即使 Matrix-Game 永远无法成为一款主流产品,其架构也可能影响竞争对手。图块级几何检索提供了一种可测试的替代方案,无需依赖更大的上下文窗口或永久重建的场景。

它还带来了更明确的评估问题。研究人员可以衡量检索到的图块是否改善场景回忆,也可以测试相机编码能否减少几何漂移。

他们可以识别静态与动态分离失效的情况。开放代码让这些发现能够转化为补丁、分支版本和替代检查点。

这种反馈循环是此次发布最有力的价值主张。封闭系统可以提供令人印象深刻的体验,但外部研究人员很难分离并研究其机制。

Kunlun Tech 仍需获得采用、完善文档并提供可靠的检查点,才能从开放中获益。一个缺乏持续维护集成的代码仓库,很快就可能沦为归档资料。

下一阶段将揭示 Matrix-Game 3.5 是会成为外部工作的基础,还是主要停留在会议时期的参考实现。

Matrix-Game 3.5 发布后值得关注的方面

三个信号将决定此次开放发布是能支撑 Kunlun Tech 的效率叙事,还是会暴露其架构与部署主张之间更大的差距。

第一个信号是蒸馏后的实时检查点。Kunlun Tech 需要发布承诺的自回归权重,并提供准确的硬件和软件配置。

独立团队应在启用记忆功能的情况下,以 720p 测试 Kunlun Tech Matrix-Game 3.5 开源世界模型。结果应包括端到端延迟、持续帧率、显存占用和控制响应速度。

如果能成功复现接近每秒 20 帧的表现,将增强 Kunlun Tech 对封闭系统发起挑战的底气。检查点延迟发布或结果不一致,则会削弱此次发布的核心效率主张。

第二个信号是独立的长时程评估。研究人员应测试重复返回、镜头反转、遮挡、移动主体和结构变化。

这些测试必须将视觉回忆与物理预测区分开来。记住一面墙并不能证明模型理解碰撞。保持一个人的面部一致,也不能证明模型能追踪此人的状态。

相较于 Matrix-Game 3.0 的明显提升将支持 Patch Memory 理论。提升幅度较小或结果不一致,则意味着几何检索只能解决持久世界生成中的部分问题。

第三个信号是外部采用情况。有用的证据包括持续维护的集成、已发布的实验、微调检查点,以及在没有 Kunlun Tech 直接参与的情况下创建的应用。

代码仓库的星标数衡量的是关注度,而非基础设施价值。在研究、游戏原型、模拟工作流或混合引擎系统中的重复使用,能提供更有力的信号。

评估 Matrix-Game 3.5 的开发者应从范围较窄的测试开始。记录镜头路径、提示词、硬件、延迟和可见故障。蒸馏模型发布后,重复进行这些测试。

现在的核心问题已经十分具体:一个开放的五十亿参数系统,能否在单张专业级 GPU 上以交互速度作出响应,同时记住生成的世界?答案将决定 Matrix-Game 3.5 是会成为可复用的基础设施,还是仍只是一场雄心勃勃的预演。

 
 

免费开始使用

一款本地优先的AI助手

为了获得更好的人工智能体验,

remio 目前仅支持Windows 10+ (x64)和M-Chip Mac 。

你的 AI 工作伙伴

和 remio 一起高效工作

规划、创作、交付

一站式完成

bottom of page