昆仑万维宣称2026年为世界模型元年,但 Matrix-Game 3.5 仍面临实时性考验
已更新:7月20日
昆仑万维在上海世界人工智能大会上宣布2026年为“世界模型元年”,并推出 Matrix-Game 3.5。该公司称,其拥有50亿参数的模型可以在单块 GPU 上以每秒约20帧的速度生成交互式 720p 视频。这一主张将效率而非单纯的视觉奇观置于此次发布的核心位置。
Matrix-Game 3.5 与 Mureka V9.5 音乐生成器和 Mureka O3 音乐推理模型一同亮相。昆仑万维还展示了 Riemann-1.0,这是一款旨在连接视觉预测与机器人动作的模型。这些产品共同将世界建模定位为游戏、媒体、模拟和机器人技术的共享基础。
然而,现有证据只能支持这一宏大叙事的一部分。昆仑万维已经发布 Matrix-Game 3.5 的代码和基础模型权重,但其代码仓库表示,蒸馏后的实时模型仍将于日后推出。因此,当前真正的较量在于昆仑万维开放、高效的基础设施战略与其现有版本的实际局限之间。
Google DeepMind 的 Genie 3 已经为可导航的 AI 环境树立了一个显著的基准。Nvidia 的 Cosmos 平台正推动世界模型向机器人、自动驾驶汽车和合成训练数据领域发展。昆仑万维正尝试通过一种架构连接这些方向,同时让外部开发者也能使用这套架构。
昆仑万维的2026年世界模型攻势从 Matrix-Game 3.5 开始
此次发布之所以重要,是因为昆仑万维将世界模型定位为基础设施,而不仅仅是能力更强的视频生成器。
世界模型预测环境在某个动作之后会如何变化。与传统视频生成器不同,它必须响应控制指令,同时保持物体、几何结构和先前事件的一致性。系统需要记住当前画面之外发生过的事情。
昆仑万维董事长兼首席执行官方汉利用该公司在世界人工智能大会上的活动,将2026年称为“世界模型元年”。这一说法是一项战略判断,而非行业共识。它认为,生成式 AI 正从制作孤立的媒体内容,转向维持用户或机器可以持续探索的环境。
Matrix-Game 3.5 是这一观点的技术核心。昆仑万维将其描述为一款用于长时间运行、由摄像机控制的视频生成的记忆增强模型。它既支持第一人称导航,也支持围绕固定角色构建的第三人称场景。
该公司的模型发布详情介绍了三项核心变化,分别涉及几何记忆、摄像机感知位置编码,以及对移动主体的独立处理。每项变化都针对生成世界丧失连贯性的一种不同方式。
第一个问题是空间遗忘。传统视频模型只能看到有限数量的近期帧。当摄像机离开一栋建筑后再次返回时,模型可能会以不同方式重新绘制这栋建筑。门的位置会移动,标志会改变,道路也不再连通。
第二个问题是摄像机控制。视频模型可以模仿运动,却不一定能建立摄像机与场景之间的稳定关系。用户要求转向时,模型可能生成看似合理的图像过渡,同时悄然破坏环境的几何结构。
第三个问题涉及移动物体。存储所有内容的记忆系统可能会保留人物或车辆的过时位置。再次使用这段记忆时,一旦物体移动,就会产生重复影像、视觉拖影或“幽灵”。
昆仑万维称,Matrix-Game 3.5 在解决这些问题的同时,仍保留了规模相对较小的50亿参数主干网络。其公开代码仓库显示,底层文生视频和图生视频框架为 Wan2.2-TI2V-5B。第一人称和第三人称检查点均以 Apache 2.0 许可证开放。
该公司还宣称可在单块 GPU 上以每秒约20帧的速度生成 720p 视频。对于这一规格需要谨慎措辞,因为目前公开的软件包尚不能完整验证这一结果。其文档要求使用一块显存至少为 40GB 的 Nvidia GPU 来运行现有基础模型的推理。
更重要的是,该代码仓库表示,蒸馏后的实时自回归模型将在日后发布。目前记录的推理流程默认使用25个去噪步骤,并根据锚点图像、摄像机路径和文本提示生成每组80帧的画面。
因此,此次发布具有实质性的开放性,但并不完整。开发者可以检查架构、下载基础权重并运行提供的示例,但尚无法仅凭已发布的软件包复现其主打的实时配置。
这一区别构成了本文的核心矛盾。昆仑万维发布了一个高效、可复用的世界模型基础。其代码支持严肃的技术审查,但最具商业价值的性能主张仍需等待可公开复现的版本来验证。
为什么 Patch Memory 是 Matrix-Game 3.5 的主要技术押注
Matrix-Game 3.5 将记忆视为一个几何检索问题,而不是要求模型将整个世界保存在近期画面中。
它的主要机制名为 Patch Memory。Patch 是从先前图像中截取的一小块区域。系统会估算该 Patch 的深度,并将其与摄像机记录的位置相结合。
随后,Matrix-Game 3.5 将该 Patch 投影到三维坐标系中。当摄像机之后再次接近同一区域时,系统会识别历史上可见的 Patch,并将其投影到新的视角中。这些检索到的细节会组成一个记忆画布,提供给生成器。
这种机制不同于存储完整帧。完整帧包含有用的场景信息,但也会将这些场景固定在旧视角上。以 Patch 为单位的存储方式允许系统检索与当前摄像机视角相匹配的较小片段。
它也不同于构建一个永久性的三维重建结果。当深度估算或摄像机位置发生漂移时,全局重建可能会积累误差。Patch Memory 则维护一个由局部观察结果组成的灵活集合。
这种方法类似于知识系统中的检索。生成器不需要将每一条历史观察结果都放入活跃上下文中,只需要与当前请求和位置相符的相关观察结果。
这种相似性在视频生成之外也很重要。长时间运行的 AI 系统通常会因为遗忘早期信息或加载过多无关历史而失败。选择性检索可以保留有用的上下文,而无须每次都将所有历史细节输入模型。
对这类上下文问题感兴趣的开发者,可以将这种方法与可搜索的知识库进行比较。两者的底层数据不同,但都依赖于在正确的时刻检索正确的记忆。
昆仑万维将 Patch Memory 与 Warped PRoPE 相结合,后者是一种摄像机感知的位置编码方法。位置编码用于告诉 Transformer,各个 Token 在时间和空间上如何关联。标准视频编码通常表示时间和二维图像坐标。
Warped PRoPE 增加了由摄像机投影矩阵推导出的信息。这为模型提供了不同视角之间的旋转、平移和透视关系表示。昆仑万维称,该方法无须增加主干网络参数。
这两者的结合具有明确的分工。Patch Memory 提供来自正确区域的早期视觉证据,Warped PRoPE 则告诉注意力系统,这些证据应如何与当前视角对齐。
该架构还将静态场景与动态主体分开处理。建筑、地形和固定物体进入几何记忆,而人物、车辆和其他移动主体则使用独立的多视角参考 Token。
运动检测和分割会从 Patch Memory 中过滤掉移动主体。否则,汽车移动后,其早期图像可能仍会嵌在街道上。参考 Token 分支则负责在整个序列中保持主体的身份与外观。
已发布的Patch Memory 代码支持其基本架构描述。其中包括记忆重投影组件、深度估算依赖项、第一人称示例和第三人称工作流。代码仓库还为两种视角模式分别提供了检查点。
这些机制使 Matrix-Game 3.5 不只是一款改了名称的视频模型。它们直接解决了区分精美短片与可探索环境的状态问题。该模型试图记住物体应当位于何处,而不只是记住最近几帧的模样。
然而,几何一致性并不等于对物理规律的理解。模型可以保持门的位置一致,却仍可能生成错误的碰撞、物体行为或因果结果。Patch 检索提升了视觉连续性,但并不能证明模型已经学会可靠的物理规律。
该机制也依赖上游估算结果。错误的深度或摄像机信息可能会将记忆中的 Patch 放置到错误位置。当运动幅度较小、主体被部分遮挡,或其运动与摄像机移动重合时,动态物体过滤也可能失效。
这些局限并不会抹杀该架构的价值,而是界定了独立评估需要衡量的内容。有效的测试应包括反复返回先前地点、移动主体、摄像机反向运动、遮挡,以及包含结构变化的长序列。
昆仑万维的效率主张给闭源世界模型带来压力
Matrix-Game 3.5 对 Google DeepMind 构成的战略挑战,并不在于它显然能够生成更出色的世界,而在于昆仑万维希望在更易获得的硬件上实现相当的交互体验。
Google DeepMind 于2025年8月发布 Genie 3,将其定位为通用世界模型。其交互式环境以 720p、每秒24帧运行。Google 表示,该系统能够在数分钟内保持一致性。
这提供了一个有用的参照点,但并不能构成严格的基准比较。Google 尚未公布 Genie 3 的模型规模、硬件要求、训练数据或完整架构。不同的提示、动作、延迟定义和输出流程也进一步限制了直接比较。
昆仑万维宣称的帧率略低,约为每秒20帧。更值得关注的是其声称的部署资源需求。如果一款50亿参数的模型能够在单块 GPU 上运行,更多群体将有机会进行实验,而不必依赖闭源托管系统。
Matrix-Game 3.5 还开放了其基础检查点和实现代码。研究人员可以修改记忆检索方式、替换输入、评估失败案例或微调组件。Genie 3 仍是一种受控的产品体验,而非可供公开检查的研究基础。
这并不意味着 Matrix-Game 3.5 是更强大的系统。Genie 3 可以接收文本提示,生成多样化的可导航环境,并已通过 Project Genie 获得了更广泛的公众体验。昆仑万维尚未提供同等证据,证明其模型能够在相同范围内实现泛化。
这一对比反而揭示了两条相互竞争的路线。Google 可以结合大型专有数据集、专用基础设施和一体化消费者入口。昆仑万维则押注于更小的模型、可下载的组件以及可复现的研究,认为这些要素将加速单一公司之外的技术进步。
Matrix-Game 的演进印证了这一效率叙事。Matrix-Game 2.0 使用少步自回归扩散流程,以每秒 25 帧的速度生成交互式视频。其训练流程包含约 1,200 小时经过标注的 Unreal Engine 和游戏画面。
随后,Matrix-Game 3.0 将重点放在长时程记忆和更高分辨率的生成上。其技术论文报告称,一个拥有 50 亿参数的模型能够以 720p 分辨率达到每秒 40 帧。不过,该结果使用的是多 GPU 推理配置,而非单个 GPU。
因此,从 3.0 版本的每秒 40 帧表面下降至 3.5 版本的每秒 20 帧,并不能简单视为性能倒退。硬件环境发生了变化,同时记忆设计也变得更加复杂。3.5 版本还加入了显式视角几何和独立的主体追踪功能。
实时性能仍比单一帧率数字更加复杂。输入处理、深度估计、记忆检索、视频解码和显示延迟都会影响响应速度。一个系统即使报告了很快的生成速度,在控制发生变化时仍可能让人感觉存在延迟。
只有当外部开发者能够复现完整流程时,昆仑万维的发布才会对闭源系统形成压力。最终的实时检查点必须在长时间交互中持续维持其帧率,而不能只在短序列中达到这一水平。随着记忆集合不断增长,它还必须保持生成质量。
公开发布可以加快这一验证过程。研究人员可以测试会议演示会回避的故障模式。他们可以检查被记住的物体能否在摄像机转向后继续存在、动态主体能否保持稳定,以及控制是否始终能够得到一致响应。
该公司的竞争地位还取决于许可条款和实现细节是否清晰。Matrix-Game 3.5 项目采用 Apache 2.0 许可证,而若干第三方组件则有各自的条款。开发者在进行商业部署前,仍需审查相关依赖项和底层 Wan 模型。
对游戏工作室而言,其吸引力显而易见。可在本地部署的世界模型能够生成探索性原型、交互式背景或模拟变体,而无需将每一帧都发送到托管服务。不过,目前的模型并不能取代确定性的游戏引擎。
传统引擎可以保证碰撞规则、脚本化状态和可重复的结果。生成式世界模型则是预测可能的下一帧。这种灵活性有利于快速创作,但对于许多生产环境中的游戏机制而言,预测错误仍然不可接受。
近期机会在于混合系统。传统引擎可以维护权威状态,而世界模型则负责提供视觉效果、替代场景或训练变体。与其宣称 Matrix-Game 3.5 能生成完整游戏,不如说它的摄像机控制和记忆设计更适合承担这种实验性角色。
开放代码尚不能证明世界模型已具备可部署性
最大的不确定性,在于昆仑万维发布的实时性能声明与外部人员目前实际可运行的确切配置之间仍存在差距。
公共代码仓库提供了两个拥有 50 亿参数的基础模型。一个用于第一人称生成,另一个支持带有可选参考图像的第三人称场景。两者都依赖 Wan2.2 视频模型基础和一个外部度量深度模型。
文档所列的硬件要求相当高。以 704×1280 像素生成时,GPU 显存峰值接近 40GB。根据项目文档,配套计算机还需要至少 64GB 系统内存。
这些规格仍可由单个专业级 GPU 满足,这对于实验性世界建模而言值得关注。但它们并不意味着该模型能够在普通消费级笔记本电脑或主流游戏显卡上实用运行。“单 GPU”不应被理解为普通本地硬件。
更重要的限定条件在于速度。已发布的代码仓库明确表示,经过蒸馏的实时自回归模型将很快发布。这意味着,目前可下载的基础检查点尚不能让研究人员独立验证官方宣称的每秒 20 帧模式。
蒸馏能够将较慢的生成流程压缩为更少的步骤。Matrix-Game 3.5 采用分阶段方法,训练一个因果生成器来模仿计算成本更高的双向扩散模型。该公司表示,这一流程能够在更长时间的推演中保留摄像机控制和记忆条件信息。
在这些权重发布之前,开发者可以研究记忆系统并生成示例,但无法公平地验证完整的部署声明。这属于发布顺序问题,并不能证明所宣称的结果是虚假的。
评估本身也是另一个挑战。世界模型需要超越图像质量的衡量标准。一个视觉上清晰的序列仍可能忘记某个房间、忽略某项操作、错误地移动物体或生成不一致的几何结构。
长时程测试应衡量摄像机离开场景再返回后,场景能否保持稳定。动作测试应计算所请求的移动是否能可靠地改变预测世界。动态测试应追踪主体被遮挡前后的身份和位置。
物理一致性需要单独一层测试。系统应当能够预测接触、移动和环境变化之后的合理结果。仅凭视觉记忆无法证明其具备因果推理能力。
据报道,昆仑万维的演示包括开放环境和第一人称游戏场景。这些示例有助于说明其预期用途,但经过精心挑选的演示并非独立基准。该公司尚未发布足够多的第三方 Matrix-Game 3.5 测试结果,因此还无法确立其性能排名。
同样的谨慎态度也适用于更广泛的产品矩阵。据报道,Mureka V9.5 改进了人声质量、提示遵循度、编曲以及感知真实感。Mureka O3 则在生成过程中使用额外的推理时计算,对音乐决策进行审查和调整。
昆仑万维报告了这些音乐模型的内部评估比例。该公司表示,Mureka V9.5 的人声表现可接受率达到 61%,提示控制可接受率达到 97%。这些数据来自该公司的评估流程,不应被视为独立的市场基准。
该公司表示,Mureka O3 将听感质量可接受率从 35% 提升至 43%。该公司还报告称,人声可接受率从 60% 提升至 68%。在缺乏公开测试数据和第三方复现的情况下,这些数字主要反映了昆仑万维所选择的开发目标。
音乐产品的发布拓宽了此次公告的范围,但并不能验证其世界模型论点。生成一首连贯的歌曲与维持一个可导航的环境,面临不同的状态、延迟和评估问题。两者之间的联系更多是战略层面的,而非某个统一系统的技术证明。
Riemann-1.0 对这一论点构成了更直接的检验,因为机器人控制依赖于对物理后果的预测。昆仑万维将其描述为一种联合表征视频、机器人状态和动作的世界动作模型。
该公司报告了该模型在多个机器人基准测试中的结果,并称其使用了 232,000 小时的人类和机器人混合数据进行训练。这些均为该公司提供的声明。独立复现需要获得模型、评估细节以及可比较的测试条件。
对企业买家而言,这一验证差距应当影响其采购问题。团队应要求获得完整的延迟测量结果、支持的 GPU、能耗、序列时长和故障率。他们还应区分已提供的基础模型与已公布但尚未发布的优化检查点。
开发者应测试自己的环境,而非依赖会议演示。围绕游戏训练的世界模型在仓库、街道、住宅或工业流程中的表现可能有所不同。摄像机控制能力并不能保证准确的领域行为。
尽管如此,此次发布仍为实验建立了一个具体基础。代码已经公开,架构可以检查,并且检查点已经提供。这比完全不提供技术访问途径的演示更有价值。
审慎的结论应当保持克制。昆仑万维已经发布了一个用于长时程视频生成的开放式几何记忆系统,但尚未提供独立验证其单 GPU 实时性能声明所需的全部内容。
世界模型竞赛正分化为游戏与物理 AI 两条路线
昆仑万维更大的赌注在于,以记忆为中心的同一个基础系统能够同时服务于交互式媒体和机器训练,而竞争对手则围绕不同的部署市场走向专业化。
Google DeepMind 将世界模型定位为面向智能体和用户的环境。Genie 3 会随着用户导航,在摄像机前方即时生成世界。其价值在于广泛的创作和交互能力,以及提供潜在无限的训练环境。
Nvidia 则通过物理 AI 切入这一领域。其世界模型平台结合了生成模型、数据整理工具、评估系统和后训练工作流。Cosmos 面向机器人、自动驾驶汽车和智能基础设施。
2026 年发布的 Cosmos 3 通过用于感知、预测和策略开发的模型及工作流扩展了这一技术栈。Nvidia 的优势来自将世界模型与模拟软件、加速计算、机器人框架和部署硬件连接起来。
昆仑万维位于这两种定位之间。Matrix-Game 起步于类游戏环境和交互式视频。Riemann-1.0 试图将世界预测能力迁移到机器人动作中。Mureka 和该公司的视频模型则围绕这一核心增加了媒体生成应用。
这一中间定位既带来机会,也带来风险。共享模型能够复用表征学习、数据基础设施和视频生成研究。然而,游戏、音乐和机器人并不具备完全相同的准确性要求或商业渠道。
游戏原型可以容忍视觉上的即兴发挥,而仓库机器人无法容忍虚构出来的障碍物位置。音乐创作者评估的是情感和审美质量,机器人开发者衡量的则是任务成功率和安全性。
“世界模型”这一说法可能会掩盖这些差异。有些系统预测未来的传感器观测结果,有些生成可交互的视频流,还有一些学习压缩后的内部状态,以帮助智能体选择动作。
Matrix-Game 3.5 主要属于交互式视频这一分支。其输入包括锚点图像、摄像机轨迹和文本提示,输出则是带有可视化记忆状态的生成视频序列。
这可以支持合成环境,但不会自动提供符号化或具有物理权威性的模拟。它预测摄像机移动时场景应当呈现的视觉效果。开发者仍然需要处理动作、物体、碰撞和可测量状态的机制。
近期最有力的用例是快速生成环境变体。工作室可以基于一张图像和一条摄像机路径探索场景概念。机器人团队则可以为感知实验生成不同的视觉条件,但前提是经过特定领域的验证。
数字孪生开发者可以使用该系统创建替代性的视觉轨迹。但在进行工程决策时,他们仍需要经过验证的几何结构和传感器模型。看似合理的图像无法取代经过校准的模拟数据。
开放模型路线使昆仑万维能够在成熟商业类别形成之前建立影响力。研究人员可以调整该系统、发表扩展成果,并让 Matrix-Game 成为通用基准。即使直接收入仍不确定,这种可见度也能够吸引开发者。
早期版本的 Matrix-Game 已经出现在后续研究和比较评估中。该公司提到,一些学术项目基于其早期版本构建了多人或高效交互系统。此类采用情况比宣传性排名更重要,因为它能表明外部团队是否认为该架构具有实用价值。
然而,Nvidia 提供了一个强大的开放替代方案。Cosmos 在开放模型许可证下提供代码、模型、数据集和评估工具。其生态系统直接面向已有硬件和模拟工作流的物理 AI 买家。
Google 则通过消费者分发渠道和模型规模施加不同的竞争压力。Project Genie 可以让用户体验交互式生成,无需他们配置检查点或专业 GPU。对于许多创作者而言,通过托管产品获得便捷访问,可能比源代码访问更具吸引力。
因此,Kunlun Tech 需要的不仅仅是一个在技术上有趣的版本。它还需要可靠的开发者体验、持续维护的检查点、清晰的评估,以及与现有生产系统的集成。开放代码可以开启一个生态系统,但持续支持才能让它保持活力。
该公司还必须证明,其跨领域战略能够产生技术杠杆。共享视频表征确实有用,但每个产品仍然需要专门的数据、控制机制和安全工作。一系列模型并不会自动构成一个连贯统一的世界模型平台。
对于关注这些版本的知识工作者来说,来源管理正成为评估流程的一部分。相关主张、检查点、论文和基准修订可能迅速变化。个人知识库 可以保存这些材料,以及后续的测试结果和部署说明。
行业的发展方向比最终胜者更加清晰。交互式世界生成正从简短演示迈向持久记忆、实时控制和针对具体应用的评估。如今的竞争焦点不仅是视频质量,还包括基础设施和易用性。
Matrix-Game 3.5 发布后值得关注的事项
三个信号将决定 Kunlun Tech 的“世界模型之年”会成为技术里程碑,还是仅停留在一个雄心勃勃的会议主题。
第一个信号是承诺发布的实时检查点。Kunlun Tech 需要发布蒸馏后的自回归权重、准确的硬件配置和完整的延迟测试方法。外部团队应当能够在一块受支持的 GPU 上,以 720p 分辨率复现大约每秒 20 帧的性能。
持续性能比短暂的峰值更重要。测试应覆盖长达数分钟的序列,并启用记忆检索。测试应测量生成速度、端到端控制延迟、GPU 显存占用,以及随序列增长而发生的质量变化。
成功发布将增强 Kunlun Tech 相对于闭源系统的效率优势论点。延迟发布或难以复现,则会削弱其主要差异化优势。仅凭基础模型无法回答这个问题。
第二个信号是独立的长时程评估。研究人员需要测试重访地点、复杂相机路径、遮挡、移动主体和环境变化。测试结果应将场景回忆与物理预测区分开来。
一项有用的基准测试可以要求模型离开某个地点,并在生成许多帧后返回。然后,将重建场景与之前的视图进行比较。另一项测试可以追踪移动主体能否保持身份一致,同时不会在记忆中留下重复副本。
这些评估应在可比条件下纳入 Matrix-Game 3.0、Matrix-Game 3.5 和其他可用的世界模型,并披露硬件、输入分辨率、序列长度和采样设置。缺乏统一条件时,帧率和质量方面的主张仍然难以解读。
强劲的独立测试结果将证明,Patch Memory 能够带来超越精选示例的可衡量提升。较弱的结果则可能表明,几何检索只解决了长时程一致性问题中的有限部分。
第三个信号是外部采用情况。最有说服力的证据将来自开发者构建原团队未预先编排的应用。游戏原型、模拟工具、机器人数据集和研究扩展,可以揭示该模型能否作为基础设施发挥作用。
评估采用情况时,不应只看代码库的星标数量。持续维护的集成、已发布的实验、微调检查点,以及在同行评审研究中的重复使用,都是更有力的信号。披露限制条件的商业试点还将提供另一层证据。
相邻版本同样值得关注,但不应转移对这一进程的注意力。Mureka V9.5 和 O3 需要独立听测和创作者采用。Riemann-1.0 需要可复现的机器人研究结果和明确的访问条款。
Kunlun Tech 将 2026 年定义为世界模型之年,因为它认为记忆、预测和交互正在融合为一个通用 AI 层。Matrix-Game 3.5 为这一主张提供了具体架构和开放代码库。
尚未解决的问题是执行情况。发布的系统能否维持一个连贯的世界、以交互速度响应,并在 Kunlun Tech 演示之外的环境中运行于其所声明的硬件之上?
开发者应从现有基础模型入手,记录可复现的失败案例,并在蒸馏检查点发布后比较结果。这一过程将揭示 Patch Memory 是持久可靠的基础,还是针对这一极其困难问题的又一个充满希望的答案。



