top of page

ByteDance 世界模型让张一鸣加入与 Google 和 Meta 的竞赛

据报道,ByteDance 正在准备一款可每秒生成 20 帧空间视频的世界模型,向 Google 和 Meta 在交互式 AI 领域发起挑战。

该系统将创建能响应用户动作或语音的虚拟环境,而非生成固定视频。据熟悉该项目的人士称,创始人张一鸣正亲自监督其开发。

这款据报道由 ByteDance 开发的世界模型之所以重要,是因为它结合了极少有 AI 实验室能同时拥有的三项资产。ByteDance 拥有视频模型、云基础设施业务,以及可直接触达用户的 Pico 头显。

Google DeepMind 和 Meta 已将世界模型定位为通向能够理解物理环境的 AI 系统的重要路径。ByteDance 现在似乎已准备好检验这一理念更具商业整合性的版本。

核心问题不在于 ByteDance 能否生成令人惊艳的画面,而在于当人或机器与之交互时,生成场景能否保持响应性、一致性和实用性。

ByteDance 世界模型超越了生成式片段

据报道,ByteDance 希望将视频生成转变为用户使用过程中持续变化的环境。

据 9 月 7 日发布的空间视频报道称,该项目基于 ByteDance 现有的视频生成技术 Seedance 开发。产品最早可能于 10 月推出,但时间表仍未确定。

报道发布时,ByteDance 尚未公开宣布该模型。该公司也未向 Bloomberg 发表评论。因此,发布时间窗口、产品名称、访问模式和技术架构仍未得到确认。

这一限定十分重要,因为据报道的性能将标志着相较传统 AI 视频的重大转变。目前的视频生成器通常会在收到提示词、图像或参考视频后,渲染出一段完整片段。

交互式世界模型的工作方式不同。它会预测环境在某个动作发生后应如何变化,然后足够快速地生成下一视觉状态,以维持交互体验。

据报道,该系统将在云端以约每秒 20 帧生成视频。其延迟,即输入与可见响应之间的时间,据称约为 0.05 秒。

这些数据来自匿名消息人士,尚未经过独立基准测试。它们应被视为报道中的目标,而非已证实的产品性能。

如果 ByteDance 达到这些目标,用户将能够进入会对其语音和身体动作作出反应的生成空间。据报道,其应用包括游戏、直播和短剧。

观众可能通过走向某个角色来改变故事走向。直播主播则可以在生成的场景中移动,无需等待完整片段渲染完成。

游戏创作者可以描述一个场景,并在构建传统资产前先行探索。在 ByteDance 公布实际控制方式和制作限制之前,这些例子仍只是潜在用途。

据报道,该项目将与 ByteDance 的扩展现实硬件业务 Pico 协同工作。云端将处理高负载生成任务,头显则负责捕捉输入并显示结果。

这种分工可降低头显所需的处理负担。但它也会使网络可靠性、云端容量和运营成本成为用户体验的核心因素。

ByteDance 已将世界模型研究与多模态交互、机器人技术一并列入其 Seed 组织的工作范围。其公开的 Seed 模型目录也显示,该公司在视频、图像、语音和多模态理解领域的产品组合正不断扩展。

不过,该目录并未证实这款据报道的空间模型。它证明的是周边技术项目的存在,而非匿名消息人士描述的具体规格。

因此,眼下的变化更多是战略层面的,而非已被完全证实的事实。ByteDance 似乎正从生成媒体转向持续生成的环境。

此举将对 Google DeepMind 的交互式模拟工作形成直接压力,也让 ByteDance 与 Meta 教导机器理解物理情境如何发展的努力并列。

为什么张一鸣亲自重返 AI 竞赛

据报道,张一鸣的参与表明,ByteDance 将世界模型视为公司层面的押注,而非又一项实验性媒体功能。

张一鸣于 2021 年卸任 ByteDance 首席执行官。他据报道对新项目的监督,使这项工作比常规产品扩张更具分量。

Bloomberg 的报道将他与 Meta 首席 AI 科学家 Yann LeCun、World Labs 创始人 Fei-Fei Li 等研究者并列。两人都认为,AI 需要更丰富的空间理解能力,才能超越文本界面运行。

大型语言模型预测的是词语及其他 token 中的模式。世界模型则试图表征环境如何变化,包括智能体动作所产生的影响。

这一差异对机器人、自主系统、游戏和扩展现实尤为关键。这些领域所需的不只是对下一刻看似合理的图像。

一个有用的系统必须维持物体、位置、视角和因果关系。如果用户转过身,此前可见的椅子应仍处在环境设定的位置。

如果机器人推动一个杯子,预测结果应符合接触、方向和邻近障碍物等条件。仅有视觉质量并不能建立这种可靠性。

ByteDance 进入这一领域时,已积累了丰富的视频分发和生成经验。TikTok 和 Douyin 让该公司在视觉内容的排序、压缩、传输和分析方面拥有多年的运营经验。

这段历史并不会自动造就可靠的世界模型。但它为 ByteDance 提供了基础设施和产品知识,而以研究为导向的新进入者必须另行获得这些能力。

Seedance 提供了另一个起点。这一模型系列旨在实现可控视频创作,包括多主体镜头、镜头变化和协调一致的视觉序列。

据报道的项目需要将这些优势转化为低延迟预测。这与提升离线视频片段的视觉质量是不同的挑战。

每一次新的用户输入,都会改变模型下一步需要生成的内容。系统必须在响应时不丢失场景的身份、几何结构或历史状态。

张一鸣的参与也表明,市场机会不止于娱乐领域。交互式模拟最终可能支持机器人训练、自主导航和合成数据生成。

合成数据使用计算机生成的示例来训练或测试 AI 系统。当现实世界数据稀缺、危险、昂贵或难以标注时,它就具有价值。

机器人开发者可以在无需建造每一个房间的情况下测试多种房间布局。自主系统也可以遇到罕见天气或交通配置,而无需等待它们在现实中发生。

不过,有用的训练数据必须保留部署时重要的规则。如果物理规律不一致,即使视觉上令人信服的模拟仍可能传授错误的经验。

ByteDance 已通过 Seed3D 探索过这一问题,该系统可根据单张图像创建适用于模拟的资产。其技术报告指出,多样化视频模拟与明确物理反馈之间存在差距。

Seed3D 研究认为,基于视频的方法可以扩展内容规模,但往往缺乏可靠的 3D 一致性。传统物理引擎可提供更强的动力学能力,但需要成本高昂的人工资产制作。

这一权衡解释了为何据报道的空间模型值得关注。ByteDance 并非只是加入一个流行类别。

它似乎正在整合视频生成、3D 资产、模拟和多模态智能体等独立技术。悬而未决的问题是,这些部分能否形成一个连贯的平台。

Google DeepMind 是最明确的竞争目标

主要竞争是 ByteDance 与 Google DeepMind 之间的较量,因为双方都在追求可探索、实时渲染的世界。

Google 推出了 Genie 3,这是一款可根据文本创建交互式环境的通用世界模型。用户可以在这些环境中导航,模型则生成每个场景如何发展。

Google 表示,Genie 3 可输出每秒 24 帧的 720p 画面。它可以维持交互式环境数分钟,而不只是生成一段短小的固定序列。

这些规格为据报道的 ByteDance 系统提供了明显的参照点。据称 ByteDance 的目标是每秒 20 帧,同时强调极低响应延迟和 Pico 集成。

帧率本身不会决定这场竞争。一个模型可以快速刷新,却遗忘物体、改变布局,或产生不符合物理规律的响应。

Google 的 Genie 3 概览公开指出了多项局限。该系统并不总能准确复现真实地点、清晰渲染文字,或长时间维持交互。

这些披露为评估 ByteDance 提供了有用基准。任何发布演示都应依据持久性和控制能力来判断,而不只是电影般的视觉效果。

Google 面向用户的原型 Project Genie 展现了更实际的限制。Google 记录了控制延迟、视频流质量下降、场景变暗,以及对现实物理规律遵循不完美等问题。

该原型还限制了会话时长。Google 的已知问题显示,一项研究成果会多快遭遇普通产品约束。

ByteDance 可能通过一个高度受控的系统来应对这些弱点。它拥有模型开发者、云端交付路径、内容平台和计划使用的头显品牌。

这种整合可帮助工程师优化动作、网络传输、生成与显示之间的完整闭环。Google 拥有广泛的基础设施优势,但并不控制可比的消费级头显平台。

ByteDance 还拥有面向视频创作者的成熟工具。若交互式生成在头显之外也变得实用,CapCut、Doubao、TikTok 和 Douyin 都可能成为分发渠道。

Google 拥有不同的优势。DeepMind 在强化学习、模拟环境、机器人技术和规划系统方面拥有悠久历史。

Google 还可以将 Genie 研究与 Gemini、Google Cloud、Maps 及其更广泛的智能体工作相连接。其 Street View 实验提供了 ByteDance 难以轻易复制的地理数据。

因此,这场竞争并不只是中国与美国之间的竞争,而是将生成环境产品化的两条不同路径之间的较量。

Google 起步于以智能体和模拟为中心的研究脉络。ByteDance 则起步于视频创作、内容分发和自有硬件终端。

最强的 ByteDance 世界模型会让交互式生成感觉像一项媒体服务。最强的 Genie 产品则会将模拟转化为面向智能体和人类的通用界面。

两条路径尚未证明开放式生成世界能够在长时间会话中始终保持可靠。这一共同局限让竞争格局比精美演示所呈现的更为接近。

ByteDance 还必须决定将向外界开放多少模型能力。Google 已向符合条件的用户开放 Project Genie,为外部观察者提供了并不完美但很有价值的证据。

受控的 ByteDance 演示能揭示的信息更少。广泛访问、可重复的基准测试或开发者工具,将更有力地证明该模型不只是在精心挑选的提示词下有效。

Meta 正在构建物理推理能力,而非虚拟舞台

Meta 是世界模型领域的重要竞争者,但其核心押注是预测与机器人规划,而不是渲染娱乐内容。

Meta 于 2025 年 6 月发布 V-JEPA 2。这一拥有 12 亿参数的模型从视频中学习表征,并在抽象特征空间中预测未来状态。

这种方法不同于生成每一个可见像素。Meta 的模型试图捕捉对理解和规划重要的信息,同时忽略不可预测的视觉细节。

Meta 使用超过 100 万小时的视频和 100 万张图像训练 V-JEPA 2。随后,公司加入了动作条件训练,将观察到的变化与机器人指令关联起来。

公司在这一后续阶段使用了 62 小时的机器人数据。Meta 表示,由此形成的系统能够针对陌生物体和环境进行零样本规划。

零样本规划指的是无需针对特定场景额外训练便尝试完成任务。机器人会在选择下一步动作前,通过模型评估可能的行动。

在 Meta 的测试中,该系统完成了触及、拾取物体和移动物体等任务。在某些抓取与放置测试中,报告的成功率达到 65% 至 80%。

这些结果来自 Meta 自身的研究及特定实验室条件。它们并不能证明机器人在不受控的家庭或工作场所中具备普遍可靠性。

Meta 的物理推理研究还指出,在新的评估基准上,领先模型与人类表现之间仍存在显著差距。这一差距凸显了该领域尚未成熟的状态。

与 ByteDance 的对比很有参考价值。V-JEPA 2 不需要为佩戴头显的人渲染一个美观的世界。

它需要的是足够准确的表征,使机器能够比较不同动作并进行规划。报道中的 ByteDance 系统则必须立即生成可见输出,同时保持世界的结构。

视觉生成器与潜在预测器解决的是相关但不同的问题。潜在表征指内部表示,而非直接展示给用户的图像。

像素生成提供了直观的界面和引人注目的演示。它也会将计算资源花在纹理、光照及可能无助于智能体选择动作的细节上。

潜在预测可以专注于与任务相关的变化。但它不会自动为创作者、游戏玩家或头显用户提供可视化环境。

据报道,ByteDance 希望同时获得生成视频的商业吸引力和模拟系统的响应能力。将这两种特质结合起来,比单独将其中任一项做到极致更困难。

其更广泛的研究表明,公司理解这一分野。Seed3D 生成用于传统物理引擎的资产,而报道中的空间模型则会生成交互式视频。

这至少留下两种可能的技术路径。ByteDance 可以主要依赖学习式视频预测,也可以将生成能力与显式几何和模拟组件结合。

公司尚未披露选择了哪条路径。在缺乏架构细节的情况下,与 Meta 的比较应限于目标与可观察到的表现。

Meta 还向外部开发者开放 V-JEPA 2 的代码和模型检查点。这使研究人员能够测试系统、审视其局限,并构建竞争性评估。

ByteDance 尚未说明其报道中的模型是否会发布、通过 API 提供,或仅保留在自家产品内部。分发条款将决定其对机器人研究的影响。

若访问仅限于 Pico 或 ByteDance 应用,该模型仍可能成为成功的消费级产品。但作为独立机器人团队共享基础的价值会较低。

实时视频不等于可靠的世界

报道中的延迟在纸面上令人印象深刻,但持久性、物理效果、成本与安全性,将决定该系统是否不只是交互式视频。

世界模型必须记住发生过什么。只有当早先的动作持续影响后续状态时,生成的画面才能成为可用环境。

假设用户打开一扇门、移动一个物体,并在数分钟后返回。场景应从多个视角保留这些变化。

当前的交互式生成器往往难以维持这种持久性。细节会漂移,控制会出现延迟,物体也可能在离开可见画面后发生变化。

更长的会话会叠加每一个微小的预测误差。模型反复将自身生成的状态作为上下文,让不一致之处不断累积。

报道中的 0.05 秒延迟也需要明确定义。它可能指模型推理、云端响应,或完整交互循环中的某一环节。

头显体验包括传感器、本地处理、网络传输、服务器调度、生成、压缩和显示。端到端延迟将高于任何单一内部测量值。

网络条件带来另一个变量。云端生成的世界在数据中心附近可能表现良好,但在拥堵的移动网络连接下可能响应不佳。

这一挑战对扩展现实尤其重要。延迟的视觉响应可能破坏沉浸感,并使部分用户感到不适。

云端渲染将工作从头显转移出去,但并未消除成本。服务提供方必须为每个活跃会话持续生成画面。

固定视频可以渲染一次、存储后被多次观看。交互式环境可能需要针对每位用户的操作生成独特的数据流。

ByteDance 可以通过模型优化、缓存和可预测的交互模式抵消这一负担。尽管如此,使用经济性将与标题中的帧率一样重要。

公司还必须展示模型支持何种控制。在场景中移动摄像机,比以可靠的因果结果操控物体更容易。

语音输入可以改变故事,而不改变底层空间系统。运动追踪可以影响视角,却未必支持有意义的物理交互。

产品发布应区分导航、叙事控制、物体操控和智能体训练。将这些能力视为可以互换,会掩盖模型的实际价值。

评估是另一个尚未解决的问题。视频基准通常奖励视觉质量或提示词对齐度,而机器人基准衡量的是任务完成情况。

交互式世界还需要针对记忆、可控性、响应时间、几何结构与因果一致性的额外测试。它也可能需要面向特定领域的安全评估。

生成环境可能复现受版权保护的角色、可识别的地点或有害场景。空间媒体带来了新的担忧,因为用户会置身于输出内容之中。

模型也可能生成看似符合物理规律、实则错误的模拟。如果开发者利用这些输出训练机器人或自主系统,风险将变得严重。

在不准确模拟器中训练的机器人,可能会将不安全的假设带入物理世界。视觉真实感会让这些错误更难被察觉。

ByteDance 需要将娱乐主张与机器人主张区分开来。一个模型可以支持引人入胜的游戏,但未必足够可靠,无法用于对安全敏感的规划。

公司公开的 Seed3D 工作承认了这一区别。其研究人员指出,即使生成系统能提供更多样的内容,显式物理对于理解与安全仍然重要。

这一表述并未揭示报道中的 ByteDance 世界模型如何处理物理问题。但它表明 ByteDance 的研究人员认识到其中的根本权衡。

独立访问将有助于回答这些问题。研究人员需要重复试验、对抗性提示词、长时间会话和可量化的交互任务。

精选视频无法展示失败频率。它们也无法证明输出质量能否经受普通网络、复杂环境或同时使用的多名用户考验。

在这些测试出现之前,ByteDance 报道中的规格仍只是雄心勃勃的设计目标。它们尚不能证明公司已经完善了世界模型。

三个信号将表明 ByteDance 是否缩小了差距

这场竞争的下一阶段将由产品发布、可量化的持久性,以及系统超越娱乐演示的证据决定。

第一个信号是 ByteDance 是否会按报道中的时间表推出该模型。若在 10 月发布,将支持该项目已超越内部研究阶段的说法。

发布形式同样重要。Pico 体验、创作者工具、公开演示、API 和研究检查点,分别会揭示不同程度的成熟度。

有限的头显展示将验证 ByteDance 的一体化产品战略。但这不能证明外部开发者能够构建可靠的应用。

第二个信号是公开测试下的持续交互能力。ByteDance 应披露在真实网络条件下的会话时长、分辨率、帧率和端到端延迟。

评测者还应测试物体与布局在离开画面后是否仍能保持一致。他们也应衡量长时间交互中错误累积的速度。

明确的结果将强化 ByteDance 世界模型与 Genie 3 直接竞争的论点。短暂、经过精心编排的演示则会削弱这种比较。

第三个信号是通向物理系统的桥梁。ByteDance 应展示该模型能否生成支持机器人或自主智能体评估的动作条件模拟。

这些证据可以采取任务基准、机器人合作伙伴关系,或与公司面向模拟的 3D 工作整合等形式。可重复的成功比视觉润色更重要。

缺少这座桥梁,ByteDance 仍可能构建一个重要的娱乐平台。但与 Meta 和 Google DeepMind 相关联的更广泛世界模型愿景相比,它将处于更狭窄的位置。

开发者应在关注技术表现的同时关注访问条款。API 或可下载的研究成果将使独立团队能够测试持久性与控制能力。

企业买家应关注可靠性、数据治理和总体推理需求。响应迅速的原型并不会自动成为经济高效的生产系统。

创作者应关注可编辑控制。真正有用的问题是,场景能否在修改、角色移动和分支叙事过程中保持一致。

知识工作者则有不同的关注理由。世界模型指向一种界面:AI 可以先在模拟中测试行动,再提出决策建议。

这一理念仍处于早期阶段,但它可能改变人们审查产品概念、培训场景和运营计划的方式。随着演示不断增多,系统整理经过验证的研究将变得更加重要。

围绕可搜索的AI 知识库构建的工具,可以帮助团队区分已披露的规格、报道中的主张以及后续的基准测试结果。

字节跳动尚未证明其空间系统能够在交互式生成方面匹敌 Google,或在物理推理方面追上 Meta。但这份报告表明,它打算在这两个领域同时展开竞争。

仅这一意图就会改变市场格局。Google 和 Meta 在这一赛道中面对的将不再只是研究实验室或专注于模拟技术的初创公司。

它们可能还要面对一家拥有全球视频平台、创作者软件、云基础设施以及自有头显渠道的公司。这些资产为字节跳动提供了多条推动采用的路径。

更严峻的考验将从外部用户能否让系统超越其最佳演示效果时开始。新鲜感消退后,这个环境是否仍能保持记忆、作出响应,并遵循一致的规则?

如果字节跳动能就这些问题发布可重复验证的证据,其世界模型的意义将不止于 AI 视频的又一步进展。在此之前,竞争仍然开放。

关注其发布形式、稳定交互可持续的时长,以及任何机器人验证结果。这些信号结合起来,将显示张一鸣打造的是一个可信的世界模拟器,还是一个响应异常灵敏的媒体生成器。

 
 

免费开始

一款本地优先的AI助手

为了获得更好的人工智能体验,

remio 目前仅支持Windows 10+ (x64)M-Chip Mac

你的 AI 工作伙伴

remio 一起高效工作

规划、创作、交付

一站式完成

bottom of page