top of page

Google 正在自动化连贯的长篇视频生成,但真正的考验始于演示之后

9月25日
讀畢需時 13 分鐘

Google 推出了四个相互连接的研究系统,用于自动化生成连贯的长篇视频,其中一项演示可运行十分钟。该公司瞄准了生成式视频中的一个顽固缺口:单个片段可以看起来令人信服,但角色、物体和地点往往会在更长的序列中发生变化。

这项发布将关注点从纯粹的图像质量转移开来。Google 现在将视频制作视为一个编排问题,涉及规划、记忆、生成、评估和修订。其研究将 Gemini 和 Veo 与专门的智能体结合,这些智能体能够维持共享的创意方向,并跟踪各个场景中发生的内容。

这种方法给所有追求更长 AI 视频的公司带来压力,包括构建单体生成器的团队,以及独立的智能体式制作工具。问题不再是模型能否生成令人印象深刻的短片,而是自动化系统能否在推进剧情、纠正错误并尊重人类指导的同时,保持故事的内部现实一致。

Google 将四个研究项目整合为一项制作理念

Google 的核心主张是,更长的 AI 视频需要一套受管理的制作系统,而不只是拥有更长输出窗口的模型。

2026 年 9 月 24 日,Google Research 将 Co-Director、CANVAS、A²RD 和 VQQA 展示为 AI 辅助制作流程中相互补充的组成部分。这些系统分别处理创意规划、视觉分镜、片段生成和质量控制。

研究公告介绍了一层围绕 Gemini 和 Veo 构建的编排层。它接收高层级的创意规格,将意图转化为制作决策,并通过反复的反馈循环评估所生成的媒体内容。

这不同于简单的提示词链。线性管线可能会生成剧本、创建图像、将其动画化、添加音频,再组装结果。如果早期图像给角色配上了错误的服装,后续每个环节都可能继承这个错误。

Google 将其称为级联失败。最终缺陷往往要在多个阶段之后才变得可见,因此难以定位其来源。修复可能需要重写提示词、重新生成资产,并检查每个依赖场景。

Google 的 AI 视频联合导演则将制作定义为一个全局优化问题。编排器会在专门智能体开始制作前,选择创意策略、叙事结构和视觉处理方式。

多臂老虎机算法会在测试新选项与复用成功选项之间取得平衡,并搜索可用的创意配置。其决策将指导前期制作、关键帧生成、运动、音频和最终评估。

后期制作评审器是一个多模态语言模型,这意味着它能够评估多种媒体类型,而不只是文本。它根据原始创意维度对组装后的结果打分,并向编排器返回结构化奖励信号。

这类反馈为重新审视战略选择提供了路径,而不只是修补最终片段。这一底层思路很重要,因为许多看似属于视频的问题源于规划。如果管线从未记录某套服装应出现在后续哪个场景,生成器就无法保持服装的一致性。

Google 表示,该框架位于其基础模型之上,并且在概念上不依赖特定模型。不过,已发布的实现采用 Gemini 和 Veo,因此其最有力的证据仍与 Google 自己的技术栈绑定。

该系统也继承了这些媒体模型的 SynthID 水印功能。Google 指出,生产部署可以在完整视频上增加分类器,因为单个可接受的片段在被剪辑组合后,可能形成有问题的内容组合。

这四个项目都是研究系统,并非新发布的消费者产品。Co-Director 和 CANVAS 计划在学术会议亮相,相关论文则提供了架构和评估细节。

这一区别至关重要。Google 已经提出了可信的技术论点,但尚未公布通用访问方式、服务保障、工作流集成或生产经济性。

自动化连贯长篇视频生成改变了瓶颈所在

新的瓶颈是持久状态:系统必须记住什么存在、什么发生了改变,以及什么必须保持不变。

短视频生成器可以在很大程度上依赖单个提示词中的信息,以及有限范围内的生成帧。较长的叙事则需要在经历多个地点、服装变化、物体和故事事件之后,仍能记住某个角色。

Google 将由此产生的失败描述为身份漂移、特征漂移和内容崩塌。身份漂移会改变角色看起来是谁;特征漂移会改变物体或地点;内容崩塌则会使故事在视觉上保持活跃,却在叙事上停滞不前。

CANVAS 在完整视频生成之前处理这些问题。该系统会创建分镜,同时维持角色、地点、物体及其变化状态的结构化表示。

其持久视觉记忆存储了可供后续场景检索的锚点。如果故事回到一个博物馆展厅,系统可以恢复该展厅的空间组织,而不是仅依据文本生成一种全新的诠释。

这种记忆也能将刻意变化与意外的不一致区分开来。角色可以在故事需要时更换服装,但系统必须保留新服装,直到另一项计划中的变化发生。

CANVAS 论文报告称,相比其最强基线,系统在背景连续性、角色一致性和道具一致性方面分别提升了 21.6%、9.6% 和 7.6%。这些是作者在系统所选基准测试中报告的结果。

其中一个基准 HardContinuityBench 刻意在重复出现的元素之间插入较长间隔。角色可能更换配饰,可交互物体可以演变,环境则必须在叙事离开之后仍保持可辨识性。

这种设计测试的要求高于相邻帧之间的流畅性。一个地点在单个镜头中可能看起来稳定,但在数个场景之后再次出现时却可能变得难以辨认。

Google 的博物馆盗窃示例说明了这一差异。底层 Gemini 基线会改变文物和房间布局。另一种智能体式基线 AutoStudio 也会在镜头切换后丢失角色和背景细节。

CANVAS 使用存储的视觉锚点来恢复盗贼、宝石和展览空间。Google 将生成的分镜描述为在连续与非连续的转场中都保持连贯。

这一比较支持显式记忆的价值,但它仍是一个受控的研究示例。读者不能据此假定其在每种题材、风格、镜头运动或角色设计中都具备同样的可靠性。

持久状态也带来治理问题。制作团队需要了解哪些内容进入记忆、何时更新存储的参考,以及如何解决相互冲突的指令。

错误的锚点可能以异常稳定的方式保留错误细节。记忆能够减少随机漂移,但除非系统检测并修订该状态,它也可能使早期错误持续存在。

这正是此次发布背后更广泛的转变。更长的视频并不只是需要生成更多帧,而是需要一个可编辑的虚构世界模型,具备足够的结构来区分连续性与有意的变化。

对创作者而言,这更接近制作文档,而非传统提示词。角色设定表、地点参考、道具状态和镜头计划将成为可供机器读取的资产,为后续每个阶段提供指导。

A²RD 将记忆纳入生成循环

Google 的十分钟演示依赖于生成可管理的片段,同时将经过选择的上下文持续向前传递。

A²RD 是 Agentic Autoregressive Diffusion 的缩写,可将规划好的序列转化为更长的视频。自回归生成意味着系统会利用较早输出的信息来生成新的片段。

朴素的自回归视频生成会随着时间推移而退化。细小的视觉错误会成为下一片段上下文的一部分,使变异和布局变化在序列增长时不断累积。

A²RD 使用检索、合成、精炼和更新循环。在生成一个片段之前,系统会从包含视觉和叙事上下文的多模态记忆中检索相关信息。

随后,它会合成候选结果、评估结果、精炼片段,并为未来生成更新记忆。这创造了检查点,使系统能在错误扩散至剩余序列前进行干预。

该系统还会在外推和插值之间切换。外推会将故事推进到新的领域,而插值则将序列重新连接到已确立的角色、物体或环境。

这一选择解决了长篇生成中的基本冲突。过多锚定会让故事变得重复;过多新颖性则可能破坏连续性。

Google 的演示时长为十分钟,并在相隔较长时间后重新呈现元素。该公司称,A²RD 在推进叙事的同时,维持了角色身份、服装细节和环境结构。

A²RD 研究报告了时长从一分钟到十分钟的视频结果。作者称,相比选定的最先进基线,其在一致性方面最高提升 30%,在叙事连贯性方面最高提升 20%。

这些数字具有参考价值,但需要结合语境理解。“最高”指的是报告中最佳的提升结果,而不是每个基准或场景下普遍存在的增益。

A²RD 还引入了 LVBench-C,其中包含 120 个涉及角色演变、物体变化和环境揭示的文本场景。关键视觉资产必须在至少十个片段中消失后才能重新出现。

这一间隔规则针对的是长程记忆,而非即时的时间平滑性。它测试的是在许多无关场景占据生成上下文后,系统是否仍能回忆起重要内容。

其他研究者则以不同方式处理这一问题。MovieDreamer 使用分层规划、带有自回归视觉标记和扩散渲染的方法。InfLVG 则学习在固定计算预算内保留哪些先前上下文。

这些方法共享一个重要假设:在保留完整历史的同时生成每一帧,既不充分,也未必高效。长篇系统必须组织上下文、检索相关状态,并决定哪些内容可以遗忘。

Google 的路径之所以突出,是因为其记忆系统运行在更广泛的协作智能体群体之中。分镜、生成和评估共同承担连续性责任,而不是将全部负担交给单一视频模型。

这种分工也带来了额外开销。每次检索、批评、重新生成和记忆更新都会消耗算力。Google 尚未在公告中发布完整的生产成本或延迟分析。

因此,十分钟输出证明该管线能够在研究条件下完成一段长序列,但并不能证明制片方能够针对大量版本、角色或客户需求快速迭代。

实际考验将涉及编辑。创作者很少会完整接受一段长序列的生成结果。他们会替换镜头、调整节奏、修改对白,并提出会影响前后场景的修订要求。

一套可用于生产的记忆系统,必须能够传播有意作出的编辑,同时不破坏未受影响的内容。当前研究指向了这种能力,但 Google 尚未记录一套端到端的非线性编辑工作流。

视频评论家也是提示词工程师

VQQA 将质量评估转化为主动修复过程,尽管它修复的是提示词,而非直接编辑像素。

传统视频指标可以对输出结果进行排序,却无法说明应如何改进。低分会告诉系统某处出了问题,但不会说明是气球材质不对,还是音乐家换了乐器。

视频质量问答(Video Quality Question Answering,VQQA)会针对输出生成有针对性的问题。视觉语言模型回答这些问题,再将观察结果转化为自然语言指导。

Google 将这种反馈称为语义梯度。它的作用类似于模型训练中的数值梯度,但通过语言描述修正方向。

系统可以询问预期主体是否出现、属性是否属于正确对象,或角色在转场后是否保持稳定。随后,它会改写提示词并生成新的候选结果。

这有助于理解 Google 的视频生成如何运作。VQQA 是一种黑盒优化器,也就是说,它不需要访问视频模型的内部权重或激活数据。

这种设计使评估层能够与不同的生成器配合使用,但也限制了可用的修正类型。VQQA 无法直接修复某一帧,同时保留每一帧相邻画面。

相反,它会要求生成器依据改进后的提示词采样新的输出。修正可能解决原始缺陷,却也可能引入另一种问题。

Google 通过全局选择来应对这一风险。一个独立评估器会审查完整优化轨迹中的候选结果,并将其与最初未经编辑的请求进行比较。

系统会选择整体最佳候选结果,而不是假定最后一次修订必然更优。这降低了局部修复悄然削弱整体构图的可能性。

其中一个示例要求生成一个长方体气球。基线结果渲染出一个坚硬的立方体,缺乏令人信服的气球材质;而 VQQA 修订后的提示词则生成了一个带有接缝和反光聚酯薄膜纹理的箱状物体。

另一个示例包含一名女钢琴家和一名男小提琴家。基线结果在剪辑后改变了两人各自演奏的乐器,而经优化后的生成则保持了他们的角色。

VQQA paper 报告称,相较于未经优化的生成结果,VQQA 在 T2V-CompBench 上实现了 11.57% 的绝对提升,在 VBench2 上实现了 8.43% 的绝对提升。作者表示,这些提升只需经过少量优化步骤即可取得。

VQQA 的吸引力在于,它让模型批评变得可理解。人类可以查看生成的问题,并理解系统为何要求再次尝试。

不过,评估器仍然是 AI 模型。它可能忽略缺陷、误解艺术意图,或奖励那些提升基准符合度却削弱情感影响力的改动。

这一框架也有可能收敛到视觉语言模型容易判断的输出。模糊性、视觉隐喻、非常规调度和有意的不连续性,都可能在自动评论家眼中像是错误。

因此,人类导演的参与不仅在于最初的提示词。创作者必须判断何时不一致具有意义,何时奇特构图是有意为之,以及优化何时移除了有价值的元素。

Google 表示正在探索人机协作工作流,但这一说法涵盖多种可能的控制模式。创作者可能审核每一张分镜,也可能仅在系统标记错误后介入,或直接修改记忆状态。

这种差异将决定该系统更像是制作助手,还是一个偶尔征求许可的自主流程。

基准测试显示进展,而非生产就绪

Google 的结果为智能体视频编排提供了研究层面的依据,但这些提升能否经受真实制作约束,仍有待独立使用来验证。

此次公告引入或使用了多个基准测试,因为长视频质量无法简化为单一指标。角色连续性、环境稳定性、叙事推进、运动效果和提示词遵循度,都可能各自出现问题。

GenAD-Bench 包含涵盖 50 个虚构品牌的 400 个场景,每个品牌有四款产品。它评估 Co-Director 系统是否能够遵循营销约束,同时不依赖知名的受版权保护品牌。

Google 报告称,该基准上的峰值质量得分为 81.4。Co-Director paper 表示,该框架通过全局创意搜索和局部多模态优化,优于所选基线。

HardContinuityBench 专注于重复出现的场景和视觉状态。LVBench-C 考察跨越较长时间间隔的属性演变。现有测试套件则衡量构图正确性、运动效果和图像转视频的一致性。

这些评估结合起来,比一支精选演示视频更具信息价值。它们揭示了不同的失败模式,也使得在代码、提示词和配置公开后更容易复现比较结果。

不过,大部分证据来自 Google 研究人员对以 Google 为中心系统的评估。其中一些基准是与受测试的方法同时创建的。

这并不意味着结果无效。但这确实意味着独立复现至关重要,尤其是在评估器包含可能与生产技术栈共享偏好的语言模型或视觉语言模型时。

测试场景也无法复现专业电影制作中的每一种复杂情况。真实项目涉及修订后的剧本、获得授权的资产、演员肖像许可、客户反馈、变化的画面比例和精确的交付要求。

连续性只是制作标准之一。对白时机、声音设计、表演、摄影语法、法律许可、文化语境和编辑意图,都可能决定素材是否可用。

Google 的系统还将创意合成与一致性约束分开处理。这种划分在技术上很有用,但制作团队更关心每一个优化循环中能保留多少控制权。

导演可能希望角色在姿态、年龄、光线和情绪表达变化的同时,仍然保持视觉上的可辨识性。锁定过多属性的记忆系统,可能会限制表现范围,而不是赋能创作。

当自动评判器选择“最佳”结果时,风险会进一步增加。即使一致性较低的候选结果更能有效讲述故事,评分也可能偏向一致性。

因此,这一公告并未消除创作权衡,而是将其转移到了记忆模式、评估器提示词、奖励因子和选择策略之中。

安全性也需要类似的审视。SynthID 为生成媒体提供了溯源信号,但水印无法解决涉及冒充、受版权保护的风格、误导性语境或有害叙事组合的所有风险。

Google 承认,单独看来安全的片段在组合后可能形成不安全的含义。其提出的最终视频分类器表明,长视频安全是一个序列层面的问题。

同样的原则也适用于事实性内容。一部制作精良的解说视频可以保持完美的视觉连续性,同时呈现不准确的叙事。技术上的连贯性并不保证真实性。

考虑采用这一方法的企业,应将演示质量与运营可靠性分开看待。他们需要故障率、修订成本、周转时间、控制界面,以及品牌资产能够在重复运行中保持正确的证据。

这些细节在公告中尚未披露。Google 公布的是研究架构和基准测试结果,而不是生产服务协议。

Google 的 AI 视频 Co-Director 接下来必须证明什么

下一阶段将由独立复现、可编辑工作流以及反复优化的经济性来评判。

第一个信号是更广泛的技术访问。研究人员需要获得足够的代码、基准材料、提示词和配置细节,才能在 Google 的首选示例之外测试这四套系统。

如果独立结果能够在陌生的生成器和创作类型中复现连续性提升,便会强化这一主张。显著的性能下降则表明,编排层仍依赖于精心选择的模型或任务。

第二个信号是面向创作者的编辑工作流。一套实用系统必须让人们能够替换一个镜头、修订对象状态,或改变故事后段的情节,而无需重建整部视频。

成功的局部编辑将证实,持久记忆能够支持实际制作,而不只是支撑演示。如果微小修订会触发大范围重新生成,工作流仍将昂贵且不可预测。

第三个信号是运行效率。测试时搜索、多个智能体、评估器调用和反复生成,都可能通过为每个结果投入更多计算来提升质量。

Google 尚未提供足够信息,以比较这种开销与人工修正或其他长视频方法之间的差异。延迟和重新生成次数将决定哪些项目能够经常采用这一方法。

这些信号的重要性不止于电影制作。营销团队可以将长视频系统用于包含重复产品的营销活动。培训部门可以构建基于场景的课程,而游戏工作室可以原型化叙事序列。

知识工作者也可能面临更大的验证负担。自动化制作可以生成更连贯的演示文稿和解说内容,由于视觉效果保持一致,薄弱论断会显得更可信。

团队需要可追溯的源材料、审核节点和有条理的创意决策。个人知识库 可以帮助保留参考资料和审批记录,但无法替代编辑判断。

Google 更大的贡献在于改变了问题定义。自动化生成连贯的长视频,如今意味着要在整段叙事中协调记忆、规划、媒体合成、批评和修订。

这比要求一个生成器持续生成更多秒数,是一种更强的制作模型。但它也带来了更多可能失效、发生分歧或优化错误目标的组件。

创作者应关注哪些内容变得可编辑,而不只是哪些内容变得更长。他们还应追问,连续性是否能经受住自身资产、修订要求和质量标准的考验。

这段十分钟演示表明,上限正在提高。决定性的考验将在外部团队能够中断流程、改变主意,并仍然完成故事时开始。

 
 

免费开始使用

一款本地优先的AI助手

为了获得更好的人工智能体验,

remio 目前仅支持Windows 10+ (x64)和M-Chip Mac 。

你的 AI 工作伙伴

和 remio 一起高效工作

规划、创作、交付

一站式完成

bottom of page