top of page

SAGA 追溯 AI 视频的生成器,挑战仅依赖水印的溯源方式

Google News 近期呈现了 AI 安全领域的一场新冲突:即使传统溯源数据不可用,SAGA 仍能识别出合成视频最可能的生成器。

该系统不再只问视频是真实还是合成。研究人员将其设计为可在五个层级上归因视频,包括生成任务、模型版本、开发团队和具体生成器。

这一差异至关重要,因为当今主流防御手段高度依赖内容创作者、平台和模型提供方的配合。水印和签名元数据可以传递来源信息,但并非每一段视频都带有这些信号。

SAGA 采取了不同路径。它检视生成过程本身留下的空间和时间伪迹。研究表明,这些伪迹可以像模型指纹一样发挥作用,但它们属于统计证据,而非无可置疑的证明。

这项工作来自加州大学河滨分校、YouTube 和 Google DeepMind 的关联研究人员,并发表于 2026 IEEE/CVF Conference on Computer Vision and Pattern Recognition 论文集。

它真正对抗的并非另一种检测器,而是这样一种假设:仅依靠合作式标记,就能在开放、可编辑且充满对抗性的媒体环境中建立内容溯源。

Google News 将 AI 视频归因推向焦点

SAGA 将取证问题从“这是假的吗?”转变为“最可能由哪个系统生成?”

研究人员将 SAGA 描述为面向生成式 AI 视频的来源归因框架。其目标是识别与合成视频背后的工具、模型家族或开发团队相关的特征。

经过同行评审的 SAGA 论文提出了五个归因层级。第一个用于区分真实与合成视频;其余层级则对生成任务、模型版本、开发团队和精确生成器进行分类。

这一层级结构能为调查人员提供多种可能的答案。一段片段可能被判定为合成内容,却不足以支持可靠的模型级结论;另一段则可能包含足够证据,可将其关联到某个特定生成器。

这种分级结果比强迫每项调查都得出单一的真假结论更有用。它也反映了取证置信度在受控研究环境之外的实际运作方式。

SAGA 使用视频 Transformer,这是一种能够分析图像区域与连续帧之间关系的神经网络架构。首先,领域无关的视觉编码器从单帧中提取空间特征。

随后,时间编码器检视这些特征如何在整个片段中变化。系统寻找反复出现的模式,以区分不同生成流程产出的视频。

研究人员将其可解释性方法称为时间注意力特征签名,即 T-Sigs。这些签名可视化展示:当系统将一种生成器与另一种区分开时,哪些时刻获得了关注。

T-Sigs 很重要,因为来源归因可能带来严重后果。平台、调查人员或记者在评估存在争议的视频时,需要的不只是模型给出的、无法解释的标签。

该框架还采用了困难负样本挖掘。这种训练方法向系统提供难以区分的样本,迫使其学习相关类别之间更细微的差异。

研究人员称,SAGA 在每个类别仅使用 0.5% 带来源标签的数据时,便达到了完全监督方法的性能。该结果适用于研究中的数据集,不应被视为普遍适用的实际环境表现。

较低的标注要求解决了一个现实障碍:视频生成器变化很快,而收集并标注每个版本的代表性输出需要时间和访问权限。

不过,数据效率并不意味着不再需要参考材料。取证系统在将模式与已知来源关联之前,仍需要代表性输出和可靠标签。

Google News 的读者可能会看到这项技术被描述为能够将 AI 视频“追溯到其来源”的工具。这种表述需要谨慎理解。

SAGA 不会检索创作者账号、提示词或原始上传记录。它是根据从数据中学习到的模式,将技术特征归因于最可能的生成器类别。

这仍然是一项有意义的转变。了解最可能的模型家族,可以缩小调查范围、为平台执法提供参考,或检验关于可疑视频如何生成的说法。

但它本身无法识别是谁生成了该片段,或他们为何发布它。这些问题仍需要账号记录、上传历史、设备证据和传统调查工作。

为什么二元深度伪造检测已不足够

“合成”标签描述的是视频状态,而来源归因能够揭示其背后的制作路径。

二元检测长期主导着公众对深度伪造的讨论。检测器接收一个文件,并估计它来自摄像机还是生成系统。

这项任务仍然有用,但它无法回答许多实际问题。调查人员往往需要关联相关片段、识别反复出现的模型家族,或确定某个行动是否更换了制作工具。

设想在突发新闻事件期间传播的多段合成视频。二元检测器可能会将它们全部标记出来,却无法提供证据说明是否由同一行动制作了整组内容。

来源归因可以围绕共享的生成器签名对这些文件进行聚类。该发现并不能证明作者相同,但能为分析人员提供比多个独立“伪造”标签更有力的线索。

当有人声称一段争议视频来自某个特定模型时,归因同样重要。在已知错误率和其他可能解释的前提下,模型级估计可以支持或质疑这种说法。

随着明显的视觉错误逐渐消失,这个问题变得更加紧迫。手部、文字、物体运动和场景一致性曾经提供明显线索,但生成器正在持续减少这些可见缺陷。

因此,取证分析必须检视普通观众无法可靠察觉的信号,其中可能包括频率模式、残留伪迹、帧间关系,或由模型架构和解码过程引入的特性。

SAGA 同时关注空间和时间证据。空间证据存在于单个画面内,时间证据则来自物体和视觉特征如何跨帧演变。

视频归因需要两者兼具。两个生成器或许能生成相似的静态画面,却可能以不同方式处理运动、遮挡或转场。

该框架的五层设计也承认,归因可以具有多种有用的分辨率。即使无法确定精确版本,调查人员仍可能识别出开发者更广泛的模型家族。

这种灵活性将取证归因与面向消费者的真实性徽章区分开来。徽章必须迅速传达简单结果,而调查可以保留多个置信度层级。

安全团队可在分析影响力行动、冒充活动或用于欺诈的合成材料时采用这一方法。平台也可以利用它来确定人工审核的优先级。

企业遭遇伪造的高管视频,是另一个具体案例。分析人员可能先检查溯源元数据,再检测已知水印,最后评估学习型取证签名。

任何单一结果都不应决定案件结论。独立方法之间的一致性,比单个分类器分数更能构成行动依据。

这种分层流程与成熟的数字取证方法相似。分析人员会在得出结论前比较文件结构、元数据、内容历史、设备痕迹和背景证据。

AI 视频来源归因应当属于该流程的一部分,而不应取代它。

因此,其价值在于加深调查,而非自动判定真相。当基础检测提供的信息过少时,SAGA 为防御者提供了一种提出更具体问题的方式。

它也加大了对生成器开发者的压力。如果模型家族会留下可区分的签名,提供商就必须假定:其输出离开受控服务后,仍可能在技术上被识别出来。

这种前景有助于推动问责。但当第三方在缺乏充分验证的情况下发布归因结果,或披露可被对手研究的方法时,也可能引发争议。

这项新能力一方面改善了可获得的证据,另一方面也提高了证据标准。当一项决定影响言论、声誉或法律程序时,仅凭一个自信的标签将更难被接受。

SAGA 挑战仅依赖水印的 AI 视频溯源方式

核心竞争在于:一边是合作式溯源信号,另一边是视频传播后提取的取证证据。

合作式溯源始于生成器或编辑工具在创作期间为内容添加标记。该标记可能是不可见水印、签名元数据或 Content Credentials 记录。

这些系统能够承载有价值的信息。它们可能识别所用工具、记录编辑过程,或将已发布资产与签名来源关联起来。

Google 的 SynthID 采用了这一途径。根据官方 SynthID 概览,该系统会在 AI 生成的图像、音频、文本和视频中嵌入可检测水印。

YouTube 也会读取某些 Content Credentials。其披露指南称,符合条件的凭证可以表明整段视频由 AI 制作。

这种方式具有重大优势:溯源信号来自创作或编辑流程本身,而不是由外部分类器在事后重建来源。

有效的加密记录能够提供比概率性猜测更强的证据。它还可以传递视觉分析无法恢复的编辑历史。

但合作式溯源存在覆盖范围问题。它需要工具实施兼容标准、保留相关数据,并将其提供给下游平台。

并非每个生成器都会参与。开放模型可以通过修改后的流程运行,而未经授权的服务则可能完全忽略标记要求。

元数据也可能在日常处理过程中消失。重新编码、录屏、格式转换和平台处理,都可能使可见片段与其原始清单分离。

SAGA 针对的是这一缺口的另一面。它尝试从像素及其运动中残留的伪迹推断来源,而无需原始生成器插入标签。

这一差异使取证归因对敌对或未标记内容颇具吸引力。即使创作者拒绝配合,调查人员仍可分析文件。

然而,推断也有其自身弱点。压缩、编辑、分辨率变化,以及研究数据集与公共平台之间的差异,都可能影响学习到的签名。

模型更新同样可能改变相关伪迹。归因系统必须跟上获得新训练数据、架构、解码器和安全层的生成器。

因此,最强大的媒体认证策略应将两条路径结合起来。Microsoft Research 将溯源、水印和指纹识别描述为互补的认证方法

这种框架避免了错误的二选一。签名溯源记录在留存时可提供直接证据,而取证归因则可审查缺少这些记录的内容。

理想的调查应从溯源检查开始。分析人员应先检查 Content Credentials、平台披露信息和各提供商特有的水印,再应用独立的取证模型。

如果每一层证据都指向同一个生成器,可信度就会提高。如果信号相互冲突,调查人员就有理由放慢节奏,审查文件的历史记录。

冲突本身也可能揭示篡改行为。若签名记录关联的是一种工作流程,而取证模式却持续呈现另一种生成器的特征,就应受到严格审查。

不过,两种方法都无法证明意图。艺术家、安全研究人员、政治宣传者和诈骗分子都可能使用同一套生成系统。

源头归因识别的是技术路径,而非道德类别。平台在附加标签或作出执法决定时,必须明确区分这两者。

因此,溯源与取证推断之间的较量,本质上是在权威但不完整的记录与覆盖面更广但具有概率性的分析之间进行权衡。

SAGA 的重要性在于,它强化了这一等式的后半部分。它并不能消除对前半部分的需求。

AI 视频指纹无法证明什么

SAGA 的研究结果支持一条取证线索,而非对视频幕后人员作出可直接用于法庭的身份认定。

最大的不确定性在于泛化能力。模型可能在选定的基准测试中表现良好,但在公开部署中会遇到不同的压缩、编辑和分发模式。

社交平台会例行对视频进行转码。用户会裁剪片段、添加字幕、更改帧率、叠加徽标、录制屏幕,并将来自多个来源的素材组合起来。

每一种转换都可能改变取证分类器可用的信号。有些变化可能保留生成器伪影,另一些则可能削弱或掩盖它们。

已发表的论文报告了在公开数据集和跨领域场景中的实验。这比只在训练数据上测试提供了更有力的证据。

但这并不能复现真实调查中遇到的所有条件。未知生成器、定制模型和蓄意规避仍是棘手情况。

封闭集归因会带来一种特殊风险。如果系统必须在已知生成器中作出选择,它可能会将陌生片段归入错误程度最低的已知类别。

实际运行的工具需要有真正有效的拒绝选项。它应能够报告,现有证据不足以将内容归因于任何已收录的来源。

出于同样原因,置信度校准也很重要。神经网络给出的原始概率,并不会自动对应其结论在现实世界中正确的可能性。

调查人员必须针对部署环境验证阈值。审查经过压缩的社交媒体片段的新闻编辑室,面对的条件与处理原始文件的实验室不同。

对抗性压力又增加了一层复杂性。一旦攻击者了解哪些特征支持归因,他们就可能尝试抹除、模仿或混淆这些信号。

他们可能反复转码文件、添加噪声、混合多个模型的输出,或让结果再经过另一套生成式编辑系统处理。

成功的篡改不需要让视频看起来更好。它只需削弱输出与其原始生成器之间的联系。

研究人员可以通过对抗训练和更广泛的数据来应对,但这会形成一场持续的较量。其结果更像恶意软件检测,而不是一项永久有效的真实性测试。

归因还带来治理风险。如果组织在未说明不确定性的情况下呈现结果,错误的生成器标签可能损害创作者、模型提供商或发布者。

YouTube 和 Google DeepMind 的名称出现在研究机构署名中,这让透明度尤为重要。Google 运营着重要的生成、分发、搜索和广告系统。

这种集中性并不会使该研究失效。但它确实更凸显独立复现、公开基准以及研究结论与平台执法之间明确隔离的必要性。

作者通过 T-Sigs 提供了一种可解释性方法,这是有益的一步。然而,注意力可视化并不能自动解释因果关系,也不能证明模型使用了正当的取证特征。

系统可能会关注某个区域,却依赖于相关联的数据集伪影。研究人员必须测试这些特征是否能跨编码设置、主题内容和采集流程持续存在。

底层数据集同样决定模型学到什么。如果某个生成器的样本始终具有特定分辨率、水印或编辑模式,分类器可能会利用这种捷径。

困难负样本挖掘可通过强调易混淆样本来减少简单捷径。但仍需要精心设计数据集并进行外部测试。

还需进一步区分生成器归因与内容来源。即便模型标签正确,也无法揭示是哪个服务账户发起了生成。

除非原始提示词信息存在于其他地方,否则它也无法恢复该信息。它同样无法证明创作者是否明知故犯地试图欺骗任何人。

因此,记者应将结果描述为在经过测试的条件下与某个生成器一致、相关联,或被归因于该生成器。“已证明”之类的措辞超出了证据所能支持的范围。

安全团队应保留完整文件、记录处理步骤,并比较不止一种方法的结果。他们还应保留相互矛盾的证据。

对于通过 Google News 追踪快速发展的研究的读者来说,这一限制是最重要的结论。更好的取证工具并不会将概率性归因变成确定事实。

SAGA 缩小了未知范围,但并未消除未知。

决定 SAGA 是否重要的三个信号

下一项考验在于,源头归因能否走出基准测试,成为透明验证流程中的一层。

第一个信号是对经过转换和对抗处理的视频进行独立测试。原团队以外的研究人员必须评估,在裁剪、压缩、屏幕录制、插帧和生成式编辑之后,归因结果会如何变化。

在未知模型上的结果最为重要。一个有用的系统必须能够将“未见过的生成器”与对熟悉来源作出的错误但自信的匹配区分开来。

如果在这些条件下仍表现强劲,将强化 SAGA 关于生成器伪影可提供持久取证证据的主张。若准确率大幅下降,其作用则会局限于受控调查。

第二个信号是与溯源系统整合,而不是与之竞争。Google 已描述过其正在扩展用于识别 AI 生成媒体的工具,并测试更快速的检测工作流程。

其 2026 年 5 月的媒体识别更新将标签、SynthID、Content Credentials 和检测定位为更广泛战略的组成部分。

实际实现应分别展示每一层证据。用户需要知道结论是来自签名元数据、检测到的水印,还是统计归因。

将这些信号合并为一个标签,会掩盖可靠性上的重要差异。经过验证的凭证并不等同于分类器对模型家族的估计。

透明的整合会增强研究价值。即使底层模型表现良好,无法解释的平台标签也会削弱信任。

第三个信号是,开发者和平台是否会公布用于执法的评估细节。这包括错误率、拒绝行为、支持的生成器,以及在常见转换后的表现。

组织还应定义申诉路径。创作者需要有渠道质疑影响重大的标签,尤其是在系统评估经过编辑或混合的媒体时。

混合内容构成一项即时政策考验。一个视频可能结合了摄影机素材、传统视觉特效、生成式插入内容和 AI 辅助编辑。

将整个文件称为合成内容,可能掩盖的信息多于揭示的信息。精细化工具应识别哪些部分支持归因,以及置信度在哪些位置下降。

这一问题与 SAGA 对时间证据的关注一致。未来系统可能将生成器特征定位到特定片段,而不是为整个文件指定单一来源。

这种定位能力将帮助新闻编辑室分析包含真实素材的篡改片段。它也能减轻将复杂媒体强行归入二元类别的压力。

读者应关注 YouTube 如何处理这一区分。该平台位于 AI 创作、内容分发、溯源披露和模型研究的交汇点。

在该平台部署将带来规模,但规模也会提高犯错的代价。即使错误率很低,在大型平台上应用时也可能影响许多创作者。

新闻机构面临着同一决策规模更小但更紧迫的版本。在选举、战争、灾害和突发安全事件期间,它们需要更快完成验证。

SAGA 可在该工作流程中提供一条技术线索。它应与消息源采访、反向搜索、地理定位、元数据检查和逐帧分析并列使用。

企业安全团队也有另一个理由关注这项工作。合成的高管视频正越来越多地出现在冒充、社会工程和伪造证据场景中。

对模型家族的估计可能将多次尝试联系起来,或识别攻击者制作流程中的变化。这些信息可改善事件聚类,但不能确定身份。

处理这类调查的团队需要可搜索的文件、发现结果、来源和矛盾证据记录。结构化的AI knowledge base可在分析人员和案件之间保留这些背景信息。

这项研究也对标准化评估语言提出了要求。“来源”可能指生成器、模型版本、开发团队、服务账户、创作者或原始上传者。

SAGA 涵盖了多个与生成器相关的含义。公开沟通必须明确说明结果支持的是哪一种。

Google News 的报道很可能会让“将视频追溯到其来源”这一诱人的承诺受到更多关注。更持久的故事则更为狭窄,也更具影响力。

研究人员正在构建这样的工具:当明确的溯源信息缺失时,它们能够推断合成视频的制作谱系。这些工具正变得更具可解释性,也越来越不依赖大量标注数据。

它们的局限性同样重要。当条件与基准测试不同时,取证指纹可能发生变化、消失、发生碰撞或造成误导。

正确的问题不是 SAGA 是否会取代水印,而是独立测试能否表明,两种方法可以在不掩盖不确定性的前提下相互强化。

关注对未见生成器的评估、透明的证据标签和公开的部署错误率。这三个信号将表明 SAGA 会成为实用的取证层,还是仍停留在一项前景可期的研究成果。

 
 

免费开始

一款本地优先的AI助手,具备个人知识管理功能

为了获得更好的人工智能体验,

remio 目前仅支持Windows 10+ (x64)M-Chip Mac

在你的大脑里添加一个搜索栏

Ask remio

记住一切

​无需整理

bottom of page