top of page

SARAAB 深度伪造检测模型宣称准确率达 91%,但接下来将迎来开放测试

4天前
讀畢需時 14 分鐘

据报道,迪拜的 SARAAB 深度伪造检测模型在分析时长仅七秒的视频时,准确率达到 91%。这一说法让迪拜电子安全中心(DESC)在验证合成媒体真实性的竞赛中占据了一个异常具体的位置。

这个醒目的数字只是故事的开端。DESC 表示,将通过开发者平台发布 SARAAB,让外部研究人员能够检查、测试并改进该系统。这一决定将竞争从一项政府公告转变为一个可供检验的开源项目。

其主要对手并非另一款具名检测器,而是强劲基准测试结果与面对陌生、压缩或刻意篡改视频时的可靠表现之间长期存在的差距。NIST 的研究表明,泛化能力为何仍是媒体取证领域的决定性难题。

迪拜究竟公布了哪些有关 SARAAB 的信息

SARAAB 之所以重要,是因为一家政府网络安全机构计划将其深度伪造检测器置于外部审查之下。

DESC 于 2026 年 9 月 16 日在迪拜展览中心举行的 GISEC Global 期间正式发布了 SARAAB。该机构将其描述为完全由阿联酋团队开发的开源人工智能模型。

DESC 还称其为阿拉伯地区首个由政府实体创建的开源深度伪造检测模型。这一表述确立了该机构所宣称的制度性“首创”地位,但并不能证明 SARAAB 的性能优于全球所有可用检测器。

该机构的 SARAAB 公告称,该模型将通过开发者平台分发。AI 工程师、网络安全专家和研究人员将能够对其进行测试,并参与其开发。

DESC 并未在最初公告中公布所称的准确率数据。这些细节出现在后续报道中,相关信息被归因于该中心。

根据这篇已发布报道,SARAAB 在 DESC 的评估中最高准确率达到 91%。据报道,该模型在训练期间未见过的数据上取得了 89% 的准确率。

第二项结果或许比标题数字更重要。对未见数据进行测试,旨在衡量检测器是否学到了可迁移的取证信号,而非仅仅记住训练集的特征。

不过,“未见”可以描述多种不同的测试条件。它可能意味着来自熟悉生成器的新视频、新人物、一个独立数据集,或来自完全陌生生成方法的输出。这些条件带来的难度截然不同。

现有公开材料未说明测试数据集、样本数量、人口统计构成、视频来源或篡改工具,也未披露类别平衡、误报率或置信度阈值。

缺少这些细节,读者无法复现 91% 的结果,也无法将其与其他模型进行公平比较。当真实样本与篡改样本的比例不均衡时,单看准确率也可能具有误导性。

报道还称,SARAAB 可评估时长短至七秒的片段。据报道,DESC 比较中纳入的其他开源模型至少需要 15 秒的视频素材。

这一能力应对了重要的运营限制。许多可疑视频以短片段形式在即时通信服务和社交平台上传播。调查人员不能假定更长、质量更高的原始视频仍然可获取。

短输入检测器可以帮助团队在开展更深入的取证工作前,对这类材料进行分流处理。它也适用于这样的工作流程:延迟分析会让欺骗性视频的传播速度快于响应速度。

不过,七秒的最低要求并未说明性能如何随时长变化。检测器或许能够接受七秒的视频输入,但在更长片段上才能产生最可靠的结果。公开评估应衡量这条性能曲线,而非将最低输入时长视为完整的性能主张。

报道还称,SARAAB 可利用热力图识别被篡改的人脸区域。热力图是一种视觉叠加层,用于标记对模型决策有贡献的区域。

这项功能可帮助分析人员调查视频为何被标记。它并不会自动使底层预测变得正确,也不能完全解释模型的推理过程。

据报道,SARAAB 支持分析部分被篡改的视频。在这种场景中,录制内容的大部分仍是真实的,只有一个片段或一张脸被修改。检测这种局部干预比将整段完全合成的视频进行分类更难。

这也更接近现实中的攻击方式。诈骗者无须伪造整场会议,只要篡改一项请求、一段陈述或一条付款指令即可。

这些能力让这款迪拜深度伪造检测器颇具看点。不过,其最终价值将取决于代码、权重和评估程序公开后,外部评估者能够复现什么结果。

为什么 SARAAB 深度伪造检测模型瞄准了一个更难的问题

真正的技术较量,在于可复用的取证信号与会随生成方法变化而消失的伪影之间的竞争。

深度伪造检测系统通常会学习与合成或篡改媒体相关的模式。这些模式可能包括人脸不一致性、时间上的不规则性、融合伪影、频域信号,或连续帧之间的关系。

困难在于,生成系统不断变化。与某一换脸流程相关的线索,可能在更新的基于扩散的工作流程中消失。压缩和编辑还会进一步削弱残留证据。

因此,检测器可能在熟悉的基准测试中表现良好,却无法在真实环境中保持可靠。这一问题被称为泛化,即模型在训练分布之外的数据或篡改技术上的表现。

NIST 关于泛化问题的研究说明了这种差距的规模。在一项比较中,一种基线检测器在已知生成器上的 AUC 达到 0.89。

在来自陌生生成方法的样本上,其 AUC 降至 0.58 和 0.55。AUC 衡量分类器在不同阈值下区分两类样本的能力。接近 0.5 的结果意味着排序能力接近随机。

另一套接受评估的系统泛化能力显著更强,在所示数据集上的 AUC 介于 0.97 至 0.99 之间。这一比较表明,失败并非不可避免;同时也说明,架构、训练数据和评估设计至关重要。

SARAAB 所称的未见数据 89% 准确率直接回应了这一挑战。然而,如果不知道哪些因素是“未见”的,以及测试集是如何构建的,这一结果仍难以解读。

有意义的公开评估应区分多个维度。它应测试未知生成器、训练中未出现的身份、不同肤色、不同光照条件,以及多种摄像机类型。

它还应纳入常见转换方式。社交平台经常会调整视频尺寸、降低比特率、修改颜色、移除元数据,或对文件进行多次重新压缩。

攻击者可以有意引入这些转换。他们可以裁剪人脸、添加噪声、叠加文字、更改帧率,或通过另一块屏幕重新录制被篡改的视频。

每项操作都可能消除取证伪影,却保留欺骗性含义。面向实际运营的检测器必须在这些变化之后接受测量,而不能只针对干净的实验室样本。

部分篡改还带来另一项挑战。如果只有几秒钟内容是伪造的,对整段视频的信号进行平均处理的模型可能会稀释可疑片段。

逐帧或逐片段分析有助于定位篡改,同时也会产生更多预测,从而增加出现孤立误报的可能性。

热力图可以引导人工分析人员关注值得检查的人脸区域。然而,注意力图并不等同于因果解释。即使模型依赖于不相关的模式,它们看起来也可能颇具说服力。

因此,外部研究人员应测试 SARAAB 高亮的区域是否与实际编辑相对应。他们还应检查化妆、滤镜、弱光或视频会议效果等无害条件,是否会触发类似模式。

短视频片段本身也带来统计问题。更少的帧提供的时间证据更有限,而平台压缩可能会移除细微的视觉细节。快速运动和遮挡会进一步增加人脸分析的复杂性。

这使得七秒这一主张既有用又要求严苛。独立测试应报告多个片段时长下的表现,包括七秒、15 秒、30 秒和 60 秒。

它们还应报告延迟和硬件要求。一款能准确处理短片段、却需要在专用硬件上耗时数分钟的检测器,与实时筛查系统所承担的角色并不相同。

核心问题并不是这款迪拜深度伪造检测器能否发现人类遗漏的样本,而是其决策能否在真实传播环境中常见的复杂转换下保持稳定。

SARAAB 的开源计划为回答这一问题创造了路径。可访问的代码库能够公开预处理过程、模型架构、阈值和已知局限性。

开放权重将允许独立的红队测试。文档齐全的数据集和评估脚本,将使 91% 的说法可以被复现,而非仅能在 DESC 内部重复。

二者的差异十分重要。由原始团队重复得到结果,显示的是内部一致性;由外部人员复现结果,则表明所报告的结论经得起独立方法与假设的检验。

开源改变了主张与验证之间的平衡

公开发布 SARAAB,会将外部批评从沟通风险转化为开发流程的一部分。

政府机构通常从私营供应商采购检测产品。这些系统可能提供置信度评分,却不公开其训练数据、模型行为或失效条件。

这类工具可协助分流,但其不透明性会带来运营风险。调查人员可能会过度依赖一个无法检查或复现的评分。

DESC 正在采取不同路径。该机构计划通过开发者使用的平台发布模型,邀请安全研究人员以其创建者未挑选的案例测试该模型。

这种开放性有助于更快发现盲点。研究人员可以探测模型对压缩、人口统计差异、对抗性修改和新生成模型的敏感性。

它也可能让攻击者发现漏洞。一旦权重和预处理逻辑公开,对手就能研究检测器,并据此优化合成媒体以规避检测。

这种张力在网络安全领域并不陌生。开放代码支持检查与集体改进,而公开披露也会让攻击者了解防御所依赖的假设。

决定性因素在于维护。一个获得定期评估、问题跟踪和模型更新的开放检测器,能够应对已发现的弱点。

一个被遗弃的代码库能带来透明度,却无法提供持久保护。随着生成系统和传播模式变化,其公开基准的相关性也会降低。

DESC 表示,研究人员将能够基于 SARAAB 开展研究并为其作出贡献。当代码库发布时,这一承诺将变得可衡量。

一项严肃的发布应明确其许可证、模型权重、预期用途及禁止用途。还应包含带版本的评估结果,以及用于报告安全发现的清晰渠道。

数据集文档同样重要。深度伪造数据集可能嵌入人口统计失衡、同意问题,或对何为真实媒体的狭隘假设。

模型卡应说明涵盖了哪些面孔、语言、视频格式和操纵类型,并指出模型在哪些方面表现较差。

此次发布还应区分研究用途与高风险决策。检测器分数不应单独决定某段视频是否存在欺诈、某人是否在说谎,或证据是否可被采纳。

NIST 运营 OpenMFC evaluation,为媒体取证系统提供共享测试。其方法体现了为何共同的评估条件至关重要。

当每位开发者选择不同的数据集和指标时,标题中的准确率将难以比较。共享挑战赛可以在一致规则下,利用保留数据测试系统。

SARAAB 将受益于此类评估。据报道,DESC 的对比结果将其置于其他纳入比较的开源模型之上,但这些模型的名称和配置尚未公布。

这一遗漏使读者无法判断基线。与较旧、未维护的检测器进行比较,与由其开发者自行配置的领先系统进行测试,意义截然不同。

独立基准测试应在相同运行点比较 SARAAB。假阳性率、假阴性率、精确率、召回率和校准度,都能揭示单一准确率数字所掩盖的信息。

假阳性尤其值得关注。错误地将真实影像标记为伪造的检测器,可能损害声誉、延误报道,并让合法证据蒙上疑云。

假阴性带来另一种伤害。当筛查工具未能标记欺骗性视频时,它可能让该视频获得不应有的真实感。

当用户把“未检测到”视为“已验证真实”时,问题会更加严重。深度伪造检测器通常评估是否存在已知取证信号,并不能确立每个所展示事件的真实性。

开放文档应明确这一界限。最理想的结果是提供支持受训分析人员的工具,而不是以自动化裁判取代核验。

正是在这里,开放性让 SARAAB 相比缺乏支持的黑箱系统拥有结构性优势。研究人员可以测试其边界,并在组织围绕模型建立具有重大后果的工作流程之前传达这些限制。

此次发布还可以促进区域研究能力。一个由阿联酋主导的项目,可以将更多机构、数据集和运营背景带入这个常由北美、欧洲和东亚基准塑造的领域。

这一益处取决于负责任的数据实践和透明评估。区域代表性应改善证据基础,而不应削弱同意、隐私或文档标准。

91% 准确率没有告诉安全团队什么

91% 的结果是一个令人鼓舞的研究信号,而不是 SARAAB 能正确识别任何深度伪造内容的普遍概率。

准确率衡量的是在特定评估中正确分类所占的比例。其含义取决于数据集、标签、类别平衡、阈值,以及对正确结果的定义。

设想一个以真实视频为主的测试集。模型可能只需偏向真实标签就取得较高准确率,即使它漏掉了许多被操纵的片段。

精确率关注被标记的视频中有多少确实被操纵。召回率关注系统成功发现了多少被操纵的视频。在筛查工作流程中,两者都很重要。

理想的平衡取决于使用场景。处理数百万上传内容的社交平台可能优先考虑可扩展的分流;审查证据的取证团队则可能接受较慢的分析,以减少破坏性错误。

校准同样重要。经过良好校准的 80% 置信度分数,在可比案例中应大致以该比例对应正确预测。

未经校准的模型可能生成无法可靠映射到真实风险的高置信度分数。即使总体准确率看起来可以接受,这种行为也可能误导操作人员。

SARAAB 报告的结果尚未披露这些指标,也未说明团队是否在视频之外测试了被操纵的音频。

公开描述聚焦于视频中的面部操纵。这一范围很重要,因为片段可能使用真实视觉画面,却配有克隆音频、合成字幕或误导性剪辑。

反过来,真实录音也可能被置于虚假背景中。任何像素级检测器都无法确定说明文字、日期、地点或周边说法是否真实。

因此,深度伪造检测应属于更广泛的核验流程。分析人员应审查来源、发布历史、元数据、佐证证据以及发送者要求采取的行为。

内容溯源提供了另一层保障。C2PA 标准支持防篡改记录,用于描述与数字资产相关的来源和编辑历史。

官方 C2PA explainer 强调,Content Credentials 并不判断某项断言是否真实。它们验证溯源信息是否得到正确构建、可信,并与资产关联。

溯源和检测解决的是不同问题。SARAAB 在审查媒体后寻找操纵的取证迹象。

Content Credentials 可以记录文件的来源以及发生过哪些声明的变更。它们的缺失并不能证明文件是伪造的,因为许多相机和编辑工具不会附加这些信息。

凭证也可能在转换或平台处理过程中被移除。当溯源信息缺失时,检测器仍然有用;而溯源信息无需完全依赖统计伪影,也能增强信心。

人工核验提供了第三层保障。调查人员可以通过已知渠道联系声称的来源,寻找更早的副本,并将媒体与已验证材料进行比较。

这些层级结合使用时效果最佳。没有任何单一检测器、水印、凭证或分析人员能够覆盖每一种操纵和传播路径。

风险不止于将错误信息视为抽象问题。冒充欺诈通过看似来自亲属、高管、企业或公职人员的信息瞄准人们。

美国联邦贸易委员会报告称,消费者在 2024 年因冒充者损失了近 30 亿美元。其欺诈指南建议,人们应利用自己独立确认真实的信息,核验意外联系。

即使自动化筛查得到改进,这一做法仍然必要。91% 的检测器仍意味着,在其自身报告测试的条件内存在错误。

当输入内容不同于这些条件时,现实世界表现可能更低。一旦攻击者了解哪些伪影会触发检测,他们也会随之调整。

安全团队应避免将 SARAAB 深度伪造检测模型变成绿灯系统。低风险分数不应授权付款、重置账户或验证高管请求。

更好的工作流程是利用该分数分流案件。高风险片段应立即获得审查,而具有重大后果的请求无论检测器输出如何,都应接受独立身份核验。

组织还需要针对存在争议的结果制定程序。受到错误标记影响的人应能够获得人工审查及支持性证据。

记录模型版本至关重要。如果 SARAAB 随时间变化,调查人员必须知道是哪一个版本分析了片段,以及哪个阈值产生了结果。

这些记录有助于复现决策并衡量漂移,也可防止团队将当前模型的行为作为较早评估的证据。

三个信号将显示迪拜的检测器是否兑现承诺

SARAAB 的可信度将取决于发布质量、独立压力测试以及实际运营使用的证据。

第一个信号是实际的开源发布。研究人员应寻找可用代码、可下载权重、明确许可证、评估脚本,以及对训练和测试条件的文档说明。

仅包含演示界面的代码库,无法提供足够访问权限来复现 91% 的数字。完整发布将使评估人员能够追溯从原始视频到最终分类的路径。

模型卡应说明 SARAAB 的目标用户和支持格式,还应描述其局限性、数据治理以及在不同输入条件下的预期表现。

DESC 应公布哪些模型出现在其比较测试中。结果应附带版本号、预处理设置、硬件和决策阈值。

若这些材料出现,项目的核心主张将变得可审计。若它们始终缺失,这一公告的分量将低于准确率数字所暗示的程度。

第二个信号是针对陌生生成器和降质媒体的独立测试。研究人员应使用新的换脸系统、扩散工具、滤镜、屏幕录制和反复压缩来挑战该模型。

他们应纳入来自不同设备、光照条件和人口群体的视频。结果应针对多种片段时长报告,尤其是声称的最短七秒。

局部操纵值得进行专门测试。评估人员应衡量 SARAAB 是否能在较长的真实录音中找到短暂的篡改片段,同时不产生过多误报。

热图定位应获得单独评分。正确的视频级标签,并不必然意味着高亮显示的面部区域与真正被操纵的区域一致。

最有力的证据将来自共享或保留评估,它们能防止开发者直接根据答案调优。NIST 风格挑战赛的结果将比自行选择的演示更具可比性。

强劲的跨数据集表现将强化 DESC 关于 SARAAB 提供可迁移检测能力的主张。若在新生成器上表现大幅下滑,则表明模型仍与其原始基准绑定。

第三个信号是负责任的运营采用。DESC 或合作组织应说明 SARAAB 在何处使用、它为哪些决策提供参考,以及人工如何审查其输出。

采用本身无法证明准确性。不过,有文档记录的工作流程可以显示,该模型是否处理真实提交内容、缩短审查时间,或帮助定位可疑片段。

有用的报告应包括部署后观察到的错误率,并说明团队如何处理不确定分数,以及分析人员多常推翻模型输出。

组织还应披露 SARAAB 是在本地运行,还是将媒体发送到另一项服务。这一区别会影响用户提交个人、机密或证据性视频时的隐私。

本地开源部署可帮助机构保留对敏感材料的控制权,同时也会将安全、更新和模型治理的责任置于部署组织身上。

这三个信号构成了明确的标准。完整发布能够建立透明度,独立测试可以衡量泛化能力,负责任的采用则揭示该模型是否适合真实的调查工作流程。

在此之前,最公平的评估应当是有条件的。SARAAB 是一项值得关注、获得政府支持的开源计划,据称准确率达到 91%,并且对短视频检测具有实用的侧重点。

它尚不是一个通用的真实性验证系统。公开证据并未证明其在所有生成器、平台、人口群体或对抗性变换条件下的表现。

这种区别不应抹杀项目的价值,而应为下一阶段的审查提供指引。

开发者和安全团队应关注代码仓库,而非仅看新闻标题。他们应复现公布的基准测试,验证“七秒”这一说法,并将失败案例与成功结果一同公开。

对普通用户而言,眼下的经验仍然很实用:应将可疑视频视为众多证据中的一部分,尤其当它伴随着紧迫感、保密要求或索要钱财时。

如果其开源发布兑现 DESC 的承诺,SARAAB 深度伪造检测模型可以强化这一验证流程。接下来的问题是,独立测试人员能否在原始团队无法控制的条件下复现其结果。

 
 

免费开始使用

一款本地优先的AI助手

为了获得更好的人工智能体验,

remio 目前仅支持Windows 10+ (x64)和M-Chip Mac 。

你的 AI 工作伙伴

和 remio 一起高效工作

规划、创作、交付

一站式完成

bottom of page