Sora 2 视频克隆看起来很真实,但一段爆红视频无法证明这一点
- Sophie Larsen

- 7月18日
- 讀畢需時 14 分鐘
已更新:7月20日
在一则新近爆红的帖文中,Sora 2 视频克隆看起来足够真实,以至于作者声称无法通过单帧画面识破造假。这则发布于 7 月 17 日的帖文称,OpenAI 的模型捕捉到了两名被称为 Gabriel 和 Sam 的人物每一处面部肌肉运动,以及他们各自独特的走路姿态。这是一项非同寻常的主张,但分享的视频并非独立评测。
更值得关注的细节是时间点。这次演示出现时,距离 OpenAI 于 2026 年 4 月 26 日停止提供 Sora 产品已过去近三个月。一款已经停用的消费级产品,仍在引发有关合成身份、视觉证据,以及观众能否相信自己双眼的现实争论。
这构成了核心矛盾。Sora 2 在运动过程中保持人物一致性的能力,似乎已经超越了人们熟悉的深度伪造换脸。然而,支持这一具体案例的证据仅来自一则社交帖文,原始文件、生成设置、失败尝试和来源记录均未公开。
Google 和其他 AI 开发商一直在追求日益逼真的视频生成效果,但视觉质量已不再是决定胜负的关键。更艰难的竞赛围绕身份控制、持久有效的内容凭证,以及经得住转发传播的验证方法展开。一旦合成视频在视觉上足以令人信服,信任就必须来自媒体的历史记录,而非其外观。
Sora 2 视频克隆帖文究竟声称了什么
这则帖文展示了一个惊人的结果,而不是对 Sora 2 克隆准确性的受控测试。
Gabriel 的 Sora 原帖称,在此前某个参照时间点过去一年后,仍没有任何技术接近 Sora 的“完美视频深度克隆”。帖文声称,该系统捕捉到了面部肌肉运动,以及两名主体各自的走路方式。随后,帖文提出了最强烈的断言:观众可以截取任意一帧,却依然无法判断其是否真实。
这种措辞很重要,因为它将三种不同的能力压缩成了一个结论。面部相似度关注的是生成的面孔是否与主体一致。动作保真度关注的是表情、姿势和步态能否随时间推移始终保持可识别性。真实性则关注观察者能否判断媒体是如何制作的。
这些能力彼此关联,但并不能互相替代。令人信服的面孔并不能证明步态重建准确。令人信服的步态也不意味着每一帧都具有照片般的真实感。照片级真实感同样不会抹去嵌入原始文件中的来源信息。
公开帖文没有披露视频的制作方式。它没有展示参考录像、提示词、生成次数、被淘汰的结果、编辑流程或原始元数据,也没有提供由独立观察者在盲测中对真实与生成视频进行分类的对比实验。
这些缺失的信息使人们无法对准确性作出有意义的判断。这个结果可能是 Sora 的直接输出,可能是从多次尝试中挑选出的成功案例,也可能是经过传统编辑手段优化的视频。帖文中没有证据表明发生了人为处理,但同样没有足够证据排除这种可能性。
OpenAI 自己的 Sora 2 概述描述了一项密切相关的能力。该公司表示,模型可以观察某个人的视频,并将此人置入生成的环境中。它还声称能够准确呈现人物的外貌和声音。
该公司将这项面向消费者的功能称为“characters”,此前称为 cameos。一段简短的视频和音频录制会捕捉用户的形象并验证身份。随后,用户可以将该身份置入生成的场景,或授权朋友使用。
这一官方描述支持了爆红视频结果在总体上的可信度。Sora 2 的设计目标明确包括在生成视频中保持人物的可识别性。然而,OpenAI 也表示,该模型远非完美,仍会犯很多错误。
在讨论这段视频时,应当注意这一区别。将这则帖文描述为一个格外成功的 Sora 2 生成结果可能呈现何种效果的证据,是合理的;但将一段经过筛选的视频视为所有输出都能实现完美身份重建的证明,则不合理。
关于单帧画面的断言,其适用范围也比乍看之下更窄。人类观众通常会通过动作不一致、口型同步、不断变化的反射或不稳定的物体来判断真实性。无论完整视频能否经得住审视,精心挑选的单帧画面都可能掩盖这些时序错误。
与此同时,单帧层面的可信度仍然很重要。截图在传播时往往不带音频、动作、水印或上下文。有人从视频中截取一帧并转发到其他地方后,合成画面片刻之间就可能变成一张虚假的照片。
这正是 Sora 2 视频克隆呈现出的真实感为何具有超越娱乐的影响。爆红视频不仅仅是对视觉质量的展示,也说明了一段生成表演能以多快的速度碎片化为看似真实的证据。
Sora 的身份捕捉超越了换脸
Sora 2 的重要变化是持续一致的表演克隆,而不仅仅是生成更加清晰的合成人脸。
传统换脸通常会将一个身份映射到已有的表演上。源演员提供头部动作、节奏、肢体语言和环境。软件主要负责替换或重建面部,同时保留大部分原始影像。
Sora 2 追求的是更广泛的任务。它在保持植入身份的同时生成周围场景、动作、音频和物理交互。这要求模型在多个帧画面中协调外貌与语音、表情、机位、光线和动作。
持续一致的世界状态意味着,人物和物体需要在场景变化时保持连贯。如果主体转过身、走到另一个物体后方,或在不同镜头角度之间移动,系统必须保持其身份不变。失败通常表现为服装改变、面部结构漂移,或环境发生无法解释的变化。
OpenAI 表示,Sora 2 提升了执行跨多个镜头指令并保持状态的能力。它还能生成对话、音效和背景声景。这些能力的结合,使合成人物更像是一场连续的表演,而非一幅会动的肖像。
爆红帖文之所以强调面部肌肉和步态,是因为这些特征能够在静态外貌之外传递身份。人们会通过细微的节奏模式、习惯性表情、姿势和动作识别熟悉的人。能够保留这些信号的模型,即使在光线或拍摄距离发生变化时,也能唤起辨识感。
然而,这则帖文并未说明 Sora 如何获得这些行为细节。OpenAI 的公开说明称,characters 始于一段简短的视频和音频采集。它并未表示这一过程会为每一处面部肌肉建立精确的生物力学模型,或生成经过独立测量的步态特征。
因此,“捕捉到了每一处面部肌肉”应被理解为作者的主观感受。模型可能生成了看起来高度还原的行为,却没有像该说法暗示的那样明确重建每块肌肉。现代生成式系统可以在不以解剖学方式表征人体的情况下,复现令人信服的表层模式。
这一区别不只是技术层面的谨慎措辞。一个系统可以创造极具说服力的形象,同时产生一些朋友能够察觉、陌生人却会忽略的细微错误。准确性也可能因表情、观看角度、语音、光线、服装和场景复杂度而异。
精心打磨的视频往往会掩盖这种差异。社交信息流奖励的是最佳输出,而不是结果的整体分布。观众看到的是成功生成的结果,却看不到身份发生漂移、声音生成失败或动作变得不自然的频率。
一项严谨的 Sora 2 深度克隆测试应当采用多个源主体和标准化提示词。评测者应在盲测条件下对比生成影像与真实影像。研究人员还应分别测量身份相似度、动作一致性、声音相似度和检测准确率。
测试还应公开失败案例。如果没有不成功的示例,观众就无法判断分享的视频代表的是正常表现还是罕见结果。这也是影响各种生成式 AI 演示的同一种选择偏差问题。
尽管如此,缺乏基准测试并不会让这次演示变得无关紧要。造成社会危害的门槛低于科学证明的门槛。一段虚假视频只需在足够长的时间内说服足够多的观众,就可能影响舆论。
令人信服的合成表演可以利用熟悉感。接收者可能因为视频中的人物以符合预期的方式动作和说话而选择相信。这增加了高管诈骗、虚假代言、身份冒充和人身骚扰的风险。
当源素材很容易获取时,风险会变得更加突出。公开采访、视频通话、播客和社交帖文中都包含表情、声音和身体动作。即使某款商业产品要求获得同意,类似能力也可能出现在控制措施更薄弱的其他地方。
Sora 的 character 系统试图为这一过程设置授权机制。模型的高保真度使授权成为必要,而授权流程又让合法用户更容易进行高保真身份生成。能力与控制措施同步发展,但并未解决更广泛的验证问题。
真正的对手是视觉信任
核心竞争已不再是 Sora 2 与另一款生成器之间的较量,而是合成真实感与传播后仍可验证的证据之间的对抗。
OpenAI 围绕用户同意设计了 characters。该公司表示,用户可以控制谁能使用自己的形象、撤销访问权限,并移除包含自己 character 的视频。它还会让用户看到使用其身份制作的草稿。
这些控制措施针对的是 OpenAI 系统内部的创作过程。它们无法保证每一个下游副本都能继续与创作者、主体或原始生成记录保持关联。下载后的视频可以被编辑、裁剪、重新压缩、通过录屏复制,或截取为截图。
这一缺口解释了为何“真假难辨”并不是适用于英文验证工作流的正确标准。人类感知从来都不是可靠的身份验证协议。逼真的输出只是让这一局限变得无法忽视。
OpenAI 的 Sora 安全措施结合了可见水印、不可见的来源信号、C2PA 元数据和内部检测工具。C2PA 是一种技术标准,用于将可通过密码学验证的来源及编辑信息附加到数字媒体上。
这些层级回答的是不同问题。可见水印用于提醒普通观众。元数据让兼容软件能够检查媒体所声明的历史记录。内部检测工具则可以帮助平台调查特定视频或音频是否由其系统生成。
但这些措施都不意味着没有标记的文件就是真实的。元数据可能在常规处理过程中消失,而截图不会继承原始视频的凭证。水印缺失可能是裁剪或录屏所致,并不代表影像来自真实相机拍摄。
这造成了一种不对称。积极、有效的来源信息可以支持关于出处的主张。缺失来源信息通常无法证明某项素材是合成的或真实的。验证系统必须传达这种不确定性,同时不能让缺乏凭证的媒体获得虚假的真实性推定。
Sora 2 系统卡承认了这一局限。OpenAI 表示,来源验证没有单一解决方案,并称分类器很难检测情境性欺骗。
该公司最初的安全措施在发布时禁止视频到视频生成,并限制在基于同意的角色系统之外描绘真实人物。它还禁止通过普通文本提示生成公众人物。这些限制试图先控制哪些人可以被合成,再处理生成内容可能如何传播的问题。
然而,经过同意生成的内容在脱离预期语境后,仍可能产生误导。某人可能授权将自己的角色用于喜剧内容,之后却发现经过编辑的片段被当作真实言论传播。重新分发的媒体要欺骗观众,并不需要模型违反最初的同意规则。
爆火的 Gabriel 视频片段暴露了这一边界。假设两位当事人都授权了自己的角色,那么这次生成可以是正当的,并且技术上令人印象深刻。但同样的高保真度仍然表明,第三方为何需要持久可靠的身份验证。
这正是核心逆转。更出色的克隆不会让视觉评估变得更加精密,而会让视觉评估变得不再重要。模型越强大,信任就越会转向来源记录、佐证信息和经过认证的拍摄内容。
新闻编辑部在评估存疑影像时,早已会核实地点、时间、上传者历史和独立证据。企业会通过独立渠道确认财务请求。个人也应对非同寻常的视频主张采取类似做法,尤其是在涉及金钱、声誉或安全时。
这种工作流程不如发现异常手指或错误倒影那样令人满足,但它更具可扩展性。视觉瑕疵会随每次模型更新而变化,而关于来源、保管链、动机和佐证的问题始终有用。
知识工作者也面临类似挑战。合成媒体可能在缺乏可靠语境的情况下进入会议档案、研究文件夹和内部报告。维护一个可搜索的个人知识库可以保存来源 URL 和笔记,但绝不能把已存储的语境误认为经过验证的真实性。
这一经验具有现实意义。保存原始链接、上传者身份、发布时间以及任何可用的内容凭证。将内容声称的事项与已经独立证实的事项分开记录。当媒体本身没有明显警示时,这种区分至关重要。
完美克隆仍是一项未经验证的主张
这项演示足以引发人们对逼真合成身份的担忧,但不足以支持“完美”一词。
完美需要明确的衡量标准。它是指朋友能够认出当事人、面部匹配软件报告高度相似,还是观众无法通过受控的真实性测试?每一种标准衡量的都是不同事物。
该帖文没有提供任何此类结果。它只是对一段经过筛选并发布的视频给出了自信的解读。没有对照视频、置信区间、评估者人数,也没有与其他生成器进行比较。
通过社交平台尤其难以验证“任何一帧”这一说法。视频压缩可能掩盖细微缺陷,而较小的播放窗口会减少可供检查的细节。反过来,压缩也可能产生一些被观众误认为是生成缺陷的伪影。
原始文件有助于回答几个问题。调查人员可以检查分辨率、编码历史、帧节奏、元数据和内容凭证。他们还可以在一致条件下,将面部、声音和步态与源录像进行比较。
即便完成这一过程,也无法证明每位观众会作何反应。身份验证与感知真实感是两回事。一个文件可以看起来完全真实,同时携带有效的生成凭证;也可以看起来像合成内容,尽管它实际来自摄像机。
OpenAI 自己的措辞比这项爆火主张更加克制。其发布材料称其具有“卓越的保真度”,但也表示该模型会犯很多错误。对于一个最出色的生成结果比失败案例传播得更广的生成式系统而言,这种表述是可信的。
产品历史也使问题更加复杂。OpenAI 现在在其 Sora 页面上标注通知,称该产品已于 2026 年 4 月 26 日停止提供。该公司并未将这段 7 月爆火的视频作为新版本、基准测试或产品重新发布来介绍。
源帖文展示的可能是较早生成的内容、保留下来的输出、内部访问结果或另一种工作流程。公开材料无法确定哪一种解释正确。读者不应根据这段视频推断产品目前仍然可用。
OpenAI 关闭 Sora 改变了人们应当如何解读这项演示。Sora 关闭之前的数月里,逼真的深度伪造、公众人物、创作者权利和合成内容持续引发关注和批评。美联社报道称,OpenAI 正在退出视频生成业务并调整优先事项。
关闭并不意味着相关的底层能力从行业中消失。技术、研究知识、受过训练的人才和用户预期仍会继续影响竞争系统。其他视频生成器可以追求同样的真实感、音频表现和身份一致性组合。
这也不能说明 OpenAI 作出每一项内部决策的原因。公开报道将该应用与深度伪造担忧联系起来,但能力、安全、成本、战略和采用率都可能影响产品的未来。超出已有报道的主张都只能是猜测。
此次关闭确实揭示了技术表现与产品持久性之间的不匹配。Sora 2 最令人难忘的功能,或许是它能够将可辨认的人物置于不可能的场景中。同一项功能也带来了异常棘手的同意与审核要求。
社交应用还会成倍放大风险。生成、二次创作、发现和分享都在同一个环境中进行。创作工具生成的是单个文件,而信息流可能在当事人、平台或事实核查人员作出响应前就将其放大传播。
因此,争议不能被简化为这段爆火视频是否为伪造。该视频已被公开说明为生成内容。重要的不确定性在于,Sora 实现这一结果的可靠程度,以及这种保真度在脱离明确披露的演示环境后会产生怎样的影响。
帖子中的 Sora 2 视频克隆看起来很真实,但“看起来真实”仍只是一项观察。“完美深度克隆”是一项未经验证的性能主张。“无法认证”的含义则更加宽泛,并且与有效来源记录所发挥的作用相冲突。
严谨的报道应保留这三个层次。该视频看起来极具说服力。总体能力与 OpenAI 对产品的描述一致。最强烈的主张尚未得到独立验证。
Sora 2 视频克隆看起来逼真之后会发生什么
三个信号将表明,该行业是在构建可信的媒体基础设施,还是仅仅在制作更具说服力的视频片段。
第一个信号是对身份一致性进行独立测试。研究人员需要开展评估,检查多个镜头中的面部、声音、表情和步态。测试应包括普通输出,而不仅是开发者或用户挑选的演示内容。
一项实用的基准测试应将相似度与欺骗性区分开来。一组人员可以评估输出是否与已同意的当事人相符。另一组人员可以判断视频是真实的还是生成的。然后,可以将自动化工具与人类判断进行比较。
公布失败情况的分布将进一步证明视频克隆是否已达到新的临界点。如果性能在侧脸、快速运动、重叠语音或陌生环境下大幅下降,那么爆火案例所代表的能力就更为有限。如果准确性在这些条件下依然保持稳定,验证问题就会变得更加紧迫。
第二个信号是来源信息能否在现实传播链中保留下来。C2PA 规范为经过加密签名的内容历史提供了一个框架。它的实际价值取决于摄像机、生成器、编辑器、消息服务、社交网络和浏览器能否广泛采用。
如果凭证会在常规编辑过程中消失,它就无法保护完整的信息链。如果平台保留了凭证,但观众永远看不到,其公共价值也十分有限。界面必须显示哪些内容经过验证、由谁签名,以及有记录的历史在何处中断。
平台还应避免将凭证缺失等同于判决。大量真实媒体都没有经过认证的拍摄数据。负责任的界面可以说明来源未知,而不将内容标记为虚假。
关键测试将涉及截图和衍生内容。这篇爆火帖文明确关注从视频中提取单帧。来源验证系统需要设法将经过转换的片段与已知来源关联起来,同时清楚说明任何匹配结果的局限性。
第三个信号是竞争对手和监管机构如何处理肖像同意问题。OpenAI 要求用户主动选择创建角色,并为当事人提供撤销工具。未来的系统将面临既要达到同等控制水平,又要处理在原平台之外传播的复制输出的压力。
强有力的控制措施应在创建时验证授权、保留可审计记录,并提供切实可用的投诉流程。它们还应区分允许建立肖像模型,与允许用于所有可能的场景、信息或再分发之间的差异。
监管机构也将面对类似的区分。只关注可见标签的规则可能在水印被裁剪后失效。只关注恶意意图的规则,在伤害扩散前可能很难执行。有关来源、披露、冒充和平台响应的要求需要协同发挥作用。
这些信号都不依赖于找到永久存在的视觉缺陷。这正是重点所在。合成视频素养应摆脱根据手部、牙齿、阴影或眨眼模式进行猜测。这些线索可以促使人们进一步审查,但无法验证文件的真实性。
对于普通观众,最直接的应对方式很简单。追溯最早可找到的上传内容。寻找来自独立来源的佐证影像。除非能够重建其来源,否则应将截图视为脱离语境的主张。
对于企业,视频中熟悉的面孔不应凌驾于既定审批流程之上。敏感指示需要通过独立且可信的渠道确认。声音和外貌如今只是内容,而非身份证明。
对于记者和研究人员,应在笔记和公开表述中清楚保留不确定性。“该帖文声称”和“尚未得到独立验证”并非回避之辞,而是对现有证据的准确描述。
Sora 案例还说明了保留研究语境的重要性。结构化的第二大脑指南可以帮助人们将主张与原始来源、日期和后续更正联系起来。其价值在于保留证据链,而不是把每一项保存的内容都当作事实。
Sora 2 的视频克隆已逼真到足以骗过日常观察。但这并不意味着视觉真相已经消失,因为视觉真相从来都不只由表象来保证。相机、编辑软件、上传者和平台始终都在影响观众所看到的内容。
真正改变的是制作可信证据的成本。如今,生成的人物可以在连贯的场景中表演、说话和行动。生成结果或许仍经不起技术检验,但在检验开始之前,它就可能已经在社会层面令人信服。
下一个具有决定意义的展示,不会是又一段完美无瑕的视频,而会是一个能在媒体跨平台传播时,始终将同意、来源和署名信息与之绑定的系统。在此之前,每一个令人惊叹的克隆都应引发两种截然不同的反应:先认可其技术成就,再到像素之外核实其说法。


