top of page

OpenAI GPT-Red 自动化红队测试将提示词注入失败率降低,但基准测试来自内部

OpenAI 表示,GPT-Red 在四个月内将一项直接提示词注入测试的失败率降至原来的六分之一,尽管它曾成功攻破此前面对的几乎所有模型。该公司于 2026 年 7 月 15 日公布了相关细节,并将自动化对抗训练定位为日益自主化的 AI 智能体的一项核心防御手段。

真正重要的变化并非又一次在基准测试中领先。OpenAI GPT-Red 自动化红队测试将 AI 攻击者直接引入生产模型的训练周期。攻击者负责寻找能够攻破模型的指令,而防御模型则学习如何在不放弃合法任务的前提下抵御这些攻击。

这形成了一场比单纯模型对抗模型更为激烈的较量。OpenAI 押注的是,对抗式自我改进能够让智能体安全水平跟上能力增长的步伐。但另一面的现实是,在受控环境中训练的攻击者,可能会遗漏由陌生应用、用户、工具和部署方式带来的威胁。

该公司尚未公开发布 GPT-Red,其最突出的成果也高度依赖内部评估。这些限制不容忽视,因为提示词注入属于系统层面的安全问题。模型训练能够减少失败,却无法控制模型周围的每一项权限、连接器或应用。

OpenAI GPT-Red 自动化红队测试进入模型训练环节

OpenAI 已将自动化红队测试从发布前测试转变为持续提供生产训练数据的机制。

红队测试是指有意攻击一个系统,以便在真正的攻击者利用漏洞之前发现问题。通常由人类专家设计攻击场景、观察系统表现,并报告弱点以供修复。

GPT-Red 会自动执行类似的搜索过程。它发起攻击、观察防御模型的响应,再根据结果调整策略。成功的攻击随后会成为评估或训练后续模型的材料。

根据 GPT-Red 研究,OpenAI 通过自博弈强化学习训练了这个攻击者。自博弈会让相互竞争的系统共同训练,一方因制造失败而获得奖励,另一方则因抵御攻击而获得奖励。

OpenAI 允许 GPT-Red 控制智能体环境中的真实组成部分,包括电子邮件正文、本地文件、网页横幅和工具输出。每个环境还规定了攻击者的目标以及判定攻击成功的条件。

这一点将该项目与常规越狱测试区分开来。越狱通常始于恶意用户要求模型违反某项政策;而间接提示词注入则可以把恶意指令隐藏在并非由用户编写的信息中。

智能体可能在总结电子邮件、检查代码或研究网站时遇到这些指令。注入的文本可以要求智能体无视原始任务、泄露信息或滥用已连接的工具。

OpenAI 表示,GPT-Red 成功攻破了截至 GPT-5.5 的几乎所有受测内部及生产模型。此后,该公司在训练 GPT-5.6 时采用了这些攻击,其中包括 GPT-5.6 Sol 模型。

在 OpenAI 的测试环境中,由此带来的改进似乎相当显著。据称,GPT-5.6 Sol 在该公司难度最高的直接提示词注入基准测试中,失败次数仅为四个月前最佳生产模型的六分之一。

OpenAI 还称,在范围更广的一组韧性测试环境中,面对 GPT-Red 的直接攻击,GPT-5.6 Sol 的失败率为 0.05%。这一数字描述的是模型对该公司训练出的攻击者的抵抗表现,并不意味着能够全面防御提示词注入。

早期版本的 GPT-Red 发现了一种名为 Fake Chain-of-Thought 的技术。这种攻击会提供伪造的推理过程,试图让模型相信某项被禁止的操作是合理的。

OpenAI 表示,此类攻击针对 GPT-5.1 时的成功率超过 95%。据该公司称,针对 GPT-5.6 Sol 时,这一比例已降至 10% 以下。

这些数据使此次发布颇具意义。OpenAI 不再把攻击发现视为训练结束后进行的一次性评估,而是利用对抗式搜索在模型部署前塑造其行为。

这使安全测试成为一种拥有自身规模化路径的训练输入。防御模型越强,GPT-Red 就越需要寻找更难的攻击,而这些攻击又会成为训练下一代防御模型的经验。

自博弈创造出与防御模型共同进化的攻击者

其核心机制是一场不断变化的较量:昨天成功的防御,会成为今天最低的难度门槛。

传统安全数据集包含已知攻击和预期响应。它们能够帮助模型识别反复出现的模式,但随着防御能力提升,其价值可能逐渐下降。静态数据集无法主动寻找下一个弱点。

GPT-Red 通过在造成有效失败时获得奖励,改变了这一过程。防御模型则因在抵御恶意指令的同时继续完成原始任务而获得奖励。因此,双方都会面临持续改进的压力。

完整的 技术论文 描述了由多种不同防御模型构成的群体,而不是单一固定对手。这一选择可避免攻击者只依赖某个特定模型独有的弱点。

这些环境还代表了不同的攻击面。隐藏在电子邮件中的指令,与代码仓库内的恶意内容需要采用不同的攻击路径。工具访问权限则可能让任何一种失败从错误文本升级为外部操作。

这种多样性有助于解释其算力投入。OpenAI 表示,GPT-Red 使用的资源可与该公司部分规模最大的后训练任务相当。该公司称,这是其内部专门用于安全改进的空前算力投入。

不过,算力本身无法带来全面覆盖。它只能增加模型尝试攻击的数量,并延长竞争持续的时间。攻击者能发现哪些威胁,仍由环境设计决定。

GPT-Red 最突出的比较结果来自一个复现的间接提示词注入竞技场。OpenAI 称,面对 GPT-5.1,GPT-Red 在 84% 的场景中找到了成功的攻击方式,而人类红队人员的成功率据称为 13%。

这一比较表明,自动化能够显著扩大攻击搜索规模。一个模型无需人工逐一编写每条提示词,就能测试大量攻击变体。它还可以保留失败尝试并进行系统性改进。

然而,这一比较并不意味着人类安全工作已无必要。人类可以质疑威胁模型、发现不切实际的假设,并识别自动化奖励机制遗漏的危害。他们还可以审查模型环境之外的社会和组织层面弱点。

OpenAI 明确将 GPT-Red 定位为人类及第三方测试的补充。该公司还保留了多层防护措施和实时监控。这种表述承认,训练无法涵盖所有生产环境条件。

OpenAI 的自动售货机实验更清晰地体现了这种区别。GPT-Red 首先在一个仿照生产智能体构建的模拟环境中探索攻击方式,随后将选定的攻击转移到实际运行的系统中。

OpenAI 表示,这些攻击改变了商品价格、安排了一笔不利的订单,并取消了另一位客户的订单。该公司已向系统开发者披露这些弱点,后者也开始测试额外的防护措施。

这项实验与 Anthropic 开展的 AI 运营办公室商店实验 Project Vend 类似。两个项目都说明了智能体可靠性为何不同于普通聊天机器人的安全问题。

聊天机器人失误可能只是生成不当回答,而智能体失误则可能修改记录、执行代码、发送消息或批准交易。其周围的软件系统决定了可能产生哪些后果。

OpenAI 还使用 GPT-Red 测试了一个基于 GPT-5.4 mini 的 Codex 命令行智能体。评估包含十个保留的数据外泄场景,这些场景未被纳入攻击者的训练环境。

该公司表示,与通过提示词赋予攻击任务的 GPT-5.5 基线模型相比,GPT-Red 使用更少的 token,却攻破了更多场景。这一结果表明,专项训练提升了攻击搜索能力,而不仅仅是让一个强大的通用模型扮演恶意角色。

因此,其机制比任何单项成功率都更重要。OpenAI GPT-Red 自动化红队测试建立了一套可重复执行的流程,用于生成攻击、将其转化为训练数据,并衡量后续防御模型的表现。

智能体开发者如今面临更高的安全基线

GPT-Red 正在迫使所有智能体开发者将提示词注入测试视为持续性工程,而不是发布前检查清单。

最直接的压力落在 OpenAI 的竞争对手身上,包括 Anthropic 和 Google。任何销售工具调用型智能体的公司,都必须说明自己如何测试隐藏在浏览器、文件、电子邮件、代码及第三方服务中的指令。

此次发布也提高了客户的期待。供应商已不能再把少数人工设计的攻击提示词描述为充分证据。买家会越来越关注:每当模型、连接器或权限发生变化时,测试是否也会随之演进。

独立标准已经指向这种更广泛的视角。NIST 攻击分类体系涵盖直接和间接提示词注入,以及其他生成式 AI 威胁。

该分类体系将攻击与缓解措施视为风险管理流程的组成部分,并未暗示一次训练干预便能解决问题。组织仍需要部署控制、测试、监控和事件处置机制。

应用安全指南也体现了同样的原则。OWASP 智能体风险中的“过度自主性”描述的是拥有超出任务所需功能、权限或自主程度的系统。

这一风险十分重要,因为成功的注入攻击只能利用受损智能体已有的能力。无权发送电子邮件的助手无法秘密转发消息,而拥有广泛邮箱访问权限的助手则可能造成更严重的损害。

因此,对开发者而言,GPT-Red 改变了两项彼此独立的基线。第一项是模型的抵抗能力,第二项是应用应在多大程度上信任这种能力。

更强大的底层模型可以减少许多产品中的常见失败,却无法决定某个具体应用是否授予不受限制的文件访问权限,或是否会在执行外部操作前跳过确认。

安全团队应要求供应商报告真实工作流中的测试结果,而不只是纯文本基准测试成绩。有效的评估必须涵盖模型、系统指令、工具描述、检索内容、授权规则和用户确认机制。

随着智能体处理的敏感上下文越来越多,这种需求也会不断增长。浏览器会让智能体接触不受控制的网站,本地文件访问会让它接触来源各异的文档,而已连接的应用则会让它接触消息和共享工作区。

恶意指令可能通过上述任何渠道进入系统,而且可能始终不被任务发起者察觉。这样一来,用户便无法获得可疑提示词原本可能带来的明显警示。

知识工作者同样有理由关注这一问题。AI 系统在回答问题或执行操作之前,越来越多地会从分散的文档中整合上下文。更充分的上下文可以改善结果,但每引入一个信息源,都会扩大信任边界。

一个受控的 AI 知识库 可以帮助用户了解信息来自何处,以及谁能够访问这些信息。然而,来源可追溯并不意味着其中嵌入的指令天然安全。

正确的应对方式并不是停止连接有用信息,而是将数据与权限分离。文档应当能够提供事实,却不能因此获得重新定义智能体任务的权限。

应用设计者可以通过最小权限访问、限定范围的令牌、操作预览和确认要求来强化这一区分。即使攻击者发现了一种陌生的语言学技术,这些控制措施依然有效。

OpenAI 的成果为开发者提供了更强大的防御组件,同时也让他们不再有借口。如果自动化攻击能够大规模生成多样化的训练数据,产品团队就应当将持续对抗测试纳入发布流程。

这种必然的应对将长期展开。竞争对手需要开发自己的攻击生成器、共享评测体系或第三方测试项目。企业买家则需要获得与其实际集成场景相关的证据。

内部基准测试仍未回答最棘手的问题

已公布的提升具有实际意义,但这并不能证明提示词注入问题在 OpenAI 所选环境之外已经得到解决。

第一个不确定性涉及评测的主导权。OpenAI 设计了 GPT-Red、选择了测试环境、训练了防御模型,并公布了最终得分。论文提供了大量技术细节,但外部研究人员无法运行这一内部模型。

GPT-Red 仍未公开,因为 OpenAI 有意将其训练成能够生成有效攻击的模型。发布该模型可能会让攻击者获得该公司原本为防御目的而开发的能力。

这一决定有着明确的安全考量,但也限制了独立复现。研究人员可以审查其方法,却无法充分验证同一攻击模型面对无关系统时是否仍有类似表现。

第二个不确定性涉及分布偏移,即真实输入与训练和评测数据存在差异。攻击者可以自行选择语言、界面、时机以及技术组合。

生产环境中的智能体还可能采用与 OpenAI 测试目标不同的编排层,并拥有自定义系统指令、记忆、检索机制、工具和审批规则。每个组件都会改变攻击面。

因此,面对 GPT-Red 直接攻击时的低失败率,只回答了一个范围有限的问题。它衡量的是在特定环境中,一个防御模型面对一个已开发攻击模型时的失败频率,并不能涵盖未来的所有攻击者。

在留出场景中取得的 84% 结果,更有力地证明了其泛化能力。这些环境不同于 GPT-Red 的训练集,而且人工红队也测试了同一组场景。

尽管如此,该评测使用的是内部镜像,并以 GPT-5.1 为目标。独立团队尚未验证 GPT-Red 在面对竞争模型或陌生生产系统时,能否继续保持这一优势。

第三个不确定性涉及能力保持。模型如果拒绝困难任务、回避使用工具或限制自身操作,也可能显得更加安全。OpenAI 表示,其评测并未发现常规前沿能力有所下降。

该公司还测试了过度拒绝问题,并称模型仍能正常完成合理任务。这一结果令人鼓舞,但底层评测细节至关重要。真实用户经常会发现宽泛的能力基准未能捕捉到的拒绝模式。

防御模型也可能只在易于识别的对抗场景中表现谨慎。攻击者则可以将恶意指令伪装成普通商业内容。这种攻防较量凸显了多样化外部测试的必要性。

第四个问题是如何解读指标。平均攻击成功率可能会掩盖集中存在的弱点。即便总体比例极低,如果失败集中在电子邮件、凭证访问或不可逆操作等场景中,仍可能造成严重影响。

安全影响取决于发生概率和后果严重程度。一个日历条目遭到篡改,与一项凭证被泄露并不可同日而语。组织需要查看具体场景的结果,才能将基准分数映射到实际运营风险。

第五个问题涉及自我改进的叙事。GPT-Red 可以帮助未来模型抵御当前系统生成的攻击。然而,让模型监督模型也可能形成共同盲区。

攻击方和防御方可能从重叠的训练来源中学到相似的假设。它们或许会非常擅长在熟悉的规则下博弈,却忽略奖励结构之外的威胁。

人工测试者能够在一定程度上形成制衡,因为他们拥有不同的经验和目标。第三方研究人员也可以在不受开发者机构性假设影响的情况下挑战系统。

正因如此,OpenAI 对人工和外部红队测试的持续投入,与其算力投入同样重要。自动化提供规模,独立测试则带来不同意见。

OpenAI GPT-Red 自动化红队测试应被视为更强训练闭环的证据,而不应成为所有使用 GPT-5.6 Sol 的产品都能获得的安全保证。

实际标准仍然是分层防御。模型应抵御恶意指令,应用应限制权限,运营方应监控后果重大的操作。每一层都必须假设其他层可能失效。

三个信号将表明 GPT-Red 是否会改变智能体安全格局

接下来的考验是,GPT-Red 在内部取得的提升,能否经受独立评测、更广泛部署以及竞争对手坚决反制的检验。

第一个信号,是能否在陌生的智能体系统上完成外部复现。研究人员需要在并非由 OpenAI 设计的应用中评测 GPT-5.6 Sol。

这些测试应覆盖不同的工具框架、检索系统、文件格式和权限结构,同时还应区分直接注入与隐藏在第三方内容中的指令。

如果 GPT-5.6 Sol 仍能保持显著优势,OpenAI 的自博弈方法在内部基准之外将更具可信度。如果性能因应用不同而出现大幅波动,系统架构仍将是主导因素。

外部测试应同时报告攻击发生频率和结果严重程度,并区分任务被忽略、数据泄露和未经授权的外部操作。单一的总体准确率无法反映这些差异。

第二个信号,是 Anthropic、Google 及其他模型提供商是否会发布可比的自动化红队测试结果。如果竞争对手采取相应行动,就表明对抗训练已经成为一项标准的能力投资。

真正重要的证据不会只是另一个孤立的百分比。提供商应披露威胁模型、留出环境、拒绝行为的权衡,以及模型防御与应用控制之间的关系。

共享或可互操作的评测将释放更强烈的信号。由一家机构开发的红队模型,应当能够在无需专门适配的情况下攻击另一家机构的防御模型。

这种交叉测试可以揭示攻击模型是否过度拟合其开发者自己的模型,也可以削弱将评测双方都置于同一实验室内所带来的优势。

如果竞争对手通过不同方法追平 OpenAI,自动化对抗训练将更像是一个持久的行业方向。如果各方结果仍不可比,买家将很难区分真正的安全进展与选择性披露。

第三个信号,是已部署 GPT-5.6 智能体的失败模式。OpenAI 表示,自 GPT-5.3 以来,GPT-Red 已为其每一代后续生产模型贡献训练攻击样本。

生产事故将揭示这些改进能否覆盖真实工作流程。相关证据包括成功的注入攻击、被阻止的攻击、过度拒绝,以及因工具权限过大而导致的失败。

OpenAI 的监控系统还可以将新出现的失败反馈到 GPT-Red 环境中。这将完成其提出的安全飞轮,把部署证据与攻击模型训练及未来防御模型更新连接起来。

如果公布的改进始终局限于内部版本,这一闭环的说服力就会减弱。若陌生事故能够推动后续模型取得可衡量的改进,其可信度则会增强。

开发者无须等待这些问题得到解答才开始行动。他们可以盘点进入智能体上下文的每一个不可信来源,以及智能体随后可以使用的每一项高影响工具。

他们还可以测试普通内容能否改变智能体的目标。每项关键操作都应只授予完成任务所需的最低权限,并要求对不可逆步骤进行额外确认。

处理大量项目材料的团队可以利用 知识融合 来组织相关上下文,但仍应将导入的文档和消息视为不可信数据,而非可执行的权限指令。

OpenAI GPT-Red 自动化红队测试为模型提供商确立了更严格的基准。它表明,AI 攻击模型可以广泛搜索、生成训练数据,并在数月内改进后续防御模型。

尚待回答的问题是,当环境不再与训练场景相似时,这种防御优势能否持续。开发者和企业买家应要求供应商提供针对具体工作流程的证据,而不能只看一个醒目的总体分数。

检查你的智能体能够读取哪些来源、可以执行哪些操作,以及哪些环节仍必须由人工审批。然后密切关注这三个信号:独立复现、跨提供商测试和生产环境失败数据。它们将决定 GPT-Red 究竟代表着持久的安全进步,还是这场尚未结束的攻防较量中的又一个回合。

 
 

免费开始

一款本地优先的AI助手,具备个人知识管理功能

为了获得更好的人工智能体验,

remio 目前仅支持Windows 10+ (x64)M-Chip Mac

在你的大脑里添加一个搜索栏

Ask remio

记住一切

​无需整理

bottom of page