top of page

Anthropic、Google 和 OpenAI 的护栏正在拖慢进攻性网络安全研究

7月25日
讀畢需時 16 分鐘

Anthropic、Google 和 OpenAI 的安全控制如今面临一项艰难考验:研究人员表示,更严格的护栏正在阻碍获得授权的进攻性网络安全工作。这些限制旨在防范恶意黑客行为,但同样的控制措施也可能拦截漏洞验证、逆向工程和漏洞利用开发。

在多位进攻性安全研究人员描述反复遭遇拒绝和结果不一致后,这一冲突愈发难以忽视。他们的工作是在犯罪分子利用未知漏洞之前发现这些缺陷,通常需要开发受控的概念验证。

问题并不只是 AI 公司拒绝危险请求。研究人员表示,这些系统难以区分授权测试与真实攻击。这种模糊性会造成延误、限制可复现性,并推动敏感工作转向本地托管的开放模型。

OpenAI 和 Anthropic 已推出验证计划,旨在减少这类摩擦。Google 也限制涉及恶意软件、基础设施破坏和绕过安全过滤器的生成式 AI 用途。这些政策共同表明,领先的美国 AI 公司正在为双重用途网络能力划定边界。

这场核心争议比对模型拒绝的常规抱怨更为尖锐。进攻性与防御性安全工作往往需要相同的技术步骤。模型无法总是从置于其上下文中的代码、命令或漏洞判断操作者是否获得授权。

这让前沿实验室必须在两种代价高昂的错误之间取舍。过于宽松的模型可能帮助攻击者更快行动;过度谨慎的模型则可能阻碍防御者理解并修复同一弱点。

研究人员称,合法网络安全工作正遭拦截

眼下的变化在于,网络安全护栏如今会中断实际研究工作流,而不只是拦截明显恶意的请求。

7 月 23 日的一项网络安全调查记录了发现漏洞并开发漏洞利用工具的研究人员提出的抱怨。数人表示,前沿模型在授权工作中拒绝了合法请求,或给出了不一致的回答。

进攻性安全是指在所有者许可下,从攻击者视角测试系统。它包括渗透测试、漏洞利用验证、红队测试以及某些形式的逆向工程。

这些活动能够暴露传统代码审查遗漏的弱点。只有当研究人员确认可疑代码路径是否可被触达和利用时,它才会成为可采取行动的问题。

NCC Group 首席科学家 Chris Anley 告诉 TechCrunch,请求模型利用一个漏洞可以确认该漏洞是否值得修复。此时的拒绝并不只是失去便利,它可能中断帮助公司确定修复优先级的证据构建过程。

Anley 将这项技术比作锤子——它既可以是工具,也可以是武器。他更广泛的观点关乎技术重叠:对漏洞利用有用的指令,也可能是证明脆弱代码会造成真实风险所必需的。

这种重叠在零日漏洞中尤为重要,即发现时受影响厂商尚未知晓的漏洞。研究人员往往需要追踪执行过程、操纵内存或构造异常输入,才能理解一个缺陷。

这些步骤之所以类似攻击者行为,是因为研究人员正在复现攻击。分类器能看到可疑术语、代码和命令,却未必能看到使该工作合法的合同或实验室授权。

一家智能手机零部件制造商的一位研究人员告诉 TechCrunch,除非加入其验证计划,Anthropic 的工具对于漏洞发现几乎已无用。该研究人员称,系统一旦检测到与安全相关的工作便会停止。

RemoteThreat CEO Chris Thompson 描述了另一种故障模式。他表示,护栏在不同会话中的表现不同,包括在提供较宽松限制的审核计划内也是如此。

这种不一致十分重要,因为漏洞研究依赖可重复的实验。研究人员必须判断一个结果是来自目标、测试方法,还是模型不断变化的干预。

当政策执行发生变化却没有清晰解释时,模型便引入了另一个不可控变量。时间从分析漏洞转移到改写提示词和诊断拒绝原因上。

这些限制并不会同等影响每一位从业者。发现零日漏洞并开发漏洞利用工具的 Giuseppe Cali 告诉 TechCrunch,护栏并未妨碍他的工作。

Cali 使用 AI 进行初步逆向工程和构建辅助工具。他将实际漏洞发现和武器化控制在自己手中,部分原因是他享受这项工作。

他的经历为这一批评确立了一个重要边界。当研究人员将前沿模型用于风险较低的辅助任务时,模型依然可以发挥作用。当工作流接近可利用性、载荷行为或实际操作测试时,冲突便会加剧。

因此,当前争论关乎获取特定能力,而不是 AI 是否对安全工作有任何价值。模型可以总结代码、解释函数、提出测试建议或协助编写文档,而不触及最严格的政策边界。

当研究人员要求模型将这些步骤串联起来时,问题便会出现。而这种连接往往正是潜在缺陷变成经验证安全发现的关键所在。

为什么 Anthropic 和 Google 的政策无法清晰区分攻击与防御

Anthropic、Google 及其他前沿实验室的政策面临一个仅靠提示词无法可靠解决的分类问题。

Anthropic 表示,其实时安全措施会阻止被禁止的用途和高风险双重用途活动。其禁止类别包括几乎没有合法防御价值的行为,例如勒索软件开发或大规模数据外泄。

高风险双重用途类别则更为复杂。Anthropic 明确将漏洞利用和进攻性安全工具开发纳入其中,而两者都可能服务于合法防御目的。

在受影响的 Claude 模型上,这类请求默认会被拦截。经验证的用户可以通过 Anthropic 的 Cyber Verification Program,即 CVP,申请调整。

Anthropic 表示,获批从业者仍可能遇到拦截。该公司承认,它可能错误拒绝符合条件的申请者,获批用户也可能在合法工作中面临限制。

这一承认反映了核心技术挑战。渗透测试人员和犯罪分子可能向模型提供完全相同的漏洞利用开发指令。可见的区别通常在于授权,而非所请求的操作。

Google 的禁止使用政策同样禁止生成式 AI 内容协助恶意软件、基础设施滥用或绕过安全过滤器。若教育、科学或公共利益超过潜在危害,则允许例外。

例外条款承认了语境的重要性,但在大规模场景下执行语境判断仍然困难。用户可以声称拥有某个目标,却无需证明这一点。合法研究人员也可能研究某项产品,而并不控制其基础设施。

OpenAI 将网络能力描述为天然具有双重用途。该公司表示,防御性和进攻性工作流依赖大量相同的知识和技术。

该公司报告称,其网络安全能力在 2025 年期间大幅提升。根据其网络韧性计划,其模型在夺旗挑战中的成绩从 8 月的 27% 升至 11 月的 76%。

夺旗挑战是使用故意设置漏洞目标的受控安全演练。它们测试侦察、逆向工程、漏洞利用和权限提升等技能。

OpenAI 使用更高的能力阈值来预判能够开发远程零日漏洞利用或协助复杂入侵的模型。这一趋势解释了为何该公司不会将每个网络安全请求都视作普通编程。

Google DeepMind 在模型开发层面采取了类似的风险导向方法。其安全框架将网络安全列为需要进行能力评估和逐步升级缓解措施的领域之一。

这些政策回应了一个真实担忧:有能力的模型可以压缩专业知识、自动化重复性工作并协调工具。防御者可获得的同样效率,也能降低滥用所需的投入。

然而,激进的提示词过滤是对身份和授权问题的一种钝化回应。单凭技术内容,只能为用户目的提供薄弱证据。

简单措辞也可能产生误导。良性提示词可能包含 shellcode、exploit、persistence 或 credential extraction 等术语,因为这些概念会出现在合法评估中。

恶意请求则可能使用经过净化的语言。攻击者可能将凭证窃取描述为账户恢复,或将漏洞利用伪装成兼容性测试。

分类器必须评估代码、意图、目标、账户历史和周边活动。即便如此,它们做出的也是概率判断,而非核实法律授权。

在探索性研究中,误报尤其容易发生。研究人员并不总是知道一条可疑代码路径最终会演变成什么。他们可能需要测试多个进攻性假设,才能识别真正的漏洞。

这种不确定性与那些要求一开始就给出定义清晰防御目的的系统相冲突。研究过程往往只有在看似危险的技术工作已经开始后,才会形成这种解释。

经验证访问有所帮助,但无法消除摩擦

验证计划改善了已知防御者的访问条件,但无法保证不受限制或可预测的研究工作流。

Anthropic 的 CVP 是面向合法高风险网络安全工作的申请制计划。该公司表示,其目标是在两个工作日内作出审核决定。

批准与特定组织相关联。如果研究人员使用另一个工作区,或遇到仍属禁止范围的活动,仍可能遭到拦截。

可用性也因平台而异。Anthropic 表示,CVP 目前无法通过 Amazon Bedrock 或 Google Vertex AI 使用。使用 Claude 的第三方应用程序也可能无法参与。

这些差异带来了运营复杂性。安全团队可能因云服务提供商、工作区配置或软件集成不同而受到不同对待。

该计划还要求数据保留。Anthropic 建议使用零数据保留的组织创建一个启用数据保留的独立工作区。

这一条件引出了护栏之外的第二个问题。进攻性研究经常涉及机密源代码、尚未修复的漏洞、专有固件,以及可能促成入侵的信息。

即便存在合同保护,将这些材料发送至托管模型也可能造成不可接受的暴露风险。因此,一些研究人员会在厂商修复漏洞之前避免使用前沿服务。

Crowdfense 首席技术官 Paolo Stagno 告诉 TechCrunch,他的团队会使用前沿模型进行逆向工程,但避免将其用于寻找漏洞或创建漏洞利用程序。

Stagno 提到了敏感漏洞信息泄露,或数据被吸收到未来训练中的担忧。对于漏洞利用相关工作,他的团队使用本地运行的开放模型,无需将材料发送给服务提供商。

OpenAI 的可信网络访问系统采用多个能力等级。标准访问支持常见防御任务,而验证访问则会为获得授权的工作减少部分限制。

更专业的访问权限涵盖进攻性测试,包括漏洞利用开发、渗透测试、逆向工程和红队测试。获批某一访问等级,并不意味着自动获得所有网络安全专用模型的使用权限。

OpenAI 还表示,该计划并不会取消所有安全防护或拒绝机制。访问权限仍仅限于获批用户、内部工作流程,以及该组织拥有或获准测试的系统。

这些条件是站得住脚的。服务提供商无法安全地将验证理解为可对任何目标发起攻击的一揽子许可。

但它们也揭示了,验证并不能完全解决研究问题。授权是细粒度的,可能仅适用于一个系统、一段时间、一种测试方法或一次客户委托。

通用的账户级审批无法覆盖每一次范围变更。持续审查文件则会带来更多延迟,并暴露额外的客户信息。

OpenAI 此前表示,其可信计划已覆盖数千名经验证的防御人员,以及数百个保护关键软件的团队。这一规模显示了需求,但并未衡量误拦率或被放弃的工作流程。

缺失的是实际的性能指标。研究人员需要了解:获批请求被拦截的频率有多高、申诉需要多久,以及模型更新后决策是否依旧稳定。

他们还需要有用的解释。笼统的安全提示无法说明触发因素究竟是目标、代码行为、所请求的输出,还是累积的账户活动。

缺少这些信息时,用户会尝试调整提示词措辞。即使研究人员只是想获得合理的结果,这种行为也可能看起来像是在试图规避限制。

更好的执行机制应关注完整的运行环境。服务提供商可以将身份验证与隔离执行、目标白名单、速率限制、审计日志和受控网络访问结合起来。

这一模式类似于网络靶场,即用于安全演练的隔离环境。与仅依靠提示词分类相比,它能提供更有力的授权证据。

它也将更多责任放在基础设施上。服务提供商必须确认,一个看似隔离的目标不会成为通往外部系统的跳板。

这种方法无法覆盖每一位研究人员。独立专家和小型咨询机构可能缺少面向企业计划所要求的组织文件。

安全研究长期以来一直受益于那些在未与供应商建立正式关系的情况下调查产品的外部研究者。若将高级访问权限限制在大型、易于验证的机构中,可能会缩小这一群体。

结果将形成一个双层体系。大型企业获得专用模型和支持,而独立研究人员则依赖消费级工具、本地开放模型或手工方法。

安全护栏正将敏感工作推向开放模型

当托管式前沿模型变得不可预测,或不适合处理机密工作时,研究人员就有理由在本地运行开放模型。

多位研究人员告诉 TechCrunch,当美国前沿服务拒绝处理进攻性任务时,他们会转而使用可下载模型。Thompson 特别提到了 GLM 等中国开放模型。

本地部署改变了控制结构。研究人员可以选择模型版本、保留提示词、关闭外部连接,并将存在漏洞的代码保留在自己的硬件上。

在供应商更新其托管服务后,他们也能复现实验。固定的模型检查点比安全防护可能在未经通知的情况下发生变化的服务表现更一致。

这并不意味着每个开放模型都能匹敌领先托管模型的推理质量。研究人员必须比较能力、上下文处理、硬件需求和工具集成。

开放模型也会将更多安全责任转移给运营者。隔离不佳的智能体可能执行不安全命令、暴露密钥,或连接到生产系统。

不过,本地控制同时回应了两项抱怨:它消除了服务提供商层面的拒绝,也减少了将未公开漏洞数据发送给外部服务的需要。

这种组合比基准测试中的领先地位更重要。只要能在敏感且可重复的工作流程中持续可用,稍弱一些的模型也可能更有价值。

这种转变也为美国 AI 公司带来了战略张力。严格的安全防护能减少其自身平台上的滥用,但也可能将合法专家引导至不受其治理的系统。

这些研究人员随后会向另一套模型生态提供反馈、集成和工作流程知识。他们的使用可能会改进围绕限制更少的模型构建的工具。

这并不证明安全护栏会让互联网变得更不安全。无论经过验证的防御人员如何选择,攻击者都可以使用开放模型。

不过,防御人员的迁移可能削弱这样一种论点:托管式限制能为负责任的用户保留优势。只有当这些用户能够完成有意义的工作时,这种优势才有价值。

OpenAI 将其战略描述为:在限制恶意能力提升的同时,为防御人员提供更好的工具。Anthropic 同样为经验证的专业人士提供调整后的安全防护。

这两个目标都依赖于经过校准的访问机制。一个几乎拦截所有看似危险行为的控制措施可以减少滥用,但也可能消除原本承诺给防御人员的能力。

迁移压力并不只来自明确的拒绝。当数据保留要求、平台排除条款或不清晰的申诉机制使机密委托变得复杂时,托管模型也可能失去吸引力。

一家咨询公司可能服务多个客户,每个客户都有独立的授权边界。它无法随意在同一个被保留的工作空间中混合这些客户的源代码和研究发现。

一名独立研究人员可能在联系产品制造商之前调查一款被广泛部署的产品。此人并不总能提供证明授权的客户合同。

漏洞赏金计划则创造了另一个灰色地带。它们在公开规则下邀请测试,但模型提供商可能无法验证每项请求的操作是否都在范围之内。

这些情况暴露了公司级审查的局限。信任附着于个人或组织,而授权则附着于具体操作。

本地运行的模型避开了这一验证缺口。它们也移除了那个本可检测大规模滥用、暂停访问或调查可疑模式的服务提供商。

因此,这种权衡并未消失,而是发生了转移。托管服务提供监督,但可能带来摩擦和保密顾虑;本地模型提供控制,但减少了集中式执行。

美国前沿实验室无法通过更严格的拒绝机制来扭转开放模型的可用性。更现实的选择,是让负责任的托管访问优于本地替代方案。

这意味着可预测的政策、更快的申诉、有意义的隐私控制,以及为受控漏洞利用而设计的环境。仅靠原始模型能力,无法让安全研究人员留在平台上。

研究人员的批评存在重要局限

进攻性研究人员指出了真实的工作流程失败,但他们的利益并不能决定危险 AI 能力应在多大范围内发布。

一些进攻性安全公司会为政府客户发现、收购或出售漏洞。他们的工作并不总会立即促成披露和修复。

TechCrunch 引述的知名研究人员 Mark Dowd 曾向西方政府出售零日漏洞。他承认,这一背景可能会影响他对企业限制的看法。

政府重视未公开漏洞,因为情报机构可以在目标仍然暴露的情况下利用它们。这一市场使得“进攻性研究等同于公共防御”的简单说法变得复杂。

模型提供商必须考虑的不只是客户看上去是否可信,还必须考虑相关协助是否可能扩大监控、入侵或漏洞囤积。

法律授权并不等同于公共利益。即便是政府批准的行动,如果某个漏洞影响到被广泛使用的软件,仍可能引发争议或造成系统性风险。

研究人员对于 AI 应在多大程度上参与其中也存在分歧。Cali 的工作流程表明,有用的协助可以在自动化漏洞发现或武器化之前止步。

这种做法在风险最高的阶段保留了人类判断,也降低了模型将一个不完整想法转化为可复用攻击方法的可能性。

与此同时,服务提供商的风险论点并非假设。OpenAI 表示,模型的网络安全能力提升很快,而这三家实验室都将高级网络能力视为严肃的安全领域。

随着模型获得更长时程的自主行动能力,单次回应的重要性将低于一连串行动。智能体可以检查代码、生成测试、执行命令、评估失败并修订计划。

这种能力改变了风险等级。过去只需拒绝一个简短恶意软件请求,如今可能需要治理数千项协调行动。

它也让隔离测试变得不可或缺。具备工具使用能力的智能体可以跨越纯文本助手无法触及的边界。

研究人员理应获得可预测的访问权限,但服务提供商需要证据表明周边环境能遏制失误。仅靠验证无法提供这种证据。

此外,目前没有针对合法网络安全工作的公开标准化安全护栏质量衡量方式。个别案例揭示了失败模式,但无法确立整体误拦率。

TechCrunch 的访谈涵盖了不同的组织和工作流程。它们提供了可信的预警信号,而非对安全行业具有代表性的调查。

服务提供商同样很少公布获批用户的使用体验数据。注册人数显示了覆盖范围,但对于任务完成情况或模型实用性几乎没有说明。

这一证据缺口鼓励双方夸大各自立场。研究人员可能将一次拒绝解读为安全政策武断的证据;服务提供商则可能将计划的可用性视为合法访问有效的证明。

更好的评估应在多个模型上测试真实的授权工作流程,并衡量任务成功率、不当拒绝、不安全的配合、一致性、申诉时间和数据处理要求。

该基准还应包含模糊案例。简单的防御性提示词和明显的勒索软件请求,无法检验存在争议的边界。

场景可以包括:在网络靶场内验证漏洞利用、逆向工程恶意软件、分析漏洞赏金目标,以及开发安全的概念验证。

独立评估者还需要获得最高风险模型等级的访问权限。否则,他们衡量的将只是公开限制,而无法检验验证机制是否真正解决了问题。

结果不应披露会助长滥用的操作细节。汇总报告仍可展示,控制措施是否会随着时间推移更准确地区分合法工作。

在此类证据出现之前,下定论仍为时过早。安全护栏显然会给一些研究人员带来摩擦,但取消它们则会带来另一种、且可能更大的风险。

实际目标并非不受限制的访问,而是在现实的攻防测试条件下,依然有用且可追责的访问。

Anthropic、Google 和 OpenAI 接下来必须证明什么

下一阶段应以工作流可靠性、受控执行,以及负责任的研究人员是否仍留在受治理的平台上来衡量。

第一个信号,是验证项目中的可量化表现。Anthropic 和 OpenAI 应披露合法双重用途请求的审批时限、申诉结果和误报率。

这些数字需要结合模型、访问级别和任务类别等背景解读。单一的全项目百分比,可能掩盖漏洞验证中的严重问题。

Anthropic 已表示,其目标是在两个工作日内决定 CVP 申请。更重要的问题是,获批后会发生什么。

如果经过验证的研究人员仍频繁遭遇无法解释的拦截,审查机制只是移动了边界,并未解决工作流问题。误报率下降将更有力地证明校准式防护措施的价值。

第二个信号,是受控研究环境的普及程度。前沿实验室可以提供配备审计工具、受限网络和明确目标授权的隔离工作区。

这类环境可让模型执行看似危险的任务,而无需授予其对外部基础设施的开放访问。它们也能让事件复盘比围绕提示词的推测更具体。

成功需要云平台和第三方工具的广泛支持。Anthropic 当前 CVP 的可用性缺口表明,当模型通过中间方触达用户时,访问机制可能如何失效。

隐私控制与执行控制同样重要。安全团队需要可信的选项,以处理专有代码和未披露漏洞,而不会带来额外暴露。

如果公司将网络靶场与强有力的数据保留选项结合,更多研究人员就能有理由使用托管模型。若数据保留仍是强制要求,敏感工作将继续转向本地。

第三个信号,是研究人员的行为。服务商应观察,受尊敬的进攻型团队是否会使用专业化的前沿模型进行漏洞利用验证,而不只是代码摘要。

如果持续迁移至 GLM 和其他可下载模型,将削弱“经过验证的访问能为防御者带来实际优势”的说法。稳定的采用情况则表明,防护措施正变得可用。

尽管近期研究人员账户主要聚焦 Anthropic 和 OpenAI,Google 也应被纳入这一比较。其政策和前沿框架反映了相同的核心权衡。

anthropic google 这一关键词组合也反映了更广泛的市场现实。安全团队会比较不同服务商在治理、部署、隐私和访问方面的表现,而不只看原始基准分数。

没有任何一家公司能仅靠更好的拒答信息解决双重用途分类问题。决定性的改进,将来自身份、环境、授权、监控,以及透明的纠错路径的结合。

开发者和企业买家在采用 AI 模型开展安全工作前,应提出直接的问题。哪些任务会触发强化防护?获批用户能否在活跃项目期间提出申诉?

他们还应审视数据保留、区域处理、平台可用性、可审计性和模型版本稳定性。这些细节决定产品能否支撑一项真正的安全计划。

进攻型研究人员应记录误报情况,但不要发布会助长危害的材料。可比较的证据将让服务商更难把失败归咎于个别滥用案例。

与此同时,AI 公司应将误拒合法请求视为安全缺陷。一个不加区分地拦截防御者的系统,并未实现预期的平衡。

接下来的考验很简单。Anthropic、Google 和 OpenAI 能否在保留有意义监督的同时,为获授权研究人员提供可靠的访问,使其获得攻击者已经在寻求的能力?

如果验证项目能够做到一致且保密,受治理的前沿模型就能留住负责任的专家。否则,这些专家将继续转向限制更少、服务商监督也更少的本地替代方案。

 
 

免费开始使用

一款本地优先的AI助手

为了获得更好的人工智能体验,

remio 目前仅支持Windows 10+ (x64)M-Chip Mac

你的 AI 工作伙伴

remio 一起高效工作

规划、创作、交付

一站式完成

bottom of page