FAR.AI 安全排行榜显示前沿模型之间的防护差距达百倍
- Olivia Johnson

- 7月31日
- 讀畢需時 14 分鐘
FAR.AI 推出了一项 AI 安全排行榜,称保护前沿模型的最强与最弱安全防护之间存在百倍差距。该公告于 2026 年 7 月 30 日通过 Google News 及 Yahoo Finance 的联合发布报道触达了更广泛的受众。
这项排名将抽象的安全争论转化为可见的比较。具备相近标称能力的前沿系统,显然可能需要截然不同程度的投入才能被攻破。这种差异比所有受测系统最终是否都能被攻破更重要。
这一发现也给 OpenAI、Anthropic、Google 及其他模型开发商带来压力。它们的产品在推理、编程、速度和成本方面展开竞争。FAR.AI 认为,对滥用行为的抵抗力也应成为另一项可衡量的维度。
这一核心结论仍需谨慎解读。排行榜可以衡量受控条件下的特定攻击,但无法给出模型造成危害的普遍概率。因此,FAR.AI 报告的差距应引导审查,而非决定每一项模型选择。
FAR.AI 将防护强度转化为公开排名
排行榜改变了讨论重点:不再是防护措施是否会失效,而是攻击者在其失效前必须投入多少成本。
FAR.AI 是一家专注于先进 AI 安全与保障的独立非营利研究机构。其研究人员针对领先模型开发商的系统开展对抗性测试,通常被称为红队测试。
红队测试会让模型承受蓄意攻击,以揭示常规评估可能遗漏的行为。测试人员会尝试越狱、微调攻击、提示操纵以及其他可能绕过安全控制的方法。
FAR.AI 表示,这一新排行榜利用一致的对抗性测试比较前沿模型的安全防护。其核心主张是,受评系统之间的保护水平相差约一百倍。
这一数字比简单的通过或失败标签更具信息量。此前研究一再发现,在持续攻击下,针对每个接受测试的主流模型家族都能实现成功越狱。
因此,实际问题并非坚定的专业人士是否终能发现弱点,而是利用漏洞需要几分钟、几小时、大量专业知识,还是普通用户无法获得的访问权限。
FAR.AI 更广泛的安全研究支持这一方法。该机构会测试模型层面的拒答机制,以及检查提示或回复的外部过滤器和监控系统。
这些层面构成纵深防御流程。模型可能首先拒绝有害请求,而独立的分类器会拦截通过初始控制的内容。
账户监控可以再增加一层防护。服务商可能检测到反复试探,在研究人员披露新攻击后暂停账户或更新过滤器。
这类保护措施能够显著提高攻击者的成本。不过,它们也可能同时失效,因为每个组件对语言和上下文的理解并不相同。
FAR.AI 此前开发过 STACK,这是一种旨在攻击连续多层防御、而非单一隔离过滤器的方法。其研究人员报告称,在灾难性风险场景中,该攻击的成功率为 71%,而传统攻击的成功率为 0%。
此前的研究解释了为何新排行榜聚焦于整个防御屏障。若外部分类器误解了经过编码的请求,即使模型具有强有力的拒答政策,仍可能暴露于风险之中。
反过来也可能发生。模型内部拒答机制或许较弱,但服务商监控能在有害内容到达用户前捕获明显的滥用行为。
只要方法论说明每项受测配置,公开排名就能揭示这些差异。模型版本、系统提示、访问方式、攻击预算和评估日期都会改变结果。
这正是 Google News 标题值得关注的首要原因。它呈现了巨大的数值差距,但底层测量条件决定了这一数字的含义。
该排行榜推出之际,模型排名正影响采购决策。开发者在选择 API 前,通常会比较能力评分、上下文限制、延迟和编程表现。
安全性很少以同样易于获取的形式与这些指标并列出现。FAR.AI 正试图让这种缺失更难辩护。
为什么 Google News 读者应关注百倍差距
百倍差距意味着,两款能力相近的模型可能让同一攻击者付出截然不同的成本。
这一差异很重要,因为防护措施能争取时间。它们无需消除每一种可能的攻击,也能减少技术较弱或缺乏持续性的行为者实施滥用。
薄弱防御可能会被公开流传的复制提示攻破。更强的系统则可能要求专业人士经过数小时迭代测试,开发新的攻击手法。
额外投入缩小了能够获取危险协助的人群范围,也让模型服务商有更多机会检测试探行为并封禁滥用账户。
英国 AI 安全研究所也描述过类似模式。其公开的前沿趋势报告发现,一种生物滥用攻击所需的专家投入约为早期比较对象的 40 倍。
据报道,第一个系统在大约十分钟后便因已知漏洞失守。后一个系统则需要超过七小时,以及一种新开发的通用越狱方法。
两个系统最终都生成了违反政策的回答。若将这些结果视为等同,就会抹去两者之间实际发生的安全改进。
FAR.AI 报告的百倍跨度将这一逻辑延伸至当前模型。如果其测量结果可复现,最弱的系统并非只是稍微更容易被攻击。
它们处于不同的运营风险类别。对个人而言负担得起的攻击方式,面对防护更完善的模型时可能并不现实。
这正是本文的核心张力所在。所有在足够激进条件下测试的防护措施都可能失效,但距离失效的远近仍会决定现实世界中的暴露程度。
能力评分无法回答这一问题。英国研究所发现,在其测试中,通用模型能力与防护稳健性之间的相关性很低。
其比较报告的 R-squared 值为 0.097。这一结果表明,更强的推理表现并不能可靠地带来更强的对抗性请求抵抗能力。
原因很直接。模型能力主要来自为实用性能优化的训练、规模、架构和后训练。
安全则依赖额外投入,包括针对性安全训练、对抗性评估、分类器、监控、访问控制和快速修复。
一家服务商可以在能力基准中领先,却在某个防御类别上投入不足。另一家服务商则可能在经过严密测试的控制措施后部署能力较弱的模型。
因此,企业买家应将能力评估与安全评估分开。单一综合评分可能掩盖模型在某一维度表现出色、在另一维度表现不佳的情况。
Google News 的表述可能引发另一种误解。“百倍”听起来像是附着于每家公司或产品的永久属性。
防护表现更具波动性。服务商可以修补攻击方式、更换分类器、修改系统提示,或发布替代模型。
攻击者也会适应。如今提高成本的防御,一旦成功越狱方法公开并可复用,价值就可能下降。
一份有用的排行榜必须记录这些变化。它应保留历史结果,同时清晰区分旧模型配置与当前部署。
若没有这种版本管理,公开评分过时的速度可能比普通能力基准更快。安全排名需要在每项结果旁标明日期、攻击预算和复测政策。
对于通过 Google News 发现这则报道的读者而言,百倍主张只是切入点。更重要的结论在于,前沿领域的防御投入并不均衡。
相似能力不再意味着相似安全性
当产品面向许多相同客户时,FAR.AI 的排名促使模型开发商解释其防护措施为何存在差异。
OpenAI、Anthropic、Google 及其他前沿开发商都发布了有关安全测试的信息。OpenAI 的Preparedness Framework、Anthropic 的Responsible Scaling Policy以及 Google DeepMind 的Frontier Safety Framework均描述了各公司评估先进能力及应用防护措施的方法。不过,它们的报告格式和评估方法仍难以直接比较。
一家公司可能报告被拒绝的有害请求比例,另一家公司则可能描述红队演练,却不公布可比较的攻击成功率。
第三家公司可能强调账户监控或部署限制。这些控制措施很重要,但披露方式不一致,使买家无法进行直接比较。
独立排行榜试图通过对多款产品采用同一种方法论来解决这一问题。这种做法类似标准化测试,但模型安全比学术能力评估更复杂。
能力基准通常要求每个系统回答相同问题。安全测试则需要一个会在模型拒绝时改变策略的自适应对手。
静态提示集可能奖励那些专门针对已知示例训练过的系统,却可能错过在更长对话或工具使用中出现的攻击。
这一担忧已出现在智能体测试中。一项由 NIST 研究人员、Gray Swan AI 和英国研究所参与的联合红队项目,审查了针对使用工具的 AI 智能体的攻击。
由此产生的智能体安全研究强调了自适应攻击与跨模型迁移。针对某一部署发现的提示注入攻击,有时也能在另一部署中奏效。
工具访问将风险提升到不安全文本回复之外。智能体可能在遵从恶意指令后暴露凭据、更改文件权限,或采取外部行动。
FAR.AI 强调过一些测试,其中研究人员针对众多智能体配置中的政策违规行为发起攻击。这项工作发现,每个受测系统都存在严重弱点。
前沿模型排行榜应将这些智能体失效与普通聊天机器人越狱区分开来。生成被禁止的文本与执行未经授权的操作,涉及不同的威胁模型。
周边应用同样可能决定最终风险。连接至内部文档、电子邮件、代码仓库或支付工具的模型,拥有更多造成损害的机会。
即便底层模型存在漏洞,访问控制也能限制这种暴露。人工审批、受限权限、隔离执行和日志记录都可以降低成功攻击的后果。
这意味着,任何企业都不应将排行榜上的高位视为无需应用层控制即可部署模型的许可。
得出相反结论同样错误。组织即使计划在模型周围增加安全防护,也不应忽视较低的评分。
模型层面的保障措施仍是一道防线。如果这道防线容易失效,周边的每一项控制措施都必须承受更大压力。
能力与风险之间的竞争在网络安全领域尤其明显。模型可以帮助防御人员分析可疑代码,但过度拒绝也可能阻碍正当调查。
当模型因请求看似有害而拒绝良性或已获授权的工作时,就会发生过度拒绝。只奖励拒绝行为的排行榜,可能会偏向那些因实用性较低而显得更安全的模型。
因此,FAR.AI 需要说明其排名是否同时衡量了抗攻击能力和良性实用性。这些维度应保持可见,而非被隐藏在单一综合分数之中。
安全团队需要的是既能抵御恶意请求,又能协助开展获授权防御工作的模型。任何一方面失效都可能带来运营风险。
对每个请求都作答的模型可能助长滥用。在事件发生期间阻止取证分析的模型,则可能延误遏制措施。
只有当这些系统保持相近的实用性时,百倍差距才有意义。否则,排名可能部分衡量的是各模型拒绝困难话题的频率。
排行榜目前还无法证明什么
报告中的差距是一项警示信号,而非对现实世界危害或提供商质量的完整估计。
第一项局限在于攻击选择。不同的越狱攻击家族利用不同弱点,包括角色扮演、编码文本、多轮说服、预填充或微调。
一个模型可能抵御某一类攻击,却在另一类攻击面前失效。对这些攻击采用不同权重,会改变其最终排名。
FAR.AI 自身的工作说明了这一问题。其预填充分析发现,能够控制首批响应 token 的攻击,可能会威胁多个家族中的开放权重模型。
托管聊天界面通常不提供这种能力。运行可下载权重的企业,可能面临封闭式消费者服务中不存在的威胁。
第二项局限涉及威胁行为者。普通用户、经验丰富的提示词工程师和资金充足的实验室,拥有的时间和访问权限并不相同。
百倍比例取决于所选择的资源衡量方式。它可能代表查询次数、研究人员时间、计算成本,或其他攻击投入的代理指标。
这些指标彼此相关,但不能互相替代。一位专家的一小时,并不等同于缺乏必要技术背景者的一百小时。
自动化攻击生成进一步增加了计算复杂性。最初需要专家开发的方法,在研究人员发布可复用代码后可能变得成本低廉。
第三项局限涉及输出质量。越狱攻击可以让模型作出回应,却不代表该回应准确、新颖或具备实际可操作性。
这一差异对化学、生物、放射性、核与网络风险至关重要。冗长的回答仍可能包含会降低其实用价值的错误。
因此,研究人员必须同时评估政策违规和实质性协助。重复广泛可得信息的模型,与提供可靠专业指导的模型,带来的风险并不相同。
第四项局限是覆盖范围。即使是广泛的基准测试,也只是对可能交互空间中极小部分的抽样。
语言、编码、工具配置、系统提示词和对话历史会产生无数变化。通过某项基准测试,并不意味着未知攻击已经消失。
安全评估也会产生针对测试进行优化的激励。一旦排行榜具有影响力,提供商就可能针对其公开攻击集调整系统。
这类工作可能提升真正的安全性。它也可能鼓励狭窄的修补措施,在不解决根本弱点的情况下提高分数。
私有测试集和轮换攻击可以缓解这一问题。然而,保密性会使独立复现更加困难。
因此,排行榜的治理方式至关重要。FAR.AI 应说明由谁选择攻击、如何管理利益冲突,以及提供商如何质疑错误结果。
该组织自称是一家独立的非营利机构。它也与前沿模型开发者和政府机构开展合作。
这些关系能够提供宝贵的访问权限。但当排名会影响公司声誉时,透明的利益冲突政策同样重要。
独立审计研究人员认为,仅靠公开披露无法核实每一项前沿安全主张。严格的第三方评估有时需要对机密系统和证据进行安全访问。
公共排行榜扮演的角色更为有限。它可以暴露通过可用界面可见的相对弱点,但无法检查每一项内部安全流程。
模型开发者掌控训练数据、系统提示词、监控规则、事件记录和补救工作流。外部测试人员很少能够完整访问这五项内容。
因此,排名不应将单一分数包装成对整家公司的裁决。它衡量的是特定条件下定义明确的系统。
在完整方法论和当前结果接受独立审查之前,读者也应将最初公告视为一项被报道的主张。
Google News 和 Yahoo Finance 的分发扩大了受众范围。内容联合发布并不独立验证其基础研究。
这一差异很容易被忽略,因为财经新闻页面经常将公司或非营利组织公告与新闻报道一同刊载。
FAR.AI 先前的研究为这项新主张提供了相关背景。但这并不能免除对排行榜模型列表、攻击预算、评分规则和更新流程的审查需求。
压力落在模型实验室和企业采购方身上
排行榜使无法解释的保障措施薄弱成为采购和治理问题,而不再只是研究议题。
模型提供商如今面临一个直接问题:为什么组织要采用一个能力相近、却更容易被攻破的系统?
提供商或许有站得住脚的解释。其部署可能采用了严格的访问控制、快速监控,或基准测试之外的应用特定限制。
它也可能证明测试对某一狭窄攻击类型赋予了过高权重。透明的技术证据会增强这种回应。
沉默则传递不同的信号。如果独立评估者反复发现提供商尚未解决的基础攻击,采购方应询问该公司处理披露问题的速度。
修补速度值得成为独立指标。数日内获得验证修复的脆弱模型,与数月未变的模型,具有不同的运营风险特征。
FAR.AI 在 2026 年 5 月对 DeepSeek-V4-Pro 的评估提供了一个值得注意的先例。该组织报告称,在多个高风险领域,攻击成功率介于 98% 至 100% 之间。
它还表示,为前一代模型开发的越狱攻击无需修改即可奏效。FAR.AI 认为,这一结果表明已知弱点仍未得到修补。
这一案例说明了历史追踪为何重要。排行榜应展示开发者是否从早期失败中吸取教训,而不只是显示某一天由哪个模型领先。
企业采购方也应将同样的逻辑纳入采购流程。安全审查需要有关确切模型版本及其周边部署的证据。
团队应记录模型可以访问哪些数据、能够执行哪些操作,以及哪些失败情形需要人工批准。
他们还应测试自身的系统提示词和集成方案。供应商的默认界面无法复现定制智能体中的所有风险。
最小权限原则仍然至关重要。AI 助手应仅获得完成其分配任务所需的文档、凭据和工具。
日志应记录重要提示词、工具调用、审批和配置变更。这些记录有助于调查人员重建事件并识别反复试探行为。
组织还需要退出路径。模型行为可能在提供商更新后发生变化,而托管 API 也可能下线此前接受测试的版本。
因此,安全评分应纳入持续审查流程。它不应成为伴随产品无限期有效的一次性批准。
当 AI 系统汇总私人笔记、会议记录和内部研究时,知识工作者面临相关问题。保障措施排名并不能衡量每一种隐私或检索失败。
团队仍需要明确的信息边界和审查流程。维护良好的AI knowledge base可以改善可追溯性,但不应将模型保障措施视为唯一控制手段。
监管机构也会关注公开比较。欧盟《AI 法案》以及新兴的前沿治理框架强调风险评估、文档记录和缓解措施。
可复现的排行榜可以帮助政策制定者识别哪些领域需要共同的技术标准。不透明的排名对执法的帮助较小。
最有力的政策应用可能涉及披露一致性。开发者可以在标准化对抗条件下,同时报告缓解前能力和缓解后行为。
这种区分将揭示安全性来自训练后的模型、外部过滤器、访问限制,还是多个协调层级。
它也会使故障更易诊断。采购方可以看到,更改界面或移除监控是否会实质性改变系统风险。
FAR.AI 的百倍主张将这种比较带入公众视野。下一步是将可见性转化为可重复验证的证据。
Google News 读者接下来应关注什么
三个信号将决定 FAR.AI 的排行榜会成为安全标准,还是又一个短暂的模型排名。
第一个信号是方法论披露。FAR.AI 需要明确接受测试的模型、评估日期、攻击类别、预算和评分规则。
一项有价值的发布应说明百倍比例的计算方式。它还应区分托管服务、可下载权重和智能体部署。
关注不确定性范围和重复试验。由于模型采样和人工攻击策略会引入随机性,安全实验的结果可能存在波动。
独立研究人员应能够复现至少部分排序。复现将增强报告差距的可信度,而较大差异则会削弱它。
第二个信号是提供商的回应。OpenAI、Anthropic、Google 及其他接受评估的开发者,应针对具体弱点作出回应,而非只争论标题。
最具参考价值的回应将包括缓解措施、复测结果,或对争议测量的技术解释。笼统保证几乎无法说明问题。
提供商在排行榜上的变化将比初始排名更重要。低分模型在披露后得到改善,将表明该基准正在推动补救。
如果分数发生变化却没有相应的产品更新说明,就会引发对测试稳定性的质疑。排行榜应公布每一次修订的清晰历史记录。
第三个信号是排名能否预测真实部署结果。研究人员应将排行榜表现与红队演练、滥用事件和智能体安全测试进行比较。
没有任何公开数据集能够完美对应评分与危害之间的关系。不过,若不同评测反复得出一致结论,便能证明其具备实际价值。
分歧同样具有参考意义。某个模型或许能抵御聊天机器人越狱攻击,却会在获得浏览器、Shell 或文件访问权限后表现不佳。
FAR.AI 应谨慎扩展,而不是将互不相关的风险合并为一个数字。分别呈现有害内容、网络滥用、生物风险和智能体控制等维度,会更有帮助。
读者还应关注排行榜如何处理善意的安全研究。防御分析人员需要能够检查可疑代码,并在获得授权的情境下解释攻击技术的模型。
忽视过度拒答的排名,可能会奖励那些通过拒绝合法任务来规避风险的系统。平衡的测试应同时衡量安全拒绝与许可范围内的协助能力。
由于标题中的对比易于理解,Google News 很可能会报道未来排行榜的变动。但更深层的价值,在于长期积累下来的记录。
一份可靠的长期记录可以揭示:哪些实验室修复问题更迅速,哪些攻击类别持续存在,以及安全保障投入是否跟得上能力提升的步伐。
这些证据将帮助开发者选择模型、企业制定控制措施,以及政策制定者评估自愿安全承诺。
目前,应将这百倍差距视为提出更好问题的理由。测试的是哪个模型版本?攻击者掌握了哪些信息?投入的工作量又是如何衡量的?
随后还应提出能力排行榜通常忽略的运营问题:如果该系统失效,其背后连接着哪些数据或权限?
关注 Google News 的后续更新,但不要只看每次排名变化。决定性检验在于,公开结果是否促成了更强的保障措施和经独立验证的改进。


