AI Proving Grounds Consortium 测试安全智能体是否已准备好采取行动
AI Proving Grounds Consortium 登上 Google News,并向安全团队提出了一个直接挑战:在授予 AI 智能体生产环境权限前,先证明它们确实可靠。五家网络安全厂商在研究发现高管信心与实际就绪度之间存在巨大差距后组建了这一联盟。争议已不再是智能体能否协助分析师,而是当错误可能中断系统、暴露数据或帮助攻击者时,这些智能体是否应该采取行动。
Corelight、Dropzone AI、SCYTHE、SimSpace 和 Sondera 于 2026 年 6 月 3 日宣布成立该联盟。其公布的计划结合了接近生产环境的模拟、持续评估、智能体控制以及人工培训。每家成员企业覆盖安全运营技术栈中的不同层面。
这一公告之所以重要,是因为企业正从辅助型智能体转向能够发起调查并建议响应行动的系统。其中一些最终将隔离设备、修改访问策略,或触发自动化遏制措施。这种转变会让一个不可靠的答案演变为可能造成损害的行动。
该联盟押注于,逼真的网络靶场能够在部署前暴露这些故障。它面临的挑战是证明,由厂商运营的模拟衡量的是运营安全性,而不仅仅是在有利测试条件下的表现。
五家厂商正在建设共享的 AI 安全测试场
该联盟将 AI 安全验证从厂商承诺转变为拟议的联合测试流程。
创始成员汇集了网络遥测、自主调查、对抗性测试、模拟基础设施和智能体策略执行能力。这种组合反映了安全智能体的实际运行方式。它们依赖数据、模型、工具、权限、工作流和人工决策,而非某一个孤立的应用程序。
Corelight 专注于网络证据与检测。Dropzone AI 开发用于安全运营中心调查的智能体。SCYTHE 提供对抗性暴露验证服务,通过模拟攻击行为测试防御能力。
SimSpace 提供网络靶场环境。网络靶场是一种隔离的复制环境,团队可在其中开展攻击和防御响应,而不会危及生产系统。Sondera 提供策略控制,旨在管理智能体能够执行哪些操作。
这些厂商在其联盟发布公告中表示,组织需要让智能体与人工操作员一起接受测试。其拟议环境将模拟复杂攻击,同时使演练与实时基础设施保持隔离。
这个目标听起来很直接,但安全智能体评估包含多个环节。测试必须判断智能体是否发现了正确证据、是否进行了正确解读、是否选择了恰当响应,以及是否始终处于其授权范围内。
测试还必须捕捉底层数据不完整时会发生什么。攻击者经常制造模糊信号、模仿受信任的行为,或将活动分散到多个系统中。在干净场景中表现良好的智能体,仍可能在日常运营噪声中失效。
因此,该联盟的多厂商结构非常重要。没有任何一个成员控制从原始网络活动到最终响应之间的所有组成部分。跨多个层面测试,能够暴露产品演示通常会忽略的集成故障。
例如,调查智能体可能正确识别可疑活动,却引用了不完整的网络证据。即使拟议响应本身是恰当的,策略层也可能因此阻止该响应。反过来,有效告警也可能因智能体误解自身权限范围而导致过度行动。
此次发布还建立了一个公开论坛,而非宣布一套已经完成的认证体系。联盟表示将支持协作演练、智能体工作流验证、高管讨论和共享实践。它尚未发布通用的通过分数或独立认证标准。
这一差别很重要。联盟可以加速技术学习,却不等于成为公正的标准机构。其首要责任是证明成员能够定义可重复的测试、记录故障,并将产品营销与测量结果区分开来。
AIPGC 章程页面将该组织描述为一个联盟,致力于在部署前培训、测试和验证 AI 防御能力。该页面还将人工操作员纳入测试流程。这一选择承认,大多数当前的安全智能体仍依赖分析师审查。
真正的变化在于流程。安全领导者被要求将智能体部署视为运营就绪度决策,而不是一次软件功能发布。该联盟现在必须将这一理念转化为外部团队可审查的证据。
为什么 Google News 的关注聚焦于 78% 的信心差距
该联盟最有力的论点是,高管信心的提升速度已超过逼真测试。
Google News 的报道放大了 SimSpace 研究中的一项醒目对比。该公司称,78% 的安全领导者对其 AI 防御能力抱有高度信心。然而,在团队完成反复模拟演练前,其专有的 Defensive Security Readiness 评分最低可达 30%。
这些数字衡量的并不是相同的事物。前者反映安全领导者报告的信心,后者来自 SimSpace 平台数据,代表演练中的表现。若将两者差异视为精确的、全行业范围的缺口,会夸大现有证据所能说明的内容。
尽管如此,这一对比指出了严肃的治理问题。组织可能基于信心、演示或有限试点批准某个智能体,却缺乏关于其在持续攻击中行为表现的证据。
SimSpace 的智能体式安全研究称,73% 的受访组织已在其安全运营中心中以中等或较高程度使用 AI 智能体。仅有 29% 表示进行了持续模拟测试。
该研究还称,44% 的组织每年测试两次、测试频率更低,或根本不测试。这种节奏与会因模型更新、提示词修订、新工具和不同数据连接而变化的软件并不匹配。
一月完成验证的智能体,可能在模型提供商修改其服务后表现不同。新的端点集成可能暴露额外的操作权限。身份策略的变化也可能扩大或限制智能体可访问的范围。
传统桌面演练很少能捕捉这些交互。桌面演练要求参与者讨论对假设事件的响应方式。它可以揭示职责不清的问题,但无法复现智能体在运营压力下的工具调用或时序。
认证课程服务于另一种目的。它们帮助人们理解流程和技术,但不能证明一个连接到特定环境的特定智能体会在攻击期间安全行事。
该联盟的答案是反复模拟。SimSpace 称,每次完整演练可将其就绪度评分提升约三至五个百分点。它还表示,频繁测试的团队在四到六次迭代后能达到更高表现。
这些数字仍是公司的说法,且部分基于专有指标。读者不应假设每个组织都会获得同样的提升。更有用的原则更为有限:反复演练会暴露错误,团队可以在后续运行中测试修正措施。
该研究还称,AI 工具进入安全工作流后,初始表现会下降 10% 至 20%。这一说法需要谨慎解读。新系统可能在团队学会如何使用前带来更多告警、不熟悉的流程或协调成本。
暂时性的下降并不能证明 AI 智能体有害。它说明了领导者为何应衡量转型过程,而非假设自动化会立即带来收益。
压力落在首席信息安全官和安全运营领导者身上。他们必须说明哪些证据支持智能体拥有相应权限。厂商评估、人工审查流程和回滚控制如今都属于部署决策的一部分。
Google News 的曝光可让更多人关注这一信心差距,但无法验证底层测量方法。这需要透明的方法论、可比较的演练,以及超出组织测试的厂商范围的结果。
安全智能体必须证明判断力,而不仅仅是检测能力
智能体仅仅能够识别可疑活动,并不代表它已准备好采取行动。
检测关注系统是否识别出威胁。运营判断则关注它是否以恰当的时机、证据和权限选择了相称的响应。后一项任务带来的风险要大得多。
设想一个安全智能体正在调查一次可疑登录。它可能收集身份记录、端点事件和网络流量。随后,它需要区分遭入侵账户与使用新设备或新地点的员工。
辅助型智能体可以为分析师汇总证据。自主智能体则可能暂停账户、撤销会话、隔离设备或封锁地址。这样一来,误报就会从令人不便的建议变成运营事件。
相反方向也存在同样的风险。智能体可能因缺乏信心而避免遏制,让攻击者获得更多时间。基准测试中的高准确率可能掩盖后果严重的罕见故障。
因此,一个有效的验证场必须测试多个维度。它应衡量检测质量、调查完整性、响应准确性、策略合规性、升级行为,以及错误行动后的恢复能力。
它还应测试提示词注入。提示词注入是指不受信任的内容试图让 AI 系统偏离其既定任务。恶意消息、文档或工单可能包含旨在影响调查智能体的指令。
网络证据同样可能携带对抗性内容。攻击者控制主机名、文件名、网页和部分日志数据。将这些材料视为可信指令的智能体,可能泄露机密或误用已连接的工具。
工具权限带来了另一个问题。安全智能体可能需要跨多个系统的读取权限,而只应获得少数系统的写入权限。测试必须确认,它会拒绝被禁止的操作,包括在看似紧急的场景施压要求其行动时。
这些问题属于美国国家标准与技术研究院维护的更广泛AI 风险框架。NIST 围绕治理、映射、测量和管理组织 AI 风险工作,贯穿整个系统生命周期。
网络靶场可以帮助进行测量,但无法替代治理。组织仍需要明确的责任人、记录在案的权限限制、事件处置流程,以及将智能体撤出服务的标准。
人类监督同样需要测试。要求每项行动都获得批准听起来很安全,但分析师可能会逐渐习惯于接受重复出现的建议。一项贴近现实的演练应衡量人们是否能识别薄弱证据,并质疑智能体提出的应对方案。
随着自主性提高,人类的角色也会发生变化。起初,分析师可能审查每一次调查。之后,他们可能只审查高影响行动或异常案例。每一次转变都会形成新的运营模式,需要单独验证。
这正是能力与风险之间的核心冲突。供应商希望智能体减少重复性工作并加快响应。安全负责人则需要证据证明,更快的行动不会扩大影响范围。
该联盟可以通过设计同时要求克制与速度的演练来作出贡献。一个优秀的智能体必须知道何时升级处置、何时收集更多证据,以及何时不应采取行动。
这使得评估比传统基准测试更困难。真实事件并不会带着完整标签或唯一正确的处置顺序出现。不同组织对业务中断的容忍程度也不同。
医院在模糊事件中可能优先保障服务连续性。金融机构在交易系统面临暴露风险时,可能会更积极地暂停访问。通过标准必须反映这些运营约束。
没有任何通用分数能够决定每一项部署决策。如果该联盟既提供可复用的方法,又允许组织自行定义风险阈值,它将最具价值。
联盟的供应商组合既是优势,也是冲突来源
成员覆盖了足够多的安全技术栈,可用于测试贴近现实的工作流;但更广泛的智能体采用也会为它们带来商业利益。
Corelight 可以为调查提供网络层面的证据。Dropzone AI 可以评估自动化调查工作流。SCYTHE 可以生成对抗性活动,以测试防御是否如预期响应。
SimSpace 可以复现接近生产环境的基础设施,并协调重复演练。Sondera 可以应用管理智能体行动的规则。这些层次结合起来,支持从攻击活动到遏制的端到端场景。
这种架构比让智能体回答静态问题集更具可信度。安全工作依赖时间、不断变化的证据、系统状态,以及人与软件之间的交互。
它也能揭示组件之间的分歧。调查智能体可能建议一种响应方式,而策略系统会阻止它。测试随后可以判断:是策略过于严格,还是该建议本身并不安全。
多智能体工作流又增加了一层复杂性。Dropzone AI CEO Edward Wu 表示,未来的安全运营中心将由多个智能体与人类分析师共同参与。多个智能体可以分担调查、威胁狩猎、情报和响应工作。
不过,协调也会带来新的失败路径。一个智能体可能向另一个传递不完整的信息。两个系统可能对严重程度作出不同解读。自动化响应器可能基于没有任何单一组件充分验证的结论采取行动。
共享测试能够暴露这些错误,但该联盟需要明确的归因规则。当演练失败时,买方应了解原因是否涉及数据、模型推理、权限、编排、人类审查,或场景本身。
商业利益的一致性带来了另一项挑战。五家创始供应商销售的技术,会随着企业部署 AI 和增加验证投入而变得更有价值。这并不否定它们的工作,但会限制其独立性主张。
供应商联盟可以发布有用的实践,同时仍偏向于与其成员产品相匹配的解决方案。它可能强调网络靶场、网络遥测和策略控制,因为这些正是其成员所代表的技术。
其他方法同样值得考虑。一些组织会让智能体仅提供建议。另一些组织会使用确定性自动化进行响应,同时将语言模型限制在调查和摘要工作中。
大型安全平台也提供集成式自动化、检测和响应系统。这些平台可以在自身环境中测试工作流,尽管它们在评判自家产品时也面临类似冲突。
因此,该联盟应在可行时发布场景定义和测量方法。外部研究人员和企业团队随后便可在不购买完整成员技术栈的情况下,复现至少部分测试。
独立参与将增强这项工作的可信度。MITRE、学术安全实验室、保险公司和企业从业者都可以挑战关于攻击真实性和可接受风险的假设。
该联盟的公开材料提到行业领袖、研究人员和技术创新者。其发布公告则列出了五家创始供应商合作伙伴。它究竟是开放论坛还是封闭的产品联盟,将通过成员构成和治理方式变得更加清晰。
围绕失败的透明度与成功同样重要。公开案例研究常描述准备程度有所提升,却不说明最先失败的是哪些智能体行为。经过脱敏处理的失败分类体系会为买方提供更具可操作性的证据。
一份有用的报告可以区分漏检、错误结论、过度行动、权限违规、升级处置不足和人工审批错误。它还应说明,在系统变更后,已纠正的失败会以多高频率再次出现。
这正是 Google News 的关注能够转化为有效审视的地方。该联盟作出了可衡量的承诺:智能体应在真实条件下得到验证。买方现在可以具体追问“得到验证”究竟意味着什么,以及由谁核实结果。
准备度数字尚未证明什么
报告中的信心差距支持进行更多测试,但并不能证明该联盟已经解决了智能体安全问题。
78% 的信心数据来自接受调查的安全负责人。调查回答可能反映预期、有限经验、内部投入,或对人类监督的信心。它们并非对自主智能体性能的直接测量。
30% 的准备度结果来自 SimSpace 的 Defensive Security Readiness 指标。SimSpace 将 DSR 描述为一项基于培训和测试表现的专有衡量指标。专有评分可能很有用,但如果没有更多方法论,外部人士无法对其进行全面评估。
这两个数据背后的人群同样需要谨慎对待。该联盟的公开页面将 30% 这一数字描述为,成熟度相近的团队在重复演练前的平均准备度得分。新闻稿则称,得分可能低至 30%。
平均分与观测到的最低分是不同的说法。现有公开材料没有提供足够细节来协调所有表述。最稳妥的结论是,SimSpace 在部分受测团队中观察到了较低的演练表现。
报告中的提升也需要语境。一项演练后提高三到五个百分点,可能反映出更好的人类协作、改进后的智能体配置、对场景更熟悉,或多种因素共同作用。
重复测试可以带来真正的准备度提升,也可能让参与者学会应对演练。强有力的评估应改变攻击路径,并保留团队此前未曾见过的场景。
仿真逼真度带来另一项不确定性。网络靶场可以复现网络架构、服务、身份和攻击行为,却无法复现每项组织约束或每个新颖的攻击者决策。
真实环境存在未记录的依赖关系和不完整的资产清单。它们还涉及员工、客户、法律义务和业务压力,而受控演练无法完全重现这些因素。
还存在一个更深层的测量问题:安全性与无能力可能看起来相似。一个没有采取有害行动的智能体,可能展现了良好判断,也可能根本未能理解情况。
评估人员应区分安全拒绝与无法完成任务。否则,一个能力较弱的智能体可能看似谨慎,却几乎没有带来运营价值。
相反的问题会影响激进型智能体。快速遏制可能提升响应指标,却造成不必要的业务中断。评估必须对过度行动施加惩罚,而非仅仅奖励速度。
持续测试同样需要运营纪律。团队需要保存模型、提示词、工具、权限、数据连接器和策略的版本记录。没有这些记录,通过结果就无法与最终进入生产环境的系统关联。
该联盟的方法应补充既有的对抗性测试实践。MITRE 的 ATLAS knowledge base 收录了涉及攻击 AI 赋能系统的战术与技术。这类分类体系能够帮助场景设计者覆盖不止常见网络事件。
不过,没有任何分类体系能消除未知威胁。AI 智能体将概率性推理与软件权限结合起来,其失败模式可能随上下文变化。通过一套测试不应授予永久信任,而应授权有限范围内的使用。
成熟的部署流程会逐步授予权限。首先是只读调查。在积累证据后,再执行低影响行动。高影响遏制仍应适用更严格的阈值和人工审查。
回滚必须成为每个阶段的一部分。团队应知道如何撤销凭据、禁用集成、恢复受影响系统,以及保留行动日志。没有经过测试的停用流程的智能体,并未做好投入运营的准备。
该联盟正确地将注意力集中在信心与证据之间的差异上。现在,它自身的主张也必须符合相同标准。
Google News 读者接下来应关注什么
三个信号将表明,该联盟会成为可信的评估工作,还是仍停留在供应商教育项目。
第一个信号是公开的测试方法论。买方应关注明确界定的场景、风险级别、评分标准、智能体版本、权限边界和失败类别。
方法论不必披露敏感的攻击细节,但确实需要提供足够的结构,让企业或独立实验室理解通过结果代表什么。
公开发布将强化该联盟的核心论点。如果测试仍是私有且定制化的,准备度主张在不同组织之间仍将难以比较。
第二个信号是来自创始供应商之外部署案例的证据。案例研究应说明运营环境、智能体职责、演练频率、初始失败、所作改动,以及在未见过场景中的表现。
如果读者无法区分智能体改进与更好的人类培训,汇总的成功主张几乎没有帮助。最有力的证据将分别衡量两者,然后审视它们之间的互动。
独立参与将进一步提升信心。没有直接产品销售利益的评估者可以审查场景设计、评分和结论。
第三个信号是该联盟如何应对不断提高的自主性。当前公开评论承认,辅助型智能体如今主导生产环境。更艰难的考验始于智能体获得许可,可在没有密切监控的情况下执行响应行动。
关注涉及账户暂停、端点隔离、防火墙变更、凭据轮换或自动修复的演练。每项行动都应具备明确的前置条件、限制、日志记录和恢复程序。
该联盟还应报告,智能体在对抗性操纵期间是否保持在其被分配的范围内。正确的最终结果并不能为未经授权的中间行动开脱。
这些信号的重要性不止于安全运营。任何会更改记录、发送消息、修改代码或控制基础设施的企业级 agent,都会带来类似的验证难题。
知识工作者同样需要可靠记录:agent 看到了什么、又为何采取行动。保留可搜索的证据、决策和事件记录,有助于开展审查,尤其是在多人调查同一结果时。
这一过程不应取代技术遥测。它提供的是组织记忆,用于比较演练、追踪反复出现的失败,并解释部署决策。
Google News 可以为发布带来关注,但长期信誉将取决于公开的证据。该联盟接下来的活动和章程更新,应会揭示成员是否正在建立一套可复现的方法体系。
安全负责人不需要又一个关于 AI 将改善防御的泛泛承诺。他们需要与权限挂钩的部署门槛、可衡量的性能,以及可接受的失败率。
AI Proving Grounds Consortium 选对了问题:一个 agent 能否被信任去采取行动?答案应始终是有条件的、具体的,并且可逆。
在授予 agent 下一项权限之前,应询问:它通过了什么未曾预见的场景,测试了哪些行动边界,以及谁能够将其停止。记录版本、证据、例外情况和回滚流程。随后,在每一次实质性变更后重复这项演练。关注未来的 Google News 报道,寻找公开的方法、独立评估和真实部署结果,而不只是又一个信心指标。若出现这些信号,该联盟就将推动 agent 安全迈向可衡量的运营实践。若没有,企业仍应将具有重大后果的行动限制在狭窄权限之内,并由知情的人类进行审查。



