前沿 AI 让政府陷入网络安全两难
Google News 推送了一则 GovTech 警示,其核心围绕一项紧迫矛盾:前沿 AI 能增强政府网络安全,同时也会让攻击更快、更廉价。
这一变化之所以重要,是因为先进模型正超越起草钓鱼邮件或解释恶意代码的阶段。安全研究人员报告称,较新的系统能够发现漏洞、制定利用路径,并协调更长链条的技术操作。
这些能力也为防御方带来了新选择。政府机构可以利用模型审查代码、确定漏洞优先级、调查告警,并在对手利用相同弱点之前测试防护措施。
因此,核心竞争并非政府与 AI 的对抗,而是 AI 赋能的防御与 AI 赋能的进攻之间的较量,双方都在调用相似的能力。
这场较量有利于那些能够将模型输出与准确的资产记录、快速修复、受控访问及经验丰富的人类判断相结合的组织。它会惩罚那些把 AI 助手当作这些基础能力替代品的机构。
近期警告几乎没有给公共部门领导者留下等待的理由。纽约监管机构已敦促受监管组织,为可能放大漏洞发现速度与规模的模型做好准备。英国网络安全主管部门同样表示,AI 正在降低实施复杂攻击的门槛。
与此同时,政府试验也表明,放弃这项技术将是错误之举。由 Google 支持的新加坡沙盒在公共服务场景中测试了智能体,在带来实用自动化的同时,也引发了关于隐私、监督和网络安全的新担忧。
前沿 AI 正同时成为力量倍增器和治理考验。能够从中受益的机构,将是那些可以使用它、却不放弃对数据、工具或重大决策控制权的机构。
Google News 预示网络安全时钟正在加速
眼下的变化并非出现了一类全新的攻击,而是从发现弱点到加以利用之间的时间正在迅速缩短。
传统漏洞管理假定,发现、披露、优先级排序、补丁开发、测试和部署构成一个可控的流程。前沿模型能够压缩该流程中的多个环节。
模型可以检查代码,将软件行为与已知弱点模式进行对照,提出测试用例,并协助开发可用的漏洞利用程序。随后,操作者可在大量目标上重复这一过程。
GovTech 报道的国会证词中,前 CISA 顾问 Jack Cable 描述了这种失衡。他警告称,发现缺陷的能力已超过组织修复缺陷的能力。
由此产生的补丁缺口改变了政府机构解读漏洞积压问题的方式。延迟修复不再只意味着一段静态暴露期。
它可能成为自动化发现的邀请。一处不起眼的缺陷可能会受到关注,因为模型能够在大型代码库中搜索类似错误。
这种压力在州和地方政府尤为严重。政府机构往往运行着遗留应用、专用运营技术,以及更新节奏不一的供应商托管平台。
它们还依赖共享服务。一个身份提供商、案件管理平台或支付系统,可能连接多个部门及外部合作伙伴。
前沿 AI 让攻击者更容易理解这些关联关系。它可以组织侦察、分析公开文档,并在初次尝试失败后调整技术步骤。
这并不意味着模型可以可靠地攻破任何选定目标。攻击成功仍取决于访问权限、系统状况、操作者技能以及是否存在可被利用的弱点。
不过,政府机构不能把准备工作建立在前沿能力仍将稀缺的希望之上。相关准备窗口会在广泛访问到来之前开启。
纽约州金融服务部在 2026 年 5 月发布的一份咨询文件直接指出了这一点。该文件称,某些模型尚未被广泛获取,但警告访问范围可能很快扩大。
其建议的基础措施并不陌生:及时识别和修复漏洞、实施访问控制、开展监控以及进行事件响应。新意在于,这些控制措施被赋予了更强的紧迫性。
英国国家网络安全中心得出了类似结论。其前沿 AI 指引指出,即便 AI 正在改变攻防能力,扎实的网络安全基础仍是最有效的防御。
这一评估应当为夸张说法降温。前沿 AI 并不会让防火墙、身份控制、备份、软件资产清单或补丁管理变得无关紧要。
它会让这些领域的失误更容易被发现和利用。这项技术改变攻击者的行动速度,远多于改变一次入侵的基本结构。
因此,看到 GovTech 标题的 Google News 读者,应将其理解为一项准备期限,而非即时网络崩溃的预测。政府机构仍然掌控着许多决定 AI 辅助攻击能否成功的条件。
第一步是识别这些条件在哪些地方仍然薄弱。更困难的问题是,政府能否足够快地改善它们。
公共机构承受来自两方面的压力
政府技术领导者必须加快防御,同时防止自身部署的 AI 形成新的攻击路径。
第一重压力来自外部对手。更快的侦察和漏洞发现可能增加抵达机构网络的可信攻击数量。
第二重压力来自政府内部。员工和部门正在采用助手、编码工具、自动化工作流和智能体,而许多组织尚未完成全面盘点。
AI 智能体是一种将模型推理与可读取数据或执行操作的工具结合起来的系统。这种工具访问能力让智能体比聊天机器人更有用。
但它也让失败的后果更为严重。向聊天机器人展示一封误导性邮件只会产生文本,而被操纵的智能体可能会调取记录、修改工单,或触发另一项服务。
因此,安全团队必须管理两个相互关联的攻击面:既要保护现有基础设施免受 AI 辅助对手的攻击,也要保护员工自身使用的模型。
Frontier Model Forum 的智能体安全实践强调了这一区别。智能体系统会在更长的任务序列中与工具、外部服务、存储上下文和其他智能体交互。
每一项连接都会扩大不可信指令可能进入的地点数量。例如,提示注入会将指令隐藏在模型处理的内容中。
恶意文档可能指示智能体忽略自身任务并泄露信息。被入侵的网站则可能试图将自动化研究工作流重定向。
传统输入过滤无法解决每一种变体。政府机构需要在模型之外实施约束,尤其是在操作涉及敏感数据或生产系统时。
权限应反映智能体必须完成的最小任务范围。用于汇总公开会议文件的工具不需要访问工资记录。
建议代码变更的助手不需要部署权限。案件管理智能体不应在没有明确审查机制的情况下批准福利或结案调查。
这正是许多早期试点遭遇组织阻力的地方。更广泛的权限会让演示看起来更强大,但也会削弱隔离能力。
受限权限会降低即时便利性,却能保留停止、检查和撤销自动化操作的能力。
公共机构还面临额外的问责要求。它们必须解释决策、保留记录、保护公民权利,并提供申诉渠道。
模型流畅的解释并不能证明其底层操作合法或准确。日志必须记录与重要操作相关的数据、政策、工具调用和人工批准。
采购带来了另一重压力。采购方需要了解模型更新、数据保留、分包商、事件披露、评估结果和服务终止等问题。
供应商的安全摘要不能替代合同条款。政府机构需要可执行的通知期限、审计权,以及检索或删除政府数据的方法。
这种压力既是眼前的,也是长期的。眼前工作包括访问审查、软件资产清单、补丁、备份,以及对未经批准工具的限制。
长期工作包括安全的智能体架构、员工培训、共享评估能力,以及能够随模型变化而调整的采购标准。
被迫作出的回应并不只是增加 AI 投入,而是围绕更快的技术周期重建运营纪律。
最佳防御同样要使用前沿 AI
当攻击者能够自动化发现、测试和适应时,政府机构无法仅依靠人工流程维持防御优势。
前沿模型可以帮助防御方以许多公共组织无法仅靠人工配置的规模检查代码和配置。它们还可以将技术发现转化为按优先级排列的修复任务。
一个有效的防御工作流始于明确的目标。模型可以审查一个应用程序、一个软件组件,或一个受控测试环境。
它应只接收完成该任务所需的数据。未经批准的保护措施,不应将敏感源代码或系统信息输入面向消费者的服务。
随后,模型可以提出弱点和测试用例。安全工具必须验证这些发现,因为模型生成的漏洞报告可能包含错误。
经验证的发现应进入现有修复流程。资产所有权、服务关键性、可利用性和可用的补偿性控制措施仍决定优先级。
这种方法将 AI 视为安全计划中的加速器,而不是让模型负责该计划。
同样的原则适用于安全运营。模型可以汇总相关告警、解释不熟悉的命令,并根据已批准的证据整理时间线。
分析人员在采取破坏性行动前应核实该时间线。隔离、账户暂停、数据删除和服务关闭需要受控授权。
Google News 对前沿 AI 的报道可能让这项技术看起来像是一种同时到来的单一工具。实际上,政府机构将会在编码、云、身份、终端和生产力产品中遇到嵌入式的不同模型。
这种分布使集中治理变得重要。安全团队需要登记获批准系统及其数据访问、连接工具、负责人和评估日期。
它们还需要统一的测试方法。一个部门不应与另一个处理相似数据的部门对可接受的模型行为采用不同定义。
红队测试可以在部署前暴露可能的失败模式。在此语境中,红队测试是指旨在让系统违反其预期控制措施的结构化对抗测试。
测试应包括恶意附件、欺骗性网站、相互冲突的指令、过量请求,以及试图在系统之间转移数据的行为。结果应同时记录成功的攻击和有效的控制措施。
新加坡提供了一个具有启发性的公共部门案例。2025年8月,Google 与新加坡三个政府机构启动了 AI Agents Sandbox,以在实际条件下研究计算机使用代理。
这些机构后来报告称,测试场景涉及质量保证、AI 安全和社会援助。其沙盒研究结果既描述了潜在收益,也指出了监督、隐私、治理和网络安全方面的担忧。
这项工作的价值不在于宣称代理已经安全,而在于积累了有关它们在受限环境中如何运作的证据。
其他政府可以遵循这一模式,而不必照搬每一种应用场景。应从可逆任务、合成或低敏感度数据、明确的成功标准以及独立安全审查开始。
例如,防御性编程试点可以衡量模型识别真实漏洞的频率,也可以衡量误报和不安全修复建议的数量。
事件分诊试点可以比较在有无模型协助时分析人员的速度和准确性。它还应测试恶意证据是否会扭曲模型的结论。
这些衡量指标至关重要,因为单纯的生产力主张会掩盖运营风险。一款能够节省调查时间、却增加错误指控的工具,尚不适合用于会产生重大影响的场景。
战略优势来自一个反馈闭环。防御方使用 AI 寻找弱点、验证结果、修复系统,并将经验反馈到未来的测试中。
攻击者也会建立自己的闭环。政府的优势必须来自可信访问、更优质的遥测数据、协同响应,以及改进其所运营系统的权限。
控制措施必须位于模型之外
最安全的前沿 AI 部署假定提示词可能失效,并将关键控制置于常规安全基础设施中。
提示词有助于描述任务,但并非可靠的安全边界,因为模型是在解释语言,而不是执行正式授权。
系统提示词或许会要求代理绝不泄露税务记录,但这一指令无法替代身份核验或数据访问策略。
授权应在工具层发生。每一次搜索、检索、更新或对外通信,都应经过能够理解用户身份及其获准操作的控制措施。
政府机构还应将读取与写入分离。许多助手需要获准查看信息,但不应有权修改信息源。
在必须写入的情况下,变更应进入审核队列。高影响操作应要求第二人审批,或由独立的策略服务进行审查。
密钥也需要类似的隔离。API 密钥、管理员凭据和签名证书绝不应出现在提示词或通用模型上下文中。
安全代理服务可以为一项获授权任务提供短期凭据。它应记录凭据访问了什么,并在任务结束时撤销凭据。
网络访问应保持最小化。与获批准数据库协作的代理不需要不受限制地访问公共互联网。
出站限制能够减少数据泄露,并限制攻击者将代理用作跳板的能力。域名白名单和内容扫描可提供进一步保护。
记忆功能需要谨慎对待。持久化模型记忆会跨会话存储信息,这能创造价值,但也可能保留被投毒的指令或敏感材料。
政府机构需要制定规则,规定哪些内容可以进入记忆、保留多久、谁可以查看,以及如何删除。记忆应继承其源数据的保留要求。
日志记录必须超越最终答案。安全审查人员需要了解模型版本、工具调用、访问决策、检索记录、输出结果以及人工批准情况。
这些日志应支持重建过程,同时避免暴露超出必要范围的敏感数据。对审计轨迹本身的访问也必须受到控制。
模型更新带来另一项挑战。供应商可以改变行为,而无需更改政府机构周边的应用程序。
团队应在模型发生实质性变化后重新测试高风险工作流。采购协议应要求供应商在更新可能影响安全性或性能时发出通知。
NIST 的AI 风险框架提供了一个有用的治理结构,涵盖治理、映射、衡量和管理风险。政府机构可以将这些职能与现有网络安全计划连接起来。
治理定义责任归属和可接受的使用方式。映射识别受影响的人群、数据、系统以及潜在危害。
衡量是在现实条件下测试性能和控制措施。管理则决定是部署、限制、重新设计还是停止一个系统。
该框架有助于避免一个常见错误:将 AI 风险视为一份罕见模型故障清单。大多数真实部署都将模型风险与身份管理、数据管理、软件安全和供应商监督等熟悉弱点结合在一起。
良好的控制措施应覆盖这一组合系统。模型可能提出不安全建议,但授权策略决定该建议是否会变成实际行动。
人工审查也是一种控制措施,但必须经过谨慎设计。疲惫的员工批准数百项自动化决策,几乎无法构成有意义的监督。
审查人员需要拥有足够的背景信息、时间和权限,才能拒绝模型建议。界面应突出不确定性和相互矛盾的证据,而不是鼓励一键批准。
恢复规划完善了整套控制措施。政府机构应知道如何禁用代理、撤销凭据、恢复被修改的数据,并维持关键服务。
一个无法被安全停止的系统,尚不适合承担关键运营任务。即使其平均表现看上去令人印象深刻,这一点仍然成立。
前沿 AI 警告并不能证明什么
现有证据支持紧急准备,但并未证明自主 AI 攻击能够击败每一家管理完善的组织。
安全报告常常将实验室能力、受控演示和实际运营威胁压缩为同一种叙事。这些类别应保持区分。
模型可能在测试环境中发现漏洞。但要在受保护的生产系统中利用该弱点,可能还需要凭据、持久化能力、目标知识和运营判断。
一些演示会为模型提供异常清晰的信息。真实网络则包含不完整的资产清单、特殊配置、监控控制措施和会使攻击复杂化的障碍。
前沿系统也会犯错。它们可能虚构功能、误解代码、重复无效步骤,或提出最终失败的利用方案。
这些弱点会降低可靠性,但不会消除威胁。攻击者可以进行多次尝试,将模型与传统工具结合,并保留成功的结果。
防御方应避免两种相反的错误。第一种是认为每一项令人警觉的能力主张都预示着立即发生的运营性失陷。
第二种是在改进显而易见的弱点前等待完美证据。存在争议的预测,并不能为不受支持的软件、过度权限或未经测试的恢复计划开脱。
有关特定未发布系统的主张尤其值得谨慎对待。GovTech 曾讨论 Anthropic 报道中的 Claude Mythos Preview 及其据称识别严重软件缺陷的能力。
这篇Mythos 分析将该模型视为对公共机构的警示。然而,外部研究人员很难全面评估访问受限系统所报告的能力。
组织不应围绕某一个产品名称制定预算。持久的问题是一种跨越多家开发商和安全供应商的能力趋势。
独立评估仍然不可或缺。评估人员需要受控地访问模型、具有代表性的环境、处理危险发现的明确规则,以及发布重要局限性的自由。
测试不应只衡量任务完成情况,还应考察误报、不安全建议、抗操纵能力、数据泄露和操作员工作负担。
外部评估同样会带来安全问题。模型权重、系统细节和新发现的漏洞都可能成为有价值的攻击目标。
这种张力解释了为什么需要安全的评估安排。如果研究人员得不到有意义的访问,监督就会失效;如果敏感资产得不到保护,安全就会失效。
规模较小的政府面临相关的不平等。大型机构和科技公司可以建立地方部门难以轻易复制的评估团队。
共享测试服务、协调采购和公私信息交流可以缩小这一差距。区域安全运营中心可以在多个辖区之间分配专业能力。
Frontier Model Forum 曾指出,信息共享对于应对 AI 赋能的威胁十分重要。此类协调必须产出可用的指标、修复指导和及时预警。
它不能依赖供应商正在监控问题这一类含糊保证。政府机构需要明确的联系人、升级路径和事件报告义务。
Google News 既可能放大冷静的指导意见,也可能放大夸大的说法。读者应审视一篇报道描述的是已观察到的行为、供应商声明、专家预测,还是独立复现的结果。
正确的立场既不是恐慌,也不是自满,而是根据合理影响程度做好准备,并持续测试这些准备背后的假设。
政府领导者接下来应关注的三个信号
下一阶段将由关于访问、防御表现和可执行治理的证据来定义,而不是又一次戏剧性的模型演示。
第一个信号是具备先进网络安全能力的模型获得更广泛的访问权限。当前警告往往涉及仍处于受限、预览阶段,或仅通过精选合作关系提供的系统。
更广泛的访问将强化这样一种判断:攻击准备对技能较低的操作者而言正变得更加容易。它也会让更多独立研究人员能够测试供应商的主张。
政府安全团队应跟踪访问条件、使用保障措施、身份要求,以及有效控制措施是否能经受蓄意滥用的考验。
他们不应将单一发布日期视为准备工作的最后期限。副本、竞争对手、专用模型和泄露技术,都可能通过不同路径传播能力。
如果更广泛的访问到来,却没有相应增加已验证事件,最严重的短期预测将会减弱。政府机构仍应保留已经推进的改进措施。
第二个信号是 AI 辅助防御的可衡量表现。试点项目应公布结果,比较分析人员和自动化系统在现实任务中的表现。
有用的指标包括有效漏洞发现、修复时间、误报率、事件分诊准确率,以及被阻止的不安全操作数量。
还应在人员配置和基础设施不同的部门之间评估表现。资金充足实验室的结果未必能迁移到县级办公室。
更快速、更准确防御的证据将支持这样的论点:政府应在受控条件下使用前沿系统。高错误率则将证明应采取更有限的部署。
最有价值的报告应当包括失败案例。能够识别代理在哪些环节失效的试点,比只为展示成功而设计的演示更具指导意义。
第三个信号,是从自愿性指导转向可执行的强制要求。监管机构和立法者正日益关注模型评估、安全计划、事件披露以及第三方审查。
加州针对前沿 AI 的透明度要求和新出现的行业指导,说明了这一趋势。即使类似措施直接适用于模型开发者,也可能影响采购决策。
机构应关注规则是否界定了有实际意义的评估访问权限和报告门槛。只产出文件、却没有运行测试的要求,能提供的保护将十分有限。
它们也应审查供应商合同。采购机制可以在立法覆盖所有司法辖区之前,确立审计权、通知义务、数据控制以及终止服务支持。
明确的要求将强化本文的核心判断。前沿 AI 的竞争将由那些能够将能力与严格控制相结合的机构决定。
薄弱或零散的要求,会把更多责任转移给各个机构。届时,规模较小的组织仍将依赖供应商提供自己无法独立验证的安全证据。
这三个信号相互关联。更广泛的访问提升了威胁;可量化的防御表现显示政府能否作出响应;治理则决定这种响应能否保持问责。
公共部门领导者不必预测究竟哪一种模型会改变网络行动。他们需要的是:当模型能力、供应商和攻击技术发生变化时,仍能持续有效运作的系统。
这意味着现在就要减少脆弱暴露面。为面向互联网的系统打补丁,移除不必要的权限,测试备份,并梳理每一项连接到政府数据的 AI 工具。
这也意味着,应选择边界清晰、能够安全收集证据的有限防御用途。代码审查、受控漏洞测试和分析师支持,比自主访问生产环境具有更明确的界限。
Google News 让人们注意到一个真实的两难困境。忽视前沿 AI 会让防御者行动更慢,而草率采用它则会为公共系统打开新的进入路径。
因此,实际问题并不在于某个机构是支持 AI 还是反对 AI,而在于领导者能否说明每项部署的用途、权限、证据、负责人和停用程序。
如果不能,系统就尚未准备就绪。如果能够做到,前沿 AI 就会成为政府可以测试、约束和使用的技术,而不会把自动化误认为信任。



