top of page

Meerah Rajavel 警告:开放 AI 模型可能超越网络安全护栏

9月2日
讀畢需時 15 分鐘

Meerah Rajavel 发出了严厉警告:与当今受控的前沿系统相比,廉价的开放 AI 模型才是最值得警惕的新兴网络安全威胁。Palo Alto Networks 首席信息官在一场于 8 月 30 日、经由 Google News 发现的采访中提出了这一观点。

她担忧的是能力差距正在缩小。Rajavel 表示,前沿系统中出现的先进能力,可能在四到六个月内进入公开可用的模型。届时,攻击者只需具备计算资源和技术技能,无须持续访问受到监控的商业服务。

这一区别改变了安全讨论的焦点。Google、OpenAI 和 Anthropic 等封闭服务提供商可以监控活动、封禁用户、更新安全措施并撤销访问权限。一旦可下载的模型权重扩散到私有系统中,这些控制手段大多将不复存在。

这一警告并不证明开放模型目前造成的网络攻击已经多于封闭模型。它是对访问门槛、经济因素和控制能力的预测。核心冲突在于,开放开发的益处与可执行安全护栏的价值之间如何平衡。

Google News 报道聚焦四到六个月的窗口期

Rajavel 的核心观点是:当危险 AI 能力的成本下降、分发范围扩大时,它们将更难受到控制。

在原始的 Rajavel 采访中,她将前沿模型与攻击者可自行运行的廉价系统区分开来。前沿服务需要付费,通常也会对高风险行为施加限制。

这一经济门槛无法阻止资金雄厚的犯罪分子或国家支持的团体,但可能限制能力较弱的行为者进行试验。托管服务也让提供商有机会识别可疑提示、终止账户并保留证据。

Rajavel 认为,当相近能力进入可下载模型时,平衡就会改变。攻击者可以私下运行模型、修改其行为、自动化重复尝试,并避开提供商的滥用监控系统。

她提出的四到六个月估计,是这场采访中影响最深远的说法。它描述了从前沿能力出现到更廉价替代方案被广泛获取之间可能存在的滞后期。

这一估计不应被视为普遍适用的技术规律。不同模型在训练质量、工具访问权限、硬件需求和网络攻击表现方面存在差异。一些开放系统仍会远远落后于最强大的托管模型。

然而,攻击者并不总是需要最强的可用智能。模型只需改善侦察、网络钓鱼、代码修改、漏洞研究或凭证窃取的经济效率即可。

网络行动也由许多较小的任务组成。即使一个模型无法自主攻破经过严密加固的网络,它仍可能起草信息、检查代码、翻译诱饵内容或调整脚本。

这就形成了规模问题。当攻击者能够在没有逐请求监督的情况下运行数千个私有会话时,能力的小幅提升也会带来重要影响。

相关术语需要谨慎使用。许多被描述为开源 AI 的系统,更准确地说应称为开放权重模型。它们的训练参数可以下载,但训练数据、开发流程或完整源材料可能仍不可获得。

这种区别对许可和透明度很重要。对于 Rajavel 的即时安全论点而言,它的重要性较低,后者关注的是复制、修改和私下运行一个强大系统的能力。

她的评论正值 AI 智能体获得更大自主权之际。智能体系统是指让模型能够规划任务、使用工具并跨多个步骤采取行动的软件。

早期聊天机器人主要为人类生成可供审阅的文本。如今,智能体可以浏览文件、编写代码、调用外部服务,并与企业系统交互。

这些权限为合法自动化和滥用都创造了更多机会,也使传统提示过滤仅仅成为安全问题的一部分。

Rajavel 表示,公司必须审视 AI 系统可能从其预期边界中逸出的地方。这包括模型、其工具、连接的数据、用户权限、运行环境和软件依赖项。

Google News 的标题概括了这一颇具挑衅性的结论,但其背后的论点更为广泛。廉价的攻击能力是一种威胁,而不安全的企业采用则构成另一种威胁。

下载的模型可以帮助攻击者。公司内部缺乏治理的模型同样可能泄露信息、执行不安全指令,或继承过度的访问权限。

因此,Rajavel 的警告连接了两条战线。组织既要为能力更强的对手做好准备,也要保护自身正在加速使用的 AI。

廉价 AI 改变网络攻击的经济模式

最重要的变化并非 AI 创造了全新的犯罪形式,而是它降低了大规模实施常见攻击所需的人力。

网络犯罪始终取决于经济因素。攻击者会将一次行动的预期回报与工具、基础设施、访问权限和专业劳动力的成本进行比较。

AI 可以降低其中多项成本。它能够帮助经验较少的操作者理解陌生代码、总结技术文档,并定制社会工程信息。

私有模型还支持反复试验。攻击者可以移除行为限制、微调系统,并将其整合到自动化工作流中。

Rajavel 表示,Palo Alto Networks 服务超过 70,000 名客户,并拦截了通过其网络传播的大约 300 亿次攻击。这些数字描述的是该公司的可见范围,而非全球威胁态势的全部情况。

她还表示,该公司在上一自然年发现了近 2.5 亿次此前未见的攻击。根据她的采访说法,这一数字是前一年的四倍。

此前未见的事件并不自动意味着它是 AI 生成的攻击。新的检测结果增加,可能是由于攻击者行为变化、传感器改进、客户覆盖范围扩大或分类方法调整。

因此,Rajavel 的数据说明的是防御规模,而非证明因果关系。它们显示了为何即便攻击者生产力仅有小幅提升,也可能给安全团队带来沉重负担。

当 AI 超越文本生成时,威胁会变得更加严重。具备工具访问能力的模型可以检查系统、测试假设、修改命令,并追求多步骤目标。

Anthropic 的 2025 年网络安全评估发现,模型在漏洞识别和复杂攻击链方面取得了明显进展。接受评估的模型仍难以应对长期计划和意外障碍。

这种组合很关键。当前的限制意味着,不能简单宣称自主 AI 已经取代专业攻击者。与此同时,性能提升能够让专家更高效,也让能力较弱的行为者更具攻击能力。

商业提供商可以针对已观察到的滥用行为作出回应。他们可以更新分类器、限制工具、减少访问权限,或调查与可疑活动有关的账户。

开放权重改变了这种关系。提供商可以发布改进的安全指导,但无法远程更新每一份已下载的副本。

这种持久性也支持合法用户。研究人员可以复现结果,企业可以将敏感信息保留在本地基础设施中,开发者也可以针对专业任务调整模型。

这就是为什么冲突并非简单地存在于负责任的公司与不负责任的开放开发者之间。开放性带来了真实的经济、科学和安全收益。

防御者利用易于获取的模型检查恶意软件、搜索日志、分类警报和研究攻击。规模较小的组织可以构建防护工具,而无需依赖单一供应商。

不同任务之间的经济不对称性也不同。防御者必须持续保护众多系统,而攻击者可能只需要一条成功路径。

AI 可以帮助防御者处理海量信号,也可以帮助攻击者寻找那些防御措施未能消除的单一失误。

Rajavel 自己的企业数据展示了防御的一面。她表示,Palo Alto Networks 将信息技术运营自动化率从数年前的 12% 提高到 83%。

她还称,IT 运营成本在两年内下降了近 72%。通过 AI 和流程再设计,差旅和费用流程实现了 90% 的自动化。

这些是公司自行报告的结果,而非经过独立审计的因果发现。但它们仍展示了促使企业快速部署 AI 的生产力收益。

这种紧张关系由此直接产生。使防御自动化具有吸引力的同一套经济因素,也降低了攻击自动化的成本。

私有开放模型无须在每项基准测试中都超越最强的商业模型。它只需针对某一特定攻击工作流具备足够的能力、可负担性和适应性。

因此,安全团队不应只将模型排名作为威胁信号。部署自由度、工具集成和运行成本与原始基准性能同样重要。

开放模型以适应性换取集中控制

开放权重 AI 分散了创新与防御访问能力,但也移除了托管服务所保留的中央执行控制点。

封闭模型提供商控制着应用程序编程接口,也就是客户提交请求时使用的托管连接。这种控制支持身份验证、速率限制、日志记录和滥用检测。

提供商还可以在发布后修改服务。他们可以修补弱点、强化分类器、限制功能或移除模型。

这些措施并不完美。攻击者可以创建账户、隐藏意图、分散工作、越狱安全措施或窃取访问凭证。

封闭系统同样会集中风险。提供商的一次安全失误可能影响众多客户,而不透明的训练和审核实践也会限制外部审查。

开放权重系统颠倒了若干属性。用户获得访问权和定制能力,而原始开发者则失去对下游副本的持续控制。

Anthropic 的 2026 年开放权重立场概括了这种权衡。该公司支持不具备危险能力的开放模型,并反对一刀切的禁令。

其公开担忧始于模型达到危险的网络或生物能力之时。一旦这些权重发布,副本便可私下运行,安全措施也可能被移除。

这一立场支持了 Rajavel 论点的一部分,但并不能证明开放模型在所有情况下都是最大的威胁。Anthropic 在受控模型访问领域拥有商业利益。

开放模型开发者和倡导者则提出了不同的观点。外部研究人员可以检查行为、复现测试、开发缓解措施,并将系统调整用于防御用途。

本地部署也支持数据控制。医院、律师事务所或安全团队可能更愿意在自己管理的基础设施内处理敏感材料。

开放系统减少了对提供商政策和可用性的依赖。它们可以扩大高校、初创企业、公共机构以及商业服务覆盖不足地区的访问机会。

这种可及性带来的安全价值是真实存在的。防御专业知识和工具的分布并不均衡,进攻能力也是如此。

可下载的模型可以帮助规模较小的安全团队分析可疑脚本,而无需将专有数据发送给外部提供商。它也能支持可重复开展的研究。

问题在于,收益与危害共享同一条分发渠道。公开发布无法可靠地区分防御者与攻击者。

这正是 Google News 报道背后的核心权衡。集中控制使干预成为可能,而分布式访问则支持适应与创新。

没有任何单一标签能解决这个问题。“开放”并不意味着安全,“封闭”也不意味着更安全。

更有价值的问题是:当某项特定能力能够在无监控状态下运行时,它是否会变得显著更危险。网络安全领域存在若干合理的案例。

其中之一是可规模化的漏洞发现。能够检查大型代码库的模型可以帮助防御者发现缺陷,但攻击者也能将同样的能力用于暴露在外的软件。

另一个是漏洞利用开发。即使模型无法独立完成复杂的漏洞利用,它们也可以解释崩溃原因、生成变体并协助调试。

第三个是攻击活动自动化。AI 可以在众多目标之间协调侦察、内容生成、代码修改和运营决策。

模型行为内部的安全措施可以减少随意滥用。可下载的权重则让意志坚定的操作者能够修改或绕过这些措施。

这并不意味着每一次开放发布都具有同等风险。模型能力、硬件要求、微调难度和工具集成方式,都会改变实际威胁程度。

一个提升文档分类能力的小型模型,与一个能够可靠发现并利用未知漏洞的系统,带来的风险截然不同。

仅基于开放性制定政策会忽视这些差异。基于能力的评估提供了更有针对性的路径。

美国国家标准与技术研究院将双重用途模型定义为,其潜在能力之一是支持强大的进攻性网络行动。无论是否尝试部署安全防护措施,该定义都适用。

这一框架将关注点从模型许可证转向它实际能够做什么。它也承认,封闭式防护措施可能失效或被规避。

NIST 的方法并未消除分发问题。当两个模型能力相当时,一个持续受到监控,另一个通过私下复制广泛传播,两者可能呈现不同的运营风险。

最有力的政策分析必须同时考虑这两个维度。能力决定潜在危害,而分发决定提供商或主管机构进行干预的难易程度。

风险也存在于 AI 供应链内部

如果只关注攻击者如何使用开放模型,就会忽视企业将未经验证的模型、库和代理导入受信任环境所带来的直接风险。

Rajavel 多次强调,AI 安全不能等到部署后再添加。企业必须同时保护模型、数据、应用、基础设施和运行时环境。

运行时安全意味着在 AI 系统运行期间观察并控制其行为。这包括其提示词、输出、工具调用、文件、身份和网络连接。

随着代理式 AI 的发展,这一需求愈发突出。仅能起草文本的代理影响范围有限;能够执行代码或查询客户记录的代理,则承担着更大的运营风险。

企业通常会组合多个模型,而不是使用单一的大型系统。通用模型可能负责规划任务,而较小的模型则解析文档、分类图像或提取结构化信息。

这种模块化设计提升了速度并降低了成本,但也带来了传统软件清单可能无法捕捉的依赖关系。

从公共中心下载的模型并不只是内容。其格式、元数据、加载代码、分词器、运行时环境和配套库,都可能引入漏洞。

Palo Alto Networks 研究人员披露了与 NVIDIA、Salesforce 和 Apple 研究人员相关的开放 AI 与机器学习项目中的库漏洞。存在漏洞的版本可能通过精心构造的模型元数据执行恶意代码。

受影响的项目包括 NeMo、Uni2TS 和 FlexTok。研究人员表示,存在漏洞的加载器在处理被修改的模型文件时可能执行任意命令。

这些发现并不表明开放模型天生具有恶意性。它们表明,AI 工件参与的是一条具有常见依赖和代码执行风险的软件供应链。

OWASP 的供应链指南将模型中心、软件包、数据平台和机器学习运营软件列为可能的攻击面。

该指南建议验证软件包真实性、监控版本并维护依赖关系。这些做法听起来很常规,但 AI 开发可能削弱其执行效果。

团队可能在实验期间下载模型,并在未经完整审查的情况下将其推进到生产环境。以 Notebook 为主导的工作方式可能模糊研究与已部署软件之间的界限。

模型名称也会制造虚假的信任感。受欢迎程度、熟悉的上传者或较高的下载量,都不能替代来源与完整性检查。

组织应了解模型由谁发布、所使用的确切版本,以及工件是否发生过变更。它还应追踪许可证和已知漏洞。

安全团队需要在加载模型文件前对其进行扫描。他们应优先采用更安全的序列化格式,并隔离任何处理不受信任工件的进程。

最小权限原则仍然至关重要。代理应只获得完成其指定任务所需的数据和工具,而非为了便利而授予广泛访问权限。

网络限制同样重要。遭到入侵的模型工作流不应能够自由联系外部系统,或在内部基础设施中横向移动。

公司应记录工具调用和敏感数据访问。日志需要具备足够的上下文,以便重建代理尝试了什么操作,以及由哪个身份授权。

在人类影响较大的边界上,应继续保留人工审批。资金转账、生产环境变更、权限提升和外部通信,需要比文档摘要更强的控制措施。

持怀疑态度的一点很重要。Palo Alto Networks 销售安全产品,因此其高管在强调不断扩大的攻击面时存在商业动机。

这种动机并不会否定 Rajavel 的技术论点。它意味着读者应将已验证的漏洞和经测量的行为,与有关“最大”威胁的更广泛预测区分开来。

她所在公司的检测量无法证明开放模型导致了某一特定比例的攻击。该采访也没有提供开放与封闭系统的比较事件发生率。

四到六个月的能力滞后同样需要反复测试。公开基准可能无法代表真实的入侵工作,在那里,持续性、隐蔽性和对环境的适应能力都很重要。

封闭提供商也面临自身严重风险。账户控制可能失效,内部人员可能滥用访问权限,而有能力的模型可能在监控系统介入前协助有害用户。

前沿模型权重也可能被窃取。如果攻击者获得其参数并私下运行,封闭系统的分发优势便会消失。

审慎的结论比标题更为有限。当有能力的模型变得廉价、可修改且难以监控时,开放式分发可能放大网络风险。

这一机制是可信的。其当前规模仍不确定,应通过测量而非假设来判断。

三个信号将检验 Rajavel 的警告

这场辩论的下一阶段将取决于能力证据、现实世界事件和可执行的安全实践,而非模型标签。

第一个信号是对新发布开放权重模型开展独立网络安全评估。研究人员需要测试多步骤工作能力,而不只是孤立的问题或编程谜题。

有价值的评估应考察漏洞发现、漏洞利用开发、权限提升、持久化,以及失败后的适应能力。它们应在相似的工具和算力预算下比较不同系统。

开放模型与前沿模型之间不断扩大的差距,会削弱“四到六个月”的论断;反复出现的狭窄差距,则会强化这一论断。

评估设计仍将充满争议。发布详细的进攻性测试本身可能传播技术,而私下测试又会让结果更难审计。

最好的项目会在不发布简化滥用的操作指令的前提下,提供足够的方法论以建立可信度。独立评估者可以减少对厂商主张的依赖。

第二个信号是来自实际攻击的证据。安全供应商、模型提供商、政府和事件响应公司应记录 AI 如何改变攻击者的行为。

关键问题不在于攻击者是否曾在某个环节使用模型,而在于 AI 是否带来了更大的规模、更高的速度、更广的访问权限或更强的技术能力。

在证据允许的情况下,调查人员应区分托管服务与私下运行的模型。没有这种区分,关于开源 AI 的宽泛主张仍然难以验证。

他们还应区分能力与因果关系。机器可以生成钓鱼文本,却未必决定攻击活动的目标选择、基础设施或变现方式。

现实世界遥测数据可以揭示攻击者最先自动化哪些任务,也能显示模型局限性仍在哪些方面需要人类专业知识来弥补。

风险最高的变化将是能够在陌生环境中可靠自主实施漏洞利用。这需要规划、工具使用、理解反馈以及从错误中恢复的能力。

更直接的变化可能涉及编排。人类操作者可以将许多边界明确的任务委派给模型,同时仍掌控战略决策。

第三个信号是政府和开发者是否会趋同于基于能力的发布标准。这些标准会在分发前评估危险功能。

NIST 已经推动针对双重用途基础模型的全生命周期管理。其指南涵盖模型评估、网络滥用和供应链风险。

一个可行的框架将在能力达到相应阈值时,同时适用于开放和封闭开发者。它不会假定某一种分发模式天然安全。

一旦系统跨越有意义的阈值,开放发布可能需要额外缓解措施。选项包括分阶段访问、独立测试、延迟发布,或不公开特定高风险组件。

每种选项都有代价。限制措施可能集中市场力量、拖慢防御性研究,并减少小型组织的访问机会。

一刀切的禁令在实践中同样难以执行。权重可以跨越国界,副本可以无限期留存,而较小模型仍在持续改进。

商业提供商不应自动获得豁免。其系统需要强有力的监控、透明报告,以及对已验证滥用的快速响应。

企业买家面临着更直接的决策。他们应将每个模型和代理都视为软件依赖项,分别管理其身份、权限、来源和运行时行为。

这意味着要维护完整的 AI 清单。团队需要知道员工使用哪些模型、哪些数据会流向这些模型,以及这些模型可以采取哪些行动。

安全审查应遵循风险,而非新颖性。本地托管的摘要工具与自主生产代理不应采用完全相同的审批流程。

组织还应评估遭到攻破后会发生什么。遏制措施往往比相信预防总能奏效更重要。

设计良好的智能体即使失效,也未必会暴露整个网络。设计不当的智能体则可能让一条恶意提示词演变为企业级安全事件。

知识工作者同样应承担责任。他们应避免将敏感资料放入未经批准的服务,并核实会产生重大影响的 AI 生成指令。

处理本地技术文档的团队可以利用受控来源和明确的访问边界,构建一个可搜索的知识库。同样的纪律也适用于任何 AI 工作空间。

因此,通过 Google News 看到相关报道的读者,应将 Rajavel 的观点视为一项可验证的安全论断,而非对所有 AI 威胁的既定排序。

如果开放模型不断在数月内接近前沿网络能力,并出现在有记录的攻击中,这一论断就会更有说服力。若实际能力差距仍然很大,其说服力则会减弱。

如果监控无法对托管模型的滥用形成有意义的约束,这一论断同样会被削弱。只有当提供商有效运用集中控制时,集中控制才能提升安全性。

Rajavel 的警告归根结底关乎干预能力的丧失。一旦具备能力的模型权重广泛传播,任何开发者都无法收回每一份副本、恢复每一道防护措施,或审查每一次使用。

这种永久性值得严肃关注。开放式开发能够带来的防御收益、透明度和竞争同样值得重视。

正确的应对方式既不是自满,也不是条件反射式的全面禁止。更好的做法是获取更充分的证据,依据能力水平作出发布决策,保障供应链安全,并对企业智能体设定严格边界。

关注下一次主要的开放权重发布,然后提出三个具体问题:它能完成哪些网络任务?下载后哪些控制措施会消失?又有哪些事件显示这些能力正被滥用?

这些答案将决定,经由 Google News 引发关注的这一警告,究竟会成为决定性的 AI 安全问题,还是众多相互竞争的威胁之一。

 
 

免费开始

一款本地优先的AI助手

为了获得更好的人工智能体验,

remio 目前仅支持Windows 10+ (x64)M-Chip Mac

你的 AI 工作伙伴

remio 一起高效工作

规划、创作、交付

一站式完成

bottom of page