智能体 AI 将网络风险推向授权边界之外
尽管企业正竞相赋予自主系统更广泛的敏感工具和数据访问权限,Google News 仍发出了一则严峻的智能体 AI 风险警告。
Security Boulevard 的标题将智能体 AI 描述为网络风险的新前沿。其背后的担忧远不止又一轮聊天机器人幻觉。智能体可以将有缺陷的输出转化为跨越电子邮件、软件、云服务和业务记录的实际操作。
这改变了企业买方面临的讨论焦点。不再是生产力与不完美答案之间的权衡,而是有用的自主性与概率性软件获得凭证、记忆及行动权限后所产生的安全风险之间的权衡。
NIST 现将 AI 智能体描述为能够规划并采取影响现实环境的自主行动的系统。其安全工作反映出,既有控制措施与能够自行选择操作步骤的软件之间正出现日益扩大的鸿沟。
因此,安全团队面临一项艰巨任务:他们必须限制智能体,却不能消除令该产品具有吸引力的自主性。这一取舍将决定智能体 AI 是成为普通的企业基础设施,还是始终困于有限的试点项目之中。
Google News 警告究竟改变了什么
关键变化不在于 AI 会犯错,而在于这些错误如今可能跨越授权边界。
传统聊天机器人生成供人评估的文本。智能体则能够理解目标、制定计划、调用工具、审查结果,并在无需持续人工指导的情况下继续执行。智能体成为工作流中的主动参与者。
当智能体能够读取收件箱、检索文档、修改代码、查询客户记录或发送外部消息时,这一区别尤为重要。错误答案只是令人不便,而未经授权的数据库更新或暴露的凭证则可能演变为安全事件。
NIST 关于智能体的征询指出了三类广泛的风险来源。智能体可能遭遇对抗性数据、依赖被投毒的模型,或在攻击者未直接操纵它们的情况下采取有害行动。
第一类包括间接提示注入。攻击者将指令放入智能体之后会读取的内容中,例如网页、电子邮件、文档或支持工单。智能体可能将这些不受信任的内容误认为命令。
第二类涉及遭到入侵的组件。智能体依赖模型、连接器、库、外部服务和检索到的信息。这条链路中任何一处的弱点,都可能影响智能体的决策或扩大攻击者的访问权限。
第三类更为棘手。模型可能以不安全的方式追求既定目标,因为指令遗漏了重要约束。安全研究人员通常将此称为规范博弈,即系统满足字面目标,却违背其预期目的。
这些风险在智能体 AI 出现前就曾以更狭窄的形式存在。钓鱼邮件操纵人类,应用程序遭受供应链攻击,自动化脚本造成高昂损失。智能体将这些熟悉的风险结合到一个能够理解语言并动态选择行动的系统中。
这种组合使最新的 Google News 报道不只是一则针对新产品类别的警告。它表明,AI 安全与运营网络安全之间的边界已经开始消失。
一个系统可以完全按照其模型所预测的方式运行,却仍然违反公司的安全政策。故障可能出在权限、工具设计、上下文、审批流程或任务定义上。
组织无法仅通过检查模型是否正确回答基准测试来解决这一问题。他们必须审视整个智能体能够看到、决定、记住和改变什么。
安全团队正被要求批准一套尚未成熟的控制模型
首席信息安全官面临即时压力,因为部署需求的增长速度快于统一的智能体安全标准。
业务团队将智能体视为压缩重复性工作的方式。开发人员希望系统能够检查代码仓库、运行测试并准备代码变更。销售和支持团队希望智能体能够整合上下文并更新客户系统。
每增加一项集成,实用性都会提高,但也会增加一层信任关系。广泛连接的智能体可能成为原本由人工判断隔开的系统之间的桥梁。
压力首先落在身份团队身上。传统访问管理假定人员或确定性应用程序请求已知资源。智能体则可在执行期间选择资源、改变计划,并按顺序调用多个服务。
借用人类凭证会使问责变得更糟。日志可能显示员工的身份,即使是自主流程选择了该操作。调查人员随后很难区分人类意图与智能体行为。
为每个智能体赋予独立身份会有所帮助,但身份本身并不能解决授权问题。组织仍须决定该身份可使用哪些工具、可访问哪些记录,以及何时需要审批。
记忆带来另一个控制难题。智能体记忆是会影响未来跨步骤或跨会话决策的已存储上下文。如果恶意或不准确的内容进入该记忆,其影响可能在原始交互结束后依然持续。
普通应用程序数据库也可能存储错误数据。智能体记忆则增加了语义维度,因为模型可能将已存储的文本理解为证据、背景或指令。这种模糊性使验证和事件重建更加复杂。
组织还需要保护智能体的运行预算。攻击者可能触发长循环、重复工具调用或昂贵的模型请求。OWASP 将这种资源耗尽模式称为钱包拒绝服务。
因此,采购团队被迫在控制模型尚未确定之前做出产品决策。供应商可能强调加密、审计日志或企业身份验证,却未明确智能体的实际权限。
核心问题是运营层面的。智能体能否写入以及读取?它能否调用未经批准的目标地址?一次授权是否会在单次操作后过期?检索到的内容能否改变智能体所选择的工具?
NIST 在 2026 年 5 月发布的安全响应分析发现,各方普遍认同智能体带来了新的威胁。受访者还表示,既有网络安全实践仍然相关,但需要作出调整。
这是一个重要限定。智能体 AI 不会让现有安全工作过时,但它改变了最小权限和职责分离等熟悉原则必须在哪些环节得到执行。
因此,安全团队受到两种相反需求的压力。业务领导者希望更广泛的自主性,因为自主性能够提升效率。风险负责人则需要更狭窄的权限,因为权限决定了潜在损害。
任何一方都无法仅靠政策措辞解决这种冲突。答案必须体现在架构、运行时控制、审批流程以及每次操作后保留的证据中。
有用的自主性与安全的权限彼此背道而驰
智能体 AI 在获得恰恰会使被攻破的智能体变得危险的权限时,能力也会随之增强。
设想一个被要求解决客户支持问题的智能体。它可能需要读取客户消息、检查账户历史、审阅内部指南、更改订阅设置并发送回复。
只读智能体无法完成这一工作流。拥有完全授权的智能体可以完成,却也可能泄露账户信息或应用错误变更。产品的实用性与风险一同上升。
同样的张力也出现在软件开发中。仅提出文本建议的编程智能体,其行为很像高级助手。能够编辑文件、运行命令、安装依赖项和发起拉取请求的智能体,则可能影响软件供应链。
在这些环境中,间接提示注入尤其严重。恶意指令可能隐藏在议题、依赖项说明、网页、源文件或检索到的文档中。智能体可能在执行合法任务时遇到它。
输入过滤能够移除已知攻击模式,但自然语言存在太多等价表达形式,简单的黑名单难以奏效。更安全的方法是将检索内容视为数据,并使授权不受模型自行决定。
OWASP 的智能体安全指南建议采用最小工具访问权限、按工具划分的权限范围,并对敏感操作进行明确授权。该指南还建议按信任级别分离工具。
这些建议与成熟的应用安全原则相呼应。不同之处在于执行机制。模型不应自行决定其行动是否获得授权,因为同一被操纵的上下文可能同时影响行动和决策。
必须由确定性的策略层作出这一判断。确定性意味着,规则会根据相同的已验证输入产生相同的授权结果。模型可以提出行动建议,但模型之外的代码必须批准或拒绝该行动。
审批还需要绑定到确切参数。批准一条消息,不应授权智能体稍后发送另一条不同的消息。针对一个文件的审批,也不应悄然覆盖整个目录。
这正是许多吸引人的演示变得具有误导性的地方。演示奖励不中断地完成任务。安全部署则需要在错误可能变得不可逆、公开、造成财务影响或难以调查的节点增加阻力。
人工审查并不必然足够。审查者可能逐渐习惯于批准频繁请求,尤其当界面隐藏了重要参数时。模糊的确认按钮可能让监督沦为一种仪式。
更好的设计会按影响程度对行动分类。低风险检索可在严格边界内自动进行。风险较高的写入操作需要更严格的验证,而涉及财务、管理或对外可见的行动则应获得独立审批。
工具说明也成为攻击面的一部分。智能体部分依据开发人员或外部服务器提供的自然语言描述来选择工具。误导性的说明可能将模型引向不安全或伪造的能力。
连接模型与工具的协议增加了可用集成的数量。它们可以改善互操作性,但每个新端点都会引入身份、来源、授权和输出验证方面的问题。
智能体必须知道它连接到了哪项服务。安全层必须独立验证该服务。信任模型能从一段具有说服力的描述中推断合法性,重演了让钓鱼攻击对人类有效的同样错误。
这正是 Security Boulevard 警告背后的核心权衡。企业无法既保留完全自主性,又将每项高影响决策都降为无害建议。他们必须在部署开始前决定自主性的边界。
这一边界应当反映潜在损害,而不是模型的置信度。流畅的解释并不会让一项行动变得安全。置信度评分同样不能取代授权、验证或可审计的政策决策。
提示注入只是 Agentic AI 攻击面的一部分
只聚焦恶意提示会低估问题的严重性,因为智能体将工具、记忆、身份和外部数据整合进同一个运行时系统。
提示注入仍是迫在眉睫的威胁。直接注入通过用户请求进入;间接注入则通过智能体在完成请求时检索到的材料影响智能体。
攻击可以利用一种基本的模糊性。模型会将系统规则、用户指令、工具结果、检索文档和先前上下文一并作为语言接收。它必须推断哪些文本具有应有的权威性。
开发者可以强化指令与数据之间的边界,但这些边界无法形成数学意义上的隔离。智能体仍可能将文档中看似合理的指令视为与其目标相关。
工具滥用会造成另一条失效路径。模型可能为未经授权的目的选择合法工具、传入不安全的参数,或在误解结果后重复执行操作。
权限提升会进一步放大影响。拥有广泛凭据的智能体可能访问原始任务并不需要的数据或功能。攻击者不再需要分别攻破每个已连接的系统。
数据外泄是另一项独立风险。敏感上下文可能通过 API 请求、生成的信息、日志条目、调试追踪或工具参数流出。最终答案过滤器无法发现发生在中间操作过程中的泄露。
记忆投毒会让攻击跨越时间延续。在一项任务中存储的恶意内容可能影响后续任务,甚至影响另一位用户的任务。因此,持久记忆需要验证、隔离、过期机制和审计控制。
多智能体系统会增加传播风险。一个被攻陷的智能体可能向拥有不同权限的另一智能体发送指令或受污染的上下文。第二个智能体可能在无意间成为权限桥梁。
供应链暴露也会扩大。企业智能体可能依赖模型提供商、编排框架、插件、协议服务器、数据源和传统软件包。每个组件都有自身的更新与被攻陷路径。
级联失效使这些弱点难以被孤立评估。一份被投毒的文档可能重定向规划智能体,后者调用权限过高的工具,再将受污染的记忆写入供另一智能体使用。
没有任何单一模型输出能够完整呈现整个事件。调查人员需要一条追踪记录,展示原始请求、检索输入、模型决策、工具调用、政策检查、审批、结果以及后续记忆写入。
这一要求带来了隐私权衡。详细追踪有助于安全团队还原行为,但日志可能包含凭据、个人信息或机密业务数据。可观测性必须纳入最小化和脱敏措施。
个人知识库说明了上下文系统的敏感性。存储材料可以提高相关性,但权限与数据边界仍决定每一段上下文应当提供给谁。
企业对智能体记忆也需要采取同样严谨的做法。检索应当遵循请求者身份、当前目的和获批的数据范围。智能体不应仅因广泛上下文能提升回答质量,就接收所有可用文档。
最安全的架构假定不可信内容最终会进入模型,然后限制被操纵的模型能够完成的事情。这一原则将防御重点从完美检测转向控制影响范围。
沙箱通过将代码或工具置于隔离环境中提供帮助。出口控制限制该环境可联系的外部目的地。短期凭据则缩短了可被滥用的时间窗口。
组织还应将规划与执行分离。模型可以起草拟议步骤,而当执行到达每项敏感操作时,政策引擎再对其进行评估。先前的审批不应自动涵盖后续变化。
最后,运行时限制应对递归、重试、时间、令牌和支出设置上限。这些控制同时应对攻击和意外循环。智能体即使没有恶意意图,也可能消耗资源或重复造成损害的操作。
由此形成的架构不如实验室演示那样流畅。但它也更易于防御,因为每项重要能力都有不依赖模型遵从提示的边界。
安全框架有所帮助,但合规并不等于安全得到证明
现有框架提供了必要原则,但没有任何清单能够保证所有模型、工具和不断变化的上下文都能安全运行。
审慎的观点始于衡量。智能体行为取决于模型、系统指令、可用工具、检索内容、记忆以及周边应用逻辑。改变其中一个组件,就可能改变系统的失效模式。
因此,发布前进行的安全评估保质期很短。模型提供商的更新可能改变工具选择方式。新的连接器可能创建原始评估从未考虑过的数据路径。
提示修订同样重要。一项小小的指令变更可能提升任务完成效果,同时削弱拒绝行为。新的记忆来源也可能在不改变智能体核心代码的情况下引入恶意内容。
这并不意味着测试毫无意义。它意味着测试必须贯穿系统的整个生命周期。OWASP 建议在提示、工具、记忆、检索、政策或模型提供商发生实质性变化后,重新进行对抗性验证。
测试应复现具体的滥用情形。它们应当检验智能体是否拒绝未经授权的工具、阻止绕过审批、隔离记忆、阻断数据泄露,以及停止无边界循环。
随后,发布门禁可以防止敏感权限在没有相应证据的情况下发生变更后被部署。过往失败应转化为回归测试,就像传统软件缺陷一样。
挑战在于覆盖范围。自然语言输入存在极其庞大的变化,而智能体可以组合出陌生的行动序列。通过一组固定测试,只能表明已知情形得到了处理,并不代表系统不会在其他地方失效。
红队能够探索创造性的攻击,但它们同样受限于时间和访问权限。评估环境可能缺少会带来最大风险的生产数据、连接器或权限。
对供应商声明也应保持同样审慎。企业可以准确地说其智能体支持日志、审批或加密,但将关键实现细节留给客户处理。
安全性取决于这些控制如何组合。如果审批功能显示的参数并不完整,其价值就很有限。当审计日志遗漏检索内容或中间工具调用时,其作用也会降低。
合规认证可以确立流程纪律和基础控制。它无法证明一个概率性智能体会安全地理解未来的每一种上下文。买方应将认证视为一项参考,而非完整答案。
NIST 的发现支持这种克制的观点。受访者普遍认同,基础网络安全实践仍然适用,但他们也指出需要实施指南、信息共享和标准。
AI Agent Initiative将安全性与互操作性和身份并列。这种并列很重要,因为智能体正越来越多地跨越组织和技术边界运行。
共享标准可以使智能体身份和交互更容易验证。它们也可能增加连接性,从而扩大弱授权的后果。没有可强制执行的信任边界,互操作性可能更快地传播风险。
正确的结论既不是智能体不可控,也不是既有控制已经解决了问题。安全团队拥有可行的设计原则,但来自真实部署的证据仍然因产品而异。
买方应要求与具体工作流相关联的威胁模型。他们应请供应商明确识别信任边界、凭据范围、保留的记忆、外部目的地以及需要独立审批的操作。
他们还应询问模型更新后会发生什么。成熟的回答应包括回归测试、分阶段部署、监控、回滚以及行为变化记录。
尚未解决的问题是问责。当智能体遵循用户的宽泛目标,却选择了有害的方法时,责任横跨用户、部署方、模型提供商、应用供应商和工具运营方。
合同和政策将分配其中部分责任。技术日志将决定在事件发生后,这些责任归属能否获得证据支持。
在这种证据成为常态之前,关于安全自主性的宽泛主张值得审视。安全性较少取决于智能体承诺什么,而更多取决于周边系统拒绝让它做什么。
下一项考验是控制措施能否经受真实工作场景
三个信号将表明智能体安全是否正在走向运营化:有边界的权限、可重复的测试,以及可用的事件证据。
第一个信号是采用具备狭窄范围、短期凭据的智能体专属身份。这将增强一种判断:企业可以将自主操作与人工会话分离。
持久的共享凭据则指向相反方向。它们使归因更加困难,并让一个被攻陷的智能体继承员工或服务账户的全部权限。
关注供应商如何在产品文档中描述权限。“访问您的工作区”过于宽泛。买方需要资源级和操作级控制,以区分读取、提议、修改、发布和删除。
第二个信号是,有证据表明每次实质性智能体变更后都会运行对抗性测试。一次性评估无法覆盖新的模型、工具、提示、记忆来源和外部集成。
有用的证据包括版本化测试用例、预期拒绝结果、发布门禁和公开的修复措施。供应商应说明哪些变化会触发重新测试,以及客户是否会收到行为变化通知。
失败透明度在此很重要。如果提供商发布有实质内容的事件分析,并将这些失败纳入回归测试套件,对托管自主性的信心就会增强。反复进行无声变更则会削弱这种信心。
第三个信号是,组织能否在不暴露更多敏感数据的情况下重建智能体的操作。事件响应人员需要从请求、工具执行到最终结果的一条连贯链路。
该链路应包括执行身份、授权决策、准确参数、审批记录、目的地、返回数据和记忆影响。日志还应保留模型和政策版本。
安全团队应在事件发生前测试重建能力。一次受控演练可以暴露缺失事件、时间戳不一致、过度的数据保留,或仍被错误归因于某个人的操作。
这些信号比又一次令人印象深刻的智能体演示更重要。它们衡量的是,当系统遭遇敌对内容或不完整指令时,自主性是否能在可强制执行的限制内运行。
Google News 的标题捕捉到了网络风险的真实转变,但未来并非注定如此。当权限扩张速度快于独立控制时,Agentic AI 就会变得危险。
开发者可以通过让每一次敏感工具调用都明确可见并经过策略检查来应对。企业采购方则可以要求与真实工作流程挂钩的证据,而不是接受笼统的保证。
知识工作者也应了解,其代理能够以自身身份执行哪些操作。在委托一项工作流程前,应先询问代理能够读取、修改、记住和发送什么。
决定性的问题很实际:当代理原本有益的计划即将变成未经授权的操作时,您的组织能否在那一刻准确叫停它?如果答案并不明确,就应保持权限范围狭窄、保留人工审批,并将每一次自主权扩展都视为一次安全变更。



