智能体 AI 正在打破安全领域对人类信任的假设
- Martin Chen

- 8月12日
- 讀畢需時 14 分鐘
智能体 AI 登上 Google News,凸显出一个尖锐冲突:自主系统如今的行动速度,可能超过以人为中心、用于约束它们的控制机制。
Forbes 最近的一篇分析认为,安全计划仍假定由人发起重要操作,并由人对这些操作负责。AI 智能体动摇了这两项假设。它们可以选择工具、检索数据、调用 API,并在有限的人类参与下完成多步骤任务。
这篇文章反映的是一场更广泛的安全讨论,而非某起孤立的安全漏洞或产品发布。Microsoft、Google Cloud 和安全标准组织正在为作为独立数字行为者的智能体开发控制机制。这项工作挑战了以人类用户、可预测的应用程序和相对稳定的权限为基础的旧有模式。
这种紧张关系之所以重要,是因为智能体无需具有恶意意图也可能造成损害。被入侵的指令、过度的权限、遭污染的记忆,或错误的计划,都可能引发一连串看似合法却有害的操作。
因此,核心矛盾在于自主性与以人为中心的控制之间。企业希望智能体无需持续审批即可完成工作。安全团队则需要证据证明,每一个身份、权限、工具调用和具有重大影响的操作都仍受到约束。
解决方案并不只是为每个工作流再安排一个人监督。那样会削弱企业期待从自主系统中获得的大部分效率。安全机制必须更靠近智能体的执行路径,使软件能在操作发生前强制施加限制。
为什么智能体 AI 安全登上了 Google News
新闻并不是 AI 会犯错,而是这些错误如今能够触及真实系统并触发真实操作。
传统生成式 AI 通常等待用户提交提示词。它会返回文本、图像或代码,供人审核。这种交互在模型输出与实际运营影响之间形成了明显的检查点。
智能体 AI 移除了或缩窄了这一检查点。AI 智能体是通过规划、工具使用和重复操作来追求目标的系统。它可以收集信息、选择路径,并在某一步失败后作出调整。
这种能力改变了风险评估。一款聊天机器人可以建议删除生产数据库。一个权限过高的智能体则可能尝试执行删除,在出错后重试,并寻找另一份凭据。
同样的区别也适用于日常办公。一名起草邮件的助手会生成可供审阅的成果物。一个能够查找收件人、附加内部文件并发送邮件的智能体,则可能在任何人察觉前泄露信息。
一篇 Forbes 的安全观点文章 描述了智能体跨越环境、身份和数据边界的情况,而这些边界通常由安全团队分别管理。作者、Cyera 高管 Jason Clark 将此视为现有控制机制的结构性问题。
该来源是一篇 Forbes Technology Council 投稿,而非独立调查报道。其观点应被视为行业高管的分析。不过,其核心担忧也出现在独立研究、厂商指南和新兴技术标准之中。
关键变化在于被委托的权限。智能体可能通过用户身份、服务账户或自身凭据运行。每种模式都会对责任归属和权限范围提出棘手问题。
借用用户账户会让智能体获得分配给该用户的全部权限。共享服务账户会使归因变得困难。独立的智能体身份可以提升可见性,但前提是系统能够持续评估其上下文。
智能体还会形成更长的因果链。一个智能体可能请求另一个智能体检索记录。第二个智能体可能调用第三方工具,由该工具获取数据并将其传入另一个模型。
每一次交接都会产生新的信任决策。安全团队必须确定谁发起了任务、哪个智能体执行了操作、它获得了什么权限,以及该权限是否仍然有效。
Google News 的曝光让这一问题获得了更广泛的关注,但聚合本身并不是事件。真正的事件是部署趋势与安全证据的汇合。智能体正进入工作流,而身份控制仍围绕人类和静态工作负载设计。
这一缺口将架构讨论转化为运营问题。安全负责人如今需要治理由能够理解目标、而非遵循单一固定步骤的系统所产生的操作。
安全机制仍假定键盘后坐着一个人
大多数访问系统回答的是某个身份是否拥有权限,但智能体迫使它们追问:这一操作是否仍符合被委托的目的。
以人为中心的安全建立在若干实用假设之上:人会登录,理解组织规则,并以大致符合人类节奏的速度执行操作。当活动看似异常时,调查人员可以询问该人员。
这些假设没有一项能顺畅地迁移到智能体身上。智能体可以在不疲劳的情况下作出数千次决策。它也可能在两次其他条件相似的会话中,以不同方式理解一条含义模糊的指令。
传统身份与访问管理(通常称为 IAM)控制哪些人可以访问系统,以及该身份能够执行哪些操作。角色通常会根据岗位或技术职能,授予一组稳定的权限。
财务部门员工可能获得访问发票、付款工具和报告系统的权限。服务账户可能获得某个应用程序的数据库访问权限。之后的审查会确认这些权限是否仍然恰当。
智能体可以在一次任务中跨越这些边界。处理供应商问题的请求可能需要访问电子邮件、合同、发票、付款状态和内部消息。静态角色很难精确表达完成这一临时目标所需的权限。
Cloud Security Alliance 在一项 2026 年企业调查中报告了显著的可见性缺口。尽管 73% 的组织预计智能体将在一年内变得至关重要,但 68% 的组织无法清楚地区分智能体活动与人类活动。相关发现载于其自主智能体调查。
这种区分对于调查至关重要。如果智能体使用员工的令牌,传统日志可能只会显示该员工身份。分析人员或许无法得知,是员工点击了按钮,还是将操作委托给了软件。
这种对人类的假设也影响着审批设计。许多控制机制将身份验证视为主要信任事件。一旦用户通过这一关卡,系统便允许其执行获授权的活动,直至会话结束或另一项策略介入。
智能体需要更频繁的决策。权限应取决于任务、当前步骤、请求的资源、工具、数据敏感性,以及拟议操作的后果。
设想一个研究智能体被要求编制季度市场简报。阅读获批准的公开来源符合该目的。打开机密收购文件则不符合,即使提出请求的高管本身拥有访问权限。
智能体借用的身份可能授权了这两项操作。具备目的感知能力的控制机制仍必须拒绝第二项操作,因为它超出了被分配的任务范围。
速度会加剧这一弱点。遇到反复访问失败的人可能会停止操作并联系支持人员。智能体则可能重试、改用其他工具,或在可用上下文中寻找另一份凭据。
即使智能体是在遵循自身目标,这些行为也可能看起来像攻击。它们还可能放大真实入侵的影响,因为自动化消除了通常能让防御人员有时间作出反应的延迟。
因此,安全团队面临压力,需要区分三种身份:人类委托者、执行操作的智能体,以及接收请求的服务或工具。失去这条链路中的任何一环,都会削弱归因能力。
所需的应对措施不是建立更大的员工目录,而是一种能够在每一步保留委托上下文、并在任务结束时使访问权限失效的授权模型。
自主性与控制朝相反方向拉扯
让智能体具备价值的特性,也使永久信任变得危险:独立性、持续性、广泛的工具访问能力,以及自适应规划。
一个有用的智能体必须拥有足够的自由来选择操作。如果每一个细微步骤都需要人工审批,智能体就会沦为手工工作的复杂界面。
然而,不受限制的自主性会形成不可接受的安全模式。模型可能误解目标、遵循恶意内容、选择错误记录,或通过获批准的工具泄露信息。
提示词注入说明了这种冲突。这种攻击会将指令植入模型读取的内容中,试图让模型将这些内容当作命令。网页、文档、电子邮件或工具响应都可能携带恶意文本。
传统应用程序通过代码和系统边界,将可执行指令与普通数据分离。语言模型则通过同一推理上下文处理二者,使这种区分更难被持续、可靠地强制执行。
一个浏览网页的智能体可能遇到一条隐藏指令,要求它泄露已存储的信息。如果该智能体能够访问敏感记忆和通信工具,一张被污染的网页就可能将这些能力串联起来。
这种失败跨越多个控制层。模型将数据误判为指令。应用程序允许了不必要的数据读取。工具在未验证操作目的的情况下接受了对外操作。
仅屏蔽某个可疑短语无法解决这一链条。攻击者可以改写指令、将其拆分到不同内容中,或利用间接引用。防御者需要模型自身推理过程之外的控制机制。
Microsoft 的智能体安全指南建议采用独特的数字身份、最小权限访问、护栏、审批工作流和审计。这些控制措施降低了对模型是否遵守书面指令的依赖。
最小权限意味着仅授予完成特定任务所需的访问权限。对于智能体而言,这一原则必须比许多现有企业角色更精细、更具临时性。
费用智能体可能需要读取一张已提交的收据和一份政策文件。它不需要永久访问每名员工的全部费用记录。它也不应批准自己的例外申请。
短期凭据可以限制暴露面。凭据代理可以为一个智能体、一项任务、一项资源和一个时间窗口签发凭据。接收服务可以在接受操作前验证这些条件。
高影响步骤需要更强的屏障。汇款、删除记录、变更生产系统或暴露受监管数据,都应触发确定性的策略检查。确定性意味着,同样的既定条件会产生同样的决策。
模型可以提出操作建议,但不应决定其自身操作是否被允许。这种分离反映了熟悉的安全实践:应用程序请求访问,策略系统评估该请求。
人工审批仍然发挥作用,尤其是在意图无法安全地用代码表达时。不过,审批提示必须提供有意义的上下文。一个笼统的“允许”按钮只是转移风险,并不能改善判断。
审查者应能够看到请求的人、执行的智能体、受影响的资源、拟议操作、预期结果,以及升级审批的原因。审批应只覆盖该项操作,而非之后的每一步。
这种设计在明确边界内保留了有用的自主性。智能体可以不受打断地处理低风险检索和分析工作。具有后果的操作则会面临逐步加强的检查。
这种权衡永远不会消失。更严格的边界会降低灵活性,而更广泛的权限会增加错误可能造成的影响。企业必须决定,自主性在何处创造了足以证明承担这类剩余风险合理的价值。
身份必不可少,但它无法解释意图
为每个智能体赋予名称能够提升问责性,但仅凭身份无法判断一项有效操作是否属于当前任务范围。
身份已成为智能体 AI 安全最常见的起点。这很合理。防御者无法治理或调查无法与用户及后台服务区分开来的行为主体。
Google Cloud 在 2026 年 5 月表示,传统控制措施并非为以机器速度与敏感数据交互的自主智能体而设计。其智能体身份控制聚焦于管理智能体访问权限,并强化运行时防御。
Microsoft 同样将智能体视为应获得独立身份的数字行为主体。这样一来,策略和日志便能将智能体的操作与分派任务的人员区分开来。
The Coalition for Secure AI 在其智能体 IAM 框架中更进一步。该框架探讨现有身份协议必须如何表示智能体、委托权限和访问决策。
这些工作正在对既有 IAM 供应商、云平台和应用开发者施加压力。每一层都必须携带足够的上下文,以便下游系统作出知情的授权决策。
唯一身份可以回答是哪一个智能体发起了请求,却无法自动回答请求为何存在、计划是否发生变化,或该资源是否仍有必要。
这一限制至关重要,因为被攻破的智能体仍可能正确完成身份验证。被盗凭证、投毒指令、被篡改的记忆,或遭操纵的工具响应,并不总会产生无效身份。
智能体可能执行单独看都被允许的操作,却共同构成有害序列。读取客户记录、压缩选定文件、发送外部消息,这些操作在分别评估时都可能显得正常。
但将它们结合起来,就可能构成数据盗窃。安全系统需要审视其轨迹,即任务中决策与操作形成的有序路径。
一篇关于轨迹保障的 2026 年研究论文指出,逐项操作检查不足以应对智能体系统。作者强调,应在身份、委托、通信和执行控制之间进行架构级验证。
这种方法类似于行为检测,但增加了任务上下文。被指派去总结合同的智能体,不应开始更改访问策略,即使其技术权限允许这样做。
运行时控制可以将当前操作与原始目标、已批准计划、先前步骤及剩余权限进行比较。当轨迹偏离预期边界时,它们可以暂停执行。
日志记录也需要更高的精度。有效的审计轨迹应记录委托人、智能体身份、模型版本、工具调用、所访问资源、策略决策,以及由此产生的副作用。
不过,组织应谨慎对待无限制记录私密推理或敏感提示词的做法。详细记录本身可能包含机密数据、凭证、员工信息或客户内容。
因此,可审计性本身也带来安全和隐私义务。日志需要访问控制、保留规则、防篡改能力和明确用途。更多遥测数据并不自动意味着更安全的遥测数据。
记忆又带来另一项复杂因素。智能体可能跨会话保留偏好、任务历史或运营上下文。受污染的记忆可能在原始恶意内容消失很久后,仍影响后续操作。
组织需要为这些记忆保留溯源信息。溯源记录信息的来源、变化过程,以及哪个流程批准其继续使用。
敏感知识工作流也受益于让源材料保持有序且可追溯。一个可搜索的知识库可以支持人工审查,但无法替代智能体授权。
因此,身份只是一个控制平面,而非完整答案。安全执行还需要目的限制、外部策略执行、轨迹监控,以及可恢复的记录。
最棘手的问题是委托后的问责
智能体可以执行一项决策,却不会因此在法律、运营或伦理层面为其后果负责。
以人为中心的安全模式假定,问责最终会追溯到某个人或组织。智能体系统使这一路径更加复杂,但并未消除它。
企业领导者可能授权智能体实现某项宽泛目标。开发者可能选择其工具。平台团队可能管理凭证。安全团队可能定义策略,而供应商则提供底层模型。
当智能体造成损害时,每个参与方都可能将责任指向另一个层面。领导者没有选择具体操作。开发者没有创造恶意内容。模型提供商没有授予生产环境访问权限。
这种碎片化造成了责任归属缺口。技术归因可以识别哪个组件采取了行动,但组织问责必须识别谁接受了风险,以及谁能够停止系统。
每个生产环境中的智能体都需要一名负责的所有者。该所有者应批准智能体的用途、数据边界、工具、风险分类和升级路径。
所有权不应意味着审查每一项输出。它意味着维护自主性仍可接受的条件,也意味着当证据落在这些条件之外时暂停智能体。
安全团队需要一份最新的智能体及其能力清单。每条记录应包含智能体所有者、委托人、凭证、已连接工具、数据访问权限、模型依赖项和允许产生的后果。
该清单必须反映真实部署,而不只是获批准的项目。智能体可能通过软件功能、员工自建自动化、开发框架、浏览器扩展和第三方集成进入组织。
发现工作很困难,因为智能体可能看起来像普通 API 流量。它可能使用现有用户令牌或服务账户。若缺少智能体专属信号,防御者能看到操作,却看不到行为主体。
问责还取决于可逆性。系统应定义哪些操作能够撤销,以及撤销速度。将草稿发送到审查队列是可逆的;公开发布则会造成更广泛、也更难预测的影响。
同样的区别也适用于安全运营。智能体可以建议隔离一台设备。自动断开医院工作站或生产服务器则带来不同的运营风险。
组织应按后果对操作分类。只读访问、内部起草、外部通信、金融交易、权限变更和破坏性操作,不应采用同一套审批策略。
这里值得重视怀疑论的观点。一些拟议的智能体控制措施仍只是供应商主张、架构建议或早期标准。它们在异构生产环境中的有效性尚未在广泛规模上得到确立。
唯一身份无法防止糟糕决策。详细日志无法阻止已经完成的操作。人工审批可能流于形式、仓促完成,或容易受到误导性上下文影响。
即使外部策略引擎也可能包含错误。一条规则可能遗漏不寻常的工作流,或允许多个单独可接受的操作形成有害组合。
因此,安全计划不应声称智能体身份能够“解决”自主风险。它提升了可见性和执行能力,但模型、工具、数据和组织决策中仍存在剩余不确定性。
更安全的目标是让失败保持在可控范围内。智能体应拥有有限的访问权限、有限的时间、有限的支出权限,以及影响其他系统的有限能力。
当失败发生时,团队应能够重建事件序列、遏制智能体、撤销其凭证、恢复受影响资源,并更新策略。
这一模型将错误视为预期的运营事件。相比假设每个提示词、模型响应和工具调用都会按预期运行,它更符合现实。
三项信号将显示安全是否正在跟上步伐
下一阶段将由可执行的控制措施和生产环境证据来衡量,而不是由更多关于自主风险的警告来衡量。
第一个信号是任务范围限定的智能体身份得到采用。云平台和企业应用必须证明,智能体可以获得临时权限,而无需继承用户的完整访问权限。
应关注绑定于特定委托人、用途、工具集、资源和到期时间的凭证。还应关注下游应用能否评估这些上下文,而不是接受通用的 bearer token。
广泛支持将强化这样一种观点:既有身份基础设施能够为智能体演进。采用缓慢则会暴露出棘手的互操作性问题,尤其是在多个云和软件供应商之间。
第二个信号是对运行时控制进行独立测试。供应商越来越多地描述护栏、监控和智能体专属授权。买方需要证据证明,这些系统能够阻止现实中的多步骤攻击和意外策略违规。
测试应包括间接提示词注入、受污染的记忆、被攻破的工具、权限升级,以及被允许操作的有害组合。还应衡量会中断合法工作的误报情况。
不同模型和应用中的强劲结果,将支持向运行时执行迈进。若结果仅限于受控演示,则会削弱有关该架构已准备好广泛部署的说法。
第三个信号是,组织能否在事件发生后重建智能体操作。监管机构、保险公司、客户和内部审计人员将追问:是谁委托了权限,以及为何一项具有后果的操作通过了策略审核。
完整记录应将人工请求与智能体、模型、工具、数据、审批和最终副作用连接起来。缺失的环节将表明,问责仍依赖推断。
这一信号也检验运营准备度。一家公司可能拥有详细日志,却没有获授权暂停智能体的负责人。另一家公司可能撤销了凭证,却缺乏干净的恢复点。
通过 Google News 关注智能体 AI 的读者,应区分三种不同的叙事。模型能力描述智能体能够尝试什么。产品采用描述企业在何处部署它们。安全成熟度描述这些部署是否仍可治理。
这些曲线并未以相同速度移动。智能体能力和集成可以通过软件更新扩展。身份重构、应用支持、审计实践和组织所有权则需要协调一致的变革。
开发者在连接另一项工具之前,应先问智能体真正需要什么权限。企业买方则应要求提供关于身份隔离、策略执行、日志记录和事件遏制的证据。
知识工作者应当留意:助手何时开始采取行动,而不再只是提出建议。这条边界决定了一次错误是停留在草稿阶段,还是成为实际运营事件。
最有价值的问题并不是代理是否表现得像人。关键在于,系统能否约束一种以不同于任何人的方式运作的行动主体。
人工监督依然重要,但不能继续作为唯一的安全机制。人们无法审查每一项以机器速度作出的决策,否则企业所购买的自主性将不复存在。
安全机制必须将人类意图编码为可执行的技术边界。它必须在委派、工具调用、记忆和不断变化的计划中保留这种意图。
Google News 的关注周期会转向下一条头条新闻。底层的考验仍然存在:组织能否赋予有用的自主性,却不授予隐形、持久且无需问责的权限?
在部署下一个代理之前,请从指令到后果,梳理一项完整任务。识别每一项凭证、数据来源、工具、审批和恢复步骤。任何缺失的环节都不仅仅是文档空白,更是自主行动可能超越人工控制的地方。


