随着智能体获得更多控制权,Microsoft AI 安全治理趋严
随着智能体在其产品中获得更多访问权限、自主性和操作能力,Microsoft 已重新设计其负责任 AI 规则。此次 Microsoft AI 安全治理调整旨在解决一个基本矛盾:为聊天机器人制定的控制措施,并不能自动治理能够采取行动的软件。
该公司的 2026 年《负责任 AI 透明度报告》介绍了面向智能体的新威胁建模、提示注入防御、安全分类器,以及更严格的发布前监督。它还将治理范围从模型扩展至围绕模型的平台、工具、数据和应用程序。
这一更广泛的范围至关重要,因为智能体可以发送消息、检索记录、修改文档、调用软件工具并委派工作。Anthropic、OpenAI、Google 及其他模型提供商也面临着从生成答案转向执行任务的同样转变。
Microsoft 的回应不止是一次政策更新。它代表着一种判断:AI 安全必须成为一套运营控制系统,而不只是上线前审阅的文档。
Microsoft AI 安全治理现已覆盖完整智能体技术栈
Microsoft 正将其安全重点从模型输出转向 AI 系统能够执行的完整行动链。
该公司表示,已对其《负责任 AI 标准》进行了全面重构。该标准指导 Microsoft 如何在其业务中开发、发布和运营 AI 系统。
根据其透明度报告,修订后的方法涵盖模型、平台服务和应用程序。智能体能力贯穿每一层,而非作为独立产品类别存在。
AI 智能体是利用模型,通过工具、数据或数字环境规划并完成任务的软件。其风险特征不只取决于模型的回答。
聊天机器人可能会给出不准确的答案。智能体则可能在人工审查前就依据该答案采取行动。
这种差异改变了治理必须覆盖的范围。企业需要审查智能体的身份、权限、记忆、工具、审批要求和执行历史。
Microsoft 表示,其标准现已纳入覆盖 AI 全生命周期中智能体能力的要求。该公司还引入了围绕智能体行为设计的新威胁建模实践。
威胁建模用于识别系统可能如何失效、被滥用或遭遇攻击。对于智能体,这一过程必须考虑多步骤活动,以及执行期间不断变化的条件。
Microsoft 报告了多项相关调整。它扩大了提示注入防御范围,提升了安全分类器覆盖率,创建了新的透明度模板,并强化了智能体治理能力。
提示注入是指不可信内容试图覆盖智能体指令的情况。这类攻击可能出现在智能体处理的文档、电子邮件、网页或软件界面中。
一次成功的注入攻击可以在不攻破底层模型的情况下重定向智能体。因此,周边应用架构成为安全的核心。
Microsoft 还介绍了一个集中式发布前监督流程。该流程旨在确认相关风险已得到处理后,系统才可投入使用。
该公司将这项工作与 NIST AI 风险管理框架中的四项职能保持一致:govern、map、measure 和 manage。这些职能将风险管理视为持续过程,而不是最终的上线审查。
Microsoft 表示,已向近 20,000 名工程师、政策制定者和客户提供负责任 AI 培训。在修订标准期间,它还审查了 100 多项拟议或已颁布的法律。
来自 30 多个团队的 80 多名员工参与了该法律与治理工作。这些数字显示了这项工作的组织规模,但并不能证明每项控制措施都按预期发挥作用。
核心变化依然清晰。Microsoft 不再将模型评估视为对日益自主系统的充分保护。
智能体的行为源于其模型、指令、权限、工具、数据和运行环境之间的相互作用。治理必须覆盖整个链条。
为什么智能体行动带来了不同的安全问题
更棘手的问题始于模型生成答案之后:智能体将该答案转化为外部行动时。
传统生成式 AI 控制通常聚焦于内容。团队会测试模型是否生成不安全指令、存在偏见的回答、私人信息或不准确的说法。
智能体系统增加了另一层风险。它们会将模型决策转化为具有现实后果的工具调用。
客服智能体可能查看账户记录、撰写回复或批准退款。编程智能体可能修改代码仓库、运行命令或创建拉取请求。
办公智能体可能搜索邮件、总结会议、更新文档并向同事发送消息。每一步都可能影响一个具有独立权限的不同系统。
风险会通过组合不断增加。看似无害的模型输出,在与广泛访问权限或不完整验证相结合时,可能触发危险行动。
Microsoft 在其 Agent Hooks 示例中说明了这一问题。一个虚构的支持智能体在审批控制抛出异常后,错误地发放退款。
周边框架记录了错误,但仍继续执行。由于预期回调从未运行,另一条批处理路径绕过了另一项控制措施。
教训具有结构性。安全控制无法保护它从未看到过的执行路径。
这也是 Microsoft 近期工作区分观察与强制执行的原因。记录智能体活动有助于调查人员,但不一定能阻止不安全行动。
Microsoft 推出了 Agent Hooks,这是一个开放、框架中立的契约,用于在智能体执行过程中部署控制措施。该规范定义了框架与治理组件应如何交互。
首个版本包含适用于 Python、TypeScript、.NET、Rust 和 Go 的软件开发工具包,以及一个涵盖 47 种场景的一致性测试套件。
一致性测试用于检查框架是否会在既定条件下遵守该契约。Microsoft 的既定目标是让支持情况可被验证,而不是仅将其作为兼容性声明。
该契约针对多种失效模式。控制措施应能看到每条相关执行路径、记录证据,并在政策拒绝某项行动时将其阻止。
最后这项要求听起来显而易见,但智能体框架往往是从编排和可观测性工具演变而来。它们的错误处理可能优先考虑完成任务,而非严格执行控制。
智能体还带来委派风险。父智能体可以要求子智能体完成部分任务,这会引入另一种身份和执行路径。
重试进一步增加了复杂性。被阻止的行动可能通过采用不同中间件或审批逻辑的恢复路径重新出现。
后台作业和批处理流程的行为可能不同于交互式会话。仅附加于面向用户工作流的控制措施,可能完全错过这些路径。
记忆创造了另一个攻击面。存储的上下文可能保留错误指令或敏感数据,超出其最初出现的会话。
这些风险解释了为何 Microsoft 将治理描述为动态过程。一次性的模型测试无法覆盖部署后遇到的每一种权限、工具、用户和数据源。
该公司的立场也反映了其产品覆盖范围。Microsoft 提供模型、云基础设施、办公应用、身份系统、开发者工具和安全产品。
这种覆盖范围让 Microsoft 能够在整个技术栈中实施政策。但它也使该公司要为更多可能导致控制失效的连接承担责任。
对于企业买家而言,实际问题已不再是智能体是否能给出可接受的演示,而是已部署系统能否在每一条通往行动的路径上都表现得可预测。
核心权衡是能力与可强制执行的控制之间的取舍
Microsoft 希望智能体完成更广泛的任务,但每增加一项权限,可靠执行控制就会变得更困难。
当智能体能够访问相关上下文并采取有意义的行动时,智能体产品会更有用。狭窄的权限可以降低风险,但也可能限制智能体能够完成的工作。
广泛权限则造成相反的问题。智能体可以完成更多任务,但错误和攻击的潜在影响也会更大。
这种张力体现在 Microsoft 的 Copilot Cowork 示例中。该公司表示,该系统通过用户审批、基于权限的访问、安全控制和分阶段部署,在 Microsoft 365 中完成办公任务。
分阶段发布会在团队收集行为证据期间限制风险暴露。用户审批则在智能体的计划与选定行动之间加入人工环节。
两种机制都不能消除风险。用户可能在不了解后果的情况下批准行动,而分阶段发布可能无法暴露需要异常条件才会出现的失效问题。
最小权限访问提供了另一项控制措施。它只向智能体授予完成指定任务所需的权限。
当任务是开放式的,这一原则就会变得困难。被要求准备项目更新的智能体,可能需要访问邮件、日历、文档、聊天记录和客户记录。
它还可能需要获得写入共享系统的权限。每增加一个新连接,都会同时增加实用性和可能的失效路径数量。
Microsoft 更广泛的前沿模型框架针对最严重的能力风险。其治理框架追踪化学、生物、放射性、核、网络、自主性、控制和操纵等方面的担忧。
该框架评估的领先指标包括通用推理、长上下文推理、规划、工具使用、科学推理和软件工程。
展现出相关指标的模型将接受更深入的评估。Microsoft 将由此产生的风险分为低、中、高或关键等级。
该公司表示,高风险或关键风险在部署前需要额外审查和缓解措施。它还承诺,当已识别的风险无法被充分降低时,将暂停开发和部署。
这一承诺意义重大,但它依赖于 Microsoft 的内部评估和治理决策。外部人士无法独立确认每项模型结果或部署判断。
前沿框架还侧重于国家安全和公共安全威胁。企业智能体则带来许多规模较小、但对客户仍然重要的风险。
智能体不需要达到前沿级自主性,也能暴露机密文件、发送未经授权的消息或执行错误交易。
这些失效在很大程度上取决于部署环境。同一个模型在起草工具中可能风险较低,但连接到金融软件后风险会高得多。
Microsoft 通过分层治理来处理这种差异。前沿评估覆盖特殊能力,而其更广泛的标准则覆盖产品、部署和持续运营。
其开源 Agent Governance Toolkit 采取了另一种方法。它提供了用于策略执行、代理身份、执行控制、可靠性、合规证据和插件安全的组件。
治理工具包包含横跨 Python、TypeScript、Rust、Go 和 .NET 的七个软件包。Microsoft 表示,该代码库包含超过 9,500 项测试。
其中一个组件会在代理执行操作前进行策略决策。另一个则为代理分配加密身份,并支持代理之间的信任决策。
该工具包还包括执行环、事务处理、断路器和紧急终止机制。这些功能借鉴了操作系统和站点可靠性工程中的成熟理念。
这一工程化方向至关重要。代理安全不能完全依赖于要求模型遵守自然语言规则。
提示词可以表达意图,但外部策略引擎能够作出确定性的决策。即使模型请求调用某个被禁止的工具,它也可以拒绝该请求。
其中的权衡仍未解决。能力更强的代理需要更多通往真实系统的路径,而更多路径也会带来额外的执行负担。
Microsoft 的策略是让这些路径可见、可测试且可治理。这一策略的价值将取决于产品采用它的一致程度。
Microsoft 的框架仍面临执行缺口
已发布的标准描述了目标系统,但安全取决于控制措施能否经受住产品压力、集成错误和陌生攻击。
Microsoft 的透明度报告提供了有关治理流程的大量细节。但它并未针对每项产品、模型、控制措施或事件提供完整的公开证据。
这一区别很重要,因为内部治理在一定程度上属于自我评估。Microsoft 开发技术、评估许多风险、选择缓解措施,并决定何时可以推进部署。
外部测试可以减轻这种冲突。该公司表示,它已扩大评估合作伙伴关系,并为 Copilot Health 使用了外部测试框架。
在发布这一健康服务体验之前,它咨询了来自二十多个国家的 250 多名持证临床医生。相关工作涵盖清晰度、实用性和安全性。
这一案例展示了针对特定部署的评估流程。但它并不能证明每一种代理产品都接受了同等程度的独立审查。
随着系统日益复杂,透明度也变得更难实现。单个应用可能会结合 Microsoft 模型、第三方模型、插件、专有数据和客户自定义策略。
责任可能分散在这条供应链的各个环节。模型提供商可能会记录其局限性,而框架开发者控制工具执行,客户则负责分配权限。
当事件发生时,每一方都可能将责任指向另一层。因此,有效的 Microsoft AI 安全治理需要在整个部署过程中明确责任归属。
NIST 的风险框架支持这种生命周期视角。它将治理视为一项贯穿全局的职能,并要求持续监控、审查、文档记录以及明确的职责分工。
NIST 还指出,独立审查可以改进测试并减少内部偏见。这一原则为评估 Microsoft 未来披露提供了有用的基准。
采购方应寻找能够证明控制措施在故障情况下仍有效运行的证据。当依赖项崩溃、超时或返回格式错误的数据时,策略引擎必须拒绝该操作。
这被称为“故障时默认关闭”。系统会阻止不确定的活动,而不是因为某项控制措施不可用就继续执行。
Agent Hooks 直接针对这一要求,但规范本身无法保证正确实现。框架维护者必须将其集成,应用团队也必须正确配置它。
一致性测试有助于暴露不兼容问题,但无法预见每一条特定于应用的路径、自定义插件或策略错误。
性能带来另一重压力。开发者可能会绕过那些增加明显延迟、产生误报或打断常见工作流的控制措施。
产品团队同样面临采用激励。一个不断要求审批的代理,可能看起来不如快速行动的代理有用。
由此产生的设计挑战并非实现最大限度的限制,而是在不让日常工作无法使用的前提下,对高影响操作施加更强控制。
监管又增加了一层独立压力。欧盟针对通用 AI 模型的义务已要求提供技术文档以及面向下游提供商的信息。
欧盟委员会的模型义务还涵盖版权政策和训练内容的公开摘要。具有系统性风险的模型还须满足额外要求。
这些规则重点关注模型提供商。代理部署则将风险分散到模型、应用、工具和组织之间。
Microsoft 扩展后的标准试图弥合这一缺口。其新的部署者章节为在 Microsoft 内部使用第三方 AI 应用建立了要求。
该公司描述了三个运营阶段:评估提供商、管理部署风险,以及在发布后持续检测并响应。
这一方法承认了一个令人不安的事实:即使经过充分测试的模型,在设计不当的应用中也可能变得不安全。
最重要的不确定性并不在于 Microsoft 是否已经制定了详细规则,而在于团队能否证明这些规则治理着每一条有实际意义的操作路径。
客户应要求提供控制证据、评估覆盖范围、事件流程和审计记录。有关负责任 AI 的笼统保证并不够。
他们还应维护自己的清单。一个组织无法治理那些安全和合规团队并不知道存在的代理。
对于知识密集型工作,维护一个可搜索的AI 知识库可以提高可追溯性。然而,存储和检索控制仍必须与底层信息的敏感性相匹配。
只有当治理变得可衡量时,执行缺口才会缩小。Microsoft 已提供更多机制,但生产环境证据仍是决定性的检验。
Microsoft 的竞争对手正趋向于基于风险的治理
主要 AI 提供商越来越认同,能力增长必须触发更强的安全措施,尽管它们的阈值和披露方式各不相同。
Microsoft 并非唯一采用基于能力的安全规则的公司。Anthropic 自 2023 年以来一直维持 Responsible Scaling Policy,并随着模型变化多次修订。
Anthropic 的政策将明确的能力阈值与所需的安全措施联系起来。其当前材料涵盖生物风险、网络风险和自主 AI 研究。
该公司将其政策描述为相称、迭代,并适合在 Anthropic 之外采用。其扩展政策还包括违规报告和反报复流程。
Microsoft 的 Frontier Governance Framework 遵循类似结构。两家组织都会识别高风险能力、评估模型,并将结果与更强的保护措施相联系。
这些框架并不相同。它们使用不同的定义、阈值、报告实践和组织流程。
OpenAI 和 Google 也已发布前沿安全方法。这些政策共同显示,业界正日益认同分阶段评估和基于风险的部署。
如今的竞争既关乎实施,也关乎原则。提供商希望发布能力更强的产品,同时向政府和客户证明安全措施会同步跟进。
Microsoft 的独特地位在于,它横跨消费软件、企业基础设施、身份、安全和开发者平台开展业务。
这种整合带来了治理优势。Microsoft 可以将模型评估与访问控制、端点安全、应用策略和组织审计系统联系起来。
它也带来了锁定担忧。客户可能依赖于单一供应商提供代理、身份层、策略引擎、监控和合规证据。
Microsoft 决定将 Agent Hooks 作为框架中立的规范发布,正是在缓解这一担忧。其治理工具包也支持多个外部代理框架。
开放接口可以使控制措施具备可移植性。当团队使用来自不同提供商的模型和框架时,它们也可以为客户提供一致的策略层。
可移植性之所以重要,是因为企业 AI 环境很少长期保持统一。一家公司可能同时使用 Microsoft 365、Azure、Anthropic 模型、OpenAI 编程代理和开源编排软件。
框架中立的契约可以减少重复的集成工作,也可以明确每项决策必须由哪个组件执行。
然而,开放规范只有在竞争框架忠实实现时才有意义。因此,Microsoft 产品之外的采用情况将成为关键衡量指标。
监管机构也在推动这种趋同。欧盟规则要求在 AI 供应链中进行文档记录、风险管理和信息共享。
NIST 的自愿标准提供了另一套共同语言。Microsoft 明确将其治理流程映射到 NIST 的治理、映射、测量和管理职能。
共享术语可以简化审计和采购,但不能保证不同提供商之间拥有同等的安全表现。
每个组织仍然自行决定测试内容、结果评分方式、接受哪些剩余风险,以及公开披露哪些信息。
当客户要求可信证据时,竞争压力可以强化治理;当发布速度成为成功的首要衡量标准时,它也可能削弱治理。
这正是行业竞争的核心。胜出者不会仅仅提供能力最强的代理。
企业客户将青睐能够证明在可执行边界内实现有用自主性的系统。这要求身份、权限、监控、审批、恢复和问责机制协同运作。
Microsoft 正朝着这一整合模式推进。竞争对手将促使它证明,这种整合带来的不只是策略一致性。
Microsoft 将其规则投入生产时值得关注的事项
下一项考验是,Microsoft 能否将其治理架构转化为覆盖产品和外部框架的可见、可重复验证的证据。
第一个信号是产品层面的文档。Microsoft 应展示修订后的 Responsible AI Standard 如何改变各个代理的发布、权限、评估和事件响应。
详细的部署说明将加强该公司关于治理贯穿整个 AI 生命周期的主张。披露过于稀疏则会让客户只能依赖高层保证。
最有用的文档应识别评估类别、已知局限性、审批边界、监控实践和剩余风险。它们还应说明控制措施失效时会发生什么。
这些证据对于 Copilot 产品、Azure 代理服务、编程代理以及协调多个代理的系统都很重要。每种情境都会带来不同后果。
第二个信号是 Agent Hooks 在 Microsoft 自身框架之外的采用情况。主要编排项目的支持将验证对通用执行契约的需求。
仅靠采用还不够。框架必须通过一致性测试套件,并在交互式、批处理、重试和委派执行路径中持续执行策略。
有关集成失败的独立报告,将削弱 Microsoft 关于通用契约能够解决碎片化问题的主张。可复现的一致性结果则会增强这一主张。
第三个信号是事件透明度。Microsoft 表示,部署后仍会持续开展监控、收集用户反馈并采取纠正措施。
读者应关注该公司是否会公开有关代理失败及后续修复的实质性信息。真实事件能够揭示实验室评估未能发现的缺口。
有价值的报告应当区分模型错误、权限失败、工具误用、提示注入以及审批逻辑失效。这种区分有助于客户改进自身系统。
Microsoft 的前沿框架同样值得持续审视。具备更强自主性、规划、网络安全或软件工程能力的新模型,应触发更深入的评估。
该公司已承诺:当风险无法被充分降低时,将暂停开发和部署。未来任何一次启用这一承诺,都将成为对治理独立性的重要检验。
客户无需等到这些信号出现后才采取行动。他们可以盘点已部署的代理、缩减权限、隔离高影响力工具,并要求对不可逆操作进行审批。
他们也可以测试故障情形。团队应有意中断策略服务、提交格式错误的工具请求,并检查被拒绝的操作是否仍然保持被拒绝状态。
日志应将策略决策与实际执行的操作关联起来。只记录模型消息的记录会留下重要缺口。
组织应明确代理上线后的责任归属。当行为发生变化时,产品、安全、法务、数据和运营团队都需要明确职责。
他们还应建立停机和恢复流程。只有人们了解何时以及如何使用时,紧急停止机制才有价值。
Microsoft 的 AI 安全治理正在朝着正确的技术方向发展:它将代理视为用于执行行动的操作系统,而非聊天界面。其最有力的理念涉及运行时执行、身份、权限和证据。
剩下的问题是,这些理念能否经受住生产软件复杂条件的考验。在授予代理更广泛权限之前,采购方应要求其在每一条执行路径上提供证明。



