Wavestone AI Cyber Benchmark 2026 发现治理领先于运营安全
Wavestone 发布的 2026 年基准评估揭示出一个鲜明矛盾:组织在 AI 治理方面远优于其部署后的安全防护。Wavestone AI Cyber Benchmark 2026 发现,受评样本中有 88% 已建立治理机制;但仅有 8% 将 AI 应用日志接入安全运营中心监控。
这一差距之所以重要,是因为组织正为其 AI 系统承担更多责任。受评组织中,有一半如今使用现有框架或预训练模型设计系统,高于 2025 年的 35%。另有 40% 管理完整的开发链条。
因此,这项基准评估衡量的不只是政策制定方面的进展。它还反映出,运营风险正从技术提供商转移至企业的工程、安全、数据和业务团队。这些团队如今负责的系统能够检索敏感信息、调用工具并采取行动。
Wavestone 的核心发现令人不安。治理可以批准 AI 系统上线,但批准并不意味着该系统在事件发生时具备可观测性、可恢复性或安全性。向定制模型和智能体工作流推进最快的组织,面临着这一问题最严峻的版本。
Wavestone AI Cyber Benchmark 2026 揭示巨大的控制缺口
组织建立 AI 治理的速度,快于部署遏制故障、调查事件和恢复可信系统所需运营控制的速度。
Wavestone 于 2026 年 9 月 14 日发布了这项基准评估。其样本涵盖 30 家大型公共和私营组织。评估还纳入了这家咨询公司过去三年开展 AI 安全工作期间的观察结果。
该框架采用了经调整的 NIST Cybersecurity Framework 五项职能。每项职能包含 30 多个评估问题,按从零到 100% 的成熟度量表评分。
随着职能愈发接近实时安全运营,得分逐步下降:
Govern 得分为 54%。
Identify 得分为 55%。
Protect 得分为 48%。
Detect 得分为 40%。
Respond 得分为 29%。
最高得分涉及风险识别,最低得分则涉及风险演变为实际事件时的响应。这一分布支持了 Wavestone 合伙人 Gérôme Billois 的结论:组织在治理 AI 方面优于在生产环境中安全运营 AI。
详细结果进一步凸显了这种反差。根据 2026 benchmark,受评样本中有 88% 已实施 AI 治理机制。然而,只有 32% 明确定义了活动、利益相关方和问责模型。
这种区别将政策与运营模型区分开来。政策可以要求安全审查,却未必明确由谁监控已获批准的系统。它也可以规定升级流程,却没有建立由谁调查遭入侵知识库的机制。
技能配置同样不均衡。仅有 44% 的组织确认配备了专门的 AI 安全专家,能够在系统整个生命周期内支持技术和业务团队。
组织在测试方面取得了更多进展。三分之二开展了专门的 AI 安全渗透测试,一半开展了高级 AI 专项评估。50% 将 AI 评估纳入定期审计和渗透测试计划。
不过,测试只能捕捉某个特定时刻的系统状态。模型、检索来源、权限、集成方式和用户行为都会在部署后发生变化。一次通过的评估无法替代对这些变化的持续可见性。
该基准评估的方法论同样需要审慎看待。其百分比描述的是 30 家受评组织,并非整个全球市场。Wavestone 明确警告,不应将该样本视为具有代表性的市场估算。
即使存在这一限制,其内部模式依然具有意义。与批准和评估相关的控制措施,远比与检测、调查和恢复相关的控制措施普遍。这正是该基准评估真正值得关注的新闻。
企业正从 AI 消费者转向 AI 所有者
随着企业构建更多 AI 技术栈,并接手此前由提供商承担的责任,安全缺口的影响变得更加重大。
2025 年,Wavestone 样本中有 30% 仅使用现有产品提供的 AI 功能。到 2026 年,这一比例降至 10%。这一变化表明,企业正果断超越被动消费阶段。
2026 年样本中有一半使用现有框架或预训练模型在内部设计 AI 系统。这一比例较一年前的 35% 有所上升。管理完整开发链条的组织则从 35% 升至 40%。
这些类别承担着不同的安全义务。消费 AI 功能的公司主要管理数据暴露、用户访问、配置和供应商风险。构建检索系统的组织还必须保护其数据管道、向量数据库、模型连接和应用逻辑。
向量数据库存储用于为 AI 响应检索相关信息的数学表示。如果攻击者操纵该存储,系统便可能检索到被投毒的材料,而无需攻破底层模型。
所有权问题还延伸至知识库。组织通常将内部文档视为受治理的业务信息,而非 AI 攻击面的活跃组成部分。检索改变了这一假设,因为存储的信息能够直接影响系统行为。
Wavestone 发现,样本中有 72% 已开始为 AI 训练实施隐私措施。65% 开展数据集质量检查。仅有 9% 在投入生产前系统性地同时评估数据集质量和安全性。
质量检查关注数据是否准确、完整并适合特定任务。安全检查则关注数据是否遭到操纵、暴露或通过未经授权的途径获取。一个流程不能替代另一个流程。
提供商控制措施是另一个例子。云和模型平台提供身份验证、日志、过滤器和配置保护措施。然而,这些保护只涵盖提供商保留的责任。
Wavestone 样本中,只有 11% 已开始评估或实施超出提供商原生控制范围的保护措施。当团队微调模型、自托管组件或将智能体连接至内部工具时,这一问题更加令人担忧。
该基准评估并未主张组织应避免内部开发。构建系统可以增强对架构、数据位置和依赖关系的控制。但这也使组织必须为保护每一个新增组件负责。
Wavestone 的 2025 findings 已经指向这一问题。报告将 AI 用户与协调第三方模型的组织,以及创建专有系统的高级构建者区分开来。
2026 年的结果显示,更多组织已进入要求更高的类别。其安全计划并未随着这一转变同步、均衡地推进。
这正是运营级 AI 安全如今会给多个团队带来压力的原因。工程团队必须产出可用遥测数据;安全运营团队必须解读这些数据;身份团队必须约束权限,而业务负责人必须决定智能体可以执行哪些操作。
在这一转变期间,文档和可搜索的运营知识同样变得重要。团队需要最新的所有权记录、系统依赖关系、决策和响应程序。维护良好的 searchable knowledge base 可以支持这项工作,但无法替代安全控制措施。
AI 安全治理不等同于生产控制
核心较量在于文档化治理与持续执行的控制之间,而不在于有无 AI 政策的组织之间。
治理建立必要的边界。它可以定义可接受的使用方式、划分系统关键性、分配审查要求并确立升级路径。这些基础很有价值,但不会自动运营系统。
运营控制提出的是不同的问题。组织能否看见可疑行为?能否隔离智能体?调查人员能否重建事件经过?团队能否恢复可信的模型、数据集或知识库?
Wavestone AI Cyber Benchmark 2026 发现,88% 的组织收集 AI 应用日志。仅有 8% 将这些日志接入安全运营中心监控。
这主要不是数据收集失败,而是 AI 运营与安全运营之间的集成失败。
AI 应用团队通常监控延迟、成本、输出质量、失败请求和模型性能。安全团队则寻找已遭入侵的身份、异常访问、恶意输入、数据提取和未经授权的变更。
同一事件在不同团队眼中可能截然不同。工具调用激增可能意味着一个受欢迎的工作流、存在缺陷的智能体循环,或者一次攻击。有效检测需要同时具备来自应用和安全环境的上下文。
日志也需要明确目的。只收集提示词,却没有访问事件、工具调用、模型版本、检索来源或授权决策,可能会让调查人员面对不完整的记录。
NIST 的 AI RMF Core 将部署后监控、事件响应、恢复和变更管理视为相互关联的结果。它还要求建立文档化流程,用于跟踪并从事件和错误中恢复。
这种生命周期方法与一次性批准相冲突。AI 系统可以在没有传统软件发布的情况下发生变化。提供商可能更新模型,团队可能替换检索来源,管理员也可能扩大智能体的权限。
这些变化可能使此前的假设失效。一项批准只读文档检索的审查,对于后来能够编辑记录或发送消息的工作流几乎没有说明力。
同样的问题也影响测试。Wavestone 样本中三分之二开展专门的 AI 安全渗透测试。然而,该基准评估认为,成熟组织必须让测试成为常态,而非例外。
定期测试应跟随重大变更。这些变更包括新模型、工具、数据集、微调、访问范围和自主步骤。测试计划还需要覆盖组织的整个 AI 产品组合。
自动化扫描能够发现易受攻击的组件和配置错误。但它无法完整复现涉及模糊指令、被投毒上下文或多个互联工具的对抗性交互。
AI 红队测试通过结构化的对抗测试应对这些交互。但即使是红队测试,也只是提供关于已测试条件的证据,而非永久保证。监控和响应必须处理测试遗漏的行为。
因此,治理与运营之间的差距反映了不同性质的工作。治理决定应当发生什么;运营安全则在现实偏离该决定时进行检测,并为团队提供干预手段。
智能体 AI 将薄弱的身份控制转化为业务风险
拥有过度访问权限的 AI 智能体,可能将误导性输入或模型错误转化为未经授权的业务操作。
智能体 AI 是指能够规划任务、调用工具,并在有限人工指导下执行操作的系统。这种能力使安全目标从控制生成文本转向控制经授权的行为。
Wavestone 调研小组中,33% 的组织已将智能体 AI 风险纳入治理框架。仅 17% 的组织在开发标准中涵盖了对 AI 功能和工具的安全访问。
在身份控制方面,落地率进一步下降。只有 15% 的组织针对 AI 系统和智能体部署了专门的身份与访问管理防护措施。
这一缺口至关重要,因为智能体将概率性的模型决策与确定性的企业系统连接起来。模型可能基于不确定的上下文选择某项操作,但下游数据库或工作流会具体执行该操作。
这种风险并不需要恶意模型才会出现。被篡改的文档、间接提示词注入、含糊的请求或有缺陷的规划步骤,都可能使原本合法的智能体偏离预期。
OWASP 将过度自主性描述为由过多功能、权限或自主权导致的破坏性行为。其指南建议使用功能范围有限的工具、最小权限、下游授权和活动监控。
这些控制措施将执行机制置于模型之外。这一设计选择很重要,因为让模型自行监管其权限会形成循环依赖。
以一个读取文件并编写摘要的内部研究智能体为例。它需要访问获批的代码库,但大概率不需要删除权限。其文件连接器应仅提供必要的操作。
客户服务智能体则面临不同的风险。它可能读取账户信息、发放补偿额度并修改服务设置。每项操作都需要明确的限额、授权检查和审计记录。
软件智能体可能与源代码、问题跟踪系统、部署系统和云基础设施交互。在这些系统中使用同一个高权限身份,会使归因变得困难,并扩大单次故障的潜在影响。
最小权限原则将每个智能体限制在完成任务所需的最小资源和操作集合内。短期凭证可缩短暴露时间。为每个智能体分配独立身份,则可使活动更易追踪。
高影响操作也可能需要人工批准。该控制应在执行前生效,而不是在模型已对关键系统作出变更之后。
Wavestone 强调,智能体操作应保持有边界、可追踪且可中断。中断不止需要用户界面上的停止按钮。安全团队还需要可靠的方法来撤销凭证并阻止下游访问。
AI 控制矩阵为基于云的 AI 系统提供了更广泛的控制框架。其 2026 年版本涵盖 18 个安全领域的 247 项目标。
不过,框架是否可用并非主要限制因素。该基准显示,组织已在治理层面认识到许多风险。在应用架构和安全运营中实施这些控制仍是更艰难的任务。
智能体 AI 使这种实施变得紧迫。控制薄弱的聊天机器人可能泄露信息或生成有害回答。控制薄弱的智能体还可能依据该回答采取行动。
事件响应与恢复仍是最薄弱的环节
当大多数组织缺乏 AI 专项调查、响应计划和标准化恢复实践时,就无法宣称具备运营韧性。
Wavestone 基准对“响应”的成熟度评分最低,为 29%。其支撑指标解释了原因。
仅 8% 的受评组织能够对 AI 平台开展取证调查。AI 取证涉及重建相关提示词、检索内容、工具活动、模型版本、权限和系统变更。
半数调研组织仍在未采用结构化响应流程的情况下进行临时补救。仅 13% 的组织制定了有文档记录的 AI 专项事件响应计划,而且 Wavestone 表示,这些计划未得到一致执行。
恢复能力同样有限。22% 的组织会备份 AI 相关资产,且相关实践大多尚未标准化。
传统应用备份可能会保留代码和数据库。AI 服务还可能依赖其他资产,包括模型配置、微调数据、嵌入向量、安全策略、提示词和外部知识源。
恢复可用性并不代表重建信任。恢复后的知识库可能仍包含被投毒的文档。恢复后的智能体可能仍保留已泄露的凭证或不安全的权限。
响应面临的第一项挑战是分类。团队必须区分安全事件、可靠性故障、政策违规、模型错误和普通用户失误。有些事件跨越多个类别。
一次未经授权的智能体操作,可能始于提示词注入,随后暴露数据并创建错误记录。响应人员可能需要安全、隐私、法务、工程、模型风险及业务方面的专业知识。
第二项挑战是证据。调查人员需要来自模型服务、身份系统、检索组件、工具网关和目标应用的同步记录。缺失的上下文可能导致无法重建事件过程。
因此,Wavestone 的 88% 日志记录比例看似比实际情况更令人安心。只有团队保留了正确的事件、将其关联起来并向调查人员提供,日志才能帮助响应。
第三项挑战是遏制。组织必须清楚如何在不引发更大范围中断的情况下禁用智能体、撤销其凭证、隔离数据集、切换模型或暂停已连接的工具。
第四项挑战是恢复。团队需要一个已知可信的状态,并在让系统重新投入服务前进行完整性测试。否则,恢复可能重新引入相同的漏洞或已受损的信息。
这种运营复杂性解释了为何响应成熟度落后于治理。政策通常可以扩展现有风险管理结构,而 AI 事件响应需要新的技术证据、跨团队流程和演练。
该基准规模较小的调研小组仍是一项重要限制。这些百分比不应被视为对所有大型企业的判断。自愿接受详细评估的组织,也可能与更广泛的市场存在差异。
衡量方式也发生了变化。Wavestone 在其 2026 年评估中加入了智能体安全、专项防护、监控和响应。因此,直接的同比比较应聚焦于明确匹配的指标。
尽管如此,这一模式与既有风险指南相符。NIST 的生成式 AI 概况强调事件文档记录、日志记录、报告和生命周期信息共享。
较为审慎的解读并不是治理已经失败,而是当运营证据仍然薄弱时,治理成熟度可能制造虚假的信心。
一项政策或许能满足内部里程碑要求,但无法证明安全团队能够发现受损的检索过程、追踪智能体的操作,或恢复一个可信赖的系统。
三项信号将显示运营能力是否迎头赶上
AI 安全成熟度的下一阶段,将通过互联遥测、可执行的智能体权限和经过演练的恢复能力来衡量。
第一项信号,是将 AI 事件接入主动安全监控的组织比例。Wavestone 发现,收集应用日志与将其整合进 SOC 监控之间存在 80 个百分点的差距。
弥合这一差距需要明确的检测场景,而非仅仅转发每一条记录。团队应识别表明可疑检索、权限升级、异常工具使用或试图提取数据的事件。
改进的证据将包括经过测试的告警、调查手册,以及 AI 团队与 SOC 团队之间的共同责任。再增加一份政策文件无法解决运营缺口。
第二项信号,是针对智能体的专属身份控制措施的采用情况。当前 15% 的结果表明,治理层面的认知已领先于技术执行。
进展应体现在独立的智能体身份、范围严格限定的访问权限、短期凭证,以及下游服务内的授权机制。高影响操作应具有明确的审批要求。
随着组织将智能体引入财务、客户运营、软件交付和内部知识工作流,这一信号将愈发重要。每增加一个工具,过度访问的后果都会扩大。
第三项信号,是组织是否演练 AI 专项事件恢复。书面计划很有用,但团队必须测试遏制、调查、恢复和完整性验证。
演练应涵盖受损的数据集、被投毒的知识源、泄露的凭证、不安全的模型变更和未经授权的智能体操作。演练还应测试组织是否能在遏制期间持续开展关键工作。
这些信号将强化或削弱 Wavestone 的核心判断。更高的监控整合水平将表明治理正在进入运营环节。更好的身份控制则表明智能体政策正变得可执行。
成功的恢复演练将提供最有力的证据。它们将证明,当预防措施失效时,组织仍能维持控制,而非假定每一项防护都会奏效。
Wavestone AI Cyber Benchmark 2026 提出了企业领导者无法仅靠放缓采用速度来解决的权衡。更多内部开发可以提升自主性和架构控制力,但也会将责任转移到组织内部。
安全负责人应要求为每个治理里程碑提供证据。哪些系统会向 SOC 发送可操作事件?哪些智能体权限可以立即撤销?哪些 AI 资产具备经过测试的恢复流程?
工程和业务负责人也应提出相应的问题。每个已部署系统在获批后由谁负责?哪些变更会触发重新评估?在自主操作触达关键应用之前,哪位人员能够将其停止?
决定性问题已不再是组织是否拥有 AI 政策,而是该组织能否在 AI 系统行为超出预期时进行检测、遏制、调查和恢复。



