数据债务正成为企业 AI 安全风险
Google News 援引 IT Brew 的一则警告,挑战了企业对 AI 的一种常见假设:更先进的模型无法弥补多年来被忽视的数据控制问题。
眼前的问题是数据债务,即不完整、不一致、难以访问或治理不善的信息所累积的成本。这种债务早于生成式 AI 出现。然而,AI 系统能更快暴露这些问题,并将其影响扩散得更广。
冲突已不再局限于劣质数据是否会导致低质量回答。AI 智能体可以检索记录、调用软件,并在业务系统之间提出建议。当其底层数据缺乏明确的所有权或访问规则时,准确性问题就会演变为安全问题。
这让企业领导者处于一个棘手的位置。他们面临扩大 AI 应用的压力,而安全团队仍缺少可靠的资产清单、分类、留存政策和权限映射。部署速度与可追责的数据治理正以不同的节奏推进。
Genpact 和 HFS Research 在 2026 年 6 月发布的一项研究为这种紧张关系提供了财务视角。作者调查了 16 个行业的 2,002 名高管,并将数据、技术、流程和人才债务列为实现 AI 价值的障碍。
该报告估计,这些累积负债使 Global 2000 公司约 18 万亿美元的潜在价值被困住。这个估算值得谨慎看待,但背后的问题十分具体:组织无法安全地使用自己并不了解的信息。
Google News 的警告关乎基础设施,而不只是模型
重要变化在于,数据债务如今决定了 AI 系统能够访问、暴露和采取行动的内容。
IT Brew 的报道建立在企业重新评估 AI 就绪度这一更广泛趋势之上。多年来,企业将分散的记录、重复的数据库、未记录的字段和过宽的权限视为可管理的运营摩擦。AI 则将这些妥协直接变成了输入。
传统应用通常通过预定义查询和可预测的工作流访问信息。生成式 AI 助手可以从多个存储库中检索语义相关的材料。智能体则能更进一步,自主选择工具并采取行动。
这种扩大的触达范围改变了安全计算方式。旧共享驱动器中一份被遗忘的文档,可能在日常工作中并不引人注意。但检索系统会因为其内容与用户问题相似而将其呈现出来,即使其存储位置看似隐蔽。
过期权限也会造成类似问题。员工在调岗后仍保留访问权限,或许很少会再访问旧系统。但连接到该系统的 AI 助手可能会将其中内容带入日常对话。实际上,一名调往其他地区的销售人员可能询问账户历史,并获得其不再负责区域的价格让步信息或客户备注。
最初的访问失误依然源于人为因素。AI 提高了这种失误产生影响的频率和规模。
这正是为何数据质量与数据安全之间的区分正变得不那么有用。错误的客户分类可能会扭曲 AI 建议;缺失的敏感性标签则可能暴露同一客户的私人信息。
两种失误都源于数据管理问题,但其后果会落在业务的不同环节。
这项企业债务研究将数据债务定义为由碎片化、难以访问、质量不佳或治理不足的信息带来的阻力,并将其与流程、技术和人才债务并列。
这些类别相互作用。遗留应用会造成数据碎片化;碎片化数据迫使员工建立手动变通方案;而手动变通方案又依赖少数人掌握的未记录知识。
向这一环境引入 AI 并不会消除这些依赖关系,反而可能通过对话界面将它们隐藏起来。
研究发现,数据债务最常被选为首要业务影响的是决策质量下降和洞察不可靠,占 18%;其次是成本上升和工作浪费,占 15%。
安全并不游离于这条链条之外。如果企业无法识别权威副本、责任所有者或合法用户,就无法持续保护数据。当支撑记录缺乏来源追踪时,企业也无法解释 AI 决策。
来源追踪描述信息从何而来以及如何发生变化。当模型结合搜索结果、内部文档、用户指令和外部工具时,它变得至关重要。NSA、CISA、FBI 及国际合作伙伴在联合指南中明确建议,在整个 AI 生命周期内追踪数据来源并验证可信修订版本。
没有来源追踪,调查人员或许能看到不安全的输出,却难以还原其成因。来源是否不准确、遭到投毒、已经过时、权限配置不当,还是仅仅被模型误解?
在这里,Google News 的价值在于显示关注度正在上升,而不是作为证据本身。真正的底层证据来自企业调查、安全遥测数据、标准和已报道的组织经验。
IT Brew 自身的自动化研究发现,仅 12% 的受访 IT 专业人士非常有信心员工理解相关的数据安全政策。该数字反映的是认知情况,而非技术执行,但它凸显了快速采用周围薄弱的人为环节。
同一研究还发现,29% 的受访者在部署 AI 后经历了轻度复杂性增加。复杂性之所以重要,是因为安全团队必须先理解一个系统,才能可靠地监控它。
复杂的 AI 技术栈可能横跨数据仓库、向量数据库、模型提供商、身份系统、插件和员工设备。每一项连接都会增加权限、日志记录或留存规则可能出现偏差的环节。
因此,标题并不是说企业数据需要再来一轮清理行动。AI 已经改变了推迟这项工作的后果。
数据债务扩大了 AI 攻击面
治理不善的数据为 AI 系统泄露敏感信息或遵循受损上下文创造了更多机会。
攻击面包括系统可能被操纵或触及的每一条路径。AI 扩大了这一攻击面,因为自然语言成为连接数据和软件的接口。
风险在攻击者出现之前就已开始。员工可能将专有材料粘贴到未经批准的服务中;团队可能在未审查继承权限的情况下,将助手连接到存储库;开发人员可能收集包含机密或个人数据的运营日志。
这些行为会形成影子 AI,即运行在获批安全和治理控制之外的 AI 使用方式。工具本身可能是合法的,但组织无法可靠地观察信息如何在其中流动。
Cyberhaven 的AI 风险研究分析了涉及生成式 AI 服务、终端应用和智能体的数十亿次数据流动。该公司表示,企业 AI 行为正在产生旧有控制措施往往无法发现的风险。
阅读供应商研究时应考虑其商业动机。尽管如此,所描述的可见性缺口与一项基本安全原则一致:控制措施无法保护自己无法定位或分类的信息。
数据债务会以多种方式削弱这种可见性。
首先,重复记录使识别权威版本变得困难。安全团队可能保护了当前数据库,但较旧的导出文件仍可通过共享文件夹访问。
其次,不完整的分类使模型缺少可靠的敏感内容处理规则。一份文档即使没有任何文件标签,也可能包含机密信息。
第三,身份信息不一致会模糊谁应当拥有访问权限。收购、承包商账户、共享凭据和岗位变动,可能留下早已失去业务用途的权限。
第四,薄弱的留存实践会让信息在其价值消失后仍可访问。AI 检索使这些沉睡的信息更容易被重新发现。
第五,缺失的数据血缘关系使团队无法将输出追溯至其源头。这会使事件响应更加复杂,也让有害错误更难得到控制。
当 AI 智能体获得常设访问权限时,这些弱点会变得更加严重。常设访问权限持续可用,而不是仅为特定任务短暂授予。
只能根据获批文档起草文本的助手,其运营触达范围有限。能够读取发票、更新客户记录并发送消息的智能体,则跨越了多重信任边界。
如果某个连接的存储库包含误导性指令,智能体就可能遭遇间接提示注入。在这种攻击中,外部或检索内容中的恶意文本试图重定向模型的行为。
模型可能将敌意文本视为指令,而非普通数据。有效防御不止是过滤可疑短语。系统必须将可信指令与不可信内容分开,并限制工具能够执行的操作。
数据债务让这种分离更加复杂。当组织缺乏可靠的来源清单时,就难以决定哪些存储库值得信任。当文档所有权不明确时,也没有人负有审查风险内容的明确责任。
访问控制在检索系统中的表现也有所不同。原始文档被删除或限制访问后,搜索索引仍可能保留其中信息。缓存的嵌入向量——用于语义搜索的数值表示——会带来额外的生命周期问题。
嵌入向量本身或许无法重现源文档。然而,索引文本、元数据、检索缓存和模型日志都可能保留敏感细节。
安全团队必须了解哪些组件存储原始内容,哪些存储派生表示。他们还必须理解整个管道中的删除行为。例如,当离职承包商失去项目文件夹的访问权限时,同样的限制应及时传递至搜索索引;否则,前同事可能继续看到源系统已不再返回的文档摘录。
Cloud Security Alliance 报告称,非结构化信息估计占企业数据的 70% 至 90%。其非结构化数据研究认为,传统治理实践正难以应对这一规模。
非结构化数据包括电子邮件、聊天消息、文档、录音和演示文稿。它也是检索增强生成系统通常首先瞄准的材料。
这带来了一种核心逆转。企业曾认为过于分散、难以管理的信息,如今已成为有价值的 AI 上下文。在治理工作完成前,其实用性就会吸引人们将其整合进系统。
更快的 AI 部署与可追责治理发生碰撞
核心竞争在于部署速度与解释每一次重要数据访问或 AI 操作的能力之间的较量。
AI 项目通常以明确的业务目标起步。客服团队希望更快地回复。财务团队希望自动审核发票。工程组织希望借助助手搜索技术文档。
数据治理修复的回报并不那么立竿见影。对记录进行编目、审查权限、删除重复项以及制定保留规则,可能让人觉得与高管期待看到的演示成果相去甚远。
这种可见性上的差异,会促使团队先构建 AI 层。他们将模型连接到现有系统,测试有前景的工作流,并将基础性工作推迟到规模化成为必要条件时再进行。
在试点范围有限时,这种做法行得通。但当组织增加用户、资料库、工具或自主操作时,它就会失效。
随后,安全团队接手的系统,其价值取决于广泛的访问权限。限制这些权限可能降低回答质量;维持广泛权限则可能违反最小权限原则。
最小权限意味着只向每个用户或服务授予完成当前任务所需的访问权限。当代理需要为众多用户执行多项任务时,这一原则会更难落实。
员工的访问权限不应自动成为代理的永久权限。代理可以更快地运行、跨系统整合信息,并在员工未逐步监督时采取行动。
Teleport 的遥测数据说明了这一担忧。其 2026 年调查覆盖了 205 名 CISO、安全架构师和平台负责人。该公司报告称,拥有过度权限 AI 系统的组织,其安全事件发生次数是落实最小权限组织的 4.5 倍。
这些身份安全研究发现来自一家供应商,不能证明因果关系。不过,它们仍指向一种可信的机制:不必要的访问权限会增加受损系统可能执行破坏性操作的数量。
良好的治理必须在多个层面发挥作用。
在数据层面,团队需要明确所有者、分类、质量规则、保留期限和获准用途。在身份层面,他们需要清晰映射用户、服务、代理和资源之间的关系。
在模型层面,他们需要测试信息泄露、不安全的工具选择、不可靠输出和操纵风险。在运营层面,他们需要日志,将一次 AI 操作关联到其用户、数据来源、模型、指令和工具。
这些控制措施单独存在时,都难以有效发挥作用。
完美的访问日志无法解释某个来源是否准确。整洁的数据目录无法阻止代理采取不必要的行动。强有力的模型测试也无法弥补允许不受限制地修改生产环境的凭据。
这就是为什么购买 AI 安全产品并不能消除数据债务。产品可以改善发现、监控、政策执行或测试,但无法替每个组织决定合法的所有权和使用规则。
这些决定需要业务部门参与。法务团队了解合同义务。隐私团队了解个人数据要求。部门负责人了解哪些记录在运营中仍有必要。
安全团队将这些责任转化为控制措施,但他们无法凭空创造底层业务背景。CISA 和英国国家网络安全中心发布的联合安全 AI 指南也获得了 23 家网络安全组织的认可,并同样强调在开发和运营全过程中,对安全设计、透明度和组织所有权的责任。
这种压力也延伸到知识型员工。由于官方系统难以搜索,员工常常创建本地归档、重复笔记或私有导出副本。这些副本可以保留宝贵的上下文,却也可能脱离集中治理。
设计完善的知识管理系统在访问和保留规则保持清晰的情况下,可以减少不必要的信息碎片化。但如果团队在未审查权限的情况下导入材料,它也会带来新的风险。
目标并不是最大程度的集中化,而是对信息存放位置、谁能够访问,以及 AI 如何使用信息实现可预测的控制。
这一目标与“AI 模型应搜索一切”的信念相冲突。广泛检索可以提升便利性,但也会扩大暴露面,并使错误上下文更难被发现。
更安全的替代方案是选择性检索。内容到达模型之前,系统应根据用户、任务、敏感性和当前授权状态过滤来源。
这种过滤必须在请求时进行。在一个服务账户下将文档复制到中央索引,可能会抹平源系统中原本存在的权限差异。
团队还需要明确的工具边界。分析发票的代理并不自动需要批准付款的权限。推荐客户回复的助手不需要发送回复的授权。实际操作中,财务审核人员应能看到拟议付款、源发票和异常标记,而代理在未经另行授权批准的情况下,仍不能放款。
这些区分会减慢初始部署速度,但也会使规模化部署更具可辩护性。
数据债务相关数字未能证明什么
企业债务研究揭示了一项普遍存在的制约因素,但并未表明每一次 AI 失败都始于糟糕的数据。
Genpact 和 HFS Research 提出的 18 万亿美元估算,是近期报道中最引人注目的数字。它代表的是模型测算的潜在价值,并非企业账目中记录的资金。
该估算汇总了全球 2000 强企业在解决四类企业债务后可能实现的收入增长和成本下降。它不应被解读为数据现代化带来的保证回报。
四类债务中只有一类是数据债务。即便信息准确且治理完善,流程、技术和人才方面的限制仍可能阻碍项目推进。
模型也可能因与数据卫生无关的限制而失败。它可能产生幻觉、误解请求、选择错误工具,或对相似提示给出不一致的回应。
安全失败有许多来源。遭入侵的依赖项、被盗凭据、存在漏洞的 API、不安全的插件或有缺陷的应用设计,都可能绕过原本良好的数据治理。
将数据债务视为唯一原因,会重复造成问题的同一种过度简化。企业 AI 系统是社会技术系统,这意味着其行为取决于软件、信息、流程和人员的共同作用。
该报告的调查设计同样重要。高管的回答揭示的是他们感知到的组织约束,并非对每家参与企业数据资产的独立审计。
受访者对“数据债务”的理解可能并不相同。一位高管可能指的是重复的客户记录,另一位则可能指较差的分析质量、访问受限或治理缺失。
这一类别仍然有用,因为这些情况共享一种延迟成本模式:组织通过推迟工作获得短期速度,但当 AI 需要一致的信息时,便会面临更高成本。
不过,这个标签也可能变得过于宽泛。供应商可以将“债务”附加到任何遗留问题上,并将现代化呈现为显而易见的解决方案。
这种表述可能促使企业启动另一项昂贵的转型计划,却没有明确的优先级。一家公司可能更换平台,却保留不清晰的所有权和过度访问权限。
更好的检验方式是运营性的。组织能否针对高价值 AI 工作流回答具体问题?
团队应知道系统使用哪些来源、由谁负责,以及它们上次审查是在何时。他们应知道权限是否仍与当前角色保持一致。
他们应知道代理在检索信息后能够做什么。他们还应知道,调查人员能否在不依赖模型叙述的情况下重建一项重要决策。
美国国家标准与技术研究院围绕治理、映射、测量和管理风险来组织 AI 风险工作。其AI 风险管理框架和生成式 AI 概况呼吁记录系统用途、持续监控、明确事件响应责任归属,以及定期审查第三方 AI 系统,而不是依赖单一控制措施或产品。
这种生命周期视角契合数据债务,因为旧有弱点很少能通过一次迁移消失。随着系统演进,团队必须持续检查质量、权限、来源和使用情况。
另一项不确定性涉及可衡量的安全结果。调查受访者可以报告准备不足,但企业很少披露详细的 AI 事件。因此,公开数据对频率和严重程度的呈现并不完整。
有些事件即使 AI 影响了攻击路径,也可能被归类为普通数据丢失、访问滥用或应用遭入侵。另一些事件可能涉及不安全输出,却未造成需要报告的数据泄露。
这使比较变得困难。组织需要为 AI 相关事件制定内部定义,才能评估控制措施是否降低了这些事件。
一个有用的定义应涵盖模型操纵、未经授权的数据披露、不安全的代理操作以及遭入侵的 AI 基础设施。它还应区分已确认的损害、政策违规和险些发生的事件。
没有这种纪律,领导层可能因为报告的事件数量保持较低而宣称有所改善。但这个数字也可能只是反映了检测能力有限。
持怀疑态度的结论很直接:数据债务是可信的风险放大器,而不是对 AI 不安全性的完整解释。
清理记录却忽视代理身份、模型行为和软件依赖项的公司,仍将面临风险。购买监控工具却让所有权问题悬而未决的公司,只会在更好的仪表盘下继续面对同样的模糊性。
三项信号将显示 AI 安全是否正在跟上
下一项检验在于,企业是否会将对数据债务的担忧转化为更严格的权限、可追溯的检索和可衡量的事件减少。
第一个信号是,为 AI 代理采用任务专属的身份控制。组织应摆脱共享服务账户和永久凭据。
每个代理都应拥有独立身份、有限权限,以及可追责的人类或业务负责人。访问权限应根据任务收窄,并在不再需要时失效。NIST 2026 年关于软件代理身份与授权的概念论文指出,授权、审计、不可否认性和提示注入控制,是需要更强标准和实施指导的具体领域。
如果这成为标准实践,AI 部署与安全准备度之间的差距将开始缩小。如果常驻访问权限依然普遍,数据债务将继续转化为更大的影响范围。
第二个信号是,检索系统保留源权限和删除规则的证据。企业 AI 供应商越来越多地承诺提供安全连接器,但买家需要技术证明。
安全团队应测试:撤销的访问权限是否会及时从搜索结果中消失。他们还应验证索引、缓存、日志和备份如何处理已删除的材料。
他们还应核查引文是否能可靠地指向回答所使用的确切来源。当调查人员需要文档级溯源时,仅提供一个指向代码仓库的笼统链接并不足够。
这方面的进展将强化这样一种观点:组织可以利用分散的信息,而无需削弱其控制机制。若权限持续漂移,则表明便利性依然优先于可追责的信息检索。
第三个信号是更完善地披露与 AI 相关的安全事件。企业和供应商需要一致的分类标准,以区分数据泄露、提示注入、过度自主、身份滥用和基础设施受损。
更多报告并不一定意味着安全状况正在恶化。早期报告数量上升,可能表明检测和分类能力正在改善。
关键衡量指标在于,组织能否减少严重后果,并缩短完成处置所需的时间。这需要可比的指标,而不是孤立的营销说法。
这三个信号应出现在采购评审和运营仪表盘中。它们比启动了多少试点项目或有多少员工获得助手访问权限更具参考价值。
Google News 的关注焦点将继续转向 AI 智能体、新型安全产品和重大事件。读者应透过这些头条,审视数据层的状况。
应当追问:被重点报道的系统是否知道哪些信息具有权威性?它的访问权限是否随用户和任务而变化?一旦出现问题,其操作是否能够被还原?
企业领导者应从一项高价值工作流程着手,而不是承诺进行全组织范围的数据清理。梳理其数据来源、负责人、权限、保留要求、智能体工具和故障路径。
随后,使用已撤销的账户、被投毒的文档、过时的记录以及跨越授权边界的请求来测试这些控制措施。记录系统检索了什么、忽略了什么,以及试图采取哪些操作。
这一演练无法消除所有 AI 风险,但能揭示组织是否真正理解其已经部署的系统。
问题不再是数据债务是否会降低模型质量,而是企业能否在 AI 将每一项被遗忘的权限和未受管理的记录变成一项主动的安全决策之前,清偿这些债务。



