Ivanti AI 安全指导将工时缩短数小时,但其 Claude Skill 编造了细节
Ivanti 披露,其基于 Claude 的补丁分析 Skill 曾编造细节,尽管它将一项周期性工作流程从数小时缩短至数分钟。Ivanti AI 安全指导系统在开发期间混淆了 Microsoft Office 版本,并多次误判 Adobe 的发布节奏。
这一承认意义重大,因为该输出帮助安全团队在 Microsoft 每月的 Patch Tuesday 后确定漏洞优先级。即使所引用的每个漏洞都是真实存在的,一个看似可信的虚构内容也可能扭曲系统应优先获得关注的次序。
Ivanti 随后设置了人工审批关卡,并在 6 月的一张图表中公开标明 Claude 的作用。CrowdStrike 和 Palo Alto Networks 也让人员参与具有重要影响的安全自动化流程,但两家公司均未公开描述过捕获到类似虚构内容的情况。
因此,这个故事不只是一个模型犯错那么简单。它考验的是供应商是否会披露 AI 如何塑造运营指导、其审核人员实际核查什么,以及哪些错误仍然不可见。
Ivanti AI 安全指导在历经数月修正后投入生产
Ivanti 直到开发人员在训练期间反复发现虚构或混淆的细节后,才将其 Claude Skill 投入生产。
Ivanti 终端安全产品管理副总裁 Chris Goettl 围绕一项自己手动执行了约十年的流程构建了该 Skill。它会接收已发布的供应商公告和 Ivanti 自己的电子表格,随后应用公司的威胁风险优先级排序方法。
在这里,Skill 指提供给 AI 模型的一套可复用指令、信息源和工作流程规则。它并不意味着模型能够独立理解每家供应商的披露系统。
Goettl 按供应商逐一训练该系统。Microsoft 是第一家,因为其可下载电子表格提供了相对结构化的输入。Adobe 则需要不同的方法,因为模型必须解读单个页面及其不断变化的布局。
这种差异暴露了一个重要弱点。该 Skill 多次给出了错误的 Adobe 发布节奏。它还混淆了 Microsoft Office 版本,而 Microsoft 将其划分为多个产品系列。
这些并非文风问题。发布节奏和产品身份会影响分析师对异常活动、受影响软件及补丁紧迫性的判断。一份表述精致却模式错误的摘要,仍可能将团队引向错误方向。
Goettl 描述称,当一个回答明显缺乏支持依据时,他会直接质问系统。根据他在AI 辅助管道中的说法,Claude 承认这些虚构内容没有可供引用的依据。
Ivanti 表示,该 Skill 仅使用公开的供应商公告和由公司控制的电子表格。它不处理客户数据,且每一份生成输出在获得人工批准前都只是草稿。
高级产品经理 Todd Schell 使用此前手动编制的两个月简报对系统进行了回放测试。Ivanti 报告称一致率达到 98%,同时承认仍存在边缘情况。
这一数字需要谨慎解读。VentureBeat 并未独立审计源数据、评分方法、错误分类体系或回放结果。一致性也不能证明每个相关漏洞都出现在生成输出中。
首次生产运行发生在 2026 年 8 月,当时 Goettl 正在休假。据称,此前需要两名员工各花约四小时完成的一份电子表格,在不到 30 分钟内就完成了处理。
围绕每次 Patch Tuesday 的更广泛月度工作流程,过去总共要消耗约 48 个工时。Ivanti 估计,这相当于 Goettl 和 Schell 合计工作时间的至少 5%。
这一运营收益不难理解。机器可以比两名专家手动在电子表格间复制字段更快地收集、标准化和排序大量发布信息。
不过,Ivanti 并未将专家从流程中移除。公司将专家的工作从组装每一行,转变为审核机器生成的草稿。
这一区别界定了核心冲突。自动化通过减少人工构建来节省时间,而可靠的安全指导仍依赖人工判断和源级验证。
在更广泛的报道出现之前,Ivanti 也留下了清晰可见的披露。其 2026 年 6 月 Patch Tuesday 文章标明,一张图表由 Claude 根据作者设计的提示词和 Goettl 的数据集生成。
没有任何法规要求添加这一说明。也没有通行的行业标准规定其措辞。该披露在受到更广泛审视前已公开保留约三个月。
在开发失败情况曝光后,这一低调的说明变得重要起来。它将一个 AI 生成的产物与具体模型、人类作者、日期和明确的数据集联系在一起。
这比笼统的“AI assisted”标签更具透明度。但它仍未说明核查了哪些行、如何衡量完整性,或已发布的风险等级是否经过独立验证。
Patch Tuesday 数据问题让自动化更具吸引力
直接压力来自一个规模更大、标准化程度更低、且更依赖各供应商解读的 Patch Tuesday 流程。
2026 年 9 月 8 日,Microsoft 发布了多名安全研究人员称为其规模最大的 Patch Tuesday。然而,分析同一发布的不同机构公布的总数存在显著差异。
Tenable 统计了 964 个漏洞,其中 104 个被评为严重,860 个被评为重要。其9 月分析还指出,有两个漏洞在补丁发布前已被在野利用。
Ivanti 统计为 973 个。Senserva 则统计为 1,169 个,因为它依据知识库文章映射漏洞,而非采用其他追踪机构使用的同一以公告为中心的方法。
Tenable 与 Senserva 的总数相差 205 个漏洞。这一差距超过了 Ivanti 所引用的此前 Patch Tuesday 纪录,即 2025 年 10 月的 175 个漏洞。
这些差异并不能证明 AI 模型犯了错误。它们可能源于对范围、重复条目、产品变体、公告边界和知识库映射所作的合理选择。
但它们确实表明,单一月度总数不能被视为中立事实。如今,每个已发布统计都反映了一种解析方法,以及对哪些内容属于该集合的定义。
当 Microsoft 停止在其 Security Update Guide 中提供单一汇总的月度 CVE 列表时,这一问题进一步加剧。Rapid7 在准备其7 月补丁审查时记录了这一变化。
现在,每家安全供应商都必须根据 Microsoft 可提供的数据重建发布内容。这种重建可能涉及确定性代码、人工分析、AI 模型,或三者的组合。
确定性解析器遵循明确规则,并在获得相同输入时产生相同结果。大型语言模型可以更灵活地解读不一致的页面,但也可能生成缺乏依据的关联。
当输出不仅仅是一个统计数字时,这种权衡尤其重要。安全团队需要基于活跃利用、公开披露、严重性、资产暴露度和业务重要性进行优先级排序。
不正确的统计可能造成报告混乱。不正确的优先级则可能将有限的补丁资源从攻击者已在利用的威胁上转移开。
据称,Ivanti 的网络研讨会简报每月可触达 500 至 700 名参会者。这些参与者未必会将每项建议直接复制到生产环境,但受众规模使每一个优先级决策都具有实际影响力。
时间压力同样真实存在。安全团队无法在攻击者行动之前从容检查近一千个条目。
CrowdStrike 报告称,在涉及公开概念验证的已观测利用活动中,88% 在 48 小时内开始。概念验证是公开可用的代码或技术文档,用于展示漏洞如何被利用。
联邦要求的时限甚至更紧。CISA 的 Binding Operational Directive 26-04 为联邦民用机构中风险最高的漏洞设定了三天的修复窗口。
在这些条件下,供应商有充分动力自动化收集和初步分类。等待完美的人工审查本身也可能带来风险。
问题不在于组织是否应使用 AI,而在于它们能否证明加速流程没有遗漏关键漏洞、破坏产品映射,或抬高微弱信号的重要性。
Ivanti 的经历表明,这种证明不能来自语言流畅性。模型的错误输出看起来足够可信,以至于需要专家识别并直接质问。
因此,安全采购方正承受双重压力。他们需要更快的指导,却不能假定一份更快、措辞良好的简报就包含完整或优先级准确的集合。
真正的转变是披露,而非虚构
令人意外的并非 Claude 编造了细节,而是 Ivanti 描述了这些失败并保留了清晰可见的人工关卡。
大型语言模型通过根据训练数据和提供的上下文预测可能的序列来生成文本。它们并不天然保证每一项陈述都能对应到所提供的来源。
虚构内容通常被称为幻觉,指模型将没有依据的信息呈现得仿佛有事实基础。在这一工作流程中,失败表现为错误的供应商模式和被混淆的软件系列。
这些弱点在通用 AI 系统中早已为人所知。改变风险级别的是,它们被置于一个生成安全建议的管道之中。
消费级聊天机器人出错可能只会浪费读者时间。运营指导中漏掉一行漏洞信息,可能延误暴露系统的修复。
Ivanti 的披露并未消除这种风险。它使风险变得可供审视。
该公司至少为一张已发布图表附上了模型名称和人工负责人。Goettl 还解释了训练期间出现的问题,以及为何人工审核关卡仍然必要。
这种具体程度有助于客户提出更好的问题。他们可以区分模型辅助收集与自主优先级排序,并询问哪个阶段接受人工验证。
这一承认也使传统的信任信息变得复杂。供应商通常会在宣布 AI 功能时强调准确率提升、处理速度或分析师生产力。
开发失败很少获得同等关注。这种不平衡鼓励采购方依据工作流程的最佳基准,而非其已知失败模式来评估它。
Ivanti 报告的 98% 一致率说明了这种危险。这个数字听起来令人安心,但其实际意义取决于剩余差异具体是什么。
无关紧要的格式差异与遗漏一个正在被活跃利用的漏洞,不应得到同等权重。有效评估必须按照运营后果对错误进行分类。
完整性应与正确性分开讨论。审核人员可以在可见的条目中发现错误的严重性评级或格式不当的描述,却很难察觉缺失的条目。
这对“人工审核”的说法构成了最尖锐的挑战。阅读生成内容,并不等同于将其与权威来源清单进行核对。
独立虚拟首席信息安全官、IEEE 高级会员 Kayne McGladrey 认为,客户需要一份关于该流程的书面说明。他表示,供应商应解释模型在哪里运行、如何解析 CVE、由谁审核输出,以及有多少内容经过来源验证。
他的批评不止于要求人工签字。用此前由人工生成的月度数据进行回放,可以衡量相似度,却无法证明当月内容的正确性。
人工审核人员也可能与模型共享同一个盲区。如果双方都只关注可见条目,那么谁也不会发现那些在审核开始前就已消失的项目。
因此,相关标准应是可追溯性。每一项已发布的建议都应关联至权威输入,而每一项权威输入都应有记录在案的处置结果。
后一个方向尤为重要。它将审核从“这份草稿看起来是否合理?”转变为“每一项来源内容是否都能得到交代?”
这正是严谨的知识融合在补丁管理之外也具有意义的地方。整合来源只有在工作流保留溯源信息、暴露冲突而非将其掩盖时才有价值。
Ivanti 的披露提供了一个起点,而非一套完整标准。它告诉买方 AI 参与其中,且已知的幻觉问题影响了审核流程的设计。
但它尚未公开证明逐行溯源、独立风险分级测试、漏报率,或自动核对的来源材料比例。
不过,这一承认也对竞争对手施加了压力。如今,若某供应商宣传 AI 辅助的安全指导,却不说明其验证链条,向客户提供的信息就比 Ivanti 更少。
这种反转令人不适,却具有建设性。公开承认模型的失败,可能成为流程成熟度的证据;而沉默则可能掩盖出色的控制措施,也可能意味着根本没有控制措施。
只有能够发现缺失证据时,人工审核才有效
只有当审核设计针对遗漏、缺乏依据的主张以及高影响力的分类错误时,审核人员才能真正创造价值。
Ivanti 的工作流在 Claude 生成草稿与发布简报之间保留了人工环节。这比让模型自动发布优先级建议更安全。
然而,“人在回路中”描述的是一种设计,而非质量衡量标准。其有效性取决于审核人员能看到什么、核查什么,以及能够叫停什么。
审核人员浏览文本时,可以识别措辞异常、熟悉的产品被归入错误类别,或不合理的发布模式。Goettl 的专业知识似乎在训练期间发现了这些可见异常。
更棘手的失败是静默遗漏。如果解析器或模型从未为某个漏洞创建条目,那么只检查最终电子表格的审核人员不会收到任何明显警报。
更强健的系统需要语言模型之外的核对控制措施。确定性检查可以比对来源标识符、标记未匹配记录、检测重复 CVE,并按供应商统计预期项目数量。
随后,模型可以处理那些受益于解释能力的任务。它可以总结公告、规范化不一致的描述,或提出供专家批准的风险类别建议。
这种划分赋予机器不同的职责。代码保障完整性与可重复性,而模型则协助处理模糊语言和优先级背景。
它还会产生更明确的失败信号。即使生成的叙述看似精致,核对不匹配也可以阻止发布。
风险分级验证同样需要严格性。系统应记录某个项目为何获得该评级、哪些来源事实支撑这一决定,以及人工审核后发生了哪些变化。
没有这些记录,最终批准虽然确立了责任归属,却只能提供有限的质量证据。它无法证明审核人员检查了每一项建议,还是仅抽查了风险最高的条目。
Ivanti 表示,已知遭利用、公开披露和异常数量信号会触发升级处理。这是一套合理的规则,但公开报道并未独立验证其实际应用。
Adobe 和 Office 的失败也说明了为何必须进行供应商特定测试。一个在 Microsoft 电子表格上表现良好的工作流,可能会在另一家发布者使用网页、不同命名惯例或不规则发布节奏时失效。
因此,评估必须覆盖每个数据来源和每个转换阶段。混合平均值可能会让强劲的 Microsoft 表现掩盖薄弱的供应商连接器。
CrowdStrike 在 Fal.Con 2026 上介绍了一种不同的审核模式。据报道,其“human on the loop”方法让分析师与代理并行处理同一个检测结果,然后比较结论。
并行工作可以暴露顺序审核容易遗漏的分歧。与由一人检查已完成草稿的工作流相比,它也保留了更多人工投入。
Palo Alto Networks 于 2026 年 2 月推出 Cortex XSIAM AgentiX,配备预构建代理,并针对高影响行动设置批准关卡。其代理式 SOC 设计同样在自动化决策后果更严重的环节保留人工控制。
这两种设计都无法自动解决输入缺失的问题。人类与代理都可能基于不完整的数据源进行推理,而批准关卡也可能依据有缺陷的证据授权某项行动。
不过,这一比较仍揭示出一种正在形成的共识。主要供应商并未将不受限制的自主性视为高影响安全运营中可接受的默认选择。
这一共识很重要,因为行业语言常常混淆辅助与自主。起草一份简报的系统,与部署补丁、隔离设备或关闭事件的系统,在实质上截然不同。
买方应根据每项 AI 行动的可逆性及潜在危害进行映射。低影响摘要可采用较轻的控制措施,而改变生产系统的决策则不应如此。
他们还应要求提供真实失败案例的证据。只报告一致性的基准测试掩盖了错误究竟涉及措辞、范围、严重性还是遗漏。
Ivanti 已知的幻觉捕获案例比单纯的准确率声明提供了更有用的信息。它们明确指出系统在何种具体条件下变得不可靠。
尚未解决的问题是,生产控制措施能否发现新的失败模式,而不仅仅是训练期间发现的那些。供应商网站会变化,分类体系会演进,异常发布也可能使昨天的解析假设失效。
人工审核仍然必要,但应置于可衡量的控制体系之中。否则,这个说法可能只会带来安慰,而无法证明最危险的错误是可发现的。
Ivanti 的承认提高了所有安全供应商的标准
安全供应商如今面临压力:不仅要披露是否使用 AI,还要准确说明 AI 如何影响面向客户的优先级判断。
Ivanti 并非唯一将安全分析自动化的企业。CrowdStrike、Palo Alto Networks 和其他供应商正将模型与代理嵌入检测、调查、分流和响应工作流。
这里暴露出的竞争差异在于透明度。Ivanti 点名了所用模型,描述了输入内容,指出了已知的幻觉模式,并说明发布需要人工批准。
VentureBeat 报道称,它未发现 CrowdStrike 或 Palo Alto Networks 有类似的公开幻觉披露。这并不能证明它们的系统出现过故障,也不能证明它们的控制措施较弱。
这意味着客户缺乏可比信息。一家供应商公开了部分失败历史,而其他供应商主要描述架构与保障措施。
公开披露带来一个棘手的激励问题。报告错误的公司,可能看起来不如只发布成功评估结果的竞争对手可靠。
安全采购可以通过奖励证据来扭转这种激励。买方可以向每个供应商提出同样的问题,并将未获回答的问题视为尚未解决的控制缺口。
首先,客户应询问哪些产物由 AI 生成。答案应区分收集、解析、总结、评分、建议和自动化行动。
其次,他们应询问如何验证完整性。有效答复应涵盖缺失条目、重复记录、来源变化和摄取失败。
第三,他们应询问谁审核结果,以及审核覆盖哪些内容。明确的批准角色很有用,但有文档记录的清单和审计轨迹能提供更强保障。
第四,他们应要求提供错误类别,而非单一准确率百分比。买方需要知道失败是否影响语法、产品归属、利用状态、严重性或纳入范围。
这些要求与所涉决策的重要性相称。补丁团队之所以使用优先级排序,是因为他们无法同时修复所有问题。
9 月的发布展示了规模问题。Tenable 识别出 964 个 CVE,Ivanti 识别出 973 个,而 Senserva 按不同计数方法识别出 1,169 个。
买方不一定需要每家供应商给出完全相同的数字。但他们确实需要每家供应商解释其范围,并将建议与该范围进行核对。
同样的逻辑也适用于风险分级。供应商可以合理地对可利用性、暴露情况和业务背景给予不同权重,但这些判断应保持可追溯。
透明度也能保护供应商免受不公平比较。一套有文档记录的方法论可以表明,两个总数之所以不同,是因为范围定义不同,而不是某个系统悄然丢失了数据。
这一问题超越了网络安全。任何由 AI 生成的研究、合规简报、财务摘要或运营报告,都可能包含表面审核无法发现的合理性遗漏。
安全领域让这一问题格外显眼,因为 CVE 拥有标识符和权威公告。这种结构为供应商提供了测试完整性的实用途径。
处理结构化程度较低证据的组织面临更艰巨的任务。它们仍然需要溯源、冲突检测,以及对缺失材料的明确处理。
因此,Ivanti 的做法值得关注,但尚不充分。其披露向客户传达的信息多于沉默,而其报告中的控制措施仍留下了重要的验证问题。
该公司过往的安全背景使严格审查尤为重要。评估补丁指导的客户不仅会考量模型的效率,也会考量 Ivanti 准确传达风险的能力。
这种审查应继续以证据为基础。这里讨论的 Claude skill 分析了公开补丁数据,据报道并未访问客户环境。
它不是自主修复代理。它为定期简报生成草稿,并由人工负责发布。
混淆这些类别会夸大这一事件。因“人工已检查”而淡化幻觉问题,则会低估控制挑战。
审慎的结论介于这两个极端之间。Ivanti 建立了一个实质上更快的流程,发现了真实的模型失败,披露了 AI 的参与,并保留了专家审核。
它尚未公开证明其流程能够发现每一个遗漏的漏洞,或独立验证每一项优先级决策。这正是客户现在应要求它及其竞争对手达到的标准。
三个信号将表明 AI 补丁指导能否赢得信任
下一个考验在于,供应商能否将宽泛的人类监督转化为可见、可重复且覆盖完整来源的验证机制。
第一个信号将在 2026 年 10 月 13 日的下一次 Patch Tuesday 到来。分析师应比较已发布的总数、范围定义、已知遭利用标签,以及对异常供应商数据的处理方式。
如果 Ivanti 的输出依然迅速,同时清楚说明来源差异,其“受监督自动化”的论据将更有说服力。任何无法解释的遗漏或映射错误都会削弱这一论据。
第二个信号是 Ivanti 或其竞争对手披露更多细节。有价值的文档应说明模型在哪些环节运行、哪些确定性控制措施保障完整性,以及哪些决策需要人工批准。
这些信息将强化这样一种观点:透明度可以成为竞争标准。若仍持续依赖笼统的“人类参与其中”表述,核心验证缺口便依然无法弥合。
第三个信号来自生产环境评估的证据。供应商应报告错误类别、来源覆盖情况、审核人员的覆盖性改动,以及高影响力漏报,而不披露可能被利用的客户细节。
这类证据将显示,系统在遇到新格式和边缘案例后是否有所改进。仅凭汇总一致性无法回答这个问题。
CrowdStrike 关于快速利用的报告解释了为何这项工作不能完全回归人工处理。其漏洞利用发现表明,防御者往往只能在不断缩短的响应窗口内行动。
因此,正确的方向不是减少自动化,而是采用一种能在其建议影响人员或机器之前,对其证据进行审查的自动化方式。
对安全负责人而言,务实的做法是盘点每一个使用 AI 的外部指导来源。应询问模型是在计数、解释、排序还是执行操作,因为每种角色都会带来不同的失效路径。
随后,用一个棘手的问题检验供应商的审核主张:流程将如何发现一个从未出现在生成草稿中的漏洞?
如果答案依赖某个人注意到缺失的内容,那么这项控制并不完整。如果其中包含来源核对、异常处理以及记录在案的人工决策,那么该工作流就更可信。
Ivanti 的 AI 安全指导如今为这场讨论提供了一个公开案例。其 Claude skill 节省了大量分析师时间,却也在开发期间编造过细节,迫使公司围绕这些失效模式进行设计。
这份披露不应自动赢得信任,但值得关注。它为客户提供了可具体审查的弱点,也为竞争对手树立了一个可以超越的透明度标杆。
在依赖下一份 AI 辅助安全简报之前,请询问模型的角色、来源完整性检查,以及审核人员实际承担的任务。这些答案将比任何头条式准确率评分揭示更多信息。



