CTech AI 安全调查:自动化提高了对人类研究人员的要求
CTech 的 AI 安全调查发现,自动化如今已承担大量研究工作,但这一转变也提高了对负责监督自动化的人类的期望。9 月 18 日的调查涵盖了以色列网络安全公司中的 30 名安全研究人员。参与者表示,AI 正在处理日志解析、文档审查、初步代码扫描和并行调查等任务。
这种效率提升伴随着一个鲜明的逆转。更快的研究并不会降低对严谨判断的要求。它只会让薄弱的假设、不完整的指令和过度授权拥有更多机会,以机器速度造成损害。
因此,安全研究人员正从手动调查转向编排、验证和问责。他们正在面对的对手不只是 AI 模型或自动化攻击者,而是缺乏可靠人类判断的自动化。
这种变化已超出专业研究团队的范围。企业正在其环境中部署大量 agents、服务账户、应用程序编程接口密钥和其他非人类身份。其中许多身份能够读取敏感数据,或在互联系统中执行操作。
与此同时,攻击者也可以利用类似的自动化来探索漏洞并加快利用进程。防御者必须实现自动化,但不能轻信每一个自动生成的结论。他们还必须保护执行这些工作的 agents。
由此,行业面临一项要求很高的新标准。研究人员既需要具备质疑模型的技术深度,也需要拥有控制 agents 的运营纪律,以及定义精确目标的沟通能力。
CTech AI 安全调查揭示了哪些变化
AI 已接手重复性的安全任务,使研究人员的价值从手动产出转向引导、验证和技术判断。
这项安全研究人员调查收集了以色列网络安全行业 30 名专业人士的反馈。它并非一项受控的生产力研究,而是对活跃研究团队如何描述其工作变化的结构化观察。
调查中的每家公司都表示,AI 已接管日志解析、文档审查和初步代码扫描等任务。四分之一的受访者明确表示,这项技术是提升个人产出的倍增器。
Astelia 的创始研究工程师 Yuval Barak 提出了调查中最显著的生产力主张。他表示,agents 通过承担繁琐工作,已将每位研究人员的产出提高到此前约十倍。
这一数字反映的是一位从业者的评估,而非经过独立审计的行业基准。不过,受访者的反馈始终呈现出相同的底层工作流变化。
过去,研究人员必须收集日志、检索文档、比较代码路径,并在测试假设前整理潜在发现。如今,一个 agent 可以同时执行其中的多个步骤。
人类角色更早介入,也更晚结束。研究人员必须定义问题、选择工具、限制访问权限、审查证据,并判断报告的漏洞是否真实存在。
Linx Security 首席技术官组织中的安全研究人员 Roy Itzhaky 将这一角色描述为导演,而不是挖掘者。agent 探索多条路径,而研究人员负责让这些路径保持一致,并对结果作出判断。
这一差异至关重要,因为研究并不以系统产生多少线索来衡量。一项可信的发现必须可复现、相关,并有证据支持。
自动化扫描可以增加假设数量,却未必提升其质量。它也可能用自信的表述或看似令人信服的技术产物掩盖不确定性。
模型可能识别出可疑代码,并提出一条貌似合理的攻击路径。研究人员仍必须确定这条路径是否可达、现有控制措施是否能阻断它,以及利用是否会带来实质性影响。
同样的原则也适用于文档工作。AI 可以总结此前的调查,并发现相关结论。但它无法保证上下文仍然最新、完整,或适用于新环境。
这改变了团队管理机构记忆的方式。Barak 认为,知识可以成为团队的资产,而不再留存于个别研究人员手中。
要实现这一结果,仅仅向文档集合添加聊天机器人还不够。团队需要有组织的证据、可追溯的决策,以及能够区分可信发现与未完成推测的访问控制。
当可搜索的知识库能够保留来源上下文时,就能支持这种转变。缺少溯源信息时,更快的检索可能会让过时假设像有效知识一样迅速传播。
因此,这一事件远不只是一个简单的生产力故事。AI 正在改变研究人员投入精力的位置,也在改变安全失败可能进入流程的位置。
重复性工作正在减少。对自动化工作进行明确规定、监督和验证的负担正在增加。
更快的研究让安全团队承受压力
生产力提升建立了新的基准,迫使研究人员更快交付经过验证的成果,同时攻击者也获得了类似的自动化能力。
安全团队正承受来自工作流两端的压力。其所在组织期望更多产出,而对手则可以借助 AI 缩短侦察和试验时间。
CTech AI 安全调查显示,内部期望调整得有多快。如果一个 agent 能在几分钟内审查文档或扫描代码,漫长的手动队列就更难被合理化。
Tenzai 联合创始人兼研究副总裁 Ofri Ziv 表示,过去会在研究阶段停留数月的工作,如今必须在数周内完成评估、加固和交付。这一转变将研究表现直接与产品交付联系起来。
当团队保持验证环节时,更快的交付可以改善防御;但它也可能促使团队过早下结论、产生大量噪声告警,或部署测试不足的控制措施。
这种压力在漏洞管理中尤其明显。组织必须发现可被利用的弱点、确定优先级、制定修复方案,并在不断变化的环境中验证这些修复。
Google 的 Mandiant 团队描述过类似的运营模式。其agentic 审查框架将多个 agents 与结构化验证和人类专业知识结合起来。
该框架旨在帮助专家审查源代码、寻找利用路径,并测试潜在漏洞。其结构之所以重要,是因为不受约束的模型探索可能浪费时间,或产生缺乏依据的结论。
速度本身无法消除防御者长期以来的劣势。攻击者只需找到一条可行路径,而防御者必须降低众多资产、身份和应用程序中的暴露面。
AI 可以帮助防御者并行处理这些工作。同时,它也帮助攻击者自动化搜索、调整公开技术,并更频繁地检查暴露系统。
Google Cloud 报告称,2025 年下半年,漏洞披露与实际利用之间的间隔从数周缩短至数天。这一观察结果支持持续发现和更快防御验证的必要性。
这并不能证明 AI 导致了每一个缩短的利用窗口。但它确实表明,为何周期性的安全工作正越来越难以适应当前的运营条件。
每年进行两次的渗透测试只能捕捉环境的临时快照。新代码、权限、服务和集成可能在交付后不久就让这一视图失效。
CTech 调查中的四家公司表示,它们已构建专有的 AI hackers 或内部训练环境。这些系统持续模拟攻击,并测试弱点可能如何在生产环境中出现。
调查参与者称,这些项目采用零误报标准。这一标准是一种需要证据支持的愿景,而非 AI 安全工具的普遍属性。
误报仍然会带来真实成本。它们消耗调查时间、打断工程团队工作,还可能让用户逐渐忽视未来的警告。
漏报则更加危险。一个 agent 可能因其训练数据或可用工具未覆盖某种攻击方式,而错过新颖技术。
因此,安全领导者必须通过经过验证的结果来评估自动化。有效指标包括可复现的发现、检测覆盖率、修复时间,以及被否决的 agent 结论比例。
研究人员必须作出的应对十分明确:团队需要自动化重复性的发现工作,同时更大力投入审查、测试和证据管理。
这种压力很可能持续存在。一旦组织将自动化整合进研究管道,回到较慢的手动吞吐模式就会变得困难。
更棘手的问题是,团队能否以与生成产出相同的速度扩展判断能力。这一问题定义了当前安全研究面临的核心冲突。
AI 安全研究人员正成为导演,而非挖掘者
这一职业的主要较量是人类判断与无监督自动化之间的较量,而不是人类速度与机器速度之间的较量。
AI 安全研究人员不再通过亲自完成每一个调查步骤来创造价值。他们的价值越来越取决于决定哪些步骤应当执行、在何种约束下执行,以及需要满足哪些证据要求。
这一角色类似于技术指导。研究人员可以分配不同 agents 来审查源代码、检索文档、检查日志,或测试相互竞争的假设。
并行工作扩大了搜索空间,也带来了单次手动调查可能避免的协调问题。
agents 可能在多个分支中重复同一个错误假设。它们可能丢失相关上下文、追逐看似有吸引力却没有产出的理论,或得出相互矛盾的结论。
Itzhaky 用一个尖锐的对比概括了这种危险。过去,粗糙的思考只会耗费一个下午;如今,它可能让一群 agents 朝错误方向前进。
这句话捕捉了核心逆转。自动化降低了行动成本,却可能成倍放大定义不当目标的成本。
人类导演必须将调查目标转化为有边界的任务。每项任务都需要明确目标、允许使用的工具、停止条件,以及足以构成充分证据的标准。
研究人员还必须决定 agents 应在多大程度上保持独立。多个 agents 重复相同的推理模式,并不能构成有意义的确认。
更好的设计是分离角色。一个 agent 可以生成假设,另一个可以质疑假设,而受控工具则可以复现被怀疑的行为。
即使这样的流程也需要人类审查。模型共享训练模式,而表面上的分歧并不能保证推理彼此独立。
Terra Security 的网络安全研究人员 Ofek Haviv 认为,研究人员并不是在速度上与 agents 竞争。他们的价值在于设定 agent 结果必须达到的标准。
这一标准包括技术真实性,也包括组织相关性。当控制措施使易受攻击的路径无法到达时,理论上的弱点可能几乎不会造成影响。
相反,当一个代理拥有广泛权限时,一个微小的配置错误就可能造成重大暴露。具体情境决定了一项发现是否需要紧急处理。
研究人员还需要理解生成答案背后的工具。审查逆向工程代码的人必须能够识别模型何时虚构行为,或误读控制流。
Island 安全研究负责人 Idan Revivo 警告说,有些新人能够提示模型,却从未学习过软件逆向工程。他担忧的并不是对自动化的抵触。
这是一项关于验证能力的警示。当模型自信地给出错误结论时,必须有人具备足够的技术深度来质疑它。
这一要求提高了初级研究人员的门槛。传统上,入门级工作会让人反复接触日志、代码、系统以及常见故障模式。
如果代理吸收了这些任务,新研究人员获得培养直觉的机会可能会减少。团队必须有意识地用受监督的实验室训练、复现练习和对抗性审查来替代这些失去的实践。
调查发现,五分之一的受访者提到了 AI 对下一代研究人员的影响。Axonius 网络研究总监 Roey Vilnai 表示,知识获取渠道的改善已提高了对各经验层级人员的期望。
Zenity 安全研究总监 Tamir Ishay Sharbat 提出了一个互补的观点。他在没有相关背景的情况下进入网络安全领域,如今认为使用 AI 是研究人员的一项要求。
这些观点共同揭示了一项培训挑战。AI 可以扩大知识获取渠道,同时也让人更容易将表面的熟练误认为专业能力。
招聘流程将需要同时测试工具使用能力和独立思考能力。候选人应能指挥代理、审查其证据,并在模型失效时继续推进工作。
团队还应为关键技能保留手动练习。逆向工程、漏洞利用开发、身份分析和网络推理不能仅作为理论知识存在。
最优秀的研究人员将把机器规模的探索能力与扎实的技术怀疑精神结合起来。他们会知道何时自动化、何时缩小范围,以及何时停止系统。
这种组合,而非仅仅熟练编写提示词,正成为这一职业的新基线。
非人类身份扩大攻击面
执行安全工作的代理也会成为特权身份,组织必须发现、限制、监控并撤销这些身份。
CTech 调查中的 11 家公司将 AI 代理列为安全边界的重大变化。受访者将这些代理与 API 密钥、服务账户及其他非人类身份归为一类。
Semperis 安全研究助理副总裁 Tomer Bar 表示,在一些客户组织中,非人类身份的数量已经超过人员数量。他预测,在未来几年中,这一比例可能达到十比一。
这一预测是公司高管的判断,而非经独立验证的市场测量结果。不过,底层的身份问题确实存在。
代理需要访问数据、应用程序和工具,才能完成有价值的工作。这些连接赋予它身份、一组权限,或通过另一账户借用访问权限。
Sweet Security 安全研究员 Omer Nissim 强调,将广泛权限与不可预测的决策过程结合存在危险。他特别提到了通过 Model Context Protocol 服务器连接的代理。
Model Context Protocol,即 MCP,是一种让 AI 系统连接外部工具和数据源的标准。它是否有用取决于这些连接获得授权和受到约束的方式。
拥有源代码读取权限的代理对应一种风险等级。能够更改云设置、发送消息或部署代码的代理则对应另一种。
OWASP 将过度代理权限描述为涉及过度功能、权限或自主性的情形。意外或被操纵的模型输出随后可能触发破坏性操作。
根本问题不一定是恶意意图。一条含糊的指令、一个幻觉式结论、被攻破的工具或注入式提示词,都可能将原本合法的代理引向错误方向。
最小权限仍是主要防线。代理应只获得完成当前任务所需的工具和权限。
当工作不需要变更时,读取权限优于写入权限。高影响操作应采用独立的审批路径和范围严格限定的凭证。
组织还需要为每个代理分配独立身份。与代理共享人类凭证会使归因变得困难,也可能让系统冒充其操作人员。
NIST 最近的代理身份指南建议将代理视为独立实体。每个代理都应拥有标识符、凭证和权限,并与其负责的用户或系统关联。
该指南还强调了静态 API 密钥和长期有效的持有者令牌所带来的风险。任何获得这些凭证的人,通常都可以在无需证明自己拥有特定身份的情况下使用它们。
这使凭证存储和轮换成为 AI 安全的一部分。代理密钥可能通过配置文件、日志、记忆存储、工具输出或调试记录泄露。
人工审批并不能解决所有问题。持续的权限请求可能导致同意疲劳,促使用户未经仔细审查便批准操作。
更稳健的设计是为代理设定经过批准的运行边界。这些边界应定义可访问的资源、允许的操作、时间限制和升级条件。
监控必须捕获的不仅是最终答案。安全团队需要记录工具调用、身份使用、检索的数据、变更的资源和审批决定。
这些证据既支持事件调查,也支持日常质量控制。它让研究人员能够重建代理为何得出某个结论或执行某项操作。
责任归属也必须保持可见。Itzhaky 指出,代理可以由员工、自动化流水线或其他代理创建。
如果没有可追责的所有者,被遗忘的代理可能会在原始任务结束后继续保留权限。这种模式类似于被遗弃的服务账户,但自主行为使暴露风险更难预测。
因此,发现工作应包括代理清单、凭证、工具、数据访问权限以及父子关系。撤销时必须同时终止代理及其创建的任何委派访问权限。
这正是生产力叙事与安全叙事的交汇点。组织部署代理的速度可能快于其身份管理计划的治理速度。
由此产生的缺口将成为新的研究目标。安全团队必须在使用代理调查其他一切的同时,调查代理行为本身。
自动化无法取代怀疑式验证
调查反映了真实的工作流转变,但其最强的生产力和准确性主张仍需独立测量。
CTech AI 安全调查提供了来自在职研究人员的宝贵一手观察。然而,其 30 人样本群体仍集中于以色列网络安全行业。
已发布文章未提供随机样本、标准化问卷或经独立审计的性能数据。读者不应将其中的比例视为普适的劳动力测量结果。
受访者关于生产力提升十倍的估计,可能反映出有意义的变化,但并不能证明经验证发现的数量增加了十倍。产出可能指报告、假设、代码审查、实验或已确认的漏洞。
这些类别的价值不同。如果大多数初步发现无法复现,十倍的初始发现可能反而带来更多工作。
同样的谨慎也适用于零误报的说法。系统可以通过缩小报告范围来减少误报,但这种选择可能增加遗漏漏洞的数量。
团队需要衡量两个方面。精确率描述已报告发现中有多少是有效的,而召回率描述系统实际发现了多少相关弱点。
一项工具在只报告明显问题时可能显得准确。它仍可能遗漏微妙的攻击链、不熟悉的软件,或需要长篇上下文推理的漏洞。
Google Cloud 的漏洞指南警告称,代理可能会悄然忽略训练数据中代表性不足的新型技术或零日漏洞。
这一局限为人类专业能力赋予了明确角色。研究人员必须识别扫描覆盖范围何时过窄,并设计超出模型熟悉模式的测试。
幻觉是另一项担忧。生成的报告可能引用不存在的函数、误解某项依赖关系,或根据不完整的代码推断可利用性。
因此,复现应在受控环境中进行。可信的流水线应保留输入、工具版本、提示词、系统状态和可观测结果。
代理输出也需要进行威胁建模。攻击者可以植入操纵模型的文本,尤其是在系统读取不受信任的网站、代码库、工单或文档时。
这种攻击称为间接提示词注入。恶意指令隐藏在检索内容中,试图重定向代理的行为。
防御不能完全依赖于告诉模型忽略恶意指令。系统需要隔离的工具、范围限定的权限、内容边界,以及对重要操作的明确审批。
研究人员还必须区分模型置信度与证据质量。流畅的解释可能让薄弱的发现看起来完整无缺。
强有力的审查流程会提出几个具体问题:该行为能否复现?易受攻击的路径是否可达?利用需要何种权限?哪些控制措施能够阻止或检测它?
该流程还应记录被否决的假设。这些失败有助于团队改进基准测试,并防止后续代理重复同样没有成效的路径。
安全基准是一组用于测试系统行为的明确任务集合。内部基准应包括误导性证据、部分访问权限、工具故障和不熟悉的漏洞类别。
生产环境中的表现比基准分数更重要。团队应将代理发现与后续事件、人工审查和独立测试进行比较。
人工审查者需要防范自动化偏见,即仅因为建议由系统生成,便倾向于采纳机器建议的倾向。
轮换审查者、隐藏代理的置信度评分,或要求独立复现,都可以减少这种偏见。高影响发现应在发现与批准之间设置更严格的隔离。
怀疑论者的观点并不意味着团队应放弃 AI。人工研究同样会遗漏漏洞、遵循错误假设,并受到文档记录不一致的影响。
更站得住脚的结论更为有限。AI 扩大了研究能力,但只有当团队维持严谨的验证机制时,这种能力才有用。
新的更高门槛并非完美无误,而是能够解释代理做了什么、验证结果,并控制错误的后果。
持续安全成为下一项考验
下一阶段将由持续验证、可衡量的研究质量,以及对代理身份可执行的控制来评判。
首个值得关注的信号是,在生产工作流中,持续安全评估是否会取代周期性测试。多位调查受访者认为,每年两次的渗透测试已无法匹配软件和攻击者活动的速度。
持续评估意味着:随着资产即代码、配置、身份以及外部暴露面的变化不断发生,对其进行测试。它应当补充更深入的人工审查,而不是让安全工作沦为无休止的扫描器告警流。
Google 描述了一条智能体安全流水线:它扫描代码、生成证明,并构建修复方案。该公司表示,这种方法已应用于数亿行内部代码。
这一系统提供了一个有用的参考信号,因为它将发现、复现和修复连接起来。关键衡量标准在于,其他组织能否借助更小的数据集、团队和基础设施,实现类似的严谨程度。
广泛采用将强化该调查的核心论断。持续存在的告警噪声或低效的修复率,则会削弱这一论断。
第二个信号是企业如何治理非人类身份。智能体清单应成为身份与访问管理的一部分,而不是一份孤立的 AI 政策文件。
有意义的进展包括:为智能体分配唯一凭证、使用短期访问权限、实施委托授权、明确归属责任,以及保留完整的操作日志。组织还应能够暂停某个智能体,而无需禁用其人类操作员。
应关注那些能够将智能体操作关联到特定用户、任务和获批准运行边界的标准与产品。这条链路能够在不共享个人凭证的前提下支持问责。
如果部署仍依赖权限过宽的 API 密钥和通用服务账户,生产力将跑在治理之前。这种结果会加剧对“影子管理员”和不可预测访问路径的担忧。
第三个信号是招聘与培训如何变化。初级研究人员仍需要直接练习代码、系统、利用技术和证据收集。
团队应为 AI 辅助岗位发布更清晰的能力预期。面试和培训项目可以测试候选人是否能够识别虚构发现、质疑模型假设,并手动复现结果。
健康的转型将围绕智能体监督建立结构化学徒机制。资深研究人员可以让受训者接触成功运行案例与失败案例。
不健康的转型则会移除基础性工作,却不提供相应的教育价值替代。这将培养出只能操作界面、却无法验证其背后系统的研究人员。
这些信号对企业采购方的重要性不亚于对安全专业人士。一家供应商使用 AI 的事实本身意义不大,除非其提供有关权限、证据、审查和故障处理的细节。
采购方应询问:谁负责批准发现、智能体如何进行身份验证、它们保留哪些数据,以及结果是否能够复现。他们还应询问,当工具发生故障或输入包含恶意指令时,系统会如何表现。
开发者应预期,安全审查将更贴近每一次代码变更。他们可能会获得更快的反馈,但自动化发现仍需提供足够的上下文来支持修复。
知识工作者也应关注,因为智能体身份问题并不局限于网络安全工具。任何接入电子邮件、文档、代码或业务系统的助手,都可能成为权限过高的非人类身份。
CTech AI 安全调查最终描述的是工作分配的重新调整,而非研究人员的消失。机器承担更多收集与探索工作;人类则对目标、约束条件和真实性承担更多责任。
当证据始终处于核心位置时,这种安排可以提升安全性。当组织将生成的活动误认为已验证的进展时,它也可能增加风险。
实际问题不再是 AI 是否应参与安全研究,而是团队能否在自动化规模超出其监督能力之前,让自动化具备可问责性。
向你的安全供应商和内部团队索取一份完整的智能体辅助发现记录,其中包括其权限、证据链、人工审查和最终处置结果。这份记录比泛泛的生产力承诺更能说明问题。



