top of page

SK Shieldus AI 红队测试从模型测试走向智能体行动

5天前
讀畢需時 16 分鐘

SK Shieldus AI 红队测试已从模型防护扩展至智能体行为、医疗系统、互联数据和外部服务。这一更广泛的范围至关重要,因为智能体能够采取行动,而不只是生成不安全文本。

该公司表示,其白帽黑客团队 EQST 正在为结合模型、应用程序、私有信息和运营工具的系统构建攻击场景。该团队还将其方法应用于医疗 AI,因为被操纵的决策可能影响患者安全。

这不仅是又一个黑客竞赛故事。Microsoft、OWASP 和安全研究人员已经表明,提示词注入能够绕过现代防御措施。SK Shieldus 目前正尝试将竞赛经验转化为可重复的企业测试。

这一转变同时给安全厂商和企业采购方带来压力。传统渗透测试会检查软件边界、权限和已知漏洞类别。智能体测试还必须审视,AI 是否会遵从隐藏在其获授权读取的信息中的恶意指令。

SK Shieldus 在 AI 红队测试中做了哪些改变

SK Shieldus 正将测试对象从孤立的 AI 模型扩大到智能体作出决策并采取行动的完整环境。

该公司于 2026 年 9 月 18 日通过其 EQST 白帽团队披露了这一扩展。根据最初的 AI 安全报告,EQST 的目标包括模型、互联数据、应用程序、外部服务和智能体环境。

这一范围反映了企业智能体的结构。模型通常提供推理层,而周边软件则赋予其访问文件、消息、数据库和业务应用程序的能力。

攻击者无需攻破每一个组件。他们只需要一个能够改变智能体行为的可信输入,或一项会将错误转化为行动的过度权限。

提示词注入是这一问题的核心。它将恶意指令植入 AI 系统处理的材料中,例如电子邮件、网页、图像或文档。

间接攻击不需要用户亲自输入恶意命令。智能体会在执行常规任务时检索相关内容,并可能将嵌入文本误认为合法指令。

EQST 表示,其使用专有的攻击场景集合和内部测试方法。目标是暴露组织可能难以通过内部审查发现的安全风险。

该团队还参与编写了由韩国科学和信息通信技术部及韩国互联网振兴院发布的 AI 安全红队测试指南。这份 7 月 7 日发布的指南涵盖准备、执行、团队组织和报告。

这种对流程的重视很重要。一次巧妙的越狱攻击可以吸引关注,但企业评估需要明确的测试目标、证据、严重性评级、修复建议以及可靠的复测。

这一扩展还与 SK Shieldus 将 AI 智能体视为非人类身份的更广泛理念相联系。这些软件行为主体需要受到控制的身份和权限,因为它们会与企业系统交互。

8 月,该公司表示正将零信任实践扩展至智能体。其方法将每一次智能体请求视为需要身份验证、有限授权和持续评估的事项。

这一零信任扩展与红队测试形成互补。身份控制限制智能体可访问的范围,而对抗性测试则检验这些控制在压力下如何失效。

任何一项单独采用都不足够。推理能力很强但拥有过度访问权限的智能体依然危险。权限受到严格限制的智能体,也仍可能在允许的环境内泄露数据或提出有害建议。

因此,值得注意的变化并非某一种攻击技术,而是决定测试从不可信输入到后果严重的行动之间的完整链路。

这条链路可能包括检索系统、工具选择、身份验证、记忆、审批界面、日志记录和下游应用程序。每一处连接都会增加意图丢失或权限被错误使用的可能性。

对于采购方而言,SK Shieldus 智能体安全如今意味着更广泛的承诺。EQST 不仅测试模型是否拒绝被禁止的请求,也测试已部署的智能体在其常规输入变得恶意时能否安全运行。

AI 智能体将模型缺陷转化为业务行动

核心安全问题是过度自主性:当软件拥有足够权限采取行动时,被操纵的输出就会变得危险。

聊天机器人可能会对恶意提示词生成不准确或受限制的文本。智能体则可能利用同样被操纵的响应发送消息、泄露文件、修改记录或调用其他服务。

OWASP 将过度自主性定义为围绕三种常见设计缺陷的问题:功能过多、权限过度和自主性过高。其自主性风险指南说明,提示词注入如何通过权限过高的工具触发破坏性行动。

以需要汇总邮箱内容的邮件助手为例。读取权限可支持这一用途,而发送消息的权限则增加了可能并非必要的能力。

一封恶意电子邮件可能包含指示,要求助手搜索其他消息并转发敏感材料。智能体可能会在执行获授权的检索任务时遇到这些指示。

这一弱点横跨多个层面。模型无法区分数据与命令,应用程序暴露了发送工具,而身份则拥有使用该工具的权限。

仅针对模型的基准测试只能捕捉第一个失效环节。如果 SK Shieldus AI 红队测试希望衡量运营风险,就必须复现整个路径。

Microsoft 通过其 LLMail-Inject 竞赛提供了一个具体案例。模拟服务能够读取电子邮件并代表用户采取行动,包括发送消息。

攻击者试图将指令植入服务会检索的邮件中,目标是让助手执行用户从未请求的操作。

该竞赛包含输入分类器、激活分析、基于模型的评判和指令层级等防御措施。参与者仍然针对不同场景和模型调整了攻击方法。

Microsoft 在首个挑战中记录了 621 名参与者、224 支团队和 370,724 次提交。相关提示词注入结果说明,单次成功评估无法终结这一问题。

防御者会更改过滤器、提示词和模型,攻击者随后改变措辞、放置位置、编码、语言或上下文。智能体安全因此成为持续博弈,而非一次性认证。

这也是互联数据值得单独审查的原因。企业智能体会摄取员工已信任来源的材料,包括共享驱动器、客户工单、内部 wiki 和协作工具。

恶意载荷可通过任何有权编辑这些内容的贡献者或遭入侵账户进入系统。智能体之后可能会检索它,却无法将这一变更识别为攻击。

多模态输入增加了另一条路径。恶意指令可能出现在图像、音频片段或视频中,而非纯文本内。

6 月,EQST 研究员 Byunghyun Kim 在针对行业场景使用多模态提示词注入后,赢得了 Judgement Day AI 红队竞赛。SK Shieldus 表示,这些攻击包括隐藏文本和伪造的系统风格日志。

该竞赛涵盖八个场景,包括医疗、航空和灾害响应环境。根据该公司的竞赛披露,另外两名 EQST 研究员分别获得第五名和第七名。

这些结果体现了实用的攻击设计经验。但它们并不能证明 EQST 能够在客户环境中阻止每一种类似攻击。

这一差异很重要,因为竞赛提供已知规则、可衡量目标和隔离的测试环境。企业部署则涉及不断变化的集成、不一致的数据、继承权限以及审批习惯各异的员工。

企业项目必须将攻击成功转化为设计变更。实用的建议可能包括只读权限范围、功能有限的工具、确定性验证、独立审批以及对重复操作的限制。

它还必须审查审批界面。当由智能体撰写供人员审阅的说明时,人工确认步骤只能提供有限保护。

攻击者可以操纵这一说明,或隐藏操作的重要性。操作人员于是会在以为其服务于原始请求的情况下,批准一项危险行动。

因此,安全目标不仅是模型合规,而是确保用户意图在智能体跨越的每一个边界上得到忠实执行。

竞赛战绩建立可信度,而非证明

EQST 的竞赛成绩证明其具备攻击能力,但采购方仍需要证据表明,这些技能能够为已部署系统带来可重复的改进。

该团队已在多种形式的 AI 和传统安全测试中积累了成果。这种广度为 SK Shieldus 扩展其 AI 红队提供了可信基础。

根据该公司的说法,EQST 在 2025 年 8 月 Microsoft 的 Re:LLMail-Inject 挑战赛中获得第二名。该竞赛聚焦于针对基于电子邮件智能体的自适应间接提示词注入。

2026 年 6 月,Byunghyun Kim 在 Judgement Day 中获得第一名。该竞赛历时约八周,测试针对高风险行业场景中 AI 系统的攻击。

8 月,EQST 在 DEF CON 34 期间 AI Village 举办的 AI 智能体黑客活动 HalCTF 中获得第五名。据 9 月报告称,超过 200 支团队参与了该活动。

该团队还在 9 月稍早举行的一场医疗 AI 红队挑战赛中获得最高奖项、优秀奖和特别奖。该活动评估患者安全、网络安全、隐私、公平性、伦理和智能体安全。

这些成绩涵盖了有价值的类别。邮件智能体揭示间接提示词注入,多模态系统测试隐藏在普通文本之外的指令,医疗场景则将模型行为与安全敏感型决策联系起来。

然而,排行榜衡量的是竞赛条件下的表现。它们很少能够回答首席信息安全官在部署前需要解决的问题。

一个团队在接近生产环境的应用程序中发现了多少关键问题?哪些问题能够稳定复现?工程师修复这些问题的速度有多快?

修复是否阻止了相关攻击变体,还是只拦截了提交的载荷?在引入更严格控制后,系统是否仍保留了有用功能?

误报同样重要。若防御措施阻止正常文档、客户消息或合法工具调用,就可能使智能体无法使用。

当系统处理敏感信息或不可逆操作时,漏报更为重要。采购方需要同时衡量这两项,而不是接受智能体已通过红队测试这一笼统说法。

NIST 的生成式 AI 风险画像建议针对提示注入、数据投毒、模型提取及其他攻击开展对抗性测试。它还呼吁建立涵盖绕过、未授权访问、渗透尝试和修复情况的指标。

NIST 风险画像将红队测试定位为持续风险管理的一部分。它并不认为一次成功的测试能够提供永久保障。

这正是 SK Shieldus AI 红队测试面临的核心挑战。EQST 必须将个人攻击者的技能转化为一项服务,在不同客户、行业和智能体架构中提供可比较的证据。

成熟的评估应从智能体清单开始。测试人员需要了解每项工作流中涉及哪些身份、工具、数据集、记忆存储、模型和外部服务。

随后,团队需要将威胁场景与业务结果关联起来。提取一段无害的测试字符串,与泄露患者数据、篡改付款记录或更改生产环境配置并不相同。

测试人员应记录完整的攻击路径,包括恶意输入、检索事件、模型决策、工具调用、权限检查、审批步骤和最终结果。

修复措施必须针对攻击路径,而非仅针对提示词。若攻击者可以改写特定短语,或将其转移至另一种数据格式,屏蔽该短语的保护作用就十分有限。

更有力的修复方式可能包括缩减权限、将可信指令与不可信内容分离、验证工具参数,或要求独立系统批准高风险操作。

之后的复测需要采用新的攻击变体。否则,评估只能证明开发者拦截了已知示例。

SK Shieldus 尚未公开提供这项扩展服务的详细企业成果指标。9 月的公告未说明检测率、复测结果、项目数量或客户修复所需时间。

这种缺失并不意味着该能力无效,但它限制了买家能够从奖项和公司声明中推断出的内容。

最有说服力的下一步,将是来自真实评估的匿名化证据。具有价值的披露应展示攻击类别、受影响层级、严重程度、修复模式,以及修复后的复发情况。

在此之前,EQST 的成绩应被视为其进攻性专业能力的证据。它尚不足以构成在企业部署中持续降低风险的公开证明。

医疗 AI 提高了一次失误的代价

医疗 AI 让智能体红队测试更为困难,因为安全、隐私、临床安全和人工监督可能会在同一工作流中同时失效。

医疗助手可能总结患者信息、检索临床资料、安排医疗服务,或建议下一步行动。每项任务都可能涉及敏感数据和受时间影响的决策。

当 AI 变成智能体后,风险会再次发生变化。它可能连接病历、外部知识来源、通信系统或医疗设备,而不只是生成回答。

注入式指令可能扭曲智能体检索的证据,也可能影响建议、暴露个人信息,或引导工具执行超出原定任务的操作。

底层模型上的安全过滤器无法检查每一种下游后果。周边应用必须执行访问限制、验证输出,并保留可追责的人类决策。

2026 年高级 AI 数字医疗产品红队挑战赛反映了这一更广泛的问题。参与者测试了绕过患者安全、隐私、公平性、伦理、网络安全和智能体安全防护的方法。

EQST 获得的奖项表明,该团队能够跨越这些类别开展工作。SK Shieldus 表示,这些经验正帮助其将 AI 红队测试拓展至医疗环境。

然而,挑战赛与临床验证项目仍有本质区别。医疗系统运行于特定工作流、患者群体、数据限制和专业责任之下。

红队可以识别攻击路径,但单凭自身无法确定临床有效性、可接受的剩余风险,或软件与临床医生之间责任的恰当分配。

这一限制应塑造服务设计。安全发现需要与安全工程、隐私审查、产品治理和部署后监控相衔接。

例如,智能体在遇到被操纵的元数据后,可能检索到错误文档。眼前的问题看似是检索完整性。

临床影响取决于后续如何发展。低风险助手可能会展示来源供人工审查;自主性更高的系统则可能利用该文档为患者排序优先级,或建议某项干预措施。

因此,同一技术弱点在不同部署中的严重程度并不相同。红队报告必须考虑实际权限、决策权以及人工纠正的机会。

医疗测试还需要具有代表性的边缘案例。系统在普通语言下可能表现安全,却可能在病历包含缩写、相互矛盾的记录、图像标注或复制的外部文本时失效。

攻击者可以利用这些模糊性,也可以仿冒可信格式、权威声明、系统通知或临床指令。

Judgement Day 的结果提供了一个相关线索。据报道,EQST 通过构造类似系统日志的输入,并针对系统提示词中未涵盖的例外情况,提高了攻击成功率。

这种方法攻击的是信任信号,而不只是被禁止的词语。它测试 AI 能否在复杂上下文中区分信息的来源和权威性。

医疗记录中存在大量此类信号。记录来自不同专业人员、系统、时间点,并具有不同程度的确定性。智能体不能将每一段字符串都视为具有同等权威性的指令。

这一问题也揭示了一项权衡。增加广泛上下文可以提升智能体的实用性,但每一个新来源都会扩大不可信输入面。

授予更多工具可以减少行政工作,但每个工具都会增加潜在操作。更高的自主性可以缩短工作流,却会减少可供审查的时间。

组织无法通过一个通用提示词解决这些矛盾。它们需要与每项操作后果相匹配的架构控制措施。

低风险检索可以在记录日志的情况下自动进行。敏感数据披露可能需要政策验证。临床或运营变更可能需要独立人员批准。

用户界面必须清晰展示预期操作、受影响记录、信息来源以及所使用的权限。它不应只依赖智能体生成的摘要。

医疗 AI 为 SK Shieldus 提供了一个严苛的验证场景。在这一领域取得成功,将表明 EQST 能够将技术漏洞与安全关键型运营控制相结合。

失败则会暴露出将 AI 红队测试视为扩展版渗透测试的局限。智能体安全需要更广泛地审视决策质量、权限和人类问责。

真正的考验在于企业级可重复性

SK Shieldus 必须证明,即使模型、工具、数据源和权限持续变化,其 AI 红队仍能产出一致的发现。

传统应用测试通常从相对稳定的版本开始。智能体可能在模型更新、提示词修订、连接器变更或权限调整后改变行为。

新的文档来源可能引入恶意内容。新工具可能扩大既有模型弱点的影响。经修订的审批流程可能形成绕过人工监督的新路径。

这种波动性使得年度测试不足以应对重要部署。组织需要在发布前、重大变更后以及持续运营期间进行评估。

自动化攻击有助于扩大覆盖范围。它们可以生成提示词变体、测试多种上下文,并在不同模型中重复场景。

自动化也存在局限。它往往针对可量化目标进行优化,可能遗漏人类攻击者会质疑的组织假设。

人类专家能够识别这些假设。他们可能发现,只读智能体仍能提出有害建议,或审批页面隐藏了实际工具参数。

最强的服务应结合两种方法。自动化检查提供频率和回归覆盖,而人工红队则探索意料之外的攻击路径。

SK Shieldus 的场景数据库可以支持这一模式。在研究人员针对真实系统验证后,可复用攻击可以成为回归测试。

不过,该库必须持续演进。公开示例很快会成为防御者的训练数据,而攻击者会改变编码、上下文、语言和传递格式。

Microsoft 的研究说明了这一循环。在第一轮之后,其更新后的竞赛加入了高精度拦截名单、净化处理、更强的分类器和修订后的指令。

随后,研究人员又获得了一次适应的机会。这一过程反映了真实的企业安全环境:昨天的缓解措施会成为明天的测试目标。

可重复性也取决于报告机制。即使两名评估人员的攻击创造力不同,他们也应采用可比较的严重性标准。

报告应将模型漏洞与应用故障区分开来,也应识别身份、权限设计、数据溯源、工具和用户界面中的弱点。

“提示注入”这样的单一标签掩盖了太多内容。一次攻击可能只显示不必要的文本,而另一次则可能触发付款或暴露整个文档库。

严重程度应反映可访问的数据、可执行的操作、攻击者所需访问权限、用户参与度、可检测性、可逆性和业务后果。

组织还需要证据证明,修复措施能够降低风险,而不会摧毁智能体的价值。禁用所有外部文档的控制措施或许能阻止注入攻击,却也会破坏工作流。

这正是买方参与变得至关重要的原因。安全团队定义可接受风险,但产品负责人了解智能体仍必须完成的任务。

开发者知道哪些场景可以用确定性检查替代模型判断。身份团队可以限制权限范围,而合规团队则可以明确日志记录和保留责任。

知识工作者也会影响暴露面。他们决定哪些文档会进入共享系统,以及是否会对智能体输出进行有意义的审查。

清晰的信息边界能够降低风险。团队应识别可信指令、不可信内容、敏感来源,以及需要单独授权的操作。

可搜索的知识库可以改善上下文管理,但仅靠检索并不能建立信任。溯源和权限仍决定智能体应如何使用这些材料。

组织应避免将红队发现转化为孤立的工单。结果需要推动架构标准、连接器政策、审批规则和回归测试套件的更新。

当客户能够随着时间推移比较结果时,SK Shieldus 的智能体安全能力将更具可信度。一项有价值的计划应展示每轮测试后关键路径是否在缩减。

该公司还可以发布与常见智能体架构对应的匿名化分类体系。这将帮助买家了解其场景覆盖是否与自身部署相匹配。

独立验证将进一步增强这一论点。外部基准、同行评审方法或透明的评估标准,可以将可重复的能力与营销语言区分开来。

核心矛盾依然直接明了:智能体在获得上下文和权限后会变得更有用,但这些相同特性也会增加遭受操纵的后果。

SK Shieldus AI 红队测试正是针对这种张力而设。其长期价值将取决于 EQST 能否持续一致地衡量风险,并引导客户采用更安全的设计。

买家接下来应关注什么

以下三个信号将表明,SK Shieldus 是建立了企业级安全体系,还是仅仅延续了一场成功竞赛的叙事。

第一个信号是公开的方法论。买家应关注 EQST 是否清晰说明其如何界定智能体范围、梳理攻击面、对发现的问题进行分级,以及如何开展复测。

一套有价值的方法论应覆盖模型、检索层、记忆、身份、权限、工具、数据来源和审批界面。它还应区分直接攻击与间接提示词注入。

如果 SK Shieldus 发布了可重复执行的评估标准,其扩展能力将更容易在各行业中得到评估。若流程仍不透明,客户就必须逐项评估每次服务的能力。

第二个信号是来自已部署系统的证据。匿名案例研究应说明出现了哪些攻击路径、客户如何修复,以及修复后攻击变体是否仍能得逞。

最有力的证据应包括检出率、误报率、关键发现、复测结果和修复所需时间。它不应将一次干净的测试结果包装成永久安全的证明。

客户证据将强化该公司的核心主张。若持续将重点放在排名和奖项上,其实际运营影响仍将难以确定。

第三个信号是测试与智能体治理之间的整合。SK Shieldus 已经将智能体与非人类身份和零信任控制措施关联起来。

买家应关注红队发现是否会自动影响权限、监控、连接器策略和审批要求。这种反馈闭环将把攻击发现转化为持久的控制措施。

如果红队测试仍只是独立的咨询服务,这一信号就会减弱。当报告中的建议始终未能进入身份系统、工程标准或部署准入环节时,其价值往往会流失。

竞争对手的动态同样重要,但应仅作为辅助背景。Microsoft 以及更广泛的安全社区仍在持续开发针对间接提示词注入的防御措施、基准和设计模式。

这些工作提高了所有供应商面临的预期。当公开研究已记录了针对分层防御的自适应攻击时,仅仅宣称具备提示词注入专业能力已不再足够。

企业买家在委托测试前应直接提出一组问题。团队将攻击哪些完整工作流?每条路径末端又有哪些会产生实质影响的操作?

他们应询问测试人员能否审查应用代码、提示词、工具定义、访问范围和日志。黑盒测试提供了一种视角,但内部访问能够暴露更深层的设计错误。

他们应要求在修复后,使用攻击变体进行复测。还应要求提供证据,证明新增控制措施不会破坏合法任务。

最后,他们应明确由谁承担未解决风险的责任。红队能够揭示故障,但业务负责人必须决定是缩减权限、增加审查、重新设计工作流,还是推迟部署。

SK Shieldus 已建立了可信的进攻性安全记录,并选定了一个重要目标。AI 智能体带来的安全问题横跨模型、软件、身份、数据和人为决策。

下一阶段比赢得一场竞赛更困难。EQST 必须证明,SK Shieldus AI 红队测试能够产生可重复的证据,并推动更安全的企业行为。

对于当前正在部署智能体的团队而言,实际问题并非模型能否被诱骗。公开竞赛早已回答了这一问题。

关键决策在于,每个智能体是否拥有足以将操纵转化为伤害的权限。梳理这一路径,限制不必要的访问权限,并在将智能体托付给关键工作前测试完整工作流。

 
 

免费开始使用

一款本地优先的AI助手

为了获得更好的人工智能体验,

remio 目前仅支持Windows 10+ (x64)M-Chip Mac

你的 AI 工作伙伴

remio 一起高效工作

规划、创作、交付

一站式完成

bottom of page