XBreaking LLM 越狱攻击将可解释性 AI 反过来用于对抗安全过滤器
XBreaking 研究人员利用可解释性 AI,在七个开放权重语言模型中定位并削弱了安全控制机制。他们的发现将原本用于防御的承诺转化为一场安全冲突。XBreaking LLM 越狱攻击利用模型内部信号识别与拒答行为相关的层,随后瞄准邻近组件,而非盲目搜索能够成功的提示词。
这项经过同行评审的研究于 2026 年 10 月 10 日发表于 Neural Computing and Applications。来自帕维亚大学和科钦科技大学的研究人员开发了这一方法,并测试了 Llama、Qwen、Gemma 和 Mistral 系列模型。
这并非又一种通过文字游戏诱骗聊天机器人的提示词。XBreaking 假定攻击者能够直接访问模型权重、隐藏状态、注意力图及其他内部信息。这一限制缩小了即时威胁范围,但也让面向部署可定制开放模型的组织更应警惕。
核心冲突如今已十分明确。可解释性能够帮助工程师理解并强化安全行为;同样的可见性,也可能准确暴露攻击者应将攻击集中于何处。
XBreaking LLM 越狱攻击究竟改变了什么
XBreaking 不再依赖提示词试验,而是有针对性地寻找能够区分对齐模型与无限制模型的内部组件。
人们熟悉的大多数越狱攻击都通过聊天机器人界面进行。攻击者不断调整请求的措辞、结构、语言或上下文,直到系统不再拒绝。这一过程通常需要反复生成和测试。
XBreaking 则直接在模型内部运行。研究人员将经过安全调优的模型与同一架构系列中的无限制版本进行比较。他们将这些版本称为“受审查”和“未受审查”,尽管“经安全调优”和“无限制”是更中性的描述。
这一比较使用可解释性 AI,即揭示与模型内部决策相关信号的技术。研究人员测量 Transformer 各层的平均激活值和注意力值。激活值代表内部计算,而注意力值描述 token 在处理过程中彼此影响的强弱。
这项已发表的研究报告了一个三阶段流程。首先,团队使用有害和良性输入对两个版本进行剖析。其次,统计特征选择方法会对最能区分这两个版本的层进行排序。第三,攻击会扰动这些入选层周围的组件。
这一顺序至关重要,因为它将可解释性转化为侦察手段。该方法并不将每个参数都视为同等相关,而是寻找一个较小的内部区域,其中安全调优的痕迹似乎最为明显。
实验覆盖了七个开放权重模型,包括 Llama 3.2 1B、Llama 3.1 8B、Qwen2.5 0.5B、Qwen2.5 3B、Gemma 2B、Gemma 7B 和 Mistral-7B-v0.3。
每个模型都配有一个总体架构和参数配置相同的对应无限制版本。这种配对为研究人员提供了一种受控比较内部行为的方式。
评估使用了十个类别中的 100 种有害行为。这些类别包括欺诈、虚假信息、恶意软件、侵犯隐私、骚扰、身体伤害和不安全的专业建议。研究人员还将其与涵盖相关主题的 100 种良性行为配对。
该设置源自 JailbreakBench dataset,这是一个用于评估对抗性提示词和防御措施的开放基准。团队起初排除了那些无需攻击便已产生不安全回答的问题。这一选择避免既有失败夸大报告中的攻击结果。
因此,XBreaking 改变了越狱攻击的目标。提示词仍然相关,但不再是主要优化对象。模型内部的安全特征才成为攻击目标。
这一差异构成了本文的核心张力。留下可测量内部特征的安全机制更容易被研究;当对手控制模型时,它也更容易受到攻击。
XBreaking 如何定位安全关键层
研究人员将对齐模型与无限制模型之间的差异视为一种指纹,用以揭示拒答行为集中在哪些位置。
该方法首先将标准化问题输入模型的两个版本,并记录每一层的平均激活值和注意力分数。研究人员会对这些数值进行归一化,以便比较数值范围不同的信号。
随后,特征选择流程会判断哪些层级测量结果最能将模型分类为经安全调优或无限制模型。研究人员使用方差分析检验对这些特征进行排序,并选择能提供有效分类准确率的最小特征组。
这正是 XBreaking 工作方式中“可解释”的部分。该方法并非声称每个隐藏信号都具有直观的人类可理解含义,而是识别与对齐相关的可测量差异。这些差异告诉研究人员应在何处检查或干预。
论文报告称,在七种模型配置中的五种里,指纹识别准确率超过 90%。其中 Gemma 7B 的准确率为 100%,Mistral-7B-v0.3 为 82.5%。这些是在作者实验设置内的分类结果,并非对模型安全性的普遍衡量。
另一项测试使用了稀疏自编码器,它能将模型激活分解为更具体的内部特征。在 Llama 3.1 8B 上,该方法达到了 100% 的分类准确率;较简单的激活值和注意力方法则达到 97.5%。
作者保留了更简单的方法,因为稀疏自编码器需要更多计算工作。不同层和架构可能需要不同模型,而平均激活值和注意力统计数据可在常规前向处理期间收集。
在许多配置中,入选信号出现在数量有限的中间或后部 Transformer 层。论文将这些区域解读为内容抑制的重要贡献者。然而,与拒答行为的相关性并不能提供完整的因果解释。
在定位这些层后,XBreaking 会修改附近归一化组件中的缩放权重。层归一化会调节内部信号在 Transformer 中传播时的尺度和分布。研究人员向这些权重添加受控噪声,并观察由此产生的回答。
攻击会以不同幅度测试正向和负向扰动。极小的变化往往影响有限,较大的变化则可能损害通用文本生成能力。因此,研究人员寻找一个能够削弱拒答、又不会完全破坏模型的范围。
这一机制解释了该攻击为何不同于常规微调。微调可以基于大量样本更新广泛的权重集合;XBreaking 则利用对齐指纹缩小干预范围。
最初的 XBreaking preprint 于 2025 年 4 月发布。2026 年的期刊版本加入了更广泛的评估、效用测量、迁移实验,以及对适用范围更明确的讨论。
这一方法也类似于反向进行的安全审计。防御者可以比较模型以定位脆弱的安全组件;拥有相同访问权限的攻击者则可以利用这张地图压制它们。
可解释性 AI 成为攻击地图
XBreaking 的安全影响源于一种权衡:内部可见性提升审计能力,同时削弱安全控制周围的隐蔽性。
机制可解释性研究产生模型行为的计算过程。它可以帮助研究人员定位与拒答、欺骗、偏见及其他行为相关的特征、回路或表征。
这一目标通常是防御性的。工程师希望获得比模型最终答案更充分的证据。内部测量可能在部署前暴露隐藏的失效模式,或帮助团队测试安全训练是否实现了泛化。
然而,可解释性并不会为其揭示的知识赋予道德目的。安全关键层的地图可以支持加固、监控或修复;同一张地图也能指导选择性操纵。
更广泛的可解释性研究文献早已将因果干预视为一项重要测试。研究人员改变内部特征,并检查行为结果。XBreaking 将这一逻辑用于对抗性目的。
研究报告称,有针对性的扰动使先前会拒答的模型在多个危害类别中生成了不安全内容。政府决策、恶意软件、成人内容、骚扰和专业建议属于较为脆弱的领域。
研究人员通过多名标注者的人工审查评估早期实验,只纳入标注者一致同意分类的回答。后续实验则使用 Llama Guard 3 自动评估更多回答。
这一转变提升了规模,但也引入了另一种不确定性来源。自动安全分类器可能会错误标记细微复杂的内容;其判断还取决于可能不同于部署组织政策的类别和阈值。
作者还测量了修改后的模型是否保留常规能力。他们比较了 HellaSwag 和 TruthfulQA 上的输出,并测量了 MMLU 上的答案一致性。报告结果显示,多个模型保留了原有行为的很大一部分。
保留情况并不均衡。根据论文,大多数配置在生成式评估中超过了 60% 的余弦相似度,部分超过 75%。在报告的配置中,Mistral-7B-v0.3 在 MMLU 上保留了超过 92% 的一致性。
其他结果则明显更弱。Gemma 7B 在报告测试中的余弦相似度介于 45.3% 至 51.9%,其 MMLU 一致性介于 29% 至 48%。Qwen2.5 3B 在部分设置中也记录到相对较低的一致性。
这些差异使任何“可以干净移除安全层”的说法变得复杂。XBreaking 有时保留了有用行为,但在不同模型系列之间并不一致。即使成功绕过拒答机制,模型性能仍可能出现明显退化。
更深层的教训并非可解释性已变得有害。安全研究经常公布揭示弱点的技术。真正的教训是,可解释性必须与访问控制、完整性检查和分层防护同步发展。
缺少运行层面保护的透明度可能暴露攻击面;缺少可解释性的保密性则可能让防御者看不见失效。开放模型开发者如今必须同时管理这两类风险。
开放权重模型部署者面临最大压力
XBreaking 主要对下载、修改、微调或再分发开放权重模型的团队构成压力,而非对托管商业聊天机器人的用户构成压力。
该攻击需要白盒访问,即直接查看模型内部参数和计算过程。与普通聊天机器人界面交互的用户无法获得这种访问权限。仅有提示词访问不足以实施已发表的方法。
作者明确将 GPT-4、Claude 和 Gemini 排除在其结论之外。这些商业系统提供的是受控接口,而非可下载的模型权重。其提供商还可以在核心模型外围设置独立的输入过滤器、输出分类器和滥用监控机制。
这一限制意味着,不能直接得出 XBreaking 能够禁用所有主要 AI 服务安全防护的结论。在该论文的威胁模型下,将同一技术应用于远程应用程序编程接口在技术上不可行。
开放权重部署具有不同的安全边界。模型所有者、恶意内部人员、遭入侵的流程或不受信任的分发方,都可能在部署前修改权重。届时,组织接收到的模型,其可见身份可能已无法反映实际的安全行为。
这一风险对运行于医疗、政府、金融或安全环境中的私有 AI 系统尤为重要。本地部署可以加强对敏感数据的控制,但也可能将模型完整性的责任从中央提供商转移给客户。
团队经常为专业工作流微调开放模型。既有研究表明,定制微调可能削弱安全对齐,即使开发者并无意移除防护措施。XBreaking 则提供了一条更具刻意性和针对性的路径。
因此,关键对立并非开放模型与闭源模型之争,而是透明的安全工程与在获授权定制后仍能保持可靠的安全性之间的差别。组织需要前者,但不应假定它必然保证后者。
模型溯源因此变得尤为重要。团队应了解权重的来源、应用了哪些适配器,以及内部参数是否在获批后发生变化。传统的软件清单无法完整反映这些转换。
完整性验证也需要覆盖最终的模型工件。哈希值能够发现文件是否被修改,但前提是团队维护了可信的参考版本。行为测试可以捕捉故障,但狭窄的测试集可能遗漏有针对性的改动。
持续评估提供了更强的方法。团队可以在微调、量化、合并或格式转换后,重新运行特定于政策的测试。即便开发者并未尝试发动攻击,这些操作也可能改变模型行为。
对于工程组织而言,这也成为文档管理挑战。测试结果、模型版本、适配器和审批决策必须保持关联。可搜索的工程知识库可以帮助团队在多个版本发布之间保留这些证据。
分层防护仍然必不可少,因为模型层面的对齐只是其中一种控制措施。输入筛查、输出审核、受限的工具权限、日志记录和人工审查,都能限制受损模型造成的后果。
XBreaking LLM 越狱并未使这些控制措施过时。它表明,组织不应将模型的拒答行为视为其权重永久不变的属性。
证据并未证明什么
这些结果揭示了真实的白盒弱点,但并未证明存在适用于生产环境 AI 系统的通用越狱方法。
第一个限制是模型范围。实验涵盖了来自四个模型家族的七种开放权重配置。这是一次有价值的跨模型测试,但在 2026 年可用模型中仍只占很小一部分。
测试模型的参数规模也介于 5 亿至 80 亿之间。论文探索了向更大同族模型迁移的情况,但直接证据仍主要集中在较小的配置上。前沿规模的架构可能以不同方式分布安全行为。
第二个限制涉及不受限制的参考模型。当攻击者拥有一个高度匹配的对照模型时,XBreaking 的效果最佳。这种配对使对齐差异更易于分离。
作者认为,较小的同族模型成员或新近微调的不受限制版本,可以作为替代参考。他们的迁移实验显示,与匹配模型对相比,一致性有所下降。在评估实际可靠性时,这种损失至关重要。
第三个限制在于模型对齐与部署过滤器之间的区别。XBreaking 修改的是内部拒答行为。生产系统仍可能通过独立的分类器阻止请求或响应。
一项关于更广泛安全流程的 2025 年研究发现,纳入输入和输出过滤器后,越狱的有效性可能下降。该研究得出结论,许多模型层面的攻击至少可被一个受测过滤器检测到。
这并不会否定 XBreaking,而是改变了被评估的对象。攻破核心模型是严重问题,尤其是在开发者依赖其拒答行为时。但这并不自动意味着有害内容会到达最终用户。
第四个限制是效用保持。该攻击试图在保留常规生成能力的同时移除限制。论文自身的基准测试结果显示,部分模型出现了明显性能下降。
这为防御者可能利用的可观测信号创造了条件。受损模型可能在无害测试、推理评估或回归测试套件中的回答发生变化。最强的攻击会尽量缩小这些差异,但该研究并未展示完美的隐蔽性。
第五个限制涉及因果解释。高分类准确率表明,选定的内部特征能够区分模型变体。但这并不能完全解释模型如何表征安全概念,或为何每次都会发生拒答。
平均层统计可能掩盖更具体的电路、词元效应及交互作用。稀疏自编码器的结果表明,更丰富的表征可能使分析更加精确。它同样凸显出仍有大量未知之处。
最后,研究对有害性的判断依赖于人工和自动分类器。安全评估并非纯粹机械的客观事实。政策边界因提供商、国家、行业和部署环境而异。
因此,恰当的结论应保持审慎。XBreaking 提供了证据,表明安全调优可能留下可发现且可操控的内部模式。它并未证明每一项防护都集中于一个可移除的开关之中。
三个信号将显示防御是否正在跟上
下一阶段将取决于独立复现、完整性防御,以及针对完整部署流程的测试。
第一个信号是在更大开放权重模型上的复现。研究人员需要测试,同样的层选择方法是否适用于更新的架构和大得多的参数规模。他们还需要衡量所需的计算资源。
成功复现将强化这样一种主张:对齐指纹会沿着架构家族延续。若复现失败,则表明已发表的效果更依赖于特定模型、配对方式或评估选择。
最具信息价值的研究将同时发布攻击和效用结果。如果常规模型性能崩溃,高攻击成功率的意义就会下降。防御者还需要能够揭示被修改模型是否可规避常规回归测试的测量指标。
第二个信号是,能够监测模型内部状态或验证获批权重的防御措施出现。开发者可以测试激活模式、保护模型工件,并在定制后比较对安全敏感的组件。
有效的防御必须能经受常见部署变更。量化、适配器合并、剪枝和格式转换都可能改变数值。完整性系统必须能够区分预期转换与恶意干预。
可解释性可能成为此类防御的一部分。用于选择攻击目标的同类指纹,也可能识别异常的内部行为。研究人员应测试,激活监控能否在不造成不可接受延迟的前提下检测扰动。
第三个信号是在完整应用栈上的评估。未来研究应将被修改的模型与输入过滤器、输出分类器、工具限制和人工升级规则结合起来。这将显示 XBreaking 造成的是模型层面的弱点,还是端到端的失效。
如果每个组件都依赖类似假设,分层系统仍可能失效。输出过滤器可能遗漏使用间接语言的有害内容。工具限制可能阻止执行,但仍暴露危险指令。
因此,独立红队应测试后果,而不只是拒答行为。他们应评估被修改的模型能否访问数据、调用软件,或影响一项具有重要后果的决策。这些结果比单一的不安全文本分类更重要。
开发者和企业采购方也应关注模型文档。安全报告应说明评估是在微调、量化和部署打包之前还是之后进行。来自未经改动的基础模型的结果,无法描述每个定制衍生版本。
XBreaking LLM 越狱让模型安全看起来不再像一项永久特性,而更像一种需要持续维护的安全属性。这一转变应影响采购、部署和持续测试。
使用开放模型的团队现在应盘点其现有防护措施。哪些控制位于模型内部,哪些在模型外围独立运行?组织能否在被修改的模型进入生产环境前检测到它?
这些问题提供了务实的起点。可解释性将继续揭示模型如何作出决策。最能从中受益的组织,将是那些同时保护这些解释所揭示信息的组织。



