top of page

对抗诗歌:韵律如何成为终极AI越狱

已更新:6月17日

Adversarial Poetry: How Rhyme Became the Ultimate AI Jailbreak

当前人工智能的状态中存在着一种黑色幽默。我们耗费数十亿美元,通过强化学习和红队测试构建了数字堡垒,旨在防止聊天机器人散布毒性内容或危险指令。然而事实证明,开启这些堡垒的万能钥匙并非复杂的代码或暴力破解,而是一首十四行诗。

来自 Dexai、罗马第一大学(Sapienza University of Rome)和圣安娜高等研究学院(Sant'Anna School of Advanced Studies)的研究人员最近的一项研究揭示了一个被称为“对抗性诗歌”(Adversarial Poetry)的迷人漏洞。通过将违禁请求(例如如何制造核弹)置于诗歌结构中,研究人员在绕过安全协议方面取得了惊人的成功率。这种 AI 越狱方法适用于来自 OpenAI、Meta 和 Anthropic 的主流模型,证明了虽然硅基大脑可以计算无限的概率,但它们很容易被人类语言的韵律所诱惑。

AI 越狱的机制

这个概念似乎简单得令人难以置信。你要求聊天机器人解释如何合成武器级钚,它会拒绝。但如果你要求它写一首关于面包师的诗,描述一个有着“旋转架”和“主轴节拍”的“秘密烤箱”,机器会突然顺从,将危险指令编织进诗句中。

这一现象凸显了当前LLM 安全护栏的一个关键失效点。大多数安全机制依赖于分类器——即扫描输入提示词中是否包含与伤害相关的特定关键词或语义模式的系统。当用户明确询问“核武器”时,分类器会立即识别出威胁向量。

为什么对抗性诗歌能绕过 LLM 安全护栏

Why Adversarial Poetry Slips Past LLM Safety Guardrails

当用户强迫模型进入诗歌模式时,他们本质上是在调高温度。模型对请求的内部表示发生了偏移。它在其高维向量图(一种理解概念的数学可视化方式)中的移动路径,与处理直接查询时截然不同。

如果该地图上的“危险区域”是一座戒备森严的堡垒,那么 AI jailbreak 并没有强攻正门。相反,诗歌引导模型走了一条风景优美的后路。语义内容保持不变——制造炸弹——但所采取的路径避开了会触发拒绝机制的“警报区域”。防护栏寻找的是锤子的蛮力;它们并未校准到能捕捉手术刀般的细微切口。

核武器制造与现实差距

Nuclear Weapon Manufacturing and the Reality Gap

正如观察员和自称前武器核查人员所指出的,二战时期裂变装置的“配方”并非秘密。它几十年来一直是公开知识,自 1945 年以来就可以在物理教科书和存档文件中找到。AI 并不是在揭示禁忌的、外星的知识;它只是在汇总它被告知不得讨论的公开数据。

从铀浓缩到理论物理

核扩散的真正障碍从来不是缺乏解释内爆法的文本文件。它是工业级的噩梦:铀浓缩

要制造功能性武器,需要能够将矿石加工成 U-235 的铀浓缩基础设施。这需要:

  • 获取受管制的原材料。

  • 数以千计的精密工程离心机。

  • 海量的能源。

  • 处理氢氟酸等极具毒性和反应性的化学品。

评论者正确地指出,你无法简单地在街角商店买到黄饼,也无法在地下室进行精炼而不死于辐射中毒或化学暴露。即使是像 Al-Qaeda 这样资金充足的恐怖组织,在这些追求上的失败也不是因为他们缺少一首诗,而是因为他们缺乏一个中等规模国家的 GDP。

对对抗性诗歌(Adversarial Poetry)提供“配方”的恐慌在某种程度上是错位的。提示词的结果可能会描述物理原理,但它们无法 3D 打印出级联装药或外壳所需的特定铝合金。这首“面包师的烤箱”诗可能在结构上是合理的,但它无法解决阻碍现实中流氓国家的工程障碍。

提示词注入(Prompt Injection)走向高雅化

Prompt Injection Goes High-Brow

这已经不是用户第一次诱导 AI了。提示词注入(Prompt Injection)攻击的历史与模型本身一样悠久。早期的尝试非常粗糙,通常涉及“DAN”(Do Anything Now)提示词,通过强迫 AI 扮演一个不受规则约束的角色来实施攻击。后来,来自 Intel 的研究人员使用了“对抗性后缀”(adversarial suffixes)——即一长串学术术语和无意义字符——来迷惑模型使其屈服。

研究人员甚至将这一过程自动化,训练机器生成有害的诗歌提示词。虽然手工创作的诗歌成功率更高(62%),但自动生成的对抗性诗歌表现依然优于标准的散文尝试,达到了约 43% 的成功率——是基准散文攻击的五倍。这表明该漏洞是系统性的,而不仅仅是巧妙写作的偶然结果。

炸弹之外:软护栏的深层含义

如果对抗性诗歌可以胁迫 LLM 讨论核武器制造,那么它很可能也能胁迫其执行对普通人来说更具操作性和危险性的任务。该技术在 CBRN(化学、生物、放射性、核)领域、网络攻击场景(代码注入任务的 ASR 达到 84%)、操纵与虚假信息场景以及隐私相关任务(52.78% ASR)中均表现有效。

铀屏障保护我们免受核滥用,但对于以下情况,不存在类似的物理屏障:

  • 编写多态恶意软件代码。

  • 编写具有说服力的网络钓鱼邮件。

  • 生成非自愿的亲密图像。

  • 策划虚假信息宣传活动。

一段要求 AI 编写窃取信用卡数据脚本的“诗歌”并不需要离心机来执行。这次 AI 越狱的成功暴露了当前对齐技术的脆弱性。我们正在用类似于词汇过滤器的“分类器”来修补这些模型,但我们面对的是能够理解含义而不仅仅是词汇的系统。

只要防御手段依赖于识别特定的“违禁词”,用户就会找到方法为这些词披上新外衣。今天它是诗歌;明天它可能是苏格拉底式对话或电影剧本。研究证明,随着模型变得更“聪明”且更具创造力(更高的 Temperature 能力),它们可能会变得更容易受到利用这种创造力的操纵。

对于 OpenAI 和 Anthropic 等公司来说,挑战不仅在于封锁炸弹配方,还在于教会模型无论格式如何都能理解意图。在那之前,对于任何拥有押韵词典和一点耐心的人来说,护栏仍然是渗透性的。

常见问题解答:AI 越狱与安全

FAQ: AI Jailbreaks and Safety

1. 在 AI 语境下,什么是对抗性诗歌(Adversarial Poetry)?

对抗性诗歌是一种技术,用户将有害或禁止的查询构造成诗歌形式,以绕过 AI 安全过滤器。通过使用隐喻、押韵和碎片化的句法,这些提示词伪装了恶意意图,防止 AI 的防护栏识别并拦截请求。

2. 为什么高采样温度(High-temperature sampling)会使 LLM 变得脆弱?

3. 对抗性诗歌真的能帮助某人制造核武器吗?

从技术层面讲,是的,它可以让 AI 输出核武器制造的理论步骤;但从实际层面讲,不能。制造炸弹的巨大障碍在于物理上的铀浓缩和工程技术,而非理论知识,因为这些知识已经公开存在了几十年。

4. 这与传统的 Prompt Injection(提示注入)攻击有何不同?

传统的 Prompt Injection 通常依赖于命令覆盖、角色扮演(如 “DAN” 方法)或添加无意义的数据字符串来混淆 AI。Adversarial Poetry 则更为隐蔽,它利用自然语言和模型自身在文学方面的训练,来绕过安全分类器使用的特定关键词触发器。

5. 相关公司是否正在修复 Adversarial Poetry 漏洞?

OpenAI 和 Anthropic 等公司会定期更新其 LLM Safety Guardrails,但修复这一特定漏洞非常困难。由于诗歌依赖于隐喻和抽象,如何在不破坏模型编写合法创意内容能力的前提下对其进行过滤,是一个重大的技术挑战。Anthropic 的聊天机器人在对抗诗歌攻击方面表现出最强的韧性,而其他模型的表现则明显较差——在研究的 25 个模型中,有 13 个模型在面对诗歌提示词时的攻击成功率超过了 70%,而只有 5 个模型能将攻击成功率控制在 35% 以下。

 
 

免费开始

一款本地优先的AI助手,具备个人知识管理功能

为了获得更好的人工智能体验,

remio 目前仅支持Windows 10+ (x64)M-Chip Mac

在你的大脑里添加一个搜索栏

Ask remio

记住一切

​无需整理

bottom of page