Multi-AudioJail 口音越狱研究揭示语音 AI 安全缺口
Multi-AudioJail 研究人员发现,语音 AI 内部存在明显矛盾:当完全相同的有害请求通过不同口音和声学条件传入时,安全防护的表现会发生变化。
原始报道将这一结果描述为一个令人不安的问题:一个人的口音是否已经成为安全漏洞。证据支持一个更审慎、但同样严肃的结论:口音暴露了大型音频语言模型中不一致的安全行为,尤其是在与混响等效果结合时。
这一界定至关重要。脆弱的并不是肯尼亚、中国、尼日利亚或新加坡说话者,而是那些会因音频变化而对等价请求做出不同解读的系统。
Multi-AudioJail 口音越狱研究使用由 520 条有害指令生成的 102,720 个音频文件,测试了五个可供研究使用的音频模型。研究人员改变了语言、口音和录音条件,并衡量模型是否会拒绝不安全请求。
最引人注目的结果涉及带有室内混响的肯尼亚口音提示。在一个受测模型上,越狱成功率达到 61.25%,比未经修改的基线高出 57.25 个百分点。
这并不证明每一款商业语音助手都会以同样方式失效。但它表明,以文本为中心的安全测试可能忽略语音处理之前、期间或之后引入的弱点。
压力如今落在构建语音助手、呼叫中心代理、办公副驾驶和可执行操作系统的公司身上。它们必须将音频变化视为安全边界的一部分,而不是无障碍功能的细枝末节。
Multi-AudioJail 口音越狱究竟改变了什么
Multi-AudioJail 将口音差异从模型质量问题转化为可衡量的安全测试。
马萨诸塞大学阿默斯特分校和 Google DeepMind 的研究人员在 2025 年语言建模大会上发表了这项工作。他们的已发表论文研究大型音频语言模型,即 LALM,这类模型能够接收语音并生成基于语言的回答。
这些模型不同于传统语音转录系统。转录系统主要将音频转换为文本,而音频语言模型可以在作出响应前理解语气、上下文和口头指令。
这种直接路径让语音交互更快、更具表现力,但也创造了另一个可能导致安全防护行为不可预测的环节。
研究人员评估了 Qwen2-Audio、DiVA-llama-3-v0-8b、MERaLiON-AudioLLM-Whisper-SEA-LION、MiniCPM-o-2.6 和 Ultravox-v0-4.1-Llama-3.1-8B。这些模型来自在 VoiceBench 上具有相对较低基线越狱成功率的系统。
当输入导致模型违反其预期安全限制时,就会发生越狱攻击。这类攻击不一定会入侵服务器或窃取凭据,而是绕过本应阻止不安全协助的行为控制机制。
研究人员从常用于测试对抗性提示的 AdvBench 数据集中选取了 520 条有害指令,并将其转换为六种语言以及多种带口音的英语形式。
多语言组包括美式英语、德语、意大利语、西班牙语、法语和葡萄牙语。自然口音组包括与澳大利亚、新加坡、南非、菲律宾、肯尼亚和尼日利亚相关的说话者。
另一个合成组模拟了中文、韩语、日语、阿拉伯语、葡萄牙语、西班牙语和泰米尔语口音。合成口音的生成并不等同于收集每个社群的自然语音,这一局限性将在后文变得重要。
随后,团队加入了五类声学修改,包括三种混响配置、一种回声效果和模拟耳语。
其中一种房间配置采用约 0.6 秒的混响,另一种则复现了更复杂的类似铁路环境条件。这些变换旨在模拟口头请求到达模型时可能出现的真实变化。
这些组合共生成了 102,720 个音频样本。研究人员随后比较了不同语言、口音、声学效果和模型下的越狱成功率。
在报告的评估中,仅音频的多语言攻击成功率是等价纯文本攻击的 3.1 倍。德语音频的越狱成功率为 12.31%,而德语文本为 3.92%。
混响进一步拉大了差距。对于 Qwen2-Audio,一种带混响的德语条件将成功率从 9.71% 提升至 57.79%。
自然口音提示在加入声学扰动前的平均成功率约为 2.54%。在最强的受测条件下,其平均成功率最高升至 35.39%。
单项增幅最高的情况,是将带肯尼亚口音的语音连同室内混响发送给 MERaLiON。其成功率提高了 57.25 个百分点,达到 61.25%。
根据项目结果,带合成中文口音的音频也带来了显著增长,其中一种受测组合达到 59.75%。
这些数字揭示了标题背后的事件:一个在干净文本条件下看似对齐良好的系统,当同一语义请求通过普通的语音变化传入时,可能会作出截然不同的回应。
研究人员通过项目仓库发布了评估材料和实施细节。他们以可能助长滥用为由,未提供完整的一键式攻击框架。
这一选择也表明了作者如何看待这项工作。Multi-AudioJail 并非被描述为从聊天机器人获取娱乐性回答的技巧,而是一项面向正逐步接近真实应用系统的模型安全评估。
为什么口音和室内声学效果会触及安全层
核心问题并非模型什么都没听到,而是多个处理阶段对所听内容产生了分歧。
语音请求比键入的句子需要经过更多处理环节。系统必须编码声波、识别语音模式、还原语义、理解指令并应用安全规则。
有些产品将这些阶段分开处理:它们先转录语音,再将生成的文本发送给语言模型。
另一些产品则使用端到端音频模型。这类系统更直接地处理声学信息,并能够保留情绪、语速、犹豫和背景声音等特征。
无论采用哪种设计,语音理解与安全执行之间都可能出现缺口。模型可能足以理解并回答有害请求,但其内部表征方式却不同于安全训练所覆盖的形式。
口音指发音、节奏、重音和语调上的系统性差异。这些差异包含语言信息,而非随机噪声。
混响会为原始信号加入延迟反射。一个人在厨房、车站、汽车或会议室中说话,即使字词完全不变,也可能产生显著不同的声波。
Multi-AudioJail 口音越狱结合了这些变化。有害指令依然可被理解,但它在模型内部的表征发生了变化。
安全对齐往往依赖从训练样本中学习到的统计模式。如果这些样本过度代表干净的美式英语,拒绝行为就可能与该声学分布紧密关联。
模型可能仍能识别另一种口音中的不安全概念,但触发拒绝的内部激活可能会变弱、延迟或变得不稳定。
这解释了为何这一问题比普通语音识别错误更复杂。简单的转录失败会产生错误文字,或不作回答。
音频越狱则可能在保留足够语义以促使模型服从的同时,扰乱本应让它拒绝的机制。请求通过了,护栏却没有。
结果还因模型和变换方式而异。没有任何一种口音是通用密钥,也没有任何一种声学效果能够同样击破所有系统。
这种差异性表明,问题涉及模型架构、训练数据、对齐方法和音频预处理之间的相互作用,而不支持任何生物学或文化层面的解释。
事实上,将口音本身描述为危险,是在颠倒责任。人们不应为了获得一致的安全行为而必须向软件使用标准化发音。
失效责任属于受影响的系统。开发者决定训练集包含哪些声音、测试采用哪些变换,以及策略执行发生在哪个环节。
现有评估实践有助于解释为何这一弱点长期未获充分审视。即使最终产品接受音频,许多安全基准仍从书面提示开始。
VoiceBench 的创建正是为了拓宽这种衡量。它的语音助手基准评估了不同语音系统在指令遵循、推理、知识、安全和语音相关能力上的表现。
Multi-AudioJail 将安全问题延伸到干净录音之外。它考察当信号带有地区口音、回声或室内混响时,模型是否仍遵守同一套策略。
这更接近实际部署条件。真实对话发生在笔记本电脑麦克风、压缩通话、行驶中的车辆、拥挤的办公室,以及距离设备数英尺的位置。
语音系统还可能遇到语码转换,即说话者在同一段对话中切换语言。它也可能听到多人说话、媒体播放内容或翻译后的语音。
每一种条件都可能使输入偏离对齐阶段使用的数据分布。攻击者可以刻意搜索这些变化,而普通用户也可能无意中遇到它们。
因此,这项研究同时揭示了两个问题。其中一个具有对抗性,因为有人可以优化口音和音频效果来绕过安全防护。
另一个则是可靠性问题。合法用户可能仅因发音或录音条件,就得到更不安全的回答。
第二个问题使防御更加复杂。公司不能通过屏蔽不熟悉的口音来解决问题,否则会造成歧视、无障碍缺陷以及新的攻击机会。
安全对齐正在与音频多样性竞争
语音 AI 供应商如今面临直接权衡:既要接纳多样化语音,又要控制对这些语音的每一种解读。
这个故事中的主要对手并非一家公司与另一家公司,而是一致的安全对齐与人类音频的巨大多样性之间的对抗。
文本模型在规范化后处理离散词元。音频模型则接收包含语言、说话者特征、信道噪声、时序和环境信息的密集信号。
这种丰富性赋予语音系统吸引力,也为对手提供了更多可操纵的维度。
攻击者可以改变语速、音高、口音、音量、回声、混响、背景声音和语言。有些变化对听者来说很明显,另一些则听起来只是正常的录音条件。
安全团队不能假设不安全请求只有一种稳定表征。同一条指令可以占据模型音频特征空间中的许多位置。
这造成了一个“最弱环节”问题。对英文文本的强拒绝行为意义有限:如果一段口语翻译或经过修改的录音能通过防护较弱的路径抵达同一模型,风险依然存在。
研究中的五个模型说明了这一点。它们最初的越狱成功率介于 1.73% 至 5.19% 之间,在基线条件下看起来令人鼓舞。
但在经过贴近真实场景的变换后,这些数字显著变化。安全评估不仅取决于用户提出了什么请求,也取决于他们的声音以何种方式传入系统。
这对消费级语音助手有直接影响。对话系统可能一边讨论敏感的健康、财务或职场信息,一边持续监听指令。
当语音模型获得工具使用权限时,风险会进一步增加。仅能回复的聊天机器人可以生成有害文本,但智能体可以发送消息、搜索私人文件、下单或修改账户。
开放全球应用安全项目在其prompt injection 指南中描述了这一更广泛的类别。该指南警告,多模态输入会引入攻击,而现有防御措施可能难以检测这类攻击。
基于口音的差异并不等同于图像中隐藏的指令。不过,两种情况都暴露了同一种架构风险。
模型通过某种模态接收内容,而安全控制对这种模态的理解不如对核心模型那样可靠。随后,应用程序便信任模型的解读。
当模型同时充当解释器和策略执行者时,情况会尤为危险。一个概率性系统既决定用户说了什么,也决定请求是否被允许。
更安全的设计应当分离这两类决策。独立控制机制可以检查转录文本、模型输出、请求的操作、账户权限和交易上下文。
即便如此,这种设计也并不完美。如果转录文本遗漏了关键细节,文本过滤器可能会批准一条音频模型理解得更完整的指令。
因此,开发者需要进行跨模态一致性检查。系统应比较其语音层、语言层和策略层对用户请求的理解是否一致。
出现较大分歧时,应予以拒绝或采用更安全的替代方案。敏感操作应通过不依赖同一语音解读的渠道进行确认。
速率限制同样重要。Multi-AudioJail 评估了许多组合,这反映出攻击者可以反复探测模型,寻找有效条件。
生产服务应检测相似请求之间的系统性变化。反复尝试变换声音、效果或语言,可能表明存在对抗性探索。
权限则构成另一道边界。模型绝不应仅因其对话回复听起来很自信,就获得访问敏感数据的权限。
授权必须保持确定性,并置于模型之外。一次成功的越狱不应自动演变为一次成功的账户接管。
这一区别将模型安全与应用安全区分开来。拒绝训练可减少有害回复,而访问控制则限制遭入侵模型能够造成的影响。
两者都不可或缺。将一个对齐良好的系统提示词当作授权层,会在音频处理削弱这种对齐时使应用暴露于风险之中。
行业还需要更广泛的红队参与。由单一口音主导的测试群体,无法发现分布在众多语音社群中的失效问题。
这种扩展必须避免将社群标签化为威胁。测试应衡量系统行为是否一致,而不是判断某些用户是否应受到额外审查。
理想结果是口音不变的策略执行。无论说话者的地区、身份、麦克风或所在房间如何,一个请求都应获得相同的安全处理。
要实现这一目标,不能只是在训练集中增加样本。开发者必须评估每个环节,包括语音编码、转录、策略分类、回复生成和工具执行。
口音越狱证据并不能证明什么
该研究展示了一种可重复的基准测试弱点,但并未证明商业语音助手已遭到广泛利用。
受测系统是可供研究访问的模型,并非对所有消费级产品的完整调查。多款广泛部署的专有助手未被纳入评估。
商业服务可以围绕基础模型增加审核、监控、输入过滤和产品层限制。这些层级可能改变现实世界的结果。
该研究还采用自动化评估方法衡量越狱成功率。这种评分方式适合大规模使用,但可能错误分类含糊的回复。
模型可能提供部分信息,却未完成所请求的有害任务。另一种回复可能听起来有所保留,却仍泄露了可操作的细节。
人工审查可以澄清这些情况。但它无法消除核心结论,因为报告中的差异幅度过大,不能简单归咎于轻微的评分误差。
口音类别也需要谨慎解读。口音并不是某个国家所有人共享的一种固定声音。
肯尼亚、尼日利亚、中国、澳大利亚和新加坡都拥有广泛的语言多样性。数据集中使用的标签不可避免地压缩了这种差异。
合成口音又增加了不确定性。生成的语音可能复现刻板的声学模式,却无法代表人们实际说话的方式。
因此,合成结果适合用于压力测试,却不太适合据此推断真实人群。自然录音为部署相关性提供了更有力的证据。
声学变换也带来类似限制。精确配置的混响参数并不能代表每个房间、手机或说话者位置。
不过,混响本身很常见。问题在于变化的方向和幅度,而不是声称每一种回声都会造成绕过。
该研究也未表明仅凭口音就导致了每一次增长。最强的影响出现在口音与声学扰动相互作用时。
因此,“你的口音是一项安全漏洞”更适合作为警告,而非字面意义上的诊断。证据指出,在组合音频条件下存在模型鲁棒性问题。
关于原因,还有一个未解的问题。论文报告了观察到的行为,但具体的内部机制可能因模型而异。
一个系统可能错误转录了某个短语。另一个系统可能正确编码了含义,却未能触发拒绝策略。
第三个系统可能在安全训练中较少出现的语言或语音模式上具有较弱的对齐能力。相似的输出背后可能隐藏着不同的失效方式。
防御措施必须考虑这些可能性。仅仅改善转录,无法修复即使转录准确、策略行为仍会变化的模型。
同样,如果音频编码器生成了位于对齐分布之外的表征,更强的拒绝提示词也无法保证安全。
研究人员测试了一种使用额外文本指令的推理时防御措施。它降低了部分模型—语言组合的越狱成功率。
对于 MERaLiON,报告显示德语的降幅为 14.23 个百分点,意大利语为 12.50 个百分点。Qwen2 的降幅包括德语 5.48 个百分点和意大利语 19.91 个百分点。
这些结果具有意义,但并不完整。较低的越狱率并不等于安全证明,尤其是当防御依赖同一模型遵循指令时。
美国国家标准与技术研究院的安全指南提供了一个有用的框架。其对抗性机器学习分类法涵盖规避、滥用、投毒、隐私攻击以及跨多种数据模态的攻击。
在这一框架下,音频变化属于威胁模型的一部分。不应仅将其视为由语音工程师处理的准确率问题。
不过,团队也应避免耸人听闻的结论。该研究没有证据表明,普通带有口音的说话者会故意制造安全事件。
该研究同样未证明攻击者必须拥有某种特定的自然口音。合成语音、声音转换和预录音频可以复现许多声学特征。
这意味着,基于口音的监控会瞄准错误的信号。它会增加合法用户的负担,却难以有效应对能够变换声音的攻击者。
将“异常”语音标记出来的防御分类器,也可能重演原有的失效。它可能把熟悉的美国英语定义为正常,将其他所有人视为更高风险。
正确的安全问题应是行为层面的:系统是否会在贴近现实的音频条件下,对语义等价的请求执行同样的策略?
无需将怀疑归因于身份,也能衡量这个问题。这样还能产生更有价值的工程结果。
团队应发布按群体拆分的评估结果,包括误拒绝和成功越狱。一个拦截所有陌生声音的防御机制并非安全系统。
它只是让部分受众无法使用的系统。安全性与可访问性必须共同提升。
语音 AI 开发者接下来应关注什么
下一个考验是,供应商能否在不缩小系统可理解用户范围的前提下,让跨模态安全表现保持一致。
第一个信号将来自商业语音提供商开展更广泛的对抗性评估。公开安全报告应纳入口音、语言、噪声、混响和语码转换测试。
汇总后的拒绝率还不够。供应商应报告表现最差的条件,以及纯文本、纯净音频和变换后音频之间的差距。
这类披露将表明,Multi-AudioJail 揭示的是孤立的研究模型问题,还是已部署语音系统普遍存在的弱点。较大的跨模态差距将强化该研究的警告。
第二个信号将是围绕具备工具能力的语音智能体进行架构调整。高影响操作应在语言模型之外接受确定性验证。
能够读取信息的语音助手面临一种层级的风险。能够汇款、暴露私人记录或操作职场工具的系统,则面临另一种风险。
开发者应要求对敏感操作进行明确确认。同时还应将权限绑定到已认证用户、受限工具和狭窄的交易范围。
这种方法假定越狱仍有可能发生。它限制越狱的后果,而不是承诺完美的拒绝行为。
这种预期与现代安全实践一致。应用程序通过结合隔离、授权、监控和恢复机制,来应对单个控制措施失效。
语音智能体也需要同样的分层方法。模型的对话流畅性绝不应被赋予额外权限。
第三个信号将是独立复现。研究人员需要使用多样化的自然说话者和真实设备测试更新的专有模型与开放模型。
复现研究应区分转录失效与对齐失效。还应比较端到端音频模型与将语音经由转录阶段处理的系统。
有力的结果应显示,策略在不同口音、语言、房间、麦克风和压缩格式下都能保持稳定。改进应能抵御此前未见的变换。
较弱的结果则只会显示在训练所用的确切条件下有所提升。这种模式表明的是对基准测试的适配,而非通用安全性。
未来评估还应在对抗性成功率之外衡量普通用户受到的影响。误拒绝、失真的回答和不平等访问同属一个鲁棒性问题。
语音系统必须理解广泛多样的说话者,同时又不能对任何群体更频繁地批准有害请求。这两个目标无法被割裂评估。
对企业采购方而言,实际问题已不再是供应商是否宣传语音安全。采购方需要了解政策执行发生在哪些环节,以及一旦失效会带来什么后果。
他们应询问音频是否经过多项彼此独立的检查。还应了解模型是否能在一次语音请求后直接触发工具。
开发者需要保留足够信息的日志,以便进行事件审查,同时又不能形成不必要的敏感语音档案。隐私与安全要求在这里可能彼此冲突。
原始音频具有取证价值,但也可能暴露身份、健康状况、位置和人口统计学信息。保留政策应与各类应用的风险相匹配。
对普通用户而言,现有证据并不意味着需要改变说话方式。但对于连接到重大操作的语音系统,确实有理由保持谨慎。
用户应检查确认提示、限制权限,并避免将听起来自然的助手视为请求已被安全理解的证明。
Multi-AudioJail 口音越狱最终暴露了一个设计假设。语音 AI 开发者将语音视为通往一个已获安全保障的语言模型的另一条便捷入口。
语音并不只是附带声音的文本。它是一个独立的输入空间,拥有自身的歧义、转换过程与对抗性可能。
这使多模态安全成为一个端到端的工程问题。训练模型拒绝有害文本仅仅是开始。
更困难的要求在于一致性。等效意图应在每一种受支持的语音和环境中获得等效的政策执行。
如今,企业已有一项可据以检验这一承诺的具体基准。研究人员也提供了证据,表明纯净音频测试可能造成虚假的安全感。
未来几个月应能揭示供应商是否会发布更广泛的评估、加强外部控制,并邀请独立测试。沉默将使采购方无法判断自身面临的风险。
如果语音 AI 正在成为访问私密知识、工作场所系统和个人决策的界面,其安全保障就必须经受住人们真实说话方式的考验。
责任应由技术承担,而非其用户。语音 AI 供应商能否在其助手获得更大权限之前,证明每一种受支持的口音都享有同等的安全保护?



