top of page

Jailbreak XBreaking de LLM usa IA explicável contra filtros de segurança

há 2 horas
13 min de leitura

Pesquisadores do XBreaking usaram IA explicável para localizar e enfraquecer controles de segurança em sete modelos de linguagem de pesos abertos. Suas descobertas transformam uma promessa defensiva em um conflito de segurança. O jailbreak XBreaking de LLM usa sinais internos do modelo para identificar camadas associadas ao comportamento de recusa. Em seguida, ele mira componentes próximos, em vez de procurar às cegas por um prompt bem-sucedido.

O estudo revisado por pares foi publicado na Neural Computing and Applications em 10 de outubro de 2026. Pesquisadores da Universidade de Pavia e da Cochin University of Science and Technology desenvolveram o método. Eles testaram modelos das famílias Llama, Qwen, Gemma e Mistral.

Este não é mais um prompt que engana um chatbot por meio de jogos de palavras. O XBreaking pressupõe acesso direto aos pesos do modelo, estados ocultos, mapas de atenção e outras informações internas. Essa restrição reduz a ameaça imediata, mas também torna o alerta mais preciso para organizações que implementam modelos abertos personalizáveis.

O conflito central agora está claro. A interpretabilidade pode ajudar engenheiros a compreender e fortalecer o comportamento de segurança. A mesma visibilidade também pode mostrar a um invasor exatamente onde esse comportamento está concentrado.

O que o jailbreak XBreaking de LLM realmente mudou

O XBreaking substitui a experimentação com prompts por uma busca direcionada pelos componentes internos que diferenciam modelos alinhados e irrestritos.

A maioria dos jailbreaks conhecidos opera por uma interface de chatbot. Um invasor altera a redação, a estrutura, o idioma ou o contexto de uma solicitação até que o sistema deixe de recusá-la. Esse processo frequentemente envolve geração e testes repetidos.

O XBreaking atua dentro do modelo. Seus pesquisadores comparam um modelo ajustado para segurança com uma contraparte irrestrita da mesma família arquitetural. Eles chamam essas versões de “censurada” e “não censurada”, embora ajustada para segurança e irrestrita sejam descrições mais neutras.

A comparação usa IA explicável, ou seja, técnicas que revelam sinais associados às decisões internas de um modelo. Os pesquisadores medem valores médios de ativação e atenção nas camadas do transformer. As ativações representam cálculos internos, enquanto os valores de atenção descrevem quão fortemente os tokens influenciam uns aos outros durante o processamento.

O estudo publicado relata um processo de três etapas. Primeiro, a equipe cria perfis de ambas as versões usando entradas prejudiciais e benignas. Em segundo lugar, um método estatístico de seleção de características classifica as camadas que melhor distinguem as versões. Em terceiro, o ataque perturba componentes ao redor dessas camadas selecionadas.

Essa sequência importa porque transforma a interpretabilidade em reconhecimento. O método não trata todos os parâmetros como igualmente relevantes. Ele busca uma pequena região interna em que o ajuste de segurança parece mais visível.

Os experimentos abrangeram sete modelos de pesos abertos. Entre eles estavam Llama 3.2 1B, Llama 3.1 8B, Qwen2.5 0.5B, Qwen2.5 3B, Gemma 2B, Gemma 7B e Mistral-7B-v0.3.

Cada modelo tinha uma variante irrestrita correspondente com a mesma arquitetura geral e configuração de parâmetros. Esse pareamento deu aos pesquisadores uma forma controlada de comparar o comportamento interno.

A avaliação usou 100 comportamentos prejudiciais em dez categorias. Essas categorias incluíam fraude, desinformação, malware, violações de privacidade, assédio, dano físico e aconselhamento especializado inseguro. Os pesquisadores os associaram a 100 comportamentos benignos que cobriam tópicos relacionados.

Essa configuração veio do conjunto de dados JailbreakBench, um benchmark aberto para avaliar prompts adversariais e defesas. A equipe inicialmente excluiu perguntas que já produziam respostas inseguras sem qualquer ataque. Essa escolha evitou que falhas existentes inflassem os resultados de ataque reportados.

Assim, o XBreaking altera o alvo do jailbreak. O prompt continua relevante, mas já não é o principal objeto de otimização. A assinatura interna de segurança do modelo torna-se o alvo.

Essa distinção cria a tensão central do artigo. Um mecanismo de segurança que deixa uma assinatura interna mensurável se torna mais fácil de estudar. Ele também se torna mais fácil de atacar quando um adversário controla o modelo.

Como o XBreaking encontra camadas críticas para a segurança

Os pesquisadores tratam as diferenças entre modelos alinhados e irrestritos como uma impressão digital que revela onde o comportamento de recusa está concentrado.

O método começa enviando perguntas padronizadas por ambas as versões de um modelo. Ele registra ativações médias e pontuações de atenção para cada camada. Os valores são normalizados para que os pesquisadores possam comparar sinais com diferentes faixas numéricas.

Um processo de seleção de características então pergunta quais medições em nível de camada melhor classificam um modelo como ajustado para segurança ou irrestrito. Os pesquisadores usam um teste de análise de variância para classificar essas características. Eles selecionam o menor grupo que oferece precisão de classificação útil.

Esta é a parte “explicável” de como o XBreaking funciona. Em vez de afirmar que cada sinal oculto tem um significado humano intuitivo, o método identifica diferenças mensuráveis associadas ao alinhamento. Essas diferenças indicam aos pesquisadores onde inspecionar ou intervir.

O artigo relata mais de 90% de precisão de identificação para cinco das sete configurações de modelo. Ele relata 100% de precisão para Gemma 7B e 82,5% para Mistral-7B-v0.3. Esses são resultados de classificação dentro da configuração experimental dos autores, não medidas universais de segurança de modelos.

Um teste adicional usou autoencoders esparsos, que decompõem as ativações do modelo em características internas mais específicas. No Llama 3.1 8B, essa abordagem alcançou 100% de precisão de classificação. O método mais simples de ativação e atenção alcançou 97,5%.

Os autores mantiveram o método mais simples porque autoencoders esparsos exigem maior esforço computacional. Modelos separados podem ser necessários para diferentes camadas e arquiteturas. Estatísticas médias de ativação e atenção podem ser coletadas durante o processamento direto comum.

Em muitas configurações, os sinais selecionados apareceram em um grupo limitado de camadas intermediárias ou posteriores do transformer. O artigo interpreta essas áreas como importantes contribuidoras para a supressão de conteúdo. No entanto, a correlação com o comportamento de recusa não fornece uma explicação causal completa.

Depois de localizar essas camadas, o XBreaking modifica os pesos de escala em um componente de normalização próximo. A normalização de camada regula a escala e a distribuição de sinais internos à medida que eles passam por um transformer. Os pesquisadores adicionam ruído controlado a esses pesos e observam as respostas resultantes.

O ataque testa perturbações positivas e negativas em várias magnitudes. Mudanças muito pequenas frequentemente produziram pouco efeito. Mudanças maiores poderiam prejudicar a geração geral de texto. Por isso, os pesquisadores buscaram uma faixa que enfraquecesse as recusas sem corromper completamente o modelo.

Esse mecanismo explica por que o ataque difere do fine-tuning comum. O fine-tuning pode atualizar uma ampla coleção de pesos em muitos exemplos. O XBreaking usa a impressão digital de alinhamento para restringir a intervenção.

O preprint original do XBreaking apareceu em abril de 2025. A versão de periódico de 2026 adiciona uma avaliação mais ampla, medições de utilidade, experimentos de transferência e uma discussão mais explícita sobre o escopo.

O método também se assemelha a uma auditoria de segurança invertida. Um defensor pode comparar modelos para localizar componentes de segurança frágeis. Um invasor com o mesmo acesso pode usar o mapa resultante para suprimi-los.

IA explicável se torna um mapa de ataque

O impacto do XBreaking na segurança decorre de uma contrapartida: a visibilidade interna melhora a auditoria, enquanto reduz a obscuridade em torno dos controles de segurança.

A interpretabilidade mecanicista examina os cálculos que produzem o comportamento de um modelo. Ela pode ajudar pesquisadores a localizar características, circuitos ou representações ligados à recusa, à decepção, ao viés e a outros comportamentos.

Esse objetivo geralmente é defensivo. Engenheiros querem mais evidências do que a resposta final de um modelo pode fornecer. Medições internas podem expor modos de falha ocultos antes da implementação ou ajudar equipes a testar se o treinamento de segurança foi generalizado.

No entanto, a explicabilidade não atribui um propósito moral ao conhecimento que revela. Um mapa de camadas críticas para a segurança pode apoiar reforço, monitoramento ou reparo. O mesmo mapa pode orientar manipulação seletiva.

A literatura mais ampla sobre interpretabilidade já trata a intervenção causal como um teste importante. Pesquisadores alteram uma característica interna e examinam o resultado comportamental. O XBreaking aplica essa lógica de forma adversarial.

O estudo relata que perturbações direcionadas fizeram com que modelos que antes recusavam produzissem conteúdo inseguro em diversas categorias de dano. Tomada de decisão governamental, malware, conteúdo adulto, assédio e aconselhamento especializado figuraram entre as áreas mais vulneráveis.

Os pesquisadores avaliaram experimentos iniciais por meio de revisão manual de vários anotadores. Eles incluíram apenas respostas em que os anotadores concordaram por unanimidade com a classificação. Experimentos posteriores usaram Llama Guard 3 para avaliar automaticamente números maiores de respostas.

Essa mudança melhora a escala, mas introduz outra fonte de incerteza. Um classificador de segurança automatizado pode rotular incorretamente conteúdo com nuances. Seus julgamentos também dependem de categorias e limiares que podem diferir das políticas de uma organização implementadora.

Os autores também mediram se os modelos modificados mantiveram capacidades comuns. Eles compararam resultados no HellaSwag e TruthfulQA e mediram a concordância de respostas no MMLU. Os resultados reportados mostram que vários modelos preservaram parcelas substanciais de seu comportamento original.

A preservação foi desigual. A maioria das configurações superou 60% de similaridade de cosseno nas avaliações generativas, segundo o artigo. Algumas superaram 75%. Mistral-7B-v0.3 manteve mais de 92% de concordância no MMLU nas configurações reportadas.

Outros resultados foram muito mais fracos. Gemma 7B apresentou similaridade de cosseno entre 45,3% e 51,9% nos testes reportados. Sua concordância no MMLU variou de 29% a 48%. Qwen2.5 3B também registrou concordância relativamente baixa em algumas configurações.

Essas diferenças complicam qualquer alegação de que a camada de segurança pode ser removida de forma limpa. O XBreaking às vezes preservou comportamentos úteis, mas não de modo consistente entre famílias de modelos. Um bypass de recusa bem-sucedido ainda pode resultar em um modelo visivelmente degradado.

A lição mais profunda não é que a interpretabilidade se tornou prejudicial. Pesquisas de segurança publicam rotineiramente técnicas que revelam fraquezas. A lição é que a explicabilidade deve ser desenvolvida junto a controles de acesso, verificações de integridade e salvaguardas em camadas.

Transparência sem proteção operacional pode expor uma superfície de ataque. Sigilo sem interpretabilidade pode ocultar falhas dos defensores. Desenvolvedores de modelos abertos agora precisam administrar ambos os riscos.

Implementadores de modelos de pesos abertos enfrentam a maior pressão

O XBreaking pressiona principalmente equipes que baixam, modificam, ajustam ou redistribuem modelos de pesos abertos, em vez de usuários de chatbots comerciais hospedados.

O ataque exige acesso de caixa branca, isto é, visibilidade direta dos parâmetros internos e dos cálculos do modelo. Um usuário que interage com uma interface normal de chatbot não recebe esse acesso. O acesso ao prompt, por si só, é insuficiente para o método publicado.

Os autores excluem explicitamente GPT-4, Claude e Gemini de suas alegações. Esses sistemas comerciais expõem interfaces controladas, em vez de pesos de modelo disponíveis para download. Seus provedores também podem cercar o modelo principal com filtros de entrada separados, classificadores de saída e monitoramento de abuso.

Essa limitação impede concluir diretamente que o XBreaking pode desativar as proteções de todos os principais serviços de IA. Aplicar a mesma técnica a uma interface de programação de aplicações remota é tecnicamente inviável dentro do modelo de ameaça do artigo.

Implantações com pesos abertos apresentam uma fronteira de segurança diferente. O proprietário do modelo, um agente interno mal-intencionado, um pipeline comprometido ou um distribuidor não confiável pode modificar os pesos antes da implantação. As organizações podem então receber um modelo cuja identidade visível já não reflete seu comportamento de segurança.

Esse risco é relevante para sistemas privados de IA usados em ambientes de saúde, governo, finanças ou segurança. A implantação local pode ampliar o controle sobre dados sensíveis. Ela também pode transferir a responsabilidade pela integridade do modelo de um provedor central para o cliente.

As equipes frequentemente ajustam modelos abertos para fluxos de trabalho especializados. Pesquisas anteriores mostraram que o fine-tuning personalizado pode enfraquecer o alinhamento de segurança, mesmo quando os desenvolvedores não pretendem remover proteções. O XBreaking acrescenta uma via mais deliberada e direcionada.

Portanto, o principal adversário não é modelos abertos versus modelos fechados. É a engenharia de segurança transparente versus uma segurança que permanece confiável após personalizações autorizadas. As organizações precisam da primeira sem presumir que ela garante a segunda.

A procedência do modelo se torna especialmente importante. As equipes devem saber de onde os pesos vieram, quais adaptadores foram aplicados e se os parâmetros internos mudaram após a aprovação. Um inventário convencional de software não captura integralmente essas transformações.

A verificação de integridade também precisa abranger o artefato final do modelo. Hashes podem revelar se um arquivo foi alterado, mas apenas se as equipes mantiverem uma referência confiável. Testes comportamentais podem identificar falhas, mas um conjunto de testes restrito pode deixar passar alterações direcionadas.

A avaliação contínua oferece uma abordagem mais robusta. As equipes podem repetir testes específicos de política após fine-tuning, quantização, fusão ou conversão de formato. Essas operações podem alterar o comportamento do modelo mesmo quando os desenvolvedores não estão tentando realizar um ataque.

Para organizações de engenharia, isso também se torna um desafio de documentação. Resultados de testes, versões de modelos, adaptadores e decisões de aprovação precisam permanecer conectados. Uma base de conhecimento de engenharia pesquisável pode ajudar as equipes a preservar essas evidências entre lançamentos.

Proteções em camadas continuam necessárias porque o alinhamento no nível do modelo é apenas um controle. Triagem de entrada, moderação de saída, permissões restritas para ferramentas, registros e revisão humana podem limitar as consequências de um modelo comprometido.

O jailbreak de LLM XBreaking não torna esses controles obsoletos. Ele mostra por que as organizações não devem tratar o comportamento de recusa de um modelo como uma propriedade permanente de seus pesos.

O Que as Evidências Não Estabelecem

Os resultados expõem uma vulnerabilidade real de caixa-branca, mas não estabelecem um jailbreak universal para sistemas de IA em produção.

A primeira limitação é o escopo dos modelos. Os experimentos abrangem sete configurações de pesos abertos de quatro famílias. Trata-se de um teste útil entre modelos, mas ainda representa uma pequena parcela dos modelos disponíveis em 2026.

Os modelos testados também variavam de 500 milhões a 8 bilhões de parâmetros. O artigo explora a transferência para parentes maiores, mas as evidências diretas continuam concentradas em configurações menores. Arquiteturas em escala de fronteira podem distribuir o comportamento de segurança de forma diferente.

A segunda limitação diz respeito ao modelo de referência irrestrito. O XBreaking funciona melhor quando o atacante possui uma contraparte muito semelhante para comparação. Esse pareamento torna mais fácil isolar a diferença de alinhamento.

Os autores argumentam que um membro menor da família ou uma nova versão irrestrita ajustada pode fornecer uma referência alternativa. Seus experimentos de transferência relataram menor consistência em comparação com pares correspondentes. Essa perda importa ao avaliar a confiabilidade prática.

A terceira limitação é a distinção entre alinhamento do modelo e filtros de implantação. O XBreaking modifica o comportamento interno de recusa. Um sistema de produção ainda pode bloquear a solicitação ou a resposta por meio de classificadores separados.

Um estudo de 2025 sobre o pipeline de segurança mais amplo constatou que a eficácia de jailbreaks pode cair quando filtros de entrada e saída são incluídos. Essa pesquisa concluiu que muitos ataques no nível do modelo eram detectáveis por pelo menos um filtro testado.

Isso não invalida o XBreaking. Muda a unidade avaliada. Comprometer o modelo central é grave, especialmente quando os desenvolvedores dependem de seu comportamento de recusa. Isso não significa automaticamente que conteúdo nocivo chegue a um usuário final.

A quarta limitação é a preservação de utilidade. O ataque busca remover restrições mantendo a geração comum. Os próprios resultados de benchmark do artigo mostram degradação significativa para alguns modelos.

Isso cria um sinal observável que os defensores podem explorar. Um modelo comprometido pode alterar suas respostas em testes inofensivos, avaliações de raciocínio ou suítes de regressão. Os ataques mais robustos minimizariam essas diferenças, mas o estudo não demonstra ocultação perfeita.

A quinta limitação diz respeito à interpretação causal. Alta precisão de classificação mostra que características internas selecionadas distinguem variantes do modelo. Ela não explica plenamente como o modelo representa conceitos de segurança ou por que cada recusa ocorre.

Estatísticas médias por camada podem ocultar circuitos mais específicos, efeitos de tokens e interações. O resultado do autoencoder esparso sugere que representações mais ricas podem aprimorar a análise. Também reforça o quanto ainda permanece desconhecido.

Por fim, os julgamentos de nocividade do estudo dependem de pessoas e classificadores automatizados. A avaliação de segurança não é uma verdade fundamental puramente mecânica. Os limites de política variam entre provedores, países, setores e contextos de implantação.

Portanto, a conclusão apropriada é ponderada. O XBreaking fornece evidências de que o ajuste de segurança pode deixar padrões internos detectáveis e manipuláveis. Ele não demonstra que toda proteção esteja concentrada em um único interruptor removível.

Três Sinais Mostrarão se as Defesas Estão Alcançando o Ritmo

A próxima fase será determinada por replicação independente, defesas de integridade e testes contra pipelines completos de implantação.

O primeiro sinal é a replicação em modelos maiores de pesos abertos. Pesquisadores precisam testar se o mesmo método de seleção de camadas funciona em arquiteturas mais novas e contagens de parâmetros muito maiores. Também precisam medir os recursos computacionais necessários.

Uma replicação bem-sucedida reforçaria a alegação de que as impressões digitais de alinhamento acompanham famílias arquiteturais. O fracasso sugeriria que o efeito publicado depende mais fortemente de modelos específicos, pareamentos ou escolhas de avaliação.

Os estudos mais informativos publicarão resultados tanto de ataque quanto de utilidade. Uma alta taxa de ataque vale menos se o desempenho comum do modelo desmoronar. Os defensores também precisam de medições que revelem se modelos alterados conseguem escapar de testes rotineiros de regressão.

O segundo sinal é a chegada de defesas que monitoram os componentes internos do modelo ou verificam pesos aprovados. Desenvolvedores podem testar padrões de ativação, proteger artefatos de modelo e comparar componentes sensíveis à segurança após a personalização.

Uma defesa útil precisa sobreviver a mudanças comuns de implantação. Quantização, fusão de adaptadores, poda e conversão de formato podem alterar valores numéricos. Sistemas de integridade precisam distinguir transformações esperadas de intervenções maliciosas.

A interpretabilidade pode se tornar parte dessa defesa. As mesmas impressões digitais usadas para selecionar alvos de ataque poderiam identificar comportamentos internos incomuns. Pesquisadores devem testar se o monitoramento de ativações detecta perturbações sem impor latência inaceitável.

O terceiro sinal é a avaliação contra uma pilha completa de aplicações. Estudos futuros devem combinar modelos modificados com filtros de entrada, classificadores de saída, restrições de ferramentas e regras de escalonamento para revisão humana. Isso mostraria se o XBreaking cria uma vulnerabilidade no nível do modelo ou uma falha de ponta a ponta.

Um sistema em camadas ainda pode falhar se todos os componentes se basearem em pressupostos semelhantes. Um filtro de saída pode não detectar conteúdo nocivo que usa linguagem indireta. Uma restrição de ferramenta pode impedir a execução, mas ainda expor instruções perigosas.

Portanto, equipes independentes de red team devem testar consequências, não apenas recusas. Elas devem perguntar se um modelo modificado pode acessar dados, acionar software ou influenciar uma decisão relevante. Esses resultados importam mais do que uma única classificação de texto inseguro.

Desenvolvedores e compradores empresariais também devem acompanhar a documentação dos modelos. Relatórios de segurança devem informar se as avaliações ocorreram antes ou depois de fine-tuning, quantização e empacotamento para implantação. Resultados de um modelo-base intocado não podem descrever todos os derivados personalizados.

O jailbreak de LLM XBreaking faz a segurança de modelos parecer menos uma característica permanente e mais uma propriedade de segurança que exige manutenção. Essa mudança deve influenciar compras, implantação e testes contínuos.

As equipes que usam modelos abertos devem inventariar suas proteções atuais agora. Quais controles residem dentro do modelo e quais operam de forma independente ao seu redor? A organização consegue detectar um modelo alterado antes que ele chegue à produção?

Essas perguntas oferecem um ponto de partida prático. A explicabilidade continuará a revelar como os modelos tomam decisões. As organizações que mais se beneficiarão serão aquelas que também protegerem o que essas explicações revelam.

 
 

Comece grátis

Um assistente de IA local-first com gestão de conhecimento pessoal

Para oferecer uma experiência de IA melhor,

atualmente, o remio é compatível apenas com Windows 10+ (x64) e M-Chip Macs.

Seu parceiro de IA no trabalho
Faça mais com o remio

Planeje. Crie. Entregue.
Tudo em um só lugar.

bottom of page