Kriminal AI teria contornado salvaguardas ao alugar modelos legítimos
- Martin Chen

- 21 de ago.
- 13 min de leitura
Kriminal AI chegou ao Google News depois que pesquisadores relataram uma forte contradição: o modelo criminoso supostamente irrestrito era, em grande parte, alugado de provedores legítimos de IA. O serviço comercializava inteligência personalizada e sem salvaguardas, ao mesmo tempo que supostamente direcionava solicitações para Grok, Claude e outros modelos consolidados. A descoberta desloca a questão de segurança de quem consegue criar um modelo malicioso para quem consegue reempacotar infraestrutura legítima para uso abusivo.
ThreatDown publicou sua investigação técnica em 18 de agosto de 2026. Os pesquisadores disseram que Kriminal expôs partes de sua pilha de fornecedores no JavaScript de produção entregue por seu site público. Eles também questionaram o serviço sobre seu modelo e suas instruções de sistema, embora tenham alertado que essas respostas autorrelatadas não constituem prova definitiva.
O resultado desafia a abordagem de segurança de IA centrada no modelo. Os provedores podem investir pesadamente no treinamento de modelos mais seguros, mas uma vitrine externa pode combinar confiança roubada, prompts adversariais, inferência alugada e infraestrutura fragmentada. Cada fornecedor vê uma transação, enquanto nenhum necessariamente enxerga o serviço criminoso completo.
O que a investigação sobre Kriminal AI encontrou
Kriminal teria operado menos como um laboratório de IA independente e mais como um revendedor com uma camada de jailbreak.
Segundo a investigação sobre Kriminal, o serviço afirmava oferecer um sistema de IA sem filtros ou salvaguardas. Sua interface pública se assemelhava à de uma empresa convencional de software, com contas, assinaturas, atualizações de serviço e um painel de status.
Essa apresentação importava. Chatbots criminosos anteriores frequentemente circulavam por fóruns clandestinos, canais privados de mensagens ou sites temporários. Kriminal supostamente se apresentava na web aberta, onde mecanismos de busca podiam indexá-lo e potenciais clientes podiam entrar por uma página de login comum.
A ThreatDown afirmou que o serviço promovia vários modos especializados. Eles abrangiam inteligência financeira, pesquisa de exploits, análise de documentos, engenharia social e construção de identidades. Os modos criavam a aparência de agentes técnicos distintos, desenvolvidos para diferentes etapas de atividade criminosa.
Os pesquisadores encontraram uma arquitetura diferente no código público de front-end. Ele supostamente identificava o Grok, da xAI, como o principal mecanismo de inferência, ou seja, o sistema que produzia a maior parte das respostas do modelo. OpenRouter aparentemente servia como rota para modelos especializados, incluindo Mistral Large e Llama 3.3.
O Claude, da Anthropic, também aparecia como opção para trabalho com contexto longo, segundo os pesquisadores. Eles observaram que o código não estabelecia como Kriminal obteve esse acesso. Tavily supostamente fornecia busca web em tempo real, enquanto Google Cloud e Cloudflare apareciam em outras partes da pilha de serviços.
Essas descobertas não estabelecem de forma independente que todos os provedores nomeados atenderam Kriminal conscientemente. Tampouco mostram se os operadores usaram contas diretas, intermediários, credenciais comprometidas ou outro método de acesso. Nomes de fornecedores em código do lado do cliente podem estar desatualizados, ser enganosos ou ter sido inseridos deliberadamente.
Por isso, a ThreatDown utilizou várias formas de evidência. Os pesquisadores inspecionaram o código de produção, compararam a configuração exposta com o comportamento do serviço e pediram ao chatbot que identificasse seu mecanismo subjacente. O chatbot teria citado Grok, correspondendo à referência de fornecedor encontrada no código.
Quando solicitado a fornecer suas instruções de sistema, o serviço também retornou um prompt orientando o modelo a ignorar limitações. Um prompt de sistema é uma instrução de alta prioridade posicionada em torno de uma solicitação do usuário para moldar o comportamento do modelo. Neste caso, a instrução relatada tentava suprimir as salvaguardas aplicadas pelo provedor subjacente.
Os pesquisadores trataram adequadamente as declarações do chatbot como indicativas, não conclusivas. Um modelo pode alucinar sua identidade, repetir texto inserido ou responder de acordo com uma persona. A configuração de produção forneceu um sinal separado, mas pessoas externas ainda não dispõem de registros do lado do servidor que comprovem todo o caminho da solicitação.
Essa distinção importa quando uma manchete circula pelo Google News. A conclusão mais bem sustentada é que o código exposto de Kriminal e suas respostas observadas apontavam para modelos comerciais alugados. Isso não é evidência de que todos os recursos anunciados funcionavam, todas as alegações de uso exibidas eram precisas ou todos os fornecedores permaneciam conectados.
Ainda assim, a investigação revela a inversão central. Kriminal supostamente anunciava independência dos controles da indústria de IA enquanto dependia dessa mesma indústria para inteligência, hospedagem, roteamento, busca e entrega.
Por que a atenção do Google News eleva o risco de segurança
A visibilidade pública de Kriminal transforma a IA criminosa de um problema de modelo oculto em um problema de fiscalização da cadeia de fornecimento.
O serviço não precisou treinar um modelo de fronteira. O treinamento exige pesquisadores especializados, grandes conjuntos de dados, ampla infraestrutura computacional e investimento operacional contínuo. Alugar acesso a modelos transfere a maior parte desses encargos para empresas que já os absorveram.
A contribuição alegada de Kriminal era o empacotamento. Ele combinava uma vitrine pública, personas específicas para tarefas, infraestrutura de pagamentos, um endpoint compatível com desenvolvedores e instruções destinadas a enfraquecer as salvaguardas do modelo. Esse conjunto poderia reduzir a especialização necessária para testar fluxos de trabalho criminosos assistidos por IA.
Esse padrão pressiona primeiro os provedores de modelos de fronteira. Suas políticas regem usuários diretos, mas revendedores e wrappers podem ocultar a finalidade do cliente final. Um provedor pode ver tráfego de API aparentemente normal até que comportamento, volume, sinais de pagamento ou violações repetidas de políticas revelem uma operação mais ampla.
A atual política de uso aceitável da SpaceXAI proíbe jailbreaking, prompting adversarial, injeção de prompt, hacking prejudicial, phishing e a revenda de entradas ou saídas de modelos. Ela também proíbe serviços pagos que incentivem violações por meio de saídas geradas por seus sistemas.
Essas regras criam uma base contratual para fiscalização. No entanto, restrições escritas não revelam se Kriminal utilizou uma conta direta, por quanto tempo qualquer acesso persistiu ou se o provedor já o havia identificado. Nem a política nem as evidências dos pesquisadores estabelecem a situação de contas específicas.
Provedores de nuvem e rede enfrentam um problema diferente. Uma empresa de hospedagem pode enxergar uma aplicação web comum, e não o significado de cada interação com o modelo. Um provedor de edge pode identificar padrões de tráfego, denúncias de abuso e relações de infraestrutura sem ler automaticamente cada solicitação criptografada.
Roteadores de modelos e provedores de busca ocupam outro segmento limitado. Eles podem aplicar seus próprios termos e investigar contas, mas talvez não saibam como uma aplicação upstream rotula ou revende uma resposta. Processadores de pagamento veem transações sem necessariamente enxergar o serviço entregue posteriormente.
Essa fragmentação cria resiliência. Remover uma conta pode interromper um recurso sem desmantelar a vitrine. Operadores podem substituir um modelo, transferir a hospedagem, mudar canais de pagamento ou renomear um serviço enquanto preservam a marca voltada ao cliente.
É por isso que o enquadramento do Google News não deveria reduzir a história a uma única salvaguarda que falhou. A operação alegada dependia de muitos componentes legítimos cujas visões individuais permaneciam incompletas. Cada fornecedor poderia agir dentro de seu próprio limite enquanto o serviço montado continuava em outro lugar.
A pressão também alcança as equipes de segurança corporativa. Bloquear um domínio criminoso notório resolve o acesso direto de funcionários, mas não impede atacantes de usar os mesmos modelos subjacentes fora da rede-alvo. Os defensores precisam detectar o comportamento resultante, não apenas identificar a marca que o auxiliou.
Uma mensagem de phishing não traz um rótulo confiável indicando qual modelo a redigiu. Um código de exploit não revela se veio de Grok, Claude, um modelo aberto ou um operador humano. Quando conteúdo gerado entra em uma cadeia de ataque, a atribuição ao provedor se torna secundária em relação à identidade, ao acesso e à intenção.
Assim, as empresas precisam de controles em torno de credenciais, ações privilegiadas, movimentação de dados e execução de ferramentas. As salvaguardas de modelos continuam úteis, mas ficam upstream dos sistemas que os atacantes acabam visando. Um prompt recusado só tem valor quando o atacante não consegue contornar essa recusa.
O produto real é um wrapper de jailbreak
A vantagem relatada de Kriminal não era um novo modelo; era uma interface que convertia capacidade alugada em fluxos de trabalho criminosos especializados.
Um jailbreak é uma estratégia de instrução desenvolvida para fazer um modelo ignorar ou reinterpretar seus limites de segurança. Ele não necessariamente altera os pesos do modelo, que são os parâmetros aprendidos criados durante o treinamento. Em vez disso, ataca a forma como o modelo interpreta a conversa atual.
Kriminal supostamente colocava sua própria instrução de sistema em torno de solicitações enviadas a modelos externos. Essa camada tentava apresentar o comportamento irrestrito como o papel de maior prioridade do modelo. Personas especializadas então enquadravam as mesmas capacidades subjacentes como ferramentas para trabalho com exploits, análise de inteligência ou engenharia social.
Esse arranjo se assemelha mais à integração de software do que ao desenvolvimento de modelos. O operador pode mudar de provedor sem reconstruir a vitrine. Também pode atribuir modelos diferentes a tarefas diferentes, selecionando um para documentos longos e outro para código ou chat geral.
O endpoint para desenvolvedores ampliava essa flexibilidade. A ThreatDown afirmou que Kriminal oferecia uma interface compatível com clientes no estilo OpenAI, permitindo que ferramentas externas de programação se comunicassem com ele. A compatibilidade reduz os custos de mudança porque os clientes podem conectar software existente sem aprender um protocolo proprietário.
O acesso à busca pode ampliar ainda mais um modelo que, de outra forma, seria estático. Um provedor de busca conectado fornece material web atual que não estava presente nos dados de treinamento. Em um produto legítimo, isso apoia pesquisa e atualizações factuais. Em um fluxo de trabalho malicioso, pode apoiar descoberta de alvos, pesquisa de identidades ou contexto operacional em rápida mudança.
A abordagem se encaixa em um padrão de mercado mais amplo. A análise da Trend Micro sobre o mercado criminoso de IA concluiu que criminosos frequentemente fazem jailbreak em sistemas comerciais em vez de construir modelos independentes. Os pesquisadores descreveram isso como economicamente racional, pois os provedores estabelecidos já financiaram a cara camada de inteligência.
WormGPT, FraudGPT e Xanthorox ajudaram a criar uma categoria reconhecível em torno de IA supostamente irrestrita. No entanto, uma marca criminosa não revela sua base técnica. Alguns serviços podem ser wrappers, outros podem usar modelos abertos ajustados, e alguns podem oferecer pouco além de marketing enganoso.
Esse problema de branding complica a inteligência de ameaças. Um serviço pode desaparecer e retornar sob outro nome enquanto mantém os mesmos fornecedores e prompts. Por outro lado, operadores não relacionados podem reutilizar um nome famoso sem compartilhar infraestrutura ou código.
A pesquisa mais ampla da ThreatDown sobre cibercrime com IA encontrou milhares de modelos publicados abertamente com rótulos como sem censura ou sem filtros. Esses rótulos são autodeclarações, não prova de que um modelo ofereça suporte confiável a ataques sofisticados.
A contagem de downloads também não equivale a operações criminosas bem-sucedidas. Alguns usuários são pesquisadores, entusiastas, equipes red team ou pessoas explorando o comportamento de modelos. Outros podem baixar diversas variantes sem jamais implantá-las. Os números mostram disponibilidade e interesse, não danos mensurados.
O risco prático vem da combinação entre capacidade e desenho de fluxo de trabalho. Um chatbot de uso geral exige que o usuário entenda o que perguntar, como validar uma resposta e como conectá-lo a outras ferramentas. Um serviço empacotado pode codificar parte desse processo em menus, agentes, modelos e integrações.
Esse empacotamento pode ajudar atores menos experientes a tentar tarefas que antes exigiam mais conhecimento. Ele não torna os resultados confiáveis. Código de exploit gerado pode falhar, expor seu operador, danificar o sistema errado ou inventar detalhes técnicos.
A mesma limitação se aplica à engenharia social. Um modelo pode produzir mensagens fluentes e personas sintéticas, mas uma fraude bem-sucedida ainda depende de acesso, timing, conhecimento do alvo e disciplina operacional. A IA pode reduzir o trabalho sem eliminar esses requisitos.
Esse é o principal conflito do setor. Os provedores prometem inteligência geral útil limitada por políticas, enquanto wrappers podem tentar separar a inteligência dessas limitações. A disputa já não se restringe ao treinamento de modelos. Ela continua por meio de APIs, aplicações, contas e ações posteriores.
As Salvaguardas dos Modelos Não Conseguem Ver Toda a Cadeia de Ataque
As salvaguardas reduzem resultados nocivos, mas o Kriminal ilustra por que nenhuma defesa de modelo isolada pode governar um serviço distribuído.
A Anthropic reconheceu em sua pesquisa sobre classificadores de janeiro de 2026 que nenhum sistema de IA disponível possui defesas contra jailbreak perfeitamente confiáveis. Sua abordagem anterior com classificadores reduziu drasticamente os ataques bem-sucedidos em testes, mas acrescentou custos computacionais e algumas recusas incorretas.
A arquitetura mais recente da empresa usa uma sondagem inicial barata e encaminha interações suspeitas para um classificador mais robusto. Um classificador é um sistema secundário que avalia conteúdo segundo regras de segurança. Esse desenho em camadas busca melhorar a proteção enquanto limita o custo de inspecionar cada interação da mesma forma.
Os pesquisadores ainda identificaram categorias de ataque desafiadoras. Ataques de reconstrução dividem uma solicitação nociva em partes que parecem inofensivas individualmente. A ofuscação de saída esconde material perigoso por trás de substituições, metáforas ou formas codificadas que um filtro simples pode interpretar erroneamente.
Esses não são motivos para abandonar as salvaguardas dos modelos. Uma defesa não precisa ser perfeita para impedir abusos significativos. Limites de taxa, classificadores, verificação de contas, detecção de anomalias e investigações humanas podem elevar custos e interromper comportamentos repetidos.
No entanto, a estrutura relatada do Kriminal cria diversas oportunidades para evitar controles isolados. Operadores podem distribuir prompts entre provedores, mudar a formulação, encaminhar tarefas diferentes a modelos diferentes ou migrar quando uma conta é suspensa. Um revendedor também pode ocultar a relação entre o usuário subjacente e o objetivo final.
A aplicação de regras do lado do provedor deve, portanto, examinar padrões além de prompts individuais. Sinais relevantes podem incluir criação de contas, sequências de solicitações, comportamento repetido de teste de políticas, relações de pagamento, roteamento incomum e conexões com infraestrutura abusiva conhecida. Cada sinal exige tratamento cuidadoso, pois pesquisadores legítimos podem gerar tráfego superficialmente semelhante.
Falsos positivos importam. Profissionais de segurança, pesquisadores de vulnerabilidades e equipes de resposta a incidentes perguntam a modelos sobre malware, exploits, phishing e evasão por motivos defensivos. Um sistema que bloqueasse todo prompt relacionado à segurança prejudicaria o trabalho legítimo sem impedir de forma confiável atacantes determinados.
Identidade e autorização oferecem uma fronteira mais determinística. Mesmo um modelo manipulado não pode roubar dados protegidos quando sua conta não tem acesso. Ele não pode implantar código quando suas permissões de ferramenta excluem sistemas de produção. Ele não pode transferir fundos quando ações sensíveis exigem aprovação independente.
Isso se torna mais importante à medida que sistemas de IA ganham ferramentas. Um agente habilitado para ferramentas pode navegar na web, executar código, consultar bancos de dados ou acionar serviços externos. A saída do modelo então se torna uma entrada para ações reais, fazendo do desenho de permissões algo tão importante quanto a filtragem de conteúdo.
Pesquisadores da Check Point demonstraram separadamente uma técnica de proxy de IA envolvendo assistentes com acesso à web. Seu trabalho mostrou como tráfego legítimo de IA poderia ser abusado como retransmissor, reforçando o perigo de tratar o domínio de um provedor confiável como prova de intenção confiável.
As empresas devem, consequentemente, distinguir segurança do modelo de segurança do sistema. A segurança do modelo diz respeito ao que a IA gera. A segurança do sistema determina quais identidades, aplicações e agentes podem acessar ou executar após a geração.
Controles úteis incluem identidades de serviço com escopo limitado, credenciais de curta duração, listas de permissão de ferramentas, limites de transação, etapas de aprovação e logs completos de ações. O monitoramento de rede pode então avaliar o comportamento entre chamadas ao modelo, uso de ferramentas e movimentação de dados, em vez de julgar um prompt isoladamente.
Os defensores também devem evitar exagerar o que a análise do Kriminal comprova. JavaScript público pode expor configurações, mas o roteamento no lado do servidor pode ser diferente. Um chatbot que se nomeia não é confirmação forense. Estatísticas de clientes exibidas e alegações de desempenho permanecem não verificadas, salvo se forem respaldadas por registros independentes.
Ainda assim, a pesquisa apresenta uma arquitetura crível, consistente com um padrão já estabelecido em mercados criminosos. Múltiplas observações apontaram para um wrapper que usa provedores legítimos. A incerteza diz respeito à implementação exata e à escala, não à viabilidade mais ampla do método.
Três Sinais Mostrarão se os Provedores Conseguem Responder
O próximo teste é saber se os fornecedores conseguem interromper o padrão do serviço sem apenas forçar o Kriminal a mudar de nome ou de fornecedor.
O primeiro sinal é a aplicação coordenada de regras contra contas. Observe se xAI, Anthropic, OpenRouter, provedores de hospedagem ou outros fornecedores nomeados confirmam investigações e descrevem ações contra acessos relacionados. Uma única suspensão seria relevante, mas uma ação coordenada testaria melhor a resiliência descrita pela ThreatDown.
Se diversos provedores identificarem contas vinculadas rapidamente, a investigação reforçará o argumento a favor de uma resposta a abusos entre camadas. Se o Kriminal os substituir de imediato, a história mostrará, em vez disso, que os controles atuais de integração e monitoramento continuam fáceis de contornar.
O silêncio público não prova inação. Provedores frequentemente evitam descrever investigações sobre abusos porque a divulgação pode ajudar operadores a se adaptarem. Pesquisadores talvez precisem monitorar mudanças no comportamento dos modelos, na disponibilidade, em registros de infraestrutura ou em configurações expostas como evidências indiretas.
O segundo sinal é a detecção, do lado do provedor, de padrões de revendedores. Empresas de modelos podem atualizar classificadores, examinar sequências de prompts adversariais e procurar contas que enviam repetidamente conteúdo ligado a fluxos de trabalho criminosos. Elas também podem reforçar regras contra revenda e investigar interfaces que ocultam os usuários finais.
O sucesso não deve ser medido apenas pelo desaparecimento de um domínio. Um resultado mais significativo seria maior atrito operacional entre contas e modelos de substituição. Interrupções mais longas, capacidade reduzida ou falhas repetidas indicariam que a aplicação de regras alcançou a cadeia de fornecimento.
O terceiro sinal é evidência de uso no mundo real. Páginas de marketing e demonstrações de prompts estabelecem intenção, mas não medem impacto operacional. Os defensores devem observar relatórios de incidentes que vinculem o serviço a campanhas de phishing, desenvolvimento de exploits, fraude de identidade ou acesso não autorizado.
Essa conexão exige cautela. Texto ou código semelhante é uma atribuição fraca, porque muitos modelos podem gerar material comparável. Evidências mais fortes incluiriam registros de clientes, sobreposições de infraestrutura, logs recuperados, relações de pagamento ou artefatos diretos de uma invasão investigada.
A ausência de incidentes confirmados não tornaria o serviço inofensivo. Ela enfraqueceria alegações sobre sua escala atual, enquanto manteria relevante a arquitetura subjacente. Serviços criminosos rotineiramente exageram seu alcance para atrair compradores e intimidar defensores.
O ciclo de notícias do Google News pode amplificar essas alegações antes que a verificação as alcance. Os leitores devem separar três proposições: o Kriminal anunciou funções criminosas, pesquisadores encontraram evidências que apontam para modelos alugados e o impacto no mundo real permanece menos claramente documentado.
Para provedores de IA, o objetivo estratégico não é um comportamento de recusa perfeito. É tornar o abuso caro o suficiente para que wrappers não possam oferecer acesso consistente. Isso exige controles que abranjam modelos, contas, pagamentos, roteamento e aplicações posteriores.
Para compradores empresariais, a lição é igualmente concreta. Não trate o nome de um modelo respeitado como uma fronteira de segurança completa. Limite o que cada identidade conectada à IA pode alcançar, monitore o que ela faz e exija aprovação independente para ações consequentes.
A arquitetura relatada do Kriminal transforma IA legítima em um componente de um serviço alegadamente criminoso sem exigir um novo modelo de fronteira. Os próximos meses mostrarão se os fornecedores conseguem conectar suas evidências fragmentadas antes que os operadores simplesmente reconstruam a operação em outro lugar.
Leitores que acompanham a história pelo Google News devem observar a aplicação de regras pelos provedores, mudanças de infraestrutura e evidências verificadas de incidentes, em vez de alegações de vitrines. Esses sinais revelarão se o Kriminal representa um negócio duradouro ou um wrapper de curta duração exposto por seu próprio código. Qualquer um dos resultados importa, porque o método subjacente é fácil de copiar. As equipes de segurança devem revisar quais serviços de IA, agentes e ferramentas de desenvolvimento podem alcançar sistemas sensíveis e, em seguida, reduzir permissões antes que um prompt convincente se torne uma ação autorizada.


