top of page

Kriminal AI aurait contourné les garde-fous en louant des modèles légitimes

21 août
14 min de lecture

Kriminal AI a fait son entrée dans Google News après que des chercheurs ont signalé une contradiction frappante : le modèle criminel prétendument sans restrictions était largement loué auprès de fournisseurs d’IA légitimes. Le service commercialisait une intelligence sur mesure, dépourvue de garde-fous, tout en acheminant prétendument les requêtes vers Grok, Claude et d’autres modèles établis. Cette découverte déplace la question de sécurité : il ne s’agit plus de savoir qui peut construire un modèle malveillant, mais qui peut reconditionner une infrastructure légale à des fins d’abus.

ThreatDown a publié son enquête technique le 18 août 2026. Les chercheurs ont indiqué que Kriminal avait exposé certaines parties de sa pile de fournisseurs dans le JavaScript de production diffusé par son site public. Ils ont également interrogé le service sur son modèle et ses instructions système, tout en avertissant que ces réponses autodéclarées ne constituaient pas une preuve définitive.

Le résultat remet en cause l’approche de la sécurité de l’IA centrée sur les modèles. Les fournisseurs peuvent investir massivement dans l’entraînement de modèles plus sûrs, mais une vitrine externe peut combiner une confiance détournée, des prompts adverses, de l’inférence louée et une infrastructure fragmentée. Chaque fournisseur ne voit qu’une transaction, sans qu’aucun ne perçoive nécessairement l’intégralité du service criminel.

Ce que l’enquête sur Kriminal AI a révélé

Kriminal aurait fonctionné moins comme un laboratoire d’IA indépendant que comme un revendeur doté d’une couche de jailbreak.

Selon l’enquête sur Kriminal, le service affirmait proposer un système d’IA sans filtres ni garde-fous. Son interface publique ressemblait à celle d’une entreprise logicielle conventionnelle, avec des comptes, des abonnements, des mises à jour de service et un tableau de bord d’état.

Cette présentation avait son importance. Les anciens chatbots criminels circulaient souvent sur des forums clandestins, des canaux de messagerie privés ou des sites temporaires. Kriminal se serait présenté sur le web ouvert, où les moteurs de recherche pouvaient l’indexer et où les clients potentiels pouvaient accéder à une page de connexion ordinaire.

ThreatDown a indiqué que le service promouvait plusieurs modes spécialisés. Ils couvraient le renseignement financier, la recherche d’exploits, l’analyse de documents, l’ingénierie sociale et la construction d’identités. Ces modes donnaient l’apparence d’agents techniques distincts conçus pour différentes étapes d’activités criminelles.

Les chercheurs ont trouvé une architecture différente dans le code frontal public. Celui-ci aurait identifié Grok de xAI comme moteur d’inférence principal, c’est-à-dire le système produisant la majorité des réponses du modèle. OpenRouter semblait servir de route vers des modèles spécialisés, notamment Mistral Large et Llama 3.3.

Claude d’Anthropic apparaissait également comme une option pour les tâches nécessitant un long contexte, selon les chercheurs. Ils ont relevé que le code ne permettait pas d’établir comment Kriminal obtenait cet accès. Tavily aurait fourni la recherche web en direct, tandis que Google Cloud et Cloudflare apparaissaient ailleurs dans la pile technique du service.

Ces constatations n’établissent pas de manière indépendante que chaque fournisseur cité servait sciemment Kriminal. Elles ne montrent pas non plus si les opérateurs utilisaient des comptes directs, des intermédiaires, des identifiants compromis ou une autre méthode d’accès. Les noms de fournisseurs présents dans du code côté client peuvent être obsolètes, trompeurs ou délibérément insérés.

ThreatDown a donc utilisé plusieurs formes de preuves. Les chercheurs ont inspecté le code de production, comparé la configuration exposée au comportement du service et demandé au chatbot d’identifier son moteur sous-jacent. Le chatbot aurait nommé Grok, ce qui correspondait à la référence du fournisseur trouvée dans le code.

Lorsqu’on lui a demandé ses instructions système, le service a également renvoyé un prompt demandant au modèle d’ignorer les limitations. Un prompt système est une instruction hautement prioritaire placée autour d’une requête utilisateur afin de façonner le comportement du modèle. Dans ce cas, l’instruction signalée tentait de neutraliser les protections appliquées par le fournisseur sous-jacent.

Les chercheurs ont à juste titre traité les déclarations du chatbot comme des indices, et non comme des conclusions. Un modèle peut halluciner son identité, répéter un texte inséré ou répondre selon une persona. La configuration de production fournissait un signal distinct, mais les observateurs externes ne disposent toujours pas d’enregistrements côté serveur prouvant le cheminement complet des requêtes.

Cette distinction est importante lorsqu’un titre se diffuse dans Google News. La conclusion la mieux étayée est que le code exposé de Kriminal et les réponses observées pointaient vers des modèles commerciaux loués. Ce n’est pas la preuve que toutes les fonctionnalités annoncées fonctionnaient, que toutes les affirmations d’usage affichées étaient exactes ou que tous les fournisseurs restaient connectés.

L’enquête révèle néanmoins le renversement central. Kriminal aurait vanté son indépendance vis-à-vis des contrôles de l’industrie de l’IA tout en s’appuyant sur cette même industrie pour l’intelligence, l’hébergement, le routage, la recherche et la diffusion.

Pourquoi l’attention de Google News change les enjeux de sécurité

La visibilité publique de Kriminal transforme l’IA criminelle d’un problème de modèle caché en un problème d’application des règles dans la chaîne d’approvisionnement.

Le service n’avait pas besoin d’entraîner un modèle de pointe. L’entraînement exige des chercheurs spécialisés, de vastes jeux de données, une infrastructure informatique considérable et des investissements opérationnels continus. Louer l’accès à des modèles transfère l’essentiel de ces charges aux entreprises qui les ont déjà assumées.

La contribution présumée de Kriminal résidait dans le packaging. Il combinait une vitrine publique, des personas propres à certaines tâches, une infrastructure de paiement, un endpoint compatible avec les développeurs et des instructions destinées à affaiblir les protections des modèles. Cet ensemble pourrait réduire l’expertise nécessaire pour tester des flux de travail criminels assistés par l’IA.

Ce schéma exerce d’abord une pression sur les fournisseurs de modèles de pointe. Leurs politiques régissent les utilisateurs directs, mais les revendeurs et les wrappers peuvent masquer l’objectif final du client. Un fournisseur peut ne voir qu’un trafic API apparemment normal jusqu’à ce que le comportement, le volume, les signaux de paiement ou des violations répétées de politique révèlent une opération plus vaste.

La politique d’utilisation acceptable actuelle de SpaceXAI interdit le jailbreak, les prompts adverses, l’injection de prompts, le piratage nuisible, le phishing ainsi que la revente d’entrées ou de sorties de modèles. Elle interdit également les services payants qui encouragent des violations via les sorties générées par ses systèmes.

Ces règles créent une base contractuelle pour l’application des mesures. Toutefois, les restrictions écrites ne révèlent pas si Kriminal utilisait un compte direct, combien de temps un accès a persisté ou si le fournisseur l’avait déjà identifié. Ni la politique ni les éléments de preuve des chercheurs n’établissent le statut de comptes spécifiques.

Les fournisseurs de cloud et de réseau font face à un problème différent. Une société d’hébergement peut voir une application web ordinaire plutôt que la signification de chaque interaction avec un modèle. Un fournisseur de périphérie réseau peut identifier des schémas de trafic, des signalements d’abus et des relations d’infrastructure sans lire automatiquement chaque requête chiffrée.

Les routeurs de modèles et les fournisseurs de recherche n’occupent qu’une autre tranche étroite de cette chaîne. Ils peuvent appliquer leurs propres conditions et enquêter sur des comptes, mais ils ne savent pas nécessairement comment une application en amont étiquette ou revend une réponse. Les processeurs de paiement voient les transactions sans nécessairement voir le service livré ensuite.

Cette fragmentation crée de la résilience. La suppression d’un compte peut interrompre une fonctionnalité sans démanteler la vitrine. Les opérateurs peuvent remplacer un modèle, déplacer l’hébergement, changer de canaux de paiement ou renommer un service tout en préservant la marque visible par les clients.

C’est pourquoi le traitement dans Google News ne devrait pas réduire cette affaire à un seul garde-fou défaillant. L’opération présumée dépendait de nombreux composants légitimes dont les visions individuelles restaient incomplètes. Chaque fournisseur pouvait agir dans ses propres limites tandis que le service assemblé se poursuivait ailleurs.

La pression atteint également les équipes de sécurité d’entreprise. Bloquer un domaine criminel notoire répond à l’accès direct des employés, mais n’empêche pas les attaquants d’utiliser les mêmes modèles sous-jacents hors du réseau ciblé. Les défenseurs doivent détecter le comportement résultant, et pas seulement identifier la marque qui l’a facilité.

Un message de phishing ne porte pas d’étiquette fiable indiquant quel modèle l’a rédigé. Le code d’un exploit ne révèle pas s’il provient de Grok, Claude, d’un modèle ouvert ou d’un opérateur humain. Une fois que le contenu généré entre dans une chaîne d’attaque, l’attribution au fournisseur devient secondaire par rapport à l’identité, à l’accès et à l’intention.

Les entreprises ont donc besoin de contrôles autour des identifiants, des actions privilégiées, des mouvements de données et de l’exécution d’outils. Les protections des modèles restent utiles, mais elles se situent en amont des systèmes que les attaquants ciblent finalement. Un prompt refusé n’a de valeur que si l’attaquant ne peut pas contourner ce refus.

Le véritable produit est un wrapper de jailbreak

L’avantage présumé de Kriminal n’était pas un nouveau modèle ; c’était une interface transformant des capacités louées en flux de travail criminels spécialisés.

Un jailbreak est une stratégie d’instructions conçue pour amener un modèle à ignorer ou à réinterpréter ses limites de sécurité. Il ne modifie pas nécessairement les poids du modèle, c’est-à-dire les paramètres appris créés durant l’entraînement. Il attaque plutôt la manière dont le modèle interprète la conversation en cours.

Kriminal aurait placé sa propre instruction système autour des requêtes envoyées à des modèles externes. Cette couche tentait de présenter un comportement sans restrictions comme le rôle le plus prioritaire du modèle. Des personas spécialisés présentaient ensuite les mêmes capacités sous-jacentes comme des outils pour le travail sur les exploits, l’analyse de renseignement ou l’ingénierie sociale.

Cet agencement ressemble davantage à une intégration logicielle qu’au développement de modèles. L’opérateur peut changer de fournisseur sans reconstruire sa vitrine. Il peut également attribuer différents modèles à différentes tâches, en choisissant l’un pour les longs documents et un autre pour le code ou la conversation générale.

L’endpoint pour développeurs a accru cette flexibilité. ThreatDown a indiqué que Kriminal proposait une interface compatible avec les clients de style OpenAI, permettant à des outils de codage externes de communiquer avec lui. La compatibilité réduit les coûts de changement, car les clients peuvent connecter des logiciels existants sans apprendre un protocole propriétaire.

L’accès à la recherche peut encore étendre un modèle autrement statique. Un fournisseur de recherche connecté apporte des contenus web actuels qui n’étaient pas présents dans les données d’entraînement. Dans un produit légitime, cela facilite la recherche et les mises à jour factuelles. Dans un flux de travail malveillant, cela peut soutenir la découverte de cibles, la recherche d’identité ou un contexte opérationnel en évolution rapide.

L’approche s’inscrit dans une tendance de marché plus large. L’examen de Trend Micro sur le marché de l’IA criminelle a conclu que les criminels jailbreakent souvent des systèmes commerciaux au lieu de construire des modèles indépendants. Les chercheurs ont décrit ce choix comme économiquement rationnel, puisque les fournisseurs établis avaient déjà financé la coûteuse couche d’intelligence.

WormGPT, FraudGPT et Xanthorox ont contribué à créer une catégorie reconnaissable autour d’une IA prétendument sans restrictions. Pourtant, une marque criminelle ne révèle pas sa base technique. Certains services peuvent être des wrappers, d’autres peuvent utiliser des modèles ouverts affinés, et certains peuvent n’offrir guère plus qu’un marketing trompeur.

Ce problème de branding complique le renseignement sur les menaces. Un service peut disparaître puis revenir sous un autre nom tout en conservant les mêmes fournisseurs et prompts. À l’inverse, des opérateurs non liés peuvent réutiliser un nom célèbre sans partager la moindre infrastructure ou le moindre code.

Les recherches plus larges de ThreatDown sur la cybercriminalité liée à l’IA ont identifié des milliers de modèles publiés ouvertement portant des étiquettes comme uncensored ou unfiltered. Ces étiquettes sont des autodéclarations, et non une preuve qu’un modèle prend en charge de manière fiable des attaques sophistiquées.

Les nombres de téléchargements ne correspondent pas non plus à des opérations criminelles réussies. Certains utilisateurs sont des chercheurs, des amateurs, des équipes de red team ou des personnes qui explorent le comportement des modèles. D’autres peuvent télécharger plusieurs variantes sans jamais les déployer. Ces chiffres indiquent une disponibilité et un intérêt, pas un préjudice mesuré.

Le risque concret vient de la combinaison des capacités et de la conception du workflow. Un chatbot généraliste exige que l’utilisateur sache quoi demander, comment valider une réponse et comment la connecter à d’autres outils. Un service packagé peut intégrer une partie de ce processus dans des menus, des agents, des modèles et des intégrations.

Ce packaging peut aider des acteurs moins expérimentés à tenter des tâches qui exigeaient auparavant davantage de connaissances. Il ne rend pas les résultats fiables. Le code d’exploitation généré peut échouer, exposer son opérateur, endommager le mauvais système ou inventer des détails techniques.

La même limite s’applique à l’ingénierie sociale. Un modèle peut produire des messages fluides et des personas synthétiques, mais une fraude réussie dépend toujours de l’accès, du timing, de la connaissance de la cible et de la discipline opérationnelle. L’IA peut réduire le travail nécessaire sans éliminer ces exigences.

C’est le principal conflit du secteur. Les fournisseurs promettent une intelligence générale utile encadrée par des politiques, tandis que des wrappers peuvent tenter de séparer l’intelligence de ces limites. La confrontation ne se limite plus à l’entraînement des modèles. Elle se poursuit via les API, les applications, les comptes et les actions en aval.

Les garde-fous des modèles ne peuvent pas voir toute la chaîne d’attaque

Les garde-fous réduisent les sorties nuisibles, mais Kriminal illustre pourquoi aucune défense d’un modèle unique ne peut gouverner un service distribué.

Anthropic a reconnu dans ses recherches de janvier 2026 sur les classificateurs qu’aucun système d’IA disponible ne dispose de défenses parfaitement fiables contre les jailbreaks. Son approche précédente par classificateur a fortement réduit les attaques réussies lors des tests, mais a ajouté des coûts de calcul et certains refus incorrects.

La nouvelle architecture de l’entreprise utilise une sonde initiale peu coûteuse et transmet les échanges suspects à un classificateur plus puissant. Un classificateur est un système secondaire qui évalue le contenu au regard de règles de sécurité. Cette conception en couches vise à améliorer la protection tout en limitant le coût d’une inspection uniforme de chaque interaction.

Les chercheurs ont toutefois identifié des catégories d’attaques difficiles. Les attaques par reconstruction divisent une demande nuisible en éléments paraissant inoffensifs pris séparément. L’obfuscation des sorties dissimule du contenu dangereux derrière des substitutions, des métaphores ou des formes encodées qu’un filtre simple peut mal interpréter.

Ce ne sont pas des raisons d’abandonner les protections des modèles. Une défense n’a pas besoin d’être parfaite pour empêcher des abus importants. Les limites de débit, les classificateurs, la vérification des comptes, la détection d’anomalies et les enquêtes humaines peuvent augmenter les coûts et interrompre les comportements répétés.

Cependant, la structure rapportée de Kriminal offre plusieurs possibilités d’échapper à des contrôles isolés. Les opérateurs peuvent répartir les prompts entre plusieurs fournisseurs, modifier leur formulation, orienter différentes tâches vers différents modèles ou se déplacer lorsqu’un compte est suspendu. Un revendeur peut également masquer le lien entre l’utilisateur sous-jacent et l’objectif final.

L’application des règles côté fournisseur doit donc examiner des schémas allant au-delà des prompts individuels. Les signaux pertinents peuvent inclure la création de comptes, les séquences de requêtes, les comportements répétés de test des politiques, les relations de paiement, des routages inhabituels et des connexions à une infrastructure abusive connue. Chaque signal exige un traitement prudent, car des chercheurs légitimes peuvent produire un trafic superficiellement similaire.

Les faux positifs comptent. Les professionnels de la sécurité, les chercheurs en vulnérabilités et les intervenants en réponse aux incidents interrogent les modèles sur les malwares, les exploits, le phishing et l’évasion pour des raisons défensives. Un système qui bloque chaque prompt lié à la sécurité compromettrait le travail légitime sans arrêter de manière fiable les attaquants déterminés.

L’identité et l’autorisation constituent une limite plus déterministe. Même un modèle manipulé ne peut pas voler des données protégées lorsque son compte n’y a pas accès. Il ne peut pas déployer de code lorsque ses autorisations d’outils excluent les systèmes de production. Il ne peut pas transférer de fonds lorsque les actions sensibles exigent une approbation indépendante.

Cela devient plus important à mesure que les systèmes d’IA gagnent des outils. Un agent doté d’outils peut naviguer sur des sites web, exécuter du code, interroger des bases de données ou déclencher des services externes. La sortie du modèle devient alors une entrée pour des actions réelles, ce qui rend la conception des autorisations aussi importante que le filtrage du contenu.

Des chercheurs de Check Point ont démontré séparément une technique de proxy IA impliquant des assistants avec accès au web. Leurs travaux ont montré comment un trafic IA légitime pourrait être détourné comme relais, renforçant le danger de considérer un domaine de fournisseur de confiance comme une preuve d’intention digne de confiance.

Les entreprises devraient donc distinguer la sécurité du modèle de la sécurité du système. La sécurité du modèle concerne ce que l’IA génère. La sécurité du système détermine quelles identités, applications et quels agents peuvent accéder ou exécuter après la génération.

Les contrôles utiles comprennent des identités de service à portée limitée, des identifiants de courte durée, des listes d’autorisation d’outils, des limites de transaction, des portes d’approbation et des journaux complets des actions. La surveillance réseau peut alors évaluer les comportements à travers les appels de modèles, l’utilisation d’outils et les mouvements de données, plutôt que de juger un prompt isolément.

Les défenseurs doivent également éviter de surestimer ce que l’analyse de Kriminal démontre. Le JavaScript public peut révéler une configuration, mais le routage côté serveur peut différer. Un chatbot qui se donne un nom ne constitue pas une confirmation forensique. Les statistiques clients affichées et les affirmations de performance restent non vérifiées sans documents indépendants à l’appui.

La recherche présente néanmoins une architecture crédible, cohérente avec un schéma établi de marché criminel. Plusieurs observations indiquaient un wrapper utilisant des fournisseurs légitimes. L’incertitude porte sur l’implémentation exacte et l’échelle, non sur la faisabilité plus large de la méthode.

Trois signaux montreront si les fournisseurs peuvent réagir

Le prochain test consistera à voir si les éditeurs peuvent perturber ce schéma de service sans simplement contraindre Kriminal à changer de nom ou de fournisseurs.

Le premier signal est l’application coordonnée des règles sur les comptes. Surveillez si xAI, Anthropic, OpenRouter, les hébergeurs ou d’autres fournisseurs nommés confirment des enquêtes et décrivent des mesures contre les accès concernés. Une suspension unique serait significative, mais une action coordonnée testerait mieux la résilience décrite par ThreatDown.

Si plusieurs fournisseurs identifient rapidement des comptes liés, l’enquête renforcera l’argument en faveur d’une réponse aux abus à plusieurs niveaux. Si Kriminal les remplace immédiatement, l’histoire montrera au contraire que les contrôles actuels d’intégration et de surveillance restent faciles à contourner.

Le silence public ne prouve pas l’inaction. Les fournisseurs évitent souvent de détailler les enquêtes sur les abus, car ces révélations peuvent aider les opérateurs à s’adapter. Les chercheurs devront peut-être surveiller les changements de comportement des modèles, de disponibilité, d’enregistrements d’infrastructure ou de configuration exposée comme preuves indirectes.

Le deuxième signal est la détection, côté fournisseur, de schémas de revente. Les entreprises de modèles peuvent mettre à jour leurs classificateurs, examiner des séquences de prompts adversariaux et rechercher les comptes qui envoient de façon répétée du contenu lié à des workflows criminels. Elles peuvent également renforcer les règles contre la revente et enquêter sur les interfaces qui masquent les utilisateurs finaux.

Le succès ne doit pas être mesuré uniquement à l’aune de la disparition d’un domaine. Un résultat plus significatif serait une friction opérationnelle accrue entre les comptes et modèles de remplacement. Des interruptions plus longues, des capacités réduites ou des échecs répétés indiqueraient que l’application des règles a atteint la chaîne d’approvisionnement.

Le troisième signal est la preuve d’un usage dans le monde réel. Les pages marketing et les démonstrations de prompts établissent une intention, mais elles ne mesurent pas l’impact opérationnel. Les défenseurs doivent surveiller les rapports d’incident reliant le service à des campagnes de phishing, au développement d’exploits, à la fraude à l’identité ou à des accès non autorisés.

Ce lien exige de la prudence. Des textes ou du code similaires constituent une attribution faible, car de nombreux modèles peuvent générer du matériel comparable. Des preuves plus solides incluraient des dossiers clients, des chevauchements d’infrastructure, des journaux récupérés, des relations de paiement ou des artefacts directs provenant d’une intrusion examinée.

L’absence d’incidents confirmés ne rendrait pas le service inoffensif. Elle affaiblirait les affirmations sur son échelle actuelle tout en laissant l’architecture sous-jacente pertinente. Les services criminels exagèrent régulièrement leur portée pour attirer des acheteurs et intimider les défenseurs.

Le cycle de Google News peut amplifier ces affirmations avant que la vérification ne les rattrape. Les lecteurs doivent distinguer trois propositions : Kriminal a fait la publicité de fonctions criminelles, les chercheurs ont trouvé des éléments indiquant le recours à des modèles loués, et l’impact dans le monde réel reste moins clairement documenté.

Pour les fournisseurs d’IA, l’objectif stratégique n’est pas un comportement de refus parfait. Il consiste à rendre les abus suffisamment coûteux pour que les wrappers ne puissent pas offrir un accès constant. Cela exige des contrôles couvrant les modèles, les comptes, les paiements, le routage et les applications en aval.

Pour les acheteurs en entreprise, la leçon est tout aussi concrète. Ne considérez pas le nom d’un modèle respecté comme une frontière de sécurité complète. Limitez ce que chaque identité connectée à l’IA peut atteindre, surveillez ce qu’elle fait et exigez une approbation indépendante pour les actions importantes.

L’architecture rapportée de Kriminal transforme une IA légitime en composant d’un service prétendument criminel sans nécessiter un nouveau modèle de pointe. Les prochains mois montreront si les fournisseurs peuvent relier leurs éléments de preuve fragmentés avant que les opérateurs ne se reconstruisent simplement ailleurs.

Les lecteurs qui suivent cette histoire via Google News devraient surveiller l’application des règles par les fournisseurs, les changements d’infrastructure et les preuves vérifiées d’incidents, plutôt que les affirmations des vitrines. Ces signaux révéleront si Kriminal représente une activité durable ou un wrapper de courte durée exposé par son propre code. Dans les deux cas, l’enjeu est important, car la méthode sous-jacente est facile à copier. Les équipes de sécurité devraient examiner quels services d’IA, agents et outils de développement peuvent atteindre des systèmes sensibles, puis réduire les autorisations avant qu’un prompt convaincant ne devienne une action autorisée.

 
 

Commencez pour Gratuit

Un premier assistant IA local avec gestion des connaissances personnelles

Pour une meilleure expérience IA,

remio ne supporte que Windows 10+ (x64) et M-Chip Macs actuellement.

Votre partenaire IA au travail
Faites-en plus avec remio

Planifiez. Créez. Livrez.
Tout au même endroit.

bottom of page