PrismML Bonsai 2 27B réduit l’empreinte de l’IA locale, mais les tests les plus difficiles restent déterminants
PrismML a lancé Bonsai 2 27B le 17 septembre, en comprimant un modèle de 27 milliards de paramètres dans un package de 5,9 Go destiné au matériel grand public. L’entreprise affirme que PrismML Bonsai 2 27B conserve 98,2 % des performances agrégées de son équivalent en pleine précision sur les benchmarks.
Cette combinaison change l’équation de l’IA locale. Auparavant, les développeurs devaient choisir entre des modèles plus petits, faciles à exécuter, et des modèles plus grands offrant un raisonnement plus solide. Bonsai 2 remet ce compromis en question en plaçant un système multimodal de classe 27B dans la plage mémoire des ordinateurs portables et des cartes graphiques grand public.
Toutefois, faire tenir les poids n’est que la première épreuve. Les résultats agrégés de PrismML sont rapportés par le fournisseur, plusieurs formats de packaging occupent plus de 5,9 Go, et le modèle dépend actuellement de composants d’exécution personnalisés. La principale question est de savoir si des modèles locaux compacts peuvent rester fiables lors de longues tâches pilotées par des outils.
PrismML Bonsai 2 27B intègre une IA de classe 27B dans 5,9 Go
Ce lancement compte parce que PrismML a réduit l’empreinte du modèle de langage sans modifier l’architecture 27B sous-jacente.
Bonsai 2 est dérivé de Qwen3.8-27B, un modèle multimodal qui traite le texte et les images. PrismML a conservé l’architecture tout en convertissant la plupart des poids du modèle de langage en représentation ternaire.
Les poids ternaires utilisent trois valeurs possibles : moins un, zéro et plus un. Une valeur d’échelle partagée permet au runtime de traduire ces valeurs compactes en opérations numériques utiles pendant l’inférence.
Cette représentation diffère d’une simple suppression de paramètres ou du remplacement du modèle par une architecture plus petite. Bonsai 2 contient toujours environ 27 milliards de paramètres, mais chaque poids compressé exige bien moins de stockage qu’une valeur conventionnelle de 16 bits.
L’annonce de lancement de PrismML décrit un modèle de 27,8 milliards de paramètres entraîné à l’aide de TPU Google v5. Ses documents de modèle plus détaillés indiquent 27,36 milliards de paramètres au total, incluant l’ossature linguistique, les couches d’embedding, la tête de sortie et la tour de vision.
Le plus petit package GGUF publié utilise le format PTQ1_0 de PrismML. Il stocke le composant linguistique dans environ 5,95 Go, contre environ 54 Go pour la référence en pleine précision.
Un second package GGUF, appelé PQ2_0, occupe environ 7,21 Go. Les poids linguistiques MLX destinés aux appareils Apple utilisent environ 7,67 Go, car ce conteneur stocke des informations d’échelle supplémentaires.
Le package MLX complet atteint 8,60 Go après ajout de la tour de vision non compressée de 0,92 Go. Le chiffre annoncé de 5,9 Go décrit donc le plus petit empaquetage du modèle de texte, et non toutes les configurations téléchargeables.
Cette distinction n’efface pas la réussite. Même les packages les plus volumineux restent très en dessous des besoins mémoire du modèle en pleine précision. Elle influence néanmoins ce que les acheteurs et les développeurs doivent attendre d’un téléchargement donné.
Selon sa documentation, le modèle conserve une capacité de contexte de 262 144 tokens. Une fenêtre de contexte correspond à la quantité de texte ou d’autres informations tokenisées qu’un modèle peut traiter au cours d’une interaction.
Bonsai 2 préserve également l’architecture d’attention hybride de Qwen3.8-27B. Environ les trois quarts de ses couches utilisent l’attention linéaire, ce qui limite l’augmentation de mémoire associée aux prompts longs.
PrismML a publié les poids sous licence Apache 2.0. L’entreprise fournit des builds GGUF pour les déploiements basés sur llama.cpp ainsi qu’une version MLX pour le matériel Apple.
Cette disponibilité donne aux développeurs davantage de contrôle qu’un service exclusivement cloud. Les équipes peuvent inspecter les fichiers, exécuter l’inférence dans leur propre environnement et tester le modèle sans envoyer chaque prompt à un fournisseur externe.
La sortie s’appuie sur le premier modèle Bonsai 27B de PrismML, lancé en juillet 2026. Cette génération précédente avait établi l’approche de compression de l’entreprise, tandis que Bonsai 2 l’applique à un modèle de base Qwen plus récent.
Le nouveau lancement fait passer la conservation annoncée des performances agrégées d’environ 95 % à 98,2 %. Plus important encore, PrismML ne se contente plus de promouvoir l’exécution locale d’un grand modèle : l’entreprise affirme désormais préserver une qualité suffisante pour un travail sérieux.
Pourquoi un modèle local de 27B met la pression sur les alternatives plus petites
Bonsai 2 remet en cause l’idée selon laquelle un déploiement local impose de redescendre vers un modèle de classe 8B.
Les utilisateurs de modèles locaux équilibrent généralement trois contraintes liées : la mémoire, la vitesse de réponse et la qualité de sortie. Augmenter la taille du modèle peut améliorer ses capacités, mais cela accroît aussi les besoins en stockage, en bande passante mémoire et en exécution.
La quantification conventionnelle réduit ces besoins en représentant les poids du modèle avec moins de bits. Toutefois, une quantification agressive peut dégrader les performances de façon inégale, notamment pour les tâches exigeant un raisonnement approfondi ou un suivi précis des instructions.
PrismML soutient que son approche ternaire modifie cette courbe. Sa fiche de modèle indique une moyenne réelle de 1,72 bit par poids pour la représentation centrale.
Dans l’évaluation de PrismML en mode réflexion, portant sur 14 benchmarks, le build Bonsai de 5,9 Go a obtenu un score moyen de 84,78. La référence Qwen3.8-27B en pleine précision a obtenu 86,32.
Un build conventionnel IQ2_XXS occupait 9,4 Go dans la même comparaison et a obtenu 72,59. Un build UD-Q4_K_XL plus volumineux a atteint 85,18 tout en utilisant 17,6 Go.
Ces chiffres étayent une affirmation limitée mais importante. Dans la configuration de test de PrismML, Bonsai 2 a conservé sensiblement plus de qualité agrégée que la comparaison conventionnelle à faible nombre de bits.
La compression permet également au modèle de langage complet de rester en mémoire rapide sur davantage d’appareils. Lorsque les poids débordent dans une mémoire système plus lente, l’inférence peut devenir trop lente pour un usage interactif.
PrismML rapporte jusqu’à 143 tokens générés par seconde sur une Nvidia GeForce RTX 5090. Ses mesures Apple incluent environ 47 tokens par seconde sur un M5 Max et 28,7 sur un M5 Pro.
Ces résultats sont propres au matériel utilisé et proviennent de l’entreprise. Ils ne doivent pas être considérés comme des vitesses universelles, car la longueur des prompts, le format de packaging, le runtime et les conditions thermiques influencent tous le débit.
La plage de déploiement reste néanmoins significative. Un développeur peut potentiellement exécuter un assistant de programmation privé sur une station de travail, tandis qu’un ordinateur portable Apple peut héberger un modèle local capable de recherche ou de traitement de documents.
Cela met la pression sur les petits modèles généralistes. Un modèle 8B conserve des avantages en matière de temps de démarrage, de surcharge mémoire et de prise en charge sur du matériel plus ancien. Toutefois, la seule taille mémoire devient une raison moins convaincante de le choisir si un modèle 27B compressé tient sur le même appareil.
Les fournisseurs de cloud subissent une pression différente. L’inférence locale peut éliminer la latence réseau et maintenir les prompts à l’intérieur du périmètre de sécurité d’une organisation.
Prenons le cas d’une équipe d’ingénierie travaillant avec du code source propriétaire. Un modèle local peut examiner les fichiers, générer des tests et rechercher des documents techniques sans transmettre le dépôt à un service d’inférence distant.
La même logique s’applique aux dossiers personnels, aux notes de réunions internes et aux documents réglementés. Les équipes peuvent associer un modèle local à une base de connaissances consultable tout en gardant la récupération et la génération proches des documents source.
Les modèles cloud resteront préférables pour de nombreuses tâches exigeantes. Ils peuvent offrir des capacités plus solides, une montée en charge gérée et un support opérationnel mature.
Le défi immédiat n’est donc pas que l’IA locale remplace le cloud. Il consiste à rendre les modèles locaux suffisamment capables pour prendre en charge une part plus importante du travail courant, privé et sensible à la latence.
La compression ternaire est le mécanisme derrière l’empreinte réduite
Bonsai 2 réduit le trafic mémoire en stockant la plupart des poids linguistiques sous forme de codes compacts à trois valeurs, traités directement par des kernels personnalisés.
L’inférence standard en pleine précision stocke généralement chaque poids sur 16 bits. Pour un modèle dense comptant des dizaines de milliards de paramètres, ces valeurs créent une empreinte mémoire importante avant même de prendre en compte l’état d’exécution.
Bonsai 2 attribue à chaque poids compressé l’une de trois valeurs. PrismML regroupe 128 poids sous une échelle partagée de 16 bits, ce qui ramène sa représentation effective déclarée à environ 1,71 bit par poids.
Un petit ensemble de tenseurs de plus haute précision porte la moyenne à l’échelle du modèle à 1,72 bit. PrismML indique que ces tenseurs représentent environ 0,098 % du modèle de langage.
La conversion utilise également une rotation de Hadamard, une transformation mathématique appliquée avant l’attribution ternaire. Elle redistribue les valeurs inhabituellement élevées qui pourraient autrement rendre la quantification à faible nombre de bits moins précise.
Au runtime, une transformation correspondante est appliquée aux activations, c’est-à-dire aux valeurs intermédiaires générées lorsque l’entrée traverse le réseau. Les poids empaquetés restent compressés au lieu d’être développés à nouveau en pleine précision.
Cette conception est importante parce que l’inférence locale est souvent limitée par la bande passante mémoire. Le processeur déplace de façon répétée les poids depuis la mémoire lors de la production de tokens ; réduire le nombre d’octets déplacés à chaque étape peut donc améliorer la vitesse et la consommation d’énergie.
Le dépôt du runtime prend en charge les déploiements CUDA, Metal, Vulkan, ROCm et orientés CPU à travers différentes générations de Bonsai. Il fournit également des intégrations de service local, de vision et d’outils.
Bonsai 2 lui-même présente une limitation de compatibilité au lancement. La transformation d’activation Hadamard requise n’a pas encore été intégrée au projet standard llama.cpp.
Les utilisateurs doivent actuellement s’appuyer sur le fork de PrismML ou sur les binaires installés par ses scripts de configuration. Cela crée une dépendance envers l’implémentation et le calendrier de publication de l’entreprise.
La différence entre les formats de packaging ajoute une couche supplémentaire. PTQ1_0 utilise un stockage plus dense et atteint la taille annoncée de 5,95 Go, tandis que PQ2_0 place chaque valeur ternaire dans un emplacement de deux bits.
Un empaquetage plus dense réduit le trafic mémoire, mais son décodage exige davantage de calculs. Les mesures de PrismML montrent qu’aucun des deux formats n’est systématiquement plus rapide sur tous les processeurs graphiques.
La version Apple MLX présente un autre compromis. Son conteneur stocke à la fois une échelle et un biais pour chaque groupe, ce qui porte le package du modèle de langage à 7,67 Go.
Les développeurs devraient donc choisir un format selon leur runtime réel plutôt que de télécharger automatiquement le plus petit fichier. Le build optimal dépend de la mémoire disponible, des kernels pris en charge, de la génération du processeur et des besoins de traitement des prompts.
Le système de vision reste également en dehors de l’histoire de compression mise en avant. PrismML inclut la tour de vision Qwen de 0,92 Go en pleine précision, plutôt que de la convertir en poids ternaires.
Ce choix explique en partie pourquoi un package multimodal complet occupe davantage de stockage que le chiffre de 5,9 Go pour le texte. Il pourrait aussi protéger la qualité de vision contre des pertes supplémentaires dues à la quantification.
Concrètement, Bonsai 2 n’est pas simplement un petit fichier qui fonctionne partout. C’est un système coordonné modèle-runtime dont les avantages dépendent de kernels compatibles à faible nombre de bits.
Cela rend cette sortie techniquement plus intéressante qu’un simple upload de quantification post-entraînement. Cela fait aussi de l’adoption par l’écosystème un élément essentiel de l’histoire.
L’affirmation de 98,2 % exige une lecture plus attentive
Le résultat agrégé des benchmarks est encourageant, mais il ne signifie pas que Bonsai 2 préserve 98,2 % de chaque capacité ou workflow.
L’annonce publique de PrismML cite un score agrégé de 83,9 sur une suite de 20 benchmarks. Elle compare ce résultat à 85,4 pour Qwen3.8-27B, ce qui produit le chiffre annoncé de 98,2 % de conservation.
La fiche modèle détaillée présente une autre agrégation sur 14 benchmarks. Bonsai 2 y obtient 84,78 contre 86,32 en pleine précision, soit également environ 98,2 %.
Ces deux calculs sont rapportés par l’entreprise. Les suites et les totaux différents ne doivent pas être amalgamés comme s’ils représentaient un test unique reproduit indépendamment.
Les performances varient également selon les catégories. Dans les résultats sur 14 benchmarks, Bonsai 2 obtient 96,57 sur quatre tests de mathématiques, contre 97,06 pour la pleine précision.
Sa catégorie de programmation atteint 89,42, légèrement au-dessus du score de référence de 89,07. Le suivi des instructions progresse également de 81,25 à 82,66.
Ces faibles gains ne prouvent pas que la compression améliore le modèle sous-jacent. L’échantillonnage des benchmarks, les variations de notation et le comportement de décodage peuvent produire de modestes inversions.
Les pertes les plus importantes apparaissent en connaissances, raisonnement et vision. Bonsai 2 enregistre 79,86 dans la catégorie combinée des connaissances et du raisonnement, contre 85,55 pour la référence.
Sa moyenne en vision chute de 71,36 à 66,19. Sur OCR Bench v2, qui teste la reconnaissance de texte à partir d’images, Bonsai 2 obtient 56,88 contre 60,99.
Ces écarts comptent pour les flux de travail riches en documents. Un modèle peut rester performant en mathématiques et en code tout en perdant en précision lorsqu’il interprète des captures d’écran, des formulaires numérisés, des graphiques ou des preuves visuelles détaillées.
Le résultat agentique appelle également à la retenue. Bonsai 2 obtient 74,92 sur BFCL v3, un benchmark d’appel d’outils, contre 76,74 en pleine précision.
Il s’agit d’un écart agrégé relativement faible. Toutefois, un seul test d’appel d’outils ne peut pas établir la fiabilité sur des boucles agentiques prolongées.
Les systèmes agentiques amplifient les erreurs. Une sélection de fichier, une commande ou une conclusion intermédiaire légèrement erronée peut modifier toutes les étapes suivantes.
La capacité de contexte long crée une distinction similaire. Prendre en charge 262 144 tokens signifie que l’architecture et l’environnement d’exécution peuvent accepter cette quantité. Cela ne garantit pas un rappel ou un raisonnement cohérent à toutes les positions.
Les tests indépendants seront particulièrement importants ici. Les évaluateurs devraient comparer les mêmes ensembles de prompts, versions d’exécution, tailles de contexte et paramètres de décodage entre Bonsai 2 et Qwen en pleine précision.
Les premiers retours pratiques sont déjà contrastés. Un utilisateur a indiqué exécuter entièrement le modèle sur un Mac mini M2 de 8 Go à environ 7,6 tokens par seconde, ce qui étaye l’affirmation de compatibilité de base.
D’autres premiers utilisateurs ont remis en question son comportement sur des prompts complexes et des raisonnements prolongés. Ces rapports sont anecdotiques, spécifiques au matériel et trop précoces pour établir un profil de qualité stable.
La couverture de SiliconANGLE présente à juste titre les chiffres de performance et d’efficacité comme des affirmations de l’entreprise. Cette distinction doit rester visible jusqu’à la maturité des évaluations indépendantes.
PrismML a clairement démontré une version inhabituellement compacte avec des poids publics et des fichiers reproductibles. L’entreprise n’a pas encore établi que chaque charge de travail exigeante ne subit qu’une perte de capacité de 1,8 %.
L’IA locale renforce la confidentialité, mais le déploiement a toujours un coût
Bonsai 2 élargit ce qui peut rester local, même si l’auto-hébergement transfère la responsabilité opérationnelle du fournisseur à l’utilisateur.
Le cas d’usage le plus évident est le traitement privé de documents. Un utilisateur pourrait résumer des notes locales, extraire des informations de fichiers internes ou rechercher dans une collection de connaissances sensible sans téléverser les documents source.
Le développement logiciel est une autre cible logique. Un assistant de programmation hébergé localement peut inspecter un dépôt, proposer des correctifs, appeler des outils de développement et générer des tests dans la limite d’accès existante du poste de travail.
La prise en charge multimodale ajoute des tâches fondées sur l’image. Les équipes pourraient analyser des captures d’écran d’interfaces, extraire du texte de documents ou associer des diagrammes à des instructions écrites.
L’écart constaté dans les benchmarks de vision signifie toutefois que ces scénarios doivent être validés. La reconnaissance optique de caractères à enjeux élevés ne devrait pas reposer sur un score agrégé général.
L’inférence locale peut réduire l’exposition à des tiers, mais elle ne rend pas automatiquement une application sûre. Un serveur de modèle peut toujours être mal configuré, exposé à un réseau ou doté d’autorisations excessives sur les fichiers et les commandes.
Selon sa documentation, le serveur de démonstration de PrismML se lie par défaut à une adresse locale. Les utilisateurs qui modifient cette adresse peuvent exposer le service au-delà de la machine.
Les agents qui utilisent des outils introduisent des risques supplémentaires. Un modèle capable de modifier des fichiers ou d’exécuter des commandes a besoin de limites d’autorisation, de journalisation et d’une validation humaine.
Les équipes doivent également gérer les mises à jour de modèles. Un fournisseur cloud peut remplacer l’infrastructure de manière centralisée, tandis que les déploiements locaux peuvent accumuler différentes versions de binaires, de poids et de paramètres de configuration selon les appareils.
L’exigence d’un environnement d’exécution personnalisé alourdit cette charge. Les correctifs de sécurité et les changements de compatibilité doivent atteindre le fork de PrismML avant que les utilisateurs ne les reçoivent par la voie prise en charge.
La compatibilité matérielle doit aussi être évaluée avec l’application complète. Les poids du modèle ne constituent qu’une partie de la consommation de mémoire.
L’environnement d’exécution nécessite de la mémoire de travail, le cache clé-valeur stocke l’état du contexte et les composants multimodaux consomment des ressources supplémentaires. Les prompts longs peuvent donc pousser un appareil théoriquement compatible au-delà de sa limite confortable.
L’utilisation sur batterie présente un autre compromis. PrismML rapporte environ 27,5 watts de puissance GPU et 34,1 watts pour l’ensemble CPU et GPU pendant le décodage sur un M5 Pro.
Ces mesures n’incluent pas tous les composants du système et ne peuvent pas être comparées directement aux mesures de cartes Nvidia. Elles montrent néanmoins que l’inférence locale n’est pas gratuite.
Le meilleur modèle de déploiement pourrait être hybride. Les tâches courantes et sensibles peuvent rester sur l’appareil, tandis que les tâches exceptionnellement difficiles passent à un modèle géré plus puissant selon des règles explicites.
Cette organisation permet à une entreprise de contrôler quand les données quittent la machine. Elle évite également de forcer un modèle compact à traiter des tâches où la qualité compte davantage que la confidentialité ou la latence.
La décision devrait reposer sur des performances mesurées par tâche, et non sur le seul nombre de paramètres. Une équipe devrait tester son propre code, ses documents, ses images et ses séquences d’outils avant de remplacer un service existant.
Bonsai 2 rend ces tests plus accessibles, car ses poids et ses ressources d’exécution sont publics. Le travail restant consiste à démontrer que les économies opérationnelles l’emportent sur les coûts d’intégration et de maintenance.
Ce qu’il faut surveiller après le lancement de Bonsai 2 27B
Trois signaux détermineront si Bonsai 2 devient une option d’IA locale durable : des évaluations indépendantes, la prise en charge par les environnements d’exécution en amont et une adoption soutenue en production.
Le premier signal est la reproduction indépendante des benchmarks. Les tests les plus utiles compareront Bonsai 2 à Qwen3.8-27B en pleine précision et à des quantifications conventionnelles dans des conditions identiques.
Les évaluateurs devraient rapporter davantage que des moyennes. Les échecs par tâche, la longueur des réponses, les boucles de raisonnement, la précision visuelle et le rappel en contexte long révéleront où la compression modifie le comportement.
La programmation agentique mérite une attention particulière. Un benchmark qui exige de nombreux appels d’outils, la navigation dans un dépôt et l’exécution de tests offre un meilleur test de résistance qu’une complétion de code isolée.
Si Bonsai 2 reste proche de la pleine précision dans ces évaluations, l’argument de PrismML sur la densité d’intelligence deviendra beaucoup plus solide. De fortes baisses de qualité limiteraient les meilleurs usages du modèle à des tâches plus simples ou plus tolérantes.
Le deuxième signal est la prise en charge dans les environnements d’exécution grand public. PrismML indique que Bonsai 2 nécessite actuellement son fork de llama.cpp parce que la transformation d’activation Hadamard n’est pas encore intégrée en amont.
Son adoption dans des projets largement utilisés réduirait les frictions d’installation et la dépendance aux binaires d’un seul fournisseur. Elle exposerait également l’implémentation à davantage de revues, d’optimisations et de tests matériels.
Une prise en charge plus large des environnements d’exécution peut compter autant que la qualité des benchmarks. Un format techniquement impressionnant aura du mal à s’imposer si les développeurs ne peuvent pas le déployer avec des outils familiers.
Le troisième signal est l’adoption réelle au-delà des démonstrations. Le nombre de téléchargements offre un premier indice, mais des applications reproductibles et des intégrations maintenues apportent de meilleures preuves.
Les indicateurs utiles comprennent des assistants de programmation stables, des systèmes de recherche privés, une recherche multimodale locale et des pilotes en entreprise qui se poursuivent au-delà de l’évaluation. Les rapports d’échec sont tout aussi précieux, car ils identifient les charges de travail pour lesquelles un modèle compact n’est pas prêt.
La concurrence va également s’intensifier. Les modèles conventionnels à quatre bits offrent déjà une forte qualité lorsque les utilisateurs disposent de davantage de mémoire, tandis que les modèles natifs plus petits restent plus faciles à exécuter sur du matériel modeste.
Bonsai 2 n’élimine pas ces options. Il introduit un nouveau point sur la courbe, associant un modèle de base plus grand à une compression inhabituellement agressive.
Pour les développeurs, la prochaine étape est un test pratique. Téléchargez le package approprié, reproduisez un petit benchmark sur la machine cible et évaluez de vrais prompts avant d’élargir les autorisations.
Pour les acheteurs en entreprise, exigez une précision au niveau des tâches, des engagements de prise en charge de l’environnement d’exécution et un modèle de sécurité clair. Ne considérez pas le chiffre de 98,2 % comme une garantie générale de niveau de service.
PrismML Bonsai 2 27B a déjà établi le résultat de base : un modèle de la classe 27B peut occuper moins de 6 Go dans son plus petit format uniquement linguistique. La question ouverte est de savoir si cette densité reste fiable lorsque le travail réel devient long, visuel et agentique.
Un modèle local privé améliorerait-il votre flux de travail, ou ses compromis en matière de maintenance et de qualité l’emporteraient-ils sur le contrôle qu’il procure ? La réponse dépend désormais moins de la possibilité d’intégrer un modèle capable que de ce qui se produit après.



