Alibaba et Google s’affrontent alors que Gemma 4, Phi-4 Mini et Qwen3.5 font progresser l’IA embarquée
Alibaba et Google ont publié de nouveaux petits modèles à quelques semaines d’intervalle, transformant l’IA embarquée en compétition directe autour des capacités, de la mémoire et du contrôle. Gemma 4 et Qwen3.5 rivalisent désormais avec l’ancien Phi-4 Mini de Microsoft sur les ordinateurs portables, les téléphones, les stations de travail et les systèmes edge compacts.
La confrontation entre Alibaba et Google ne se résume pas à une simple course aux benchmarks. Google a conçu Gemma 4 pour les tâches multimodales et de type agent sur du matériel local. Alibaba a doté Qwen3.5 d’une large gamme de tailles, d’une prise en charge multimodale native et d’une architecture pensée pour réduire les coûts d’inférence.
Le Phi-4 Mini de Microsoft reste une référence importante, car il a montré quel niveau de raisonnement un modèle de 3,8 milliards de paramètres pouvait offrir. Il est toutefois arrivé en mars 2025, près d’un an avant les plus petites versions de Qwen3.5 et Gemma 4. Cette différence d’ancienneté compte lorsque les développeurs comparent les architectures, les outils de déploiement et les types d’entrées pris en charge.
L’évolution plus large concerne le lieu où s’effectue le travail de l’IA. Un modèle exécuté localement peut traiter des notes sensibles, du code source, des enregistrements, des images et des documents sans envoyer chaque entrée vers un service distant. Il peut également fonctionner lorsque la connectivité est limitée ou que la latence du cloud devient inacceptable.
Cependant, le terme « IA embarquée » recouvre des matériels très différents. Un Raspberry Pi, un téléphone Android, un ordinateur portable Apple Silicon et un GPU de station de travail imposent des contraintes distinctes. La taille du modèle ne suffit pas à déterminer quel système fonctionnera le mieux.
Google et Alibaba relancent la course aux modèles locaux
Le changement déterminant est que les modèles locaux sont désormais conçus pour des flux de travail complets, et non plus seulement pour de courtes conversations textuelles.
Google a annoncé Gemma 4 début avril 2026 comme une famille de modèles ouverts destinée aux applications locales, multimodales et de type agent. L’entreprise indique que cette famille prend en charge la planification, les actions autonomes, la génération de code hors ligne, le traitement visuel et plus de 140 langues.
Google a également associé cette sortie à ses logiciels pour appareils. Les développeurs peuvent accéder à Gemma 4 via Google AI Edge, tandis qu’une préversion développeur d’AICore intègre le modèle dans l’environnement d’exécution d’IA géré d’Android. L’infrastructure de déploiement devient ainsi une partie de l’argument concurrentiel de Google.
La famille initiale couvre plusieurs catégories de matériel. Ses plus petites configurations ciblent les appareils aux ressources limitées, tandis que des variantes denses et mixture-of-experts visent les ordinateurs portables et les GPU dédiés. Un modèle mixture-of-experts n’active qu’une partie de son réseau total pour chaque entrée, ce qui réduit le calcul actif.
Google a élargi la gamme en juin avec Gemma 4 12B. Selon son guide développeur, le modèle dense peut accepter du texte, des images et de l’audio grâce à une architecture unique sans encodeur.
Un encodeur convertit normalement les médias en représentations avant qu’un modèle de langage ne les traite. Google injecte à la place les informations multimodales dans l’ossature principale du modèle. L’entreprise affirme que cette conception réduit la surcharge associée aux encodeurs distincts pour la vision et l’audio.
Gemma 4 12B illustre également la frontière floue autour de l’IA embarquée. Google indique qu’il peut fonctionner sur des ordinateurs portables dotés de 16 Go de mémoire vidéo ou unifiée. Il s’agit bien de calcul local, mais pas du même environnement qu’un téléphone de milieu de gamme.
Alibaba a commencé à publier Qwen3.5 en février 2026, puis des modèles plus petits de 9B, 4B, 2B et 0,8B en mars. Ces checkpoints plus légers ont rendu la famille plus pertinente pour le matériel grand public et les déploiements embarqués.
Qwen3.5 combine l’attention conventionnelle avec des composants d’attention linéaire. L’attention linéaire est une méthode alternative de traitement des séquences conçue pour éviter certains coûts qui augmentent fortement avec la longueur du contexte. La famille comprend aussi des modèles vision-langage natifs, capables de traiter les images aux côtés du texte.
Les petites versions de Qwen offrent à Alibaba une couverture sur une large plage de matériel. Un modèle de 0,8B peut cibler des systèmes très contraints, tandis que les versions 4B et 9B visent des appareils plus puissants. Des versions denses et mixture-of-experts plus grandes étendent la même famille aux stations de travail et aux serveurs.
Le Phi-4 Mini de Microsoft adopte une approche plus ciblée. Son rapport technique décrit un modèle textuel de 3,8 milliards de paramètres entraîné avec d’importantes quantités de données synthétiques en mathématiques et en programmation.
Cet accent mis sur l’entraînement a aidé Phi-4 Mini à devenir une référence de raisonnement compact. Microsoft a également étendu son vocabulaire à 200 000 tokens et utilisé l’attention à requêtes groupées, ce qui réduit l’utilisation mémoire en partageant les représentations de clés et de valeurs.
Il en résulte une comparaison à trois sans concurrents parfaitement équivalents. Gemma 4 est une famille multimodale de 2026. Qwen3.5 couvre de nombreuses tailles et architectures. Phi-4 Mini est un modèle plus ancien, d’abord orienté texte, dont le principal atout est le raisonnement compact.
Pourquoi la concurrence entre Alibaba et Google met Microsoft sous pression
Alibaba et Google font désormais de l’entrée multimodale et de l’étendue du déploiement des exigences centrales, ce qui met sous pression le Phi-4 Mini de Microsoft, centré sur le texte.
Phi-4 Mini n’est pas soudainement devenu incapable. Sa taille compacte reste utile pour l’extraction de texte, la classification, la génération structurée, l’assistance au code et le raisonnement mathématique. Un modèle mature peut aussi bénéficier d’une prise en charge plus large dans les frameworks d’inférence qu’une sortie plus récente.
La pression vient de l’évolution des attentes. Les développeurs veulent de plus en plus qu’un seul modèle local puisse lire une capture d’écran, interpréter un document, écouter un court enregistrement, appeler un outil et produire une sortie structurée. La qualité du texte reste importante, mais elle n’est plus le seul facteur décisif.
Google a répondu en intégrant les modèles à sa pile edge. LiteRT-LM fournit une couche d’exécution pour déployer des modèles génératifs sur du matériel pris en charge. AICore ajoute un service système Android capable de gérer l’accès aux modèles et les ressources de l’appareil.
Cette intégration peut réduire le travail des développeurs Android. Au lieu d’empaqueter chaque composant indépendamment, une application peut s’appuyer sur des capacités gérées par la plateforme lorsqu’elles sont disponibles. Google doit encore démontrer que ces voies atteignent les appareils de production de manière cohérente.
Alibaba exerce une pression par l’étendue de ses modèles. Qwen3.5 propose des checkpoints étroitement liés pour des systèmes aux plafonds mémoire différents. Les équipes peuvent prototyper sur un modèle plus grand, puis examiner des membres plus petits lorsque les coûts de déploiement deviennent restrictifs.
Cette échelle de tailles est importante, car les projets d’IA locale échouent souvent lors de l’optimisation. Un prototype peut bien fonctionner sur la station de travail d’un développeur, mais ralentir sur le matériel des clients. Disposer de plusieurs tailles de modèles au sein d’une même famille peut réduire la distance conceptuelle entre les tests et le déploiement.
Microsoft dispose aussi de ses propres atouts. Windows, Azure, Foundry, ONNX Runtime et l’écosystème Copilot en expansion lui offrent plusieurs voies d’accès aux appareils d’entreprise. Les modèles Phi profitent également des relations de Microsoft avec les fabricants de PC et les fournisseurs de puces.
Pourtant, cette comparaison précise révèle un calendrier inconfortable. Phi-4 Mini représente un modèle compact du début 2025, tandis que Gemma 4 et Qwen3.5 reflètent des choix de conception effectués pour 2026. Les modèles plus récents arrivent sur un marché où la demande de multimodalité et d’exécution autonome de tâches est plus forte.
Phi-4 Multimodal de Microsoft comble partiellement cet écart. Il combine texte, vision et parole au moyen d’adaptateurs spécifiques à chaque modalité et de faible rang, de petits composants entraînables attachés à un modèle partagé. Phi-4 Multimodal constitue toutefois une comparaison distincte de Phi-4 Mini, qui est uniquement textuel.
Les développeurs devraient donc éviter de considérer « Phi-4 Mini » et « Phi-4 Multimodal » comme des appellations interchangeables. Ils prennent en charge des entrées différentes et peuvent nécessiter des décisions de déploiement différentes. Une comparaison qui ignore cette distinction produira des conclusions trompeuses.
La pression sur Microsoft est stratégique, et pas seulement technique. Google peut relier ses modèles locaux à Android. Alibaba peut distribuer une vaste famille de modèles ouverts par l’intermédiaire des communautés mondiales de développeurs et de sa plateforme cloud. Microsoft doit maintenir à jour ses versions compactes de Phi tout en les alignant sur le matériel Windows.
Cette concurrence profite aux acheteurs en élargissant les options. Elle augmente aussi la charge d’évaluation. Les équipes doivent désormais tester la qualité des modèles, la consommation mémoire, le temps de démarrage, la vitesse soutenue, la fiabilité des outils et le comportement en matière de confidentialité sur chaque appareil cible.
Les modèles d’Alibaba et Google font de l’architecture le véritable enjeu
La rivalité entre Alibaba et Google est en définitive une compétition entre mécanismes de déploiement, et non un classement universel de l’intelligence des modèles.
Gemma 4 met l’accent sur une voie multimodale sans encodeur. Cette conception vise à éviter des piles de traitement distinctes pour le texte, la vision et l’audio. Elle peut simplifier une application locale lorsque plusieurs types de médias doivent participer à la même tâche.
Prenons le cas d’un technicien de terrain travaillant sans connectivité fiable. Une application pourrait examiner une photo d’équipement, accepter une description orale, récupérer un manuel local et rédiger une note de réparation. Le traitement multimodal natif peut réduire le nombre de modèles qui doivent rester chargés.
Le compromis concerne la mémoire. Même un modèle unifié efficace doit stocker ses poids, maintenir un cache de contexte et traiter des représentations de médias. Un modèle qui se charge techniquement peut tout de même offrir une latence inacceptable ou vider une batterie en utilisation soutenue.
Qwen3.5 emprunte une voie architecturale hybride. Sa combinaison d’attention standard et de mécanismes d’attention linéaire cible les longues séquences sans payer le coût de calcul le plus élevé à chaque couche. Cela compte pour l’analyse locale de documents, où le contexte peut devenir coûteux.
Les petits modèles d’Alibaba incluent également des capacités de vision. Un checkpoint compact de Qwen3.5 peut ainsi traiter la compréhension de captures d’écran, l’automatisation d’interfaces, l’inspection de documents et la réponse à des questions visuelles. Les performances réelles dépendront de la résolution, de la quantification et de l’environnement d’exécution de l’appareil.
La quantification réduit la précision numérique utilisée pour stocker les poids du modèle. Une version à quatre bits nécessite généralement beaucoup moins de mémoire qu’un checkpoint en pleine précision. Cette réduction peut rendre le déploiement local pratique, mais elle peut aussi affecter la qualité des résultats.
Le mécanisme de Phi-4 Mini est plus ciblé. Microsoft s’est concentré sur la qualité des données d’entraînement, notamment les données synthétiques pour les mathématiques et le code. L’entreprise indique que cela permet au modèle de rivaliser avec des systèmes plus grands sur certaines tâches de raisonnement.
Cette affirmation ne doit pas être généralisée à toutes les charges de travail. Un modèle optimisé pour les schémas mathématiques et de programmation peut surpasser ses pairs en raisonnement structuré tout en étant moins performant en compréhension visuelle, en conversation multilingue ou en génération créative.
La longueur du contexte constitue une autre source de confusion. Un modèle peut annoncer la prise en charge d’une longue entrée tout en devenant lent ou gourmand en mémoire à l’approche de cette limite. Le cache clé-valeur, qui stocke les données d’attention intermédiaires, peut consommer une quantité importante de mémoire lors de longues conversations.
Les applications diffèrent également par la quantité de contexte dont elles ont réellement besoin. Un routeur de commandes vocales peut n’avoir besoin que d’un court prompt. Un assistant privé de documents peut nécessiter des milliers de tokens. Un agent de programmation peut combiner des fichiers de dépôt, la sortie d’outils et un historique d’actions croissant.
Pour le travail de connaissance, la sélection du modèle devrait suivre la charge de travail. Un système qui organise des recherches locales peut associer un modèle compact à la récupération, qui trouve les passages pertinents avant la génération. Cette approche évite de demander au modèle de conserver une archive entière dans un seul prompt.
Cette distinction s’applique également à une base de connaissances personnelle. Les politiques de stockage local et de récupération des données peuvent compter autant que le modèle qui génère la réponse finale.
L’utilisation d’outils ajoute un autre test architectural. Un modèle peut produire un texte fluide tout en échouant à sélectionner la bonne fonction, à formater les arguments ou à se remettre d’une erreur. Un déploiement de type agent exige donc davantage qu’un bon score de benchmark.
Google positionne explicitement Gemma 4 pour les tâches en plusieurs étapes. Les familles récentes de Qwen mettent également l’accent sur les agents et l’utilisation d’outils. Phi-4 Mini peut prendre en charge des appels structurés, mais ses performances doivent être testées avec le schéma et l’environnement d’exécution exacts utilisés par une application.
Le mécanisme le plus adapté variera selon le produit. L’audio natif peut compter pour les outils de réunion. Un raisonnement compact performant peut compter pour le tutorat hors ligne. Un traitement d’images efficace peut compter pour les systèmes d’assistance mobile.
Gemma 4 vs Phi-4 Mini vs Qwen3.5 : aucun vainqueur unique
Une comparaison crédible distingue la catégorie de mémoire, la prise en charge des entrées et la qualité selon la charge de travail, au lieu de déclarer un modèle meilleur que les autres.
Dans la gamme la plus compacte, Qwen3.5 propose des checkpoints de 0,8B et 2B. Ces modèles ciblent des environnements où l’usage de la mémoire et de l’énergie prime sur la qualité maximale du raisonnement. Ils peuvent servir à la classification, à l’extraction, au routage et à des tâches d’assistant contraintes.
Les variantes compactes de Gemma 4 rivalisent dans le même territoire général, mais Google les présente autour de capacités plus larges de type agent et multimodales. Les développeurs qui évaluent les deux devraient utiliser des niveaux de quantification identiques et des prompts identiques sur le même appareil.
Phi-4 Mini se rapproche de Qwen3.5 4B en nombre de paramètres. Cela rend la comparaison tentante, mais le nombre de paramètres ne normalise ni l’architecture, ni les données, ni le comportement de contexte, ni la modalité. Il ne constitue qu’un indicateur approximatif des besoins en stockage et en calcul.
Pour le raisonnement textuel, Phi-4 Mini reste pertinent. Sa recette d’entraînement cible spécifiquement les mathématiques et le code, tandis que sa taille de 3,8B convient à de nombreux environnements de type ordinateur portable après quantification. Le rapport de Microsoft décrit également une meilleure couverture multilingue par rapport à Phi-3.5 Mini.
Qwen3.5 4B propose une architecture plus récente et une entrée visuelle native. Cela lui donne un périmètre fonctionnel plus large pour les applications impliquant des captures d’écran ou des images. Cela ne garantit pas de meilleures réponses pour toutes les tâches textuelles.
Les modèles compacts correspondants de Gemma 4 avancent un argument différent. Google combine une large prise en charge linguistique, le traitement visuel et l’intégration en périphérie. Le lancement de Gemma 4 met également en avant la génération de code hors ligne et la planification en plusieurs étapes.
Les comparaisons entre modèles plus grands introduisent davantage de complications. Gemma 4 inclut des configurations denses et de type mixture-of-experts, tandis que Qwen3.5 s’étend à des modèles bien plus grands. Certains de ces checkpoints ne peuvent être considérés comme locaux que sur des stations de travail haut de gamme.
Un modèle exécuté sur un GPU dédié est local, mais il ne représente pas le matériel grand public ordinaire. Les articles brouillent souvent cette frontière en regroupant sous une même étiquette les stations de travail, les ordinateurs portables, les téléphones et les cartes embarquées.
Les développeurs devraient définir un plafond matériel avant de comparer les résultats. Ce plafond devrait inclure la mémoire disponible, l’espace de stockage, les limites thermiques et le temps de réponse acceptable. Les appareils mobiles ont également besoin d’un budget batterie.
Ensuite, les équipes devraient choisir des tâches reproductibles. Un ensemble de tests utile peut inclure des e-mails clients, des captures d’écran, des extraits de code, des documents locaux et des appels d’outils issus du produit visé. Les données privées doivent rester protégées tout au long des tests.
Chaque modèle devrait recevoir les mêmes instructions système et le même format de sortie. Les testeurs devraient consigner les échecs, pas seulement les exemples attrayants. Une seule réponse soignée révèle peu de choses sur la fiabilité lors d’exécutions répétées.
La latence devrait être mesurée par étapes. Le délai jusqu’au premier token indique à quelle vitesse la réponse commence. La vitesse de génération mesure le débit de sortie. Le temps de bout en bout inclut le traitement d’images, la récupération de données, l’exécution des outils et la surcharge de l’application.
La mémoire devrait également être mesurée lors d’une croissance réaliste du contexte. Un modèle qui se charge aisément au démarrage peut dépasser les limites de l’appareil après une longue session. Ce comportement importe pour les assistants qui conservent plusieurs documents ou des conversations prolongées.
La qualité doit inclure la rigueur factuelle. Les modèles plus petits peuvent inventer des détails manquants lorsqu’un prompt demande une synthèse. La récupération de données et les citations peuvent réduire ce risque, mais ne l’éliminent pas.
La confidentialité mérite une inspection directe. « Local » devrait signifier que les entrées, les données intermédiaires et les sorties restent sur l’appareil prévu. Les applications peuvent toujours envoyer de la télémétrie, des rapports de crash, des requêtes de recherche ou des appels d’outils à des services externes.
Aucun de ces facteurs ne produit un vainqueur permanent. Un checkpoint Qwen3.5 peut dominer les tâches multilingues basées sur l’image. Phi-4 Mini peut rester préférable pour un flux de travail de raisonnement contraint. Gemma 4 peut offrir la voie la plus claire pour une application Android.
Ce que les benchmarks publiés ne peuvent toujours pas prouver
Les benchmarks des fournisseurs décrivent les capacités des modèles dans des conditions sélectionnées, mais n’établissent pas des performances fiables au sein d’une application réelle.
Google, Alibaba et Microsoft publient des évaluations qui diffèrent par les prompts, la notation, les tailles de modèles, la précision et les paramètres d’exécution. Comparer les chiffres entre différentes fiches de modèles peut créer une fausse impression de précision.
Même un benchmark partagé peut favoriser une recette d’entraînement. Les évaluations de code récompensent l’exposition aux tâches de programmation. Les tests mathématiques récompensent les données de raisonnement structuré. Les tests visuels dépendent du prétraitement et de la résolution des images.
Les entreprises contrôlent également les résultats qui apparaissent dans les supports de lancement. Cela ne rend pas ces résultats faux. Cela signifie que les lecteurs devraient les considérer comme des affirmations de fournisseurs tant que des tests indépendants ne les reproduisent pas dans des conditions comparables.
Les tests communautaires ajoutent des éléments utiles, mais introduisent leurs propres problèmes. Un utilisateur peut exécuter différentes quantifications, différents paramètres d’échantillonnage, modèles de prompt ou longueurs de contexte. De petits changements de configuration peuvent modifier à la fois la qualité et la vitesse.
Les premiers retours autour de Gemma 4 et Qwen3.5 montrent des résultats contrastés en matière de code, de génération de design, de rédaction multilingue et de tâches professionnelles. Cette variation étaye une conclusion prudente : la conception de la charge de travail compte davantage qu’une position unique dans un classement.
La fraîcheur des modèles peut également fausser les comparaisons. Qwen3.5 est arrivé après Phi-4 Mini, et Alibaba a continué à mettre à jour sa gamme de modèles. Google a ajouté Gemma 4 12B après l’annonce initiale de la famille.
Un titre statique à trois voies peut donc rapidement vieillir. Microsoft peut publier un autre modèle Phi compact. Alibaba peut remplacer les plus petits checkpoints Qwen3.5. Google peut étendre la disponibilité sur Android ou réviser son environnement d’exécution.
Les licences exigent un examen distinct. « Modèle ouvert » et « open source » ne sont pas toujours des termes identiques. Les développeurs devraient examiner la licence réelle, les conditions d’utilisation acceptable, les droits de redistribution et les obligations associés à chaque checkpoint.
Une licence adaptée à l’expérimentation peut soulever des questions pour la distribution commerciale embarquée. Les applications mobiles peuvent également être confrontées à des règles de magasins d’applications, à des contrôles à l’exportation et à des exigences régionales sans rapport avec la qualité du modèle.
La sécurité est une autre question non résolue. Un agent local ayant accès à des fichiers, microphones, caméras ou fonctions du système d’exploitation peut créer des risques sérieux. Le fonctionnement hors ligne réduit certaines expositions réseau, mais ne rend pas l’exécution d’outils sûre.
L’injection de prompt reste possible lorsqu’un modèle lit des documents ou pages web non fiables. Un texte malveillant peut tenter de rediriger le comportement de l’agent. Les applications ont besoin de limites d’autorisation et d’étapes de confirmation externes au modèle.
Les développeurs devraient également examiner la maturité logicielle. Les nouvelles architectures arrivent parfois dans les dépôts de modèles avant que tous les moteurs d’inférence ne les prennent pleinement en charge. Les outils de conversion, les quantificateurs, les environnements d’exécution mobiles et les backends GPU peuvent se comporter différemment.
L’historique de déploiement de Qwen3.5 illustre ce risque général. La prise en charge par les frameworks d’une nouvelle architecture hybride et multimodale exige des mises à jour coordonnées. Les poids publiés d’un modèle ne garantissent pas automatiquement une exécution stable dans chaque environnement d’exécution.
Gemma 4 est confronté à une exigence de preuve similaire. L’intégration Android de Google est stratégiquement importante, mais les aperçus développeurs ne sont pas équivalents à une disponibilité de production étendue. La couverture des appareils et la prise en charge des systèmes d’exploitation détermineront sa portée pratique.
Phi-4 Mini bénéficie du temps passé sur le marché, de sa documentation et des intégrations accumulées. L’ancienneté peut devenir un désavantage en matière de capacités, mais la maturité peut rester un avantage de déploiement.
La position sceptique est donc simple. Aucune des trois familles n’a établi une domination universelle sur les téléphones, les ordinateurs portables, les cartes en périphérie et les stations de travail. Les éléments disponibles étayent des forces différenciées, et non un classement absolu.
Trois signaux décideront de la compétition de l’IA embarquée
La prochaine phase dépendra de la prise en charge du matériel de production, de tests indépendants des charges de travail et de la vitesse des prochaines sorties de chaque entreprise.
Le premier signal est la distribution réelle sur les appareils. L’aperçu AICore de Google n’a d’importance que si Gemma 4 atteint une gamme significative d’appareils Android commercialisés avec des API stables. Les développeurs devraient surveiller les chipsets pris en charge, les exigences de mémoire et les versions de systèmes d’exploitation.
Si Google élargit cette prise en charge, sa stratégie en périphérie gagnera en crédibilité. L’intégration Android pourrait devenir plus précieuse qu’un avantage étroit dans les benchmarks. Une disponibilité limitée affaiblirait l’affirmation de Google selon laquelle Gemma 4 transforme le développement grand public d’IA embarquée.
Le même test s’applique à Microsoft. Les PC Windows intègrent de plus en plus d’unités de traitement neuronal, qui sont des processeurs optimisés pour les charges de travail d’IA. La réponse de Microsoft devrait révéler si les modèles Phi compacts deviennent une composante cohérente de la pile de développement Windows.
Alibaba contrôle moins un système d’exploitation grand public dominant en Amérique du Nord. Son signal sera l’adoption étendue par les environnements d’exécution. Une prise en charge stable dans Transformers, llama.cpp, MLX, Ollama, les frameworks mobiles et les moteurs spécifiques aux puces compenserait ce désavantage de plateforme.
Le deuxième signal est constitué de tests indépendants sous des limites matérielles fixes. Des comparaisons utiles devraient placer des modèles de taille et de quantification similaires sur le même appareil. Elles devraient rendre compte de la mémoire, de la latence, de la consommation d’énergie et de la qualité répétée des tâches.
Une évaluation publique utilisant des charges de travail réalistes liées aux documents, aux images, au code et à l’utilisation d’outils renforcerait la compréhension du marché. Elle pourrait également remettre en cause les récits des fournisseurs qui reposent sur des benchmarks soigneusement sélectionnés.
Les tests les plus instructifs mesureront la récupération après échec. Un agent doit reconnaître un appel d’outil échoué, réviser son plan et éviter de répéter des actions dangereuses. Les réponses à des questions en une seule tentative ne capturent pas ce comportement.
Le troisième signal est la prochaine sortie de petit modèle de chaque entreprise. Phi-4 Mini fait désormais face à des concurrents d’une génération plus récente. Le prochain modèle Phi compact de Microsoft montrera si l’entreprise privilégie la multimodalité native, un contexte plus long et efficace, ou une intégration Windows plus poussée.
Les mises à jour plus compactes de Qwen d’Alibaba révéleront la vitesse d’amélioration de son architecture hybride. L’entreprise a déjà établi un rythme de publication rapide. Les développeurs doivent mettre ces gains en balance avec le coût de migration induit par des changements fréquents de modèles.
La suite de Google montrera si Gemma 4 devient une famille durable ou un cycle de checkpoints éphémère. Une meilleure couverture des appareils, des quantifications optimisées et des outils d’agent stables renforceraient son positionnement local-first.
Pour les acheteurs, l’action immédiate n’est pas de choisir un vainqueur à partir d’un titre. Constituez un ensemble de tests à partir du travail que votre produit doit accomplir, puis exécutez-le dans les limites exactes de mémoire et de confidentialité auxquelles les utilisateurs seront confrontés.
Portez une attention particulière à ce qui quitte l’appareil. Un modèle local peut prendre en charge des flux de travail privés, mais les services de récupération et les outils connectés peuvent toujours transmettre des informations sensibles. Les équipes traitant des données personnelles devraient cartographier chaque cheminement des données.
La course entre Alibaba et Google a renforcé la crédibilité de l’IA locale, tandis que Phi-4 Mini de Microsoft reste une référence utile en matière de raisonnement compact. La question décisive est désormais pratique : quel modèle accomplit de manière fiable votre charge de travail réelle sans dépasser les limites de l’appareil ?



