Alibaba dévoile son plus grand modèle d’IA, mais l’échelle n’est pas le véritable test
Alibaba a propulsé Qwen3.8-Max dans google news avec un chiffre saisissant : 2 400 milliards de paramètres, soit plus du double de la taille de son précédent modèle phare. L’entreprise présente cette préversion comme son plus grand modèle à ce jour et affirme qu’il ne se classe que derrière Fable 5 d’Anthropic. Cette comparaison transforme une sortie produit en défi direct à l’idée que les laboratoires américains évoluent toujours dans une catégorie technique à part.
Le nombre de paramètres attire l’attention, mais ne tranche pas la compétition. Alibaba n’a pas accompagné son affirmation sur le classement d’un tableau complet de benchmarks publics, d’une fiche modèle détaillée ou d’une évaluation reproductible de manière indépendante. Qwen3.8-Max arrive donc à la fois comme une étape technique importante et comme un argument encore incomplet.
La compétition la plus importante oppose Alibaba à Anthropic, et non la Chine à l’ensemble des États-Unis. Anthropic a bâti sa position sur des performances fiables de pointe en programmation, raisonnement et tâches agentiques de longue durée. Alibaba affirme qu’un modèle chinois peut évoluer dans la même gamme de performances tout en soutenant une stratégie de déploiement plus large.
Cette affirmation compte pour les développeurs et les acheteurs en entreprise avant même que tous les benchmarks soient disponibles. Une alternative crédible modifie les négociations avec les fournisseurs, la planification des déploiements et les hypothèses sur l’origine des modèles de pointe. Elle soulève aussi une question plus difficile : une échelle de modèle immense se traduit-elle par un travail fiable en dehors d’une démonstration contrôlée ?
Alibaba a mis 2 400 milliards de paramètres derrière son moment Google News
Qwen3.8-Max change la conversation concurrentielle parce qu’Alibaba le présente comme un système de pointe, et non comme une alternative régionale.
Alibaba a présenté Qwen3.8-Max en avant-première lors de la World Artificial Intelligence Conference à Shanghai en juillet 2026. Cette préversion est devenue disponible via des produits Alibaba, dont Token Plan, Qoder et QoderWork, offrant à certains utilisateurs une première voie pour le tester.
Selon Alibaba, le système compte 2 400 milliards de paramètres au total. Les paramètres sont les valeurs internes ajustées lors de l’entraînement, même si leur nombre total ne mesure pas directement l’intelligence ou la fiabilité. Ce volume considérable fait néanmoins de Qwen3.8-Max l’un des plus grands modèles de langage annoncés.
Le modèle utilise une architecture de mélange d’experts, ou MoE. Cette conception dirige chaque requête vers une partie sélectionnée du réseau au lieu d’activer tous les paramètres. Alibaba activerait environ 95 milliards de paramètres pendant l’inférence, ce qui rend la taille totale moins intimidante sur le plan informatique qu’elle ne le paraît d’abord.
L’architecture explique aussi pourquoi les comparaisons de paramètres exigent de la prudence. Un modèle dense active l’intégralité de son réseau pour chaque requête, tandis qu’un système MoE active des experts sélectionnés. Comparer uniquement le nombre total de paramètres peut masquer les différences de données d’entraînement, de calcul actif, de conception d’inférence et de qualité post-entraînement.
Qwen3.8-Max est également multimodal. Alibaba indique qu’il peut traiter du texte, des images, des vidéos et des documents au sein d’un même modèle. Cette sortie dépasse donc un simple exercice de mise à l’échelle d’un modèle textuel et le positionne sur le marché des agents de travail.
Le nouveau modèle succède à Qwen3-Max, qu’Alibaba a présenté en septembre 2025 avec plus de mille milliards de paramètres. Alibaba avait déclaré que ce modèle précédent avait été entraîné sur 36 000 milliards de tokens, tandis que son système d’entraînement MoE améliorait l’utilisation du matériel de 30 % par rapport à Qwen2.5-Max.
Les résultats de Qwen3-Max publiés par Alibaba incluaient un score de 69,6 sur SWE-bench Verified et de 74,8 sur Tau2-Bench. SWE-bench Verified évalue la capacité d’un modèle à résoudre de véritables problèmes logiciels, tandis que Tau2-Bench teste l’utilisation d’outils dans des interactions simulées.
Ces chiffres ne se transposent pas automatiquement à Qwen3.8-Max. Ils montrent toutefois qu’Alibaba ciblait déjà la programmation et le comportement agentique avant d’augmenter l’échelle du modèle. Qwen3.8-Max étend cette stratégie au travail professionnel multimodal.
Les premières couvertures ont décrit le nouveau système comme une préversion plutôt que comme une sortie pleinement documentée. Un compte rendu de la préversion du modèle indiquait qu’Alibaba prévoyait de publier les poids ultérieurement. Cette distinction importe, car l’accès via un produit hébergé ne permet pas le même niveau d’examen que des poids téléchargeables et une documentation technique complète.
C’est pourquoi le titre de google news ne raconte que la moitié de l’histoire. Alibaba a révélé suffisamment d’éléments pour établir l’échelle et le marché visé. L’entreprise n’en a pas encore révélé assez pour établir la position du modèle avec le même degré de confiance.
La sortie met sous pression la prime de pointe d’Anthropic
Alibaba n’a pas besoin de battre Anthropic partout pour affaiblir l’idée selon laquelle les performances de pointe appartiennent à un petit club américain.
Anthropic est l’adversaire le plus évident, car Alibaba l’a choisi comme point de référence. L’entreprise affirme que Qwen3.8-Max ne se place que derrière Fable 5, le principal modèle d’Anthropic dans la comparaison. Alibaba demande donc aux acheteurs de considérer Qwen comme un quasi-pair, et non simplement comme un substitut moins coûteux.
Ce positionnement met Anthropic sous pression de trois manières. Premièrement, il réduit la distance de capacité perçue entre les deux entreprises. Deuxièmement, il offre aux développeurs mondiaux une autre famille de modèles pour les flux de travail de programmation et d’agents. Troisièmement, il déplace une partie de la décision d’achat de la performance absolue vers le contrôle du déploiement.
Anthropic conserve des avantages importants. L’entreprise dispose d’une plateforme développeur établie, d’un usage important en production et d’une réputation fondée sur la sûreté des modèles. Les clients d’entreprise évaluent aussi le support, la disponibilité, les contrôles de sécurité et la qualité des intégrations, pas seulement les scores de benchmark.
Alibaba apporte un ensemble d’atouts différent. L’entreprise exploite le plus grand fournisseur cloud de Chine, sert une base d’entreprises importante et peut distribuer Qwen via des produits cloud, de programmation, de commerce et grand public. Cette distribution peut transformer les améliorations du modèle en usage sans attendre l’émergence d’un écosystème d’applications indépendant.
Le contraste stratégique apparaît particulièrement clairement dans la programmation. Un modèle de programmation gagne en valeur lorsqu’il peut inspecter des dépôts, appeler des outils, exécuter des tests et conserver des décisions sur de nombreuses étapes. Une réponse impressionnante ne dit pas grand-chose sur sa capacité à achever une longue tâche d’ingénierie.
Qwen3.8-Max cible ce flux de travail via Qoder, l’environnement de programmation d’Alibaba. Si le modèle y fonctionne de manière cohérente, Alibaba peut recueillir les retours de véritables sessions de développement et améliorer le système à partir de schémas d’échec concrets. Le produit devient une partie de la boucle d’entraînement et de distribution.
Anthropic a poursuivi une opportunité similaire avec des outils de programmation agentique. Cela rend la compétition plus précise qu’un débat général sur le leadership national en IA. Les deux entreprises veulent que leurs modèles deviennent la couche de raisonnement au sein du travail logiciel professionnel.
Alibaba a également intérêt à rivaliser sur l’accessibilité. Les développeurs chinois de modèles ont attiré l’attention en publiant des poids ouverts, en prenant en charge des interfaces courantes et en réduisant les obstacles au déploiement. Ces choix peuvent compter davantage qu’une avance limitée sur un benchmark pour les entreprises qui exigent un contrôle local.
L’écosystème Qwen a déjà une portée significative. Forbes a précédemment rapporté qu’Alibaba comptait plus de 90 000 utilisateurs professionnels de services Qwen et décrit l’entreprise comme un champion chinois majeur de l’IA. Son analyse des modèles ouverts relevait également que les développeurs chinois utilisaient la distribution ouverte pour renforcer leur influence mondiale.
Un modèle proche de la pointe avec un déploiement flexible donne aux acheteurs un levier, même lorsqu’ils choisissent finalement Anthropic. Les équipes achats peuvent comparer les fournisseurs, tester la portabilité des charges de travail et éviter de concevoir tous les flux de travail autour d’un seul endpoint propriétaire.
Cela ne signifie pas qu’une migration immédiate soit probable. Changer de modèle peut modifier la qualité des résultats, le comportement en matière de sûreté, les appels d’outils et les exigences de prompt. Les entreprises doivent aussi procéder à un examen juridique avant d’envoyer des données sensibles à un nouveau fournisseur.
La pression immédiate est donc commerciale et stratégique. Anthropic doit montrer pourquoi ses performances, sa fiabilité et sa gouvernance justifient sa position. Alibaba doit prouver que son échelle produit des résultats constants, et pas seulement une spécification frappante.
Qwen3.8-Max utilise l’échelle pour contester la hiérarchie de pointe
Le mécanisme central est l’échelle parcimonieuse : Alibaba peut construire un réseau de 2 400 milliards de paramètres sans activer l’ensemble du modèle pour chaque requête.
Un modèle de mélange d’experts contient des sous-réseaux spécialisés, généralement appelés experts. Un système de routage sélectionne un groupe limité de ces experts pour chaque token. Cela permet au réseau de disposer d’une capacité d’apprentissage plus grande sans supporter le coût d’inférence total d’un modèle dense.
Cette architecture n’est pas propre à Alibaba. Son importance ici tient à l’ampleur avec laquelle Alibaba l’a mise à l’échelle. Qwen3.8-Max combinerait 2 400 milliards de paramètres au total avec environ 95 milliards de paramètres actifs pendant l’inférence.
Ce ratio permet à Alibaba de mettre en avant une échelle totale extraordinaire tout en maintenant chaque réponse dans une plage de calcul plus gérable. Cela ne rend pas l’inférence peu coûteuse à lui seul. La mémoire, la communication entre accélérateurs, la longueur de contexte et la demande de service déterminent encore le coût final.
L’échelle parcimonieuse peut aussi créer des complications techniques. Le routeur doit répartir le travail efficacement entre les experts, et ces experts doivent acquérir des spécialisations utiles. Un mauvais routage peut surcharger certains composants tandis que d’autres apportent peu.
Alibaba travaille sur ce problème depuis plusieurs générations de Qwen. La documentation de Qwen3-Max décrivait une fonction de perte d’équilibrage de charge par lot global, qui encourage une utilisation plus équilibrée des experts pendant l’entraînement. Elle décrivait également un système de pipeline conçu pour améliorer l’efficacité de l’entraînement sur de grands clusters matériels.
L’entreprise indique que Qwen3.8-Max se concentre sur la programmation et les tâches professionnelles de cowork. Dans ce contexte, cowork désigne un système d’IA qui effectue un travail en plusieurs étapes aux côtés d’une personne, plutôt que de produire une réponse isolée. Ces tâches peuvent inclure l’examen de fichiers, l’utilisation d’outils logiciels, la révision de plans et la vérification des résultats.
Les entrées multimodales étendent ces flux de travail. Un développeur pourrait demander à un modèle d’inspecter une image de conception, de lire une spécification, d’analyser du code source et de préparer un plan d’implémentation. Un analyste métier pourrait combiner des documents, des graphiques et des éléments enregistrés dans une même tâche.
Ces exemples sont des applications plausibles, et non des preuves de performances fiables. Le modèle doit préserver le contexte, choisir correctement les outils et se remettre des erreurs. Il doit aussi distinguer les instructions du contenu non fiable au sein des documents.
Le mécanisme d’échelle aide Alibaba à rivaliser, mais il ne supprime pas les contraintes matérielles de la Chine. Les contrôles à l’exportation ont restreint l’accès à certaines puces d’IA avancées, obligeant les laboratoires chinois à extraire davantage de valeur du calcul disponible. Les architectures efficaces, les systèmes d’entraînement optimisés et la distribution ouverte sont devenus des réponses stratégiques.
Une analyse de l’IA entre les États-Unis et la Chine a identifié le calcul comme un moteur majeur des progrès des modèles et un avantage américain persistant. Cette contrainte rend la taille du modèle d’Alibaba notable, même si sa taille seule révèle peu de choses sur le matériel, la durée d’entraînement ou l’efficacité qui la sous-tendent.
Le marché chinois des modèles au sens large compte également. DeepSeek a démontré qu’un laboratoire chinois pouvait contraindre ses concurrents mondiaux à réagir par l’efficacité et l’accès ouvert. Moonshot AI et Z.ai ont depuis ajouté des modèles performants axés sur le raisonnement, le code et les agents.
Kimi K3 de Moonshot compterait 2,8 billions de paramètres, dépassant Qwen3.8-Max en nombre total. Une forte demande a contraint Moonshot à suspendre les nouveaux abonnements après que ses capacités ont été mises sous pression. Cet épisode a montré qu’un développement de modèle réussi ne garantit pas une infrastructure de service suffisante.
Un rapport sur la capacité de l’IA cite l’analyste Lian Jye Su d’Omdia, selon qui Kimi K3 impose de lourdes exigences de calcul. Cette expérience constitue un avertissement pour Alibaba : la disponibilité et le débit soutenu peuvent devenir des limites concurrentielles, même lorsqu’un modèle attire les utilisateurs.
Le récit de google news affirme que la Chine comble son retard parce que ses modèles deviennent plus grands et plus performants. Une interprétation plus solide est que les développeurs chinois rivalisent désormais au moyen de plusieurs mécanismes coordonnés : architectures clairsemées, cycles de publication agressifs, distribution ouverte et obstacles au déploiement plus faibles.
L’affirmation d’Alibaba sur la taille est donc le signal d’une capacité d’ingénierie accumulée. Le véritable mécanisme réside dans la capacité de l’entreprise à entraîner, servir, distribuer et affiner le modèle à travers un vaste réseau cloud et de produits.
Ce que l’affirmation de 2,4 billions de paramètres ne prouve pas
Alibaba a établi Qwen3.8-Max comme un candidat sérieux parmi les modèles, mais n’a pas établi le classement complet des performances mis en avant autour de l’aperçu.
La principale incertitude concerne la transparence des évaluations. L’affirmation d’Alibaba selon laquelle le modèle ne serait devancé que par Fable 5 ne s’accompagne pas d’un tableau de benchmarks public complet avec les scores, les prompts, les paramètres des concurrents et la méthodologie de test. Sans ces détails, les chercheurs externes ne peuvent pas reproduire le classement.
Les classements des modèles dépendent fortement des choix d’évaluation. Un système peut exceller sur les questions scientifiques tout en étant en retrait sur le code. Il peut bien fonctionner dans des tests à un seul tour tout en perdant le contexte lors d’une longue exécution par agent.
Même les noms des benchmarks peuvent masquer des différences d’implémentation. Les autorisations d’outils, les paramètres d’échantillonnage, les limites de contexte, les tentatives répétées et l’échafaudage des agents influencent tous les résultats. Une comparaison équitable exige des conditions alignées et une divulgation claire.
L’étiquette d’aperçu crée une autre limite. Les fournisseurs modifient souvent un modèle entre l’aperçu et la disponibilité générale. Ces changements peuvent améliorer le comportement, mais ils peuvent aussi rendre les premières évaluations difficiles à comparer avec le système final.
La disponibilité par le biais des produits Alibaba offre aux testeurs un accès utile, mais l’accès hébergé ne révèle pas les poids sous-jacents. Les chercheurs ne peuvent pas inspecter pleinement l’architecture, évaluer un déploiement local ni vérifier le schéma d’activation annoncé à partir du seul endpoint.
Le projet d’Alibaba de publier les poids répondrait à une partie de cette lacune. Les poids ouverts permettent aux chercheurs et aux entreprises d’exécuter le modèle dans des conditions indépendantes. Ils ne révèlent pas les données d’entraînement ni ne reproduisent le processus d’entraînement original ; ils ne sont donc pas équivalents à une ouverture complète.
Les exigences de déploiement soulèvent une autre question. Un modèle activant environ 95 milliards de paramètres reste conséquent. Son exécution locale nécessiterait une infrastructure spécialisée, de la quantification ou un service distribué, en particulier lorsque les charges de travail utilisent de longs contextes ou des entrées multimodales.
Les poids ouverts profiteraient donc davantage aux fournisseurs cloud et aux organisations bien équipées qu’aux utilisateurs occasionnels sur ordinateur de bureau. Les variantes Qwen plus petites restent plus réalistes pour l’expérimentation locale. L’effet plus large du modèle phare pourrait provenir des méthodes de fine-tuning, des modèles distillés et des services hébergés.
L’évaluation de la sécurité requiert également de l’attention. Les agents multimodaux peuvent rencontrer des instructions malveillantes intégrées dans des documents, des images et des sites web. Un modèle qui utilise des outils doit résister à ces instructions tout en conservant un accès utile aux contenus légitimes.
La gouvernance des données complique l’adoption internationale. Les entreprises doivent examiner où les prompts sont traités, comment les journaux sont conservés, quelles informations entraînent les systèmes futurs et quelles règles nationales s’appliquent. La capacité technique ne peut pas répondre à ces questions.
Les critiques s’interrogent également sur le fait que la convergence des benchmarks reflète ou non une qualité de production équivalente. Un modèle peut égaler un leader lors de tests publics tout en restant moins fiable pour des demandes inhabituelles, de longues sessions ou des tâches mal spécifiées. Ces échecs n’apparaissent qu’à l’usage prolongé.
Le débat public autour de Qwen3.8-Max comprend déjà des signalements de boucles de raisonnement lors des premiers tests. De telles anecdotes peuvent révéler des problèmes possibles, mais elles n’établissent pas un schéma général d’échec. Des tests reproductibles sur de nombreuses tâches sont nécessaires.
Inversement, des démonstrations soignées n’établissent pas non plus une fiabilité générale. Un fournisseur peut sélectionner des tâches réussies, monter une présentation ou utiliser un échafaudage privé. Les acheteurs devraient considérer tant les démonstrations enthousiastes que les échecs isolés comme des points de départ pour l’évaluation.
Les résultats antérieurs d’Alibaba avec Qwen3-Max-Thinking illustrent ce tableau contrasté. L’entreprise a rapporté des scores compétitifs en connaissances, raisonnement, recherche, code et utilisation d’outils. Elle a également rapporté des résultats plus faibles que certains concurrents sur des tests particuliers d’agents et de contexte long.
Cette variation est normale. Aucun modèle ne domine toutes les charges de travail, et les classements agrégés compressent des différences significatives. Une entreprise choisissant entre Qwen et Anthropic devrait tester les tâches qui déterminent la valeur réelle pour son activité.
Pour les équipes logicielles, ces tâches peuvent inclure la réparation de code interne, la revue de pull requests, l’appel d’outils privés et le respect des conventions du dépôt. Pour les analystes, elles peuvent inclure l’extraction d’affirmations à partir de documents, le rapprochement de sources contradictoires et la production de synthèses auditables.
La latence, la récupération après erreur et la cohérence méritent le même poids que la précision. Un modèle qui résout une tâche difficile une fois mais échoue de façon imprévisible peut coûter plus cher à superviser qu’une solution légèrement moins performante.
Les progrès des modèles chinois s’inscrivent également dans un différend politique et sécuritaire plus large. Certains gouvernements et entreprises envisagent les services d’IA chinois à travers des préoccupations liées à l’accès aux données, à la censure et à la dépendance de la chaîne d’approvisionnement. Ces préoccupations peuvent restreindre l’adoption quelle que soit la qualité du modèle.
Dans le même temps, écarter Qwen uniquement en raison de son origine masquerait son influence technique et commerciale. Les développeurs peuvent étudier les versions ouvertes, comparer les choix d’architecture et utiliser la pression concurrentielle pour exiger de meilleures conditions de chaque fournisseur.
La conclusion appropriée est plus nuancée que le cadrage de google news. Alibaba a produit un modèle dont l’échelle, le périmètre multimodal et la distribution justifient une évaluation sérieuse. Sa place revendiquée dans la hiérarchie mondiale demeure une affirmation de l’entreprise en attente de preuves plus complètes.
Trois signaux montreront si Alibaba a comblé l’écart
La prochaine étape sera déterminée par des tests indépendants, une publication de poids ouverts et des preuves qu’Alibaba peut répondre à une demande réelle soutenue.
Le premier signal est une publication technique complète. Alibaba doit publier une fiche modèle contenant les détails de l’architecture, les limites de contexte, les tests de sécurité, les paramètres de benchmark et les limitations connues. La publication des poids promis rendrait cette divulgation plus précieuse.
Si cela se produit, des chercheurs indépendants pourront tester Qwen3.8-Max avec des harnais et des charges de travail standardisés. Des résultats reproduisant le classement d’Alibaba renforceraient l’affirmation selon laquelle l’écart avec la frontière s’est réduit. Des divergences majeures l’affaibliraient.
Le deuxième signal est la performance dans les tâches de code et d’agent de longue durée. Les benchmarks à un seul tour restent utiles, mais les charges de travail les plus précieuses en entreprise impliquent planification, outils, fichiers et corrections répétées. La fiabilité sur de nombreuses étapes distinguera un assistant compétent d’un agent fiable.
Les développeurs devraient surveiller les évaluations de type SWE-bench, les tests d’utilisation d’outils et les essais contrôlés sur des dépôts. Ils devraient également examiner les taux d’achèvement, les actions inutiles, la récupération après les erreurs d’outils et le niveau de supervision humaine requis.
Ce signal teste directement le terrain concurrentiel choisi par Alibaba face à Anthropic. Si Qwen3.8-Max égale Anthropic dans un travail professionnel soutenu, le marché gagne une seconde option crédible. S’il perd sa cohérence durant les sessions plus longues, son nombre de paramètres devient moins important commercialement.
Le troisième signal est une adoption en production sans rupture de capacité. Alibaba doit démontrer qu’il peut fournir le modèle de manière fiable à travers Qoder, Model Studio et d’autres produits à mesure que la demande augmente. La latence, la disponibilité, l’accès régional et les limites de débit compteront tous.
L’expérience de Moonshot avec Kimi K3 montre pourquoi ce test ne peut pas être considéré comme routinier. La demande a dépassé la capacité peu après le lancement, forçant l’entreprise à restreindre les nouveaux abonnements. Un modèle ne peut pas faire pression sur les fournisseurs établis si les clients ne peuvent pas compter sur l’accès.
Alibaba dispose de ressources cloud plus importantes qu’une startup, mais Qwen3.8-Max est également exigeant. Les entrées multimodales et les workflows d’agents peuvent consommer davantage de calcul que de courtes requêtes de chat. Le déploiement réel révélera si l’activation clairsemée compense suffisamment ces exigences.
Des données de marché plus larges soutiennent l’idée que le prix et le contrôle du déploiement deviennent centraux. Une récente comparaison de modèles a placé des systèmes chinois de premier plan à quelques points de benchmark des leaders américains tout en constatant des écarts de coût substantiels dans certains scénarios.
Ces comparaisons varient selon la charge de travail et le fournisseur ; elles ne devraient donc pas devenir des affirmations universelles. Elles montrent pourquoi des performances proches de la frontière peuvent avoir une influence disproportionnée. Un modèle n’a pas besoin d’être classé premier pour remodeler les décisions d’achat.
La réponse concurrentielle apportera un contexte supplémentaire. Anthropic peut défendre sa position avec des modèles plus performants, de meilleurs agents, des contrôles de sécurité plus clairs et des services d’entreprise plus fiables. OpenAI, Google, DeepSeek, Moonshot et Z.ai continueront également de faire évoluer le point de référence.
Alibaba fait face à une tâche tout aussi exigeante. L’entreprise doit transformer une annonce marquante en capacité reproductible, déploiement accessible et amélioration continue du modèle. Chaque exigence met à l’épreuve une partie différente de sa stratégie.
Pour les développeurs, la réponse pratique consiste à constituer dès maintenant un ensemble d’évaluation spécifique à leurs charges de travail. Incluez des tâches difficiles, des tâches ordinaires, de longues sessions, des échecs d’outils et des contraintes liées aux données sensibles. Testez les changements de modèles par rapport à cet ensemble plutôt que de vous fier à un seul classement public.
Les acheteurs en entreprise devraient préserver la portabilité dans la mesure du possible. Des formats d’API communs, des systèmes de récupération modulaires et des journaux d’évaluation indépendants des fournisseurs réduisent le coût de comparaison des modèles. Ils empêchent également qu’un choix initial ne devienne une dépendance permanente.
Les travailleurs du savoir devraient observer la façon dont ces systèmes traitent des preuves hétérogènes. Les modèles multimodaux peuvent recueillir des informations à partir d’un plus grand nombre de formats, mais des entrées plus larges ne garantissent pas un meilleur jugement. Le suivi des sources et la vérification restent nécessaires lorsque les sorties du modèle influencent des décisions.
L’arrivée d’Alibaba dans google news mérite donc l’attention, mais le titre ne doit pas devenir le verdict. Qwen3.8-Max a élargi l’échelle et l’ambition de l’effort chinois sur les modèles de frontière. Les preuves nécessaires pour le classer sont encore en cours d’arrivée.
Au cours des prochains mois, observez si Alibaba publie les poids promis, passe les tests indépendants d’agents et répond à la demande croissante sans restrictions majeures. Ces trois résultats nous en diront davantage que le titre sur les 2,4 billions de paramètres. S’ils convergent, Anthropic fera face à un quasi-pair doté d’un modèle de distribution différent. Dans le cas contraire, Qwen3.8-Max restera un aperçu impressionnant dont les affirmations les plus ambitieuses ont devancé la vérification publique.



