top of page

Les résultats GPT-6 Sol Max d’Agent Arena revendiquent un gain de 7,7 %, mais leur vérification reste en retard

26 sept.
15 min de lecture

Arena affirme que ses résultats GPT-6 Sol Max d’Agent Arena montrent une amélioration nette de 7,7 % sur plus de 4 000 sessions réelles d’agents. L’entrée signalée se classe sixième et figure sur la frontière de Pareto du benchmark, qui met en balance les performances et le coût des tâches.

Ce serait un résultat significatif pour les développeurs qui choisissent des modèles destinés à un travail autonome. Pourtant, l’annonce soulève immédiatement une tension. Arena a publié des affirmations de performance précises sans fournir suffisamment d’éléments publics pour identifier le modèle ou reproduire la comparaison de manière indépendante.

Le nom « GPT-6 Sol (Max) » nécessite également des éclaircissements. Arena associe cette entrée à OpenAI, mais la documentation publique d’OpenAI n’établit pas ce nom exact comme celui d’un modèle généralement disponible. Tant qu’Arena ou OpenAI n’aura pas expliqué cette désignation, les lecteurs devraient considérer ce résultat comme une affirmation de benchmark plutôt qu’une étape produit vérifiée.

Ce que revendiquent réellement les résultats GPT-6 Sol Max d’Agent Arena

L’annonce d’Arena présente un solide résultat relatif, mais le post public laisse sans réponse des détails essentiels sur la mesure.

L’annonce d’Arena indique que GPT-6 Sol (Max) a rejoint Agent Arena après plus de 4 000 conversations réelles avec des agents. Elle fait état d’une amélioration nette de 7,7 % et place cette entrée au sixième rang du classement.

Arena décrit également le modèle comme figurant sur la frontière de Pareto d’Agent Arena. Une frontière de Pareto regroupe des systèmes qui ne peuvent améliorer une dimension mesurée sans en sacrifier une autre. Ici, les dimensions pertinentes semblent être les performances sur les tâches et le coût.

Cette distinction est importante. Un modèle peut se classer derrière plusieurs alternatives en termes de réussite brute tout en restant attractif parce qu’il accomplit les tâches à moindre coût. Un autre modèle peut dominer en qualité, mais perdre du terrain lorsque le coût entre dans la comparaison.

L’amélioration revendiquée de 7,7 % ne doit donc pas être lue comme une hausse universelle de l’intelligence. Il s’agit d’un résultat au sein du cadre d’évaluation d’Arena. Sa signification dépend de la référence, de la méthode de notation, de la répartition des tâches et du traitement des exécutions échouées.

L’expression « amélioration nette » exige un examen particulier. L’annonce n’identifie pas clairement le système de référence utilisé pour la calculer. Elle n’explique pas non plus si ce chiffre tient compte du coût, de la latence, des nouvelles tentatives ou des préférences des évaluateurs.

Ces possibilités conduisent à des interprétations très différentes. Une hausse de 7,7 % du taux d’achèvement des tâches diffère d’une hausse de 7,7 % de la préférence des utilisateurs. Ces deux mesures diffèrent elles-mêmes d’un score composite combinant qualité et utilisation des ressources.

La description de l’échantillon soulève également des questions. Plus de 4 000 sessions paraît substantiel, mais le seul nombre de sessions n’établit pas la confiance statistique. Un benchmark a besoin d’informations sur la diversité des tâches, les tentatives répétées, la cohérence des évaluateurs et la configuration du modèle.

Les sessions peuvent aussi varier fortement en difficulté. Une demande peut inviter un agent à résumer une page. Une autre peut exiger de la recherche, l’utilisation d’outils, la récupération après erreur et un livrable finalisé.

La sixième place fournit un repère concurrentiel utile, mais pas suffisamment de contexte pour prendre une décision d’achat. Les lecteurs ont encore besoin du classement complet, des intervalles de confiance et des scores des entrées voisines.

La divulgation du coût par le post est pertinente pour l’affirmation liée à la frontière de Pareto. Cependant, une médiane unique peut masquer des échecs coûteux et des tâches à longue traîne. Les équipes de déploiement ont besoin de données de distribution, et pas seulement de l’observation centrale.

L’affirmation d’Arena est donc spécifique mais incomplète. Elle identifie un résultat qui mérite d’être étudié sans fournir encore assez d’informations pour établir l’origine de l’amélioration.

Pourquoi la frontière de Pareto compte davantage que la sixième place

L’affirmation importante n’est pas que le modèle a terminé sixième. C’est qu’Arena ne voit aucune option clairement meilleure au même équilibre entre performances et coût.

Les positions dans les classements attirent l’attention parce qu’elles réduisent des évaluations complexes à une liste ordonnée. Cette simplicité peut aussi masquer la décision à laquelle les développeurs sont réellement confrontés.

Les systèmes d’agents consomment des quantités de calcul différentes tout en effectuant des nombres d’étapes différents. Ils peuvent appeler des outils de recherche, inspecter des fichiers, exécuter du code, réessayer des actions échouées ou demander à un autre modèle d’évaluer une réponse.

Un modèle qui accomplit davantage de tâches peut tout de même être inefficace. Il peut générer des traces de raisonnement plus longues, effectuer des appels d’outils inutiles ou nécessiter des tentatives de récupération répétées.

Le cadre de Pareto cherche à exposer ce compromis. Un modèle se situe sur la frontière lorsqu’aucun concurrent mesuré n’est à la fois meilleur et moins coûteux. Passer à un autre système exige alors de renoncer à quelque chose.

Cette approche est plus utile qu’un score de qualité unique pour de nombreuses équipes de production. Un agent qui traite des milliers de demandes doit rester efficace malgré les contraintes de charge et de budget.

Cependant, la méthode ne fonctionne que lorsque les axes sont mesurés de façon cohérente. Les performances doivent représenter le même objectif de tâche pour tous les modèles. Les calculs de coût doivent inclure des entrées, sorties, appels d’outils et nouvelles tentatives comparables.

Le benchmark doit aussi contrôler les paramètres des modèles. L’effort de raisonnement, les limites de contexte, les prompts système et les autorisations d’outils peuvent modifier à la fois la qualité et l’utilisation des ressources. Un modèle testé avec un budget plus élevé peut sembler plus performant pour des raisons sans rapport avec ses capacités de base.

L’utilisation par Arena de conversations réelles peut améliorer la validité écologique, c’est-à-dire la ressemblance du test avec l’usage réel. Elle peut aussi introduire des différences non contrôlées qui rendent l’interprétation causale plus difficile.

Les utilisateurs ne répartissent que rarement des tâches identiques de manière uniforme entre tous les modèles. Les modèles nouveaux ou très visibles peuvent recevoir des prompts plus difficiles. Ils peuvent aussi attirer des testeurs expérimentés qui savent comment obtenir de meilleurs résultats.

Les effets de préférence créent un autre problème. Un nom de modèle reconnaissable peut influencer les attentes à moins que les évaluations ne soient réalisées en aveugle. L’ordre de présentation et le style de réponse peuvent influencer les votes sans modifier l’exactitude de la tâche.

L’article original sur Chatbot Arena décrit un modèle d’évaluation participatif fondé sur les préférences humaines par paires. L’évaluation des agents ajoute une couche supplémentaire, car la réussite peut dépendre d’outils, d’environnements et d’exécutions en plusieurs étapes.

Cela rend l’analyse de Pareto précieuse, mais plus difficile à auditer. La frontière n’est pas une propriété permanente d’un modèle. Elle est une propriété d’un jeu de données particulier, d’une règle de notation et d’une méthode de comptabilisation des coûts.

Une légère révision de la notation peut faire entrer ou sortir des systèmes proches de la frontière. Une modification de la composition des tâches peut produire le même effet.

L’étiquette de sixième place devrait donc rester secondaire. La question plus importante est de savoir si le modèle reste efficace lorsque les tâches exigent une planification plus longue, une récupération difficile et des résultats finaux vérifiables.

Si c’est le cas, le résultat d’Arena mettrait sous pression les leaders des benchmarks qui obtiennent des scores plus élevés grâce à des budgets d’inférence bien plus importants. Dans le cas contraire, la position sur la frontière pourrait refléter la charge de travail échantillonnée plutôt qu’un avantage durable.

Le véritable adversaire est la performance sans reproductibilité

Le meilleur résultat d’Arena se heurte à sa divulgation la plus faible : les lecteurs peuvent voir les chiffres principaux, mais ne peuvent pas encore reconstituer le test.

Les annonces de benchmarks d’IA arrivent souvent avant la publication d’artefacts d’évaluation complets. Cela peut être compréhensible lorsque les plateformes évoluent continuellement, mais cela limite les conclusions que les observateurs externes peuvent tirer.

Un résultat d’agent reproductible exige plus qu’une étiquette de modèle et un score agrégé. Les chercheurs ont besoin des définitions des tâches, des versions d’environnement, des prompts, des schémas d’outils, des paramètres d’échantillonnage et des règles appliquées aux échecs.

Ils ont également besoin de la fenêtre de comparaison exacte. Les classements d’agents peuvent évoluer avec l’arrivée de nouvelles conversations. Un instantané réalisé avant une hausse du trafic peut ne pas correspondre à la même page plusieurs jours plus tard.

Les résultats GPT-6 Sol Max d’Agent Arena présentent un problème supplémentaire d’identité. Le nom exact du modèle n’est pas établi dans le catalogue public des modèles OpenAI accessible aux développeurs.

Cela ne prouve pas que l’entrée est invalide. Arena peut tester une préversion, un endpoint privé, un alias interne ou une étiquette de configuration. Le nom peut également combiner un modèle de base avec un paramètre d’inférence.

Chaque explication entraîne des implications différentes. Une préversion privée montrerait une capacité future possible, mais les développeurs ne pourraient pas l’adopter immédiatement. Une étiquette de configuration signifierait que le résultat reflète un mode de fonctionnement particulier.

Un alias interne rendrait les comparaisons plus difficiles, car les lecteurs ne pourraient pas faire correspondre l’entrée à un identifiant d’API stable. Une étiquette attribuée par le benchmark obligerait Arena à expliquer son attribution.

L’absence d’OpenAI dans l’annonce compte également. Arena attribue l’entrée à OpenAI, mais les éléments fournis ne contiennent aucune publication ou note technique correspondante d’OpenAI.

L’interprétation la plus prudente est limitée. Arena indique avoir évalué un système étiqueté GPT-6 Sol (Max), et Arena rapporte les performances associées. Les informations publiques n’établissent pas encore l’identité commerciale du système.

Cette distinction évite aux lecteurs de transformer une ligne de classement en annonce de lancement. L’accès à un benchmark peut précéder la disponibilité générale. Il peut aussi concerner des variantes expérimentales qui ne seront jamais commercialisées sous le nom testé.

La reproductibilité a des conséquences pratiques qui dépassent la prudence académique. Une équipe d’ingénierie ne peut pas estimer le travail de migration sans connaître l’endpoint, le comportement du contexte, le protocole d’outils et les contraintes de débit.

Elle ne peut pas non plus vérifier si l’amélioration signalée résiste à sa propre charge de travail. Les agents de support client, d’ingénierie logicielle, de recherche et d’automatisation de navigateur échouent de manières différentes.

Le cadre AgentBench a illustré pourquoi l’évaluation des agents doit couvrir des environnements variés. Il a testé des modèles de langage sur des tâches exigeant interaction, planification et prise de décision plutôt que des réponses isolées.

Les évaluations en conditions réelles peuvent compléter les suites contrôlées. Elles révèlent des comportements utilisateurs et des modes d’échec inattendus que les tests fixes ne détectent pas.

Pourtant, le trafic réel n’élimine pas le besoin d’un reporting contrôlé. Les preuves les plus solides combinent les deux approches. Les sessions publiques peuvent révéler la demande, tandis que des tâches répétables permettent de vérifier si la différence observée persiste.

Arena peut combler une grande partie de l’écart actuel en publiant une fiche de modèle pour cette entrée. Ce document devrait identifier le fournisseur, le statut de l’endpoint, les dates d’évaluation, la configuration et le calcul du score.

D’ici là, l’affirmation de performance reste notable mais circonscrite. Le titre suggère un nouveau leader en efficacité. Les éléments disponibles établissent seulement qu’Arena en a fait état.

Plus de 4 000 sessions laissent encore d’importantes questions ouvertes

Un grand nombre de sessions réduit certaines formes de bruit, mais ne peut pas corriger un échantillon imprécis ou une métrique non définie.

Quatre mille observations peuvent étayer une comparaison fiable lorsque les tâches sont indépendantes, représentatives et notées de manière cohérente. Ces hypothèses ne peuvent pas être déduites du seul nombre.

Les sessions d’agents sont particulièrement difficiles à traiter comme des échantillons indépendants. Plusieurs sessions peuvent provenir d’un même utilisateur testant des prompts liés. Un modèle de tâche populaire peut apparaître de nombreuses fois avec de légères variations de formulation.

Les modèles peuvent aussi rencontrer des outils ou des sites web différents d’une session à l’autre. Les services externes évoluent, les pages échouent et les authentifications expirent. Deux demandes apparemment similaires peuvent s’exécuter dans des conditions très différentes.

L’évaluation doit distinguer les défaillances du modèle des défaillances de l’environnement. Un agent de navigation ne devrait pas perdre de crédit parce qu’un site cible était temporairement indisponible. À l’inverse, le benchmark ne devrait pas excuser des usages répétés et incorrects des outils en les attribuant à un problème d’infrastructure.

La politique de nouvelle tentative est une autre variable cachée. Un système peut se rétablir après une action échouée, tandis qu’un autre s’arrête immédiatement. Si le benchmark autorise une récupération illimitée, la persistance peut accroître le taux de réussite tout en augmentant le coût.

La notation doit déterminer si ce compromis est souhaitable. Un utilisateur peut préférer un agent plus lent qui termine correctement. Une entreprise opérant à grande échelle peut rejeter une consommation de ressources imprévisible.

Le coût médian aide à résumer une exécution typique, mais il dit peu de chose sur la variance. Un agent peut afficher une médiane acceptable tout en générant une longue traîne coûteuse de sessions qui bouclent ou restent bloquées.

Les étiquettes de complétion peuvent également masquer des différences de qualité. Un agent de voyage peut proposer un itinéraire sans vérifier les disponibilités. Un agent de programmation peut modifier la fonction demandée tout en cassant des tests sans rapport.

Les benchmarks ont besoin d’une vérification des résultats adaptée à la tâche. La préférence humaine est utile pour l’écriture et la recherche ouverte. Les tests exécutables fonctionnent mieux lorsque la justesse a un résultat objectif.

Les benchmarks d’ingénierie logicielle illustrent ce principe. La méthodologie SWE-bench évalue les modifications de dépôts selon des critères fondés sur les tests, même si ces résultats dépendent eux aussi fortement de l’échafaudage et de la conception de l’environnement.

Les agents généralistes font face à un défi de vérification plus large. Leurs résultats peuvent inclure des documents, des réservations, des feuilles de calcul, du code et des décisions. Aucun juge unique ne peut valider tous les types avec la même efficacité.

Les modèles évaluateurs introduisent leurs propres biais. Un juge peut récompenser des formulations familières, des réponses plus longues ou des résultats correspondant à ses préférences d’entraînement. Les évaluateurs humains peuvent être en désaccord ou négliger des erreurs cachées.

Arena devrait indiquer si le chiffre de 7,7 % provient de votes humains, de vérifications objectives des tâches, de juges modèles ou d’un mélange de ces approches. Les lecteurs ont également besoin de connaître l’incertitude entourant cette estimation.

Un intervalle de confiance montrerait si l’avance annoncée est stable. Sans lui, une différence de 7,7 % peut représenter une séparation nette ou une fluctuation ordinaire du classement.

La composition des tâches compte tout autant. Un modèle peut exceller dans la recherche et peiner lors de l’exécution de code. Un score agrégé peut masquer ces résultats opposés.

Un reporting par catégorie rendrait le résultat plus exploitable. Les développeurs pourraient alors comparer la charge de travail du benchmark avec le déploiement qu’ils envisagent.

Le benchmark devrait également communiquer le comportement en matière de refus et de sécurité. Un agent qui tente chaque tâche peut obtenir un bon score jusqu’à ce qu’il rencontre des demandes exigeant de la prudence, des contrôles de confidentialité ou une approbation explicite.

Ces questions n’invalident pas le résultat. Elles définissent les éléments de preuve encore nécessaires avant que ce résultat puisse guider un déploiement à forts enjeux.

Qui subit la pression si l’affirmation d’Arena se confirme

Un gain d’efficacité vérifié exercerait une pression sur les modèles d’agents premium, les opérateurs de benchmarks et les équipes qui sélectionnent encore les systèmes selon leur rang brut dans les classements.

La pression la plus directe pèserait sur les modèles qui obtiennent des scores élevés d’agent avec une inférence coûteuse. Un résultat de pointe laisse entendre que les acheteurs peuvent conserver une grande part des performances en utilisant moins de ressources.

Cette pression ne provoquerait pas nécessairement un changement immédiat de fournisseur. Les agents d’entreprise dépendent de la fiabilité, des contrôles de sécurité, de la disponibilité régionale et du support d’intégration.

Néanmoins, un concurrent crédible en matière de rapport coût-performance modifie les négociations. Les acheteurs peuvent demander si un modèle mieux classé apporte suffisamment de réussite supplémentaire pour justifier ses exigences opérationnelles.

Les opérateurs de benchmarks subissent également une pression. Agent Arena doit démontrer que sa frontière est stable, compréhensible et résistante aux tentatives d’optimisation abusive. Dans le cas contraire, les fournisseurs de modèles peuvent optimiser les métriques visibles sans améliorer les résultats pratiques.

Un classement public peut influencer les systèmes de routage et les listes restreintes d’approvisionnement. Cette influence crée une responsabilité de divulguer les changements importants apportés aux prompts, aux outils, à la notation et à la configuration des modèles.

Les développeurs qui construisent des routeurs de modèles ont également intérêt à y prêter attention. Un routeur affecte chaque tâche à un modèle adapté selon sa difficulté, sa rapidité, son risque ou son coût.

Un modèle classé sixième sur la frontière de Pareto peut être plus utile pour le routage qu’un modèle classé premier avec un profil de ressources bien plus lourd. Les tâches routinières peuvent être confiées au système efficient.

Les cas difficiles peuvent être escaladés vers un modèle plus capable. Cette structure peut réduire l’usage moyen de ressources sans obliger un seul système à traiter chaque demande.

Toutefois, le routage dépend de performances prévisibles par catégorie. Un classement agrégé ne peut pas indiquer à un routeur quelles tâches doivent être transférées vers quel modèle.

Les équipes ont besoin de signatures d’échec. Elles doivent savoir si le système éprouve des difficultés avec la planification à long horizon, la navigation, l’exécution de code, la mémoire ou les instructions ambiguës.

Le résultat remet également en question l’hypothèse selon laquelle des budgets d’inférence plus importants produisent toujours le meilleur agent déployable. Un raisonnement accru peut aider, mais uniquement lorsque ces étapes supplémentaires restent ciblées.

Des traces plus longues peuvent créer davantage d’occasions de dérive. Les agents peuvent répéter des recherches, perdre des contraintes ou agir sur des conclusions intermédiaires obsolètes.

Les travailleurs du savoir devraient s’y intéresser, car ces schémas d’échec affectent la charge de révision. Un agent rapide qui produit un travail plausible mais non étayé peut coûter plus de temps humain qu’un agent plus lent et plus fiable.

La mesure pertinente n’est donc pas seulement la complétion de la tâche. C’est la complétion vérifiée par unité d’effort total, y compris la vérification et la correction humaines.

C’est là que l’affirmation d’Arena pourrait devenir importante pour les flux de travail quotidiens. La recherche, la planification de projets et la production de documents bénéficient toutes d’agents qui préservent les preuves et rendent leur travail auditable.

Les utilisateurs peuvent déjà réduire les frictions de révision en conservant les sources dans une base de connaissances personnelle consultable. Toutefois, le modèle doit toujours relier chaque conclusion à la bonne source.

Un agent efficient doté d’une faible traçabilité des sources ne résoudrait pas ce problème. Il générerait simplement des conclusions non étayées à un coût mesuré inférieur.

Si le modèle d’Arena se comporte bien dans le suivi des preuves, l’utilisation contrainte des outils et la correction, le résultat dépasserait la compétition entre classements. Il indiquerait la voie vers des agents supervisés plus économiques.

Si le gain provient surtout de tâches courtes ou faciles à évaluer, son impact sera plus limité. Les systèmes premium conserveraient leur avantage sur les flux de travail complexes, où un seul échec peut annuler de nombreuses réussites moins coûteuses.

Ce qui doit se produire avant que le résultat ne change les décisions d’achat

Trois signaux détermineront si cette annonce devient un résultat de benchmark durable ou une affirmation éphémère dans un classement.

Le premier signal est une déclaration claire sur l’identité du système de la part d’Arena ou d’OpenAI. Le dossier public doit expliquer ce que désigne « GPT-6 Sol (Max) » et si les développeurs peuvent accéder au même système.

Cette clarification devrait inclure un identifiant de modèle stable. Elle devrait également distinguer le modèle sous-jacent du profil d’inférence utilisé pendant les tests.

Si Arena confirme un endpoint public reproductible, l’affirmation devient plus exploitable. Si l’étiquette désigne une configuration privée ou temporaire, le résultat reste avant tout indicatif.

Le deuxième signal est la publication de la méthodologie relative à l’amélioration de 7,7 %. Arena devrait définir la référence, la formule de notation, la conception de l’évaluation, la fenêtre d’échantillonnage et l’incertitude.

Elle devrait également expliquer comment le coût intervient dans le calcul de Pareto. Les jetons d’entrée, les jetons de sortie, les jetons de raisonnement, les appels d’outils, les nouvelles tentatives et les services externes peuvent tous affecter le total.

Une publication méthodologique renforcerait l’affirmation si des chercheurs indépendants peuvent reconstruire le classement. Des changements importants de score après divulgation affaibliraient l’interprétation initiale.

Le troisième signal est la réplication sur des charges de travail contrôlées. Des équipes indépendantes devraient tester le même modèle sur des tâches stables avec des outils, des budgets et des critères de réussite fixes.

Ces tests devraient inclure du travail à long horizon. Les catégories utiles comprennent la réparation de dépôts, la recherche multi-sources, les flux de navigation et la production de documents structurés.

La réplication n’exige pas que chaque benchmark produise le même classement. Des suites différentes mesurent des capacités différentes. La question importante est de savoir si l’avantage d’efficacité apparaît dans des environnements pertinents.

Les lecteurs devraient également surveiller la stabilité du classement. Une position de frontière qui survit plusieurs semaines de nouvelles sessions a davantage de poids qu’une brève apparition après le lancement.

Les mouvements à eux seuls ne prouveraient rien d’irrégulier. Les nouveaux modèles attirent souvent un mélange changeant de prompts, et de petits échantillons peuvent évoluer rapidement.

Arena devrait néanmoins conserver des instantanés datés. Les données historiques permettraient aux observateurs de distinguer les véritables changements de modèle de la dérive de l’évaluation.

Les résultats actuels de GPT-6 Sol Max sur Agent Arena devraient donc guider les questions, et non les achats. Ils identifient un système potentiellement efficient et révèlent les preuves dont les acheteurs ont encore besoin.

Les développeurs qui évaluent des agents peuvent utiliser cette annonce comme plan de test. Demandez si un candidat termine l’intégralité de la tâche, utilise les outils de manière responsable, cite les preuves et se remet des erreurs.

Mesurez ensuite l’ensemble du flux de travail. Incluez les tentatives infructueuses, la révision humaine, les corrections et les tâches qui exigent une escalade.

Ne supposez pas que le rang agrégé d’un modèle prédit ses performances sur des données privées. Menez des évaluations représentatives avec les autorisations et les outils prévus pour la production.

Les équipes devraient également conserver les résultats et les décisions des réviseurs. Un flux de travail IA structuré rend les comparaisons répétées plus utiles que les impressions informelles.

Arena a fourni un signal intrigant : un système étiqueté GPT-6 Sol (Max) aurait amélioré les performances nettes d’agent tout en conservant un profil de ressources compétitif. Le résultat mérite l’attention, car il présente la qualité des agents comme un problème d’efficacité.

Il n’établit pas encore un nouveau produit OpenAI, un gain universel de capacités de 7,7 % ou une frontière reproductible. Ces conclusions exigent une identification du modèle, des méthodes transparentes et des tests indépendants.

La prochaine étape revient à Arena et OpenAI. S’ils publient suffisamment de détails pour permettre à d’autres de reproduire le résultat, le benchmark pourrait influencer le routage des agents et la sélection des modèles. Si la divulgation reste limitée, votre équipe devrait-elle faire confiance au classement ou construire une évaluation contrôlée autour du travail qui compte réellement ?

 
 

Commencez pour Gratuit

Un premier assistant IA local avec gestion des connaissances personnelles

Pour une meilleure expérience IA,

remio ne supporte que Windows 10+ (x64) et M-Chip Macs actuellement.

Votre partenaire IA au travail
Faites-en plus avec remio

Planifiez. Créez. Livrez.
Tout au même endroit.

bottom of page