top of page

DeepSeek Pro paraît brillant en mode Minimal. C’est aussi le problème

DeepSeek pro est devenu généralement disponible le 13 août, mais son comportement le plus convaincant signalé n’est apparu qu’après que des utilisateurs ont recréé une configuration d’agent particulièrement spécifique.

Cette configuration est le préréglage Minimal de DeepSeek Harness, le nouvel environnement d’exécution de l’entreprise pour les agents d’IA utilisant des outils. Des tests de la communauté affirment que ce préréglage transforme un modèle de programmation irrégulier en quelque chose de bien plus proche de la présentation des benchmarks de DeepSeek.

Cette amélioration n’a pas été mesurée indépendamment sur un ensemble contrôlé et diversifié de tâches. Pourtant, la controverse importe même si les démonstrations les plus spectaculaires ne résistent pas à la réplication. Les propres documents de DeepSeek associent les performances des agents à des prompts, outils, paramètres de raisonnement et environnements d’exécution spécifiques.

La vraie question est donc plus étroite que de savoir si DeepSeek-V4-Pro est « bon » ou « mauvais ». Il s’agit de savoir si un modèle doit recevoir tout le crédit de capacités qui ne semblent fiables qu’au sein d’un harness aligné sur son entraînement.

Anthropic, OpenAI et d’autres fournisseurs de modèles font face au même enjeu lorsque leurs modèles opèrent via Claude Code, Codex ou un autre environnement d’exécution d’agents. DeepSeek a simplement rendu cette dépendance inhabituellement visible.

La disponibilité générale de DeepSeek Pro est arrivée avec un différend sur les performances des agents

La sortie du 13 août a changé le modèle disponible, mais elle n’a pas tranché quel système était réellement évalué.

DeepSeek a officiellement lancé la version en disponibilité générale de V4-Pro dans son application, sur son site web et via son API le 13 août 2026. La sortie GA de l’entreprise mettait en avant des améliorations pour les agents, trois niveaux d’effort de raisonnement et une prise en charge native de l’API Responses d’OpenAI.

L’effort faible vise les tâches simples. L’effort élevé prend en charge les flux de travail habituels des agents, tandis que l’effort maximal alloue davantage de raisonnement aux tâches complexes. La sortie a également ajouté un parcours de configuration orienté Codex sans modifier le nom du modèle API V4-Pro.

Cette annonce a suivi l’aperçu du 24 avril de la famille V4 élargie. DeepSeek a présenté V4-Pro comme un modèle mixture-of-experts comptant 1,6 billion de paramètres au total, dont 49 milliards actifs pendant l’inférence.

Un modèle mixture-of-experts achemine chaque token à travers une partie seulement du réseau. Cette conception peut accroître la capacité totale sans activer tous les paramètres pour chaque requête.

Le modèle prend en charge une fenêtre de contexte d’un million de tokens. DeepSeek affirme qu’il a été préentraîné sur plus de 32 billions de tokens, puis soumis à de l’apprentissage supervisé, de l’apprentissage par renforcement et de la distillation on-policy.

Ces spécifications n’ont pas déclenché la controverse. Les frictions ont commencé lorsque les premiers utilisateurs ont comparé les affirmations de DeepSeek sur les benchmarks d’agents à leurs propres résultats après le déploiement GA.

Certains rapports de la communauté décrivaient des traces de raisonnement courtes, une planification faible et une utilisation incohérente des outils. Un témoignage largement partagé a qualifié la sortie de décevante et suggéré qu’un problème de déploiement ou de configuration côté serveur empêchait le modèle d’exprimer son comportement attendu.

Ces observations étaient anecdotiques. Elles provenaient de prompts, comptes, outils, systèmes d’exploitation et chemins de requête différents. Elles ne permettent pas d’établir un niveau de performance général.

Puis une deuxième vague de rapports est apparue. Des utilisateurs ont déclaré que le même modèle devenait nettement plus compétent lorsqu’il était exécuté via DeepSeek Harness Minimal sous Linux ou Windows Subsystem for Linux.

Un test communautaire a affirmé que plusieurs utilisateurs avaient reproduit l’amélioration. L’auteur jugeait néanmoins le modèle inférieur à un modèle de comparaison de premier plan et critiquait son sens esthétique visuel.

Cette réserve est importante. L’affirmation n’était pas que le mode Minimal corrigeait toutes les faiblesses. Elle était que ce préréglage révélait un niveau de comportement en programmation absent de nombreuses sessions ordinaires.

Une analyse de dépôt distincte a relié le mode Minimal à un commit du 10 août. Selon cette analyse, le commit alignait le préréglage sur la composition d’agent utilisée pendant l’apprentissage par renforcement.

L’analyse décrivait un environnement restreint comprenant un prompt système sobre, un accès shell persistant, un éditeur de fichiers désigné et une politique spécifique de compression du contexte. Elle indiquait également que le préréglage excluait des descriptions d’outils sans rapport susceptibles de polluer le prompt système.

Cette interprétation reste une lecture communautaire de code et de documentation publics. DeepSeek n’a pas publié d’éléments prouvant que V4-Pro échoue hors du mode Minimal ni qu’il a été délibérément optimisé pour un préréglage public unique.

La séquence reste toutefois concrète. DeepSeek a lancé V4-Pro GA le 13 août, publié son harness en aperçu développeur et exposé un environnement étroitement lié à l’évaluation des agents.

La tension vient de la façon dont ces éléments s’articulent. Si le meilleur comportement du modèle requiert cet environnement, les utilisateurs achètent un système modèle-harness plutôt qu’un endpoint de modèle interchangeable.

Pourquoi DeepSeek Harness change la signification d’un benchmark

Un benchmark d’agent mesure ensemble le modèle, le prompt, les outils, la politique de mémoire et l’environnement d’exécution, même lorsque le classement n’affiche qu’un nom de modèle.

Un harness d’agent est la couche logicielle qui permet à un modèle de langage d’inspecter des fichiers, d’exécuter des commandes, d’appeler des outils, de conserver un état et de décider de la suite. Il transforme la prédiction de texte en boucle opérationnelle.

Cette boucle effectue de nombreux choix déterminants. Elle formate le prompt système, définit les schémas d’outils, renvoie les erreurs, tronque l’historique, résume le travail précédent et décide quand le modèle reçoit un nouveau tour.

De petits changements peuvent produire de grandes différences de performance. Un modèle peut comprendre une tâche mais échouer parce que la description d’un outil est ambiguë. Il peut modifier le mauvais fichier parce que la compression du contexte a supprimé une contrainte antérieure.

Un modèle peut également gaspiller son budget de raisonnement après avoir reçu des messages d’état bruyants. Un autre harness peut éviter le même échec en gardant le prompt court et en préservant le bon état.

Le dépôt officiel de DeepSeek décrit DeepSeek Harness comme un environnement d’exécution open source pour agents où tout est un plugin. Le projet est en aperçu développeur et avertit que des changements rompant la compatibilité surviendront.

Son architecture de plugins permet d’échanger ou de recomposer des capacités plutôt que d’enfermer les utilisateurs dans une conception d’agent fixe. Cette flexibilité rend le projet utile, mais elle complique aussi toute affirmation sur les « performances de DeepSeek-V4-Pro ».

Quels plugins étaient actifs ? Quel préréglage les a chargés ? Quel prompt système était utilisé ? Comment l’historique de conversation était-il compressé ? Le shell restait-il actif entre les tours ?

Ces détails ne relèvent pas d’une simple mise en œuvre. Ils façonnent les informations et les actions disponibles pour le modèle à chaque étape.

La documentation des modèles de DeepSeek rend cette dépendance au système visible. L’entreprise recommande le raisonnement maximal pour les tâches d’agents exigeantes et au moins 384 000 tokens de contexte pour ce mode.

Sa fiche de modèle rapporte aussi de grands écarts entre les paramètres de raisonnement. Sur Terminal Bench 2.0, DeepSeek indique V4-Pro à 59,1 en mode sans raisonnement, 63,3 avec effort élevé et 67,9 avec effort maximal.

Sur SWE-bench Verified, la progression rapportée est de 73,6, 79,4 et 80,6. Sur BrowseComp, les modes élevé et maximal obtiennent 80,4 et 83,4, tandis qu’aucun résultat sans raisonnement n’est indiqué.

Il s’agit des propres évaluations de DeepSeek, et non de réplications indépendantes. Elles démontrent toutefois la position de l’entreprise selon laquelle la configuration d’inférence modifie matériellement la capacité mesurée.

Le rapport technique va plus loin en expliquant l’environnement d’évaluation. Pour les tâches d’agents de programmation, DeepSeek a utilisé une collection minimale d’outils, incluant l’accès shell et l’édition de fichiers.

Pour les tâches d’agents de recherche, l’entreprise a utilisé un harness interne. Cela signifie que les scores d’agents rapportés n’ont jamais représenté un modèle nu répondant à des prompts isolés.

Il n’y a rien d’intrinsèquement inapproprié à cela. Les modèles d’agents ont besoin d’outils, et un benchmark doit fournir un environnement d’exécution. Chaque fournisseur en choisit un.

Le problème commence lorsqu’un score spécifique à un harness devient un raccourci pour désigner l’aptitude générale d’un modèle à travers les produits. Un résultat généré avec un shell persistant et une compression alignée sur l’entraînement ne se transfère pas automatiquement à une autre extension d’éditeur.

Un développeur utilisant un client compatible Anthropic peut envoyer des résultats d’outils structurés différemment. Une plateforme d’entreprise peut injecter des instructions de sécurité, des messages d’audit, des résultats de récupération et des étapes d’approbation.

Ces ajouts peuvent être nécessaires en production. Ils peuvent aussi éloigner considérablement le prompt de l’environnement utilisé pendant l’apprentissage par renforcement.

Le mode Minimal fait donc plus qu’améliorer une démonstration. Il expose la quantité d’infrastructure cachée derrière un score de modèle.

C’est pourquoi le différend autour de DeepSeek pro compte au-delà d’une seule sortie. La fiche de modèle nomme DeepSeek-V4-Pro, mais l’unité opérationnelle dans une tâche d’agent est DeepSeek-V4-Pro plus une configuration de harness.

Une fois cette distinction explicitée, les classements doivent rapporter les deux éléments.

L’alignement sur l’entraînement n’est pas automatiquement du surapprentissage

Les éléments publics étayent une sensibilité à la configuration, mais ils ne prouvent pas encore que DeepSeek-V4-Pro a surappris un seul harness.

Le surapprentissage a une définition précise. Un système surapprend lorsqu’il apprend des motifs qui fonctionnent bien sur sa distribution d’entraînement mais ne se généralisent pas à des entrées significativement différentes.

Dans ce cas, la distribution d’entraînement suspectée comprend plus que des problèmes de programmation. Elle peut aussi inclure la structure du prompt de l’agent, les noms d’outils, les formats de réponse, le comportement du shell et la politique de gestion du contexte.

Si l’apprentissage par renforcement récompensait à répétition le succès au sein d’une composition donnée, le modèle s’adapterait rationnellement à cette composition. Une sémantique d’outils cohérente réduit l’incertitude et rend le signal de récompense plus facile à apprendre.

Cette adaptation peut être bénéfique. Les humains sont eux aussi plus performants avec des interfaces familières, des outils fiables et des flux de travail stables.

Un modèle entraîné à utiliser un éditeur de fichiers prévisible devrait surpasser un modèle contraint d’inférer le comportement d’un éditeur non documenté. Qualifier chaque gain de ce type de « surapprentissage » rendrait le terme presque inutile.

L’accusation plus forte exige un schéma d’échec plus large. V4-Pro devrait montrer une dégradation inhabituellement forte lorsque des détails environnementaux non pertinents changent, alors même que la tâche sous-jacente reste équivalente.

Par exemple, des chercheurs pourraient renommer les outils tout en préservant leurs descriptions et leur comportement. Ils pourraient réorganiser les schémas d’outils, varier des formulations inoffensives, remplacer l’éditeur par une interface équivalente ou modifier la compression sans supprimer les faits nécessaires.

Un agent généraliste devrait tolérer bon nombre de ces changements. Un modèle lié à un harness perdrait une part substantielle de ses performances malgré des capacités pratiques identiques.

Aucune étude publique n’a encore établi ce schéma sur un nombre suffisant de tâches et d’essais aléatoires. Des captures d’écran, vidéos et sessions personnelles de programmation peuvent identifier une question de recherche, mais elles ne peuvent pas mesurer la généralisation.

L’affirmation selon laquelle « Minimal déverrouille le vrai modèle » possède également plusieurs explications alternatives.

Premièrement, le mode Minimal peut éliminer l’encombrement du prompt. De longs manuels d’outils et des instructions qui se chevauchent dégradent souvent le comportement des agents, en particulier au fil de sessions prolongées.

Deuxièmement, il peut préserver l’état plus efficacement. Un shell persistant permet à un modèle de conserver les répertoires de travail, l’état de l’environnement et les processus en cours sans avoir à les reconstruire.

Troisièmement, le préréglage peut exposer les interfaces d’outils utilisées pendant le post-entraînement. Cela crée un alignement de distribution, mais pas nécessairement une mémorisation des benchmarks.

Quatrièmement, les premières requêtes en GA ont pu rencontrer des variations de déploiement. Des signalements de la communauté ont évoqué un raisonnement inhabituellement bref et de possibles changements de routage, bien que DeepSeek n’ait pas confirmé de retour d’urgence à la version précédente.

Cinquièmement, les utilisateurs peuvent sélectionner et diffuser les exécutions réussies les plus frappantes. Les démonstrations positives se propagent rapidement, tandis que les réplications échouées reçoivent moins d’attention.

Le biais inverse existe également. Des utilisateurs déçus peuvent généraliser à partir d’une seule session défaillante, surtout après avoir lu des affirmations sur les benchmarks qui ont fait monter les attentes.

Les résultats officiels de DeepSeek laissent effectivement place au scepticisme. L’entreprise indique que V4-Pro Max résout 80,6 % de SWE-bench Verified et obtient 67,9 sur Terminal Bench 2.0.

Elle fait également état d’un classement Codeforces de 3206 et d’un taux de réussite de 93,5 % sur LiveCodeBench. Ces chiffres présentent le modèle comme un système de programmation haut de gamme dans le cadre d’évaluation annoncé.

Une évaluation indépendante fournit un point d’ancrage plus utile. Le Center for AI Standards and Innovation du gouvernement américain a évalué le modèle en préversion en utilisant les paramètres recommandés par les développeurs.

Dans son évaluation indépendante, CAISI a exécuté DeepSeek V4 sur des GPU H200 et B200. L’organisme a conservé le raisonnement interne et utilisé les valeurs recommandées pour le contexte, l’échantillonnage, les prompts système et la réflexion maximale.

CAISI a également reproduit le résultat GPQA-Diamond auto-déclaré par DeepSeek, réduisant la probabilité d’une erreur élémentaire de configuration d’inférence sur ce benchmark. Pour les tests d’agents, en revanche, il a utilisé l’agent ReAct intégré d’Inspect plutôt que DeepSeek Harness Minimal.

C’est précisément cette différence que les analyses futures devraient examiner. Un modèle peut égaler un benchmark statique de raisonnement tout en restant très sensible à la boucle d’agent qui l’entoure.

Les éléments disponibles étayent donc une conclusion prudente. DeepSeek-V4-Pro est sensible à son environnement, et DeepSeek a optimisé son flux de travail d’agent autour de compositions connues.

Les éléments ne permettent pas d’établir que DeepSeek a mémorisé des tâches de benchmarks publiques. Ils ne prouvent pas non plus une manipulation intentionnelle.

Qualifier aujourd’hui le modèle de surajusté va au-delà des données disponibles. Qualifier le harness de non pertinent ignore ce que montrent à la fois la documentation de DeepSeek et les tests de la communauté.

Le véritable enjeu oppose les agents alignés sur l’entraînement aux modèles portables

Le défi immédiat de DeepSeek n’est pas de battre un modèle concurrent. Il est de prouver que ses capacités survivent en dehors de son environnement d’exécution privilégié.

Les fournisseurs de modèles optimisent de plus en plus des systèmes d’agents complets. Le modèle reste important, mais l’orchestration détermine si son raisonnement produit un artefact utile.

OpenAI associe ses modèles à Codex. Anthropic développe ses modèles parallèlement à Claude Code. Google contrôle le comportement des modèles dans ses produits de programmation Gemini, tandis que des environnements indépendants ajoutent leurs propres prompts et outils.

DeepSeek dispose désormais de la même option stratégique. L’entreprise peut concevoir conjointement V4-Pro et DeepSeek Harness, mesurer les échecs de bout en bout et utiliser ces traces pour l’apprentissage par renforcement.

Cette approche peut produire de meilleurs résultats concrets que de traiter l’API comme un générateur de texte isolé. Elle peut également accélérer le débogage, car l’entreprise contrôle les deux côtés de l’interaction.

Un harness stable offre aux équipes d’entraînement un environnement reproductible. Elles peuvent récompenser l’utilisation correcte des commandes, valider les modifications de fichiers, pénaliser le travail inachevé et tester des sessions de longue durée.

Le compromis est la portabilité. Les entreprises déploient rarement un modèle dans l’environnement de référence intact du fournisseur.

Elles ajoutent des contrôles d’autorisation, de la recherche privée, de la journalisation, des filtres de politique, des validations humaines et des outils propres à l’organisation. Les développeurs apportent leurs éditeurs existants, leurs agents en ligne de commande et leurs frameworks d’automatisation.

Chaque ajout modifie la distribution des interactions. Un modèle qui dépend d’un prompt système minimaliste peut régresser lorsqu’une politique de sécurité d’entreprise ajoute plusieurs milliers de tokens.

Un modèle entraîné autour d’un protocole de modification de fichiers peut mal gérer les messages d’erreur d’un autre protocole. Une stratégie de compactage efficace pour la programmation peut écarter des éléments de preuve nécessaires dans des tâches juridiques ou analytiques.

Une capacité portable signifie conserver les performances malgré ces variations. Elle n’exige pas des scores identiques partout, mais requiert une dégradation progressive.

La capacité alignée sur l’entraînement propose une promesse différente. Le fournisseur propose un système recommandé avec des paramètres connus, et les utilisateurs obtiennent les performances annoncées en adoptant l’ensemble de la pile.

Aucune des deux approches n’est universellement supérieure. Un système étroitement intégré peut offrir de meilleurs résultats aux équipes prêtes à se standardiser autour de lui.

Un modèle portable donne davantage de liberté aux créateurs de plateformes. Il facilite également la comparaison des résultats de benchmarks entre environnements d’exécution.

Le message actuel de DeepSeek tente de revendiquer les deux avantages. V4-Pro est disponible via plusieurs formats d’API et présenté comme compatible avec les principaux produits d’agents.

Dans le même temps, son comportement rapporté le plus performant semble étroitement lié au raisonnement maximal et à une composition de harness spécialisée. Cet écart met sous pression l’affirmation de portabilité.

L’annonce officielle de la préversion indiquait que DeepSeek avait optimisé V4 pour Claude Code, OpenClaw, OpenCode et d’autres produits d’agents. Elle indiquait également que l’entreprise utilisait V4 en interne pour la programmation agentique.

Ces déclarations impliquent une adaptation plus large qu’un seul préréglage Minimal. DeepSeek peut les étayer en publiant des résultats obtenus dans plusieurs environnements indépendants avec des budgets équivalents.

La comparaison doit contrôler davantage que le score final. Les chercheurs devraient indiquer l’utilisation de tokens, le temps d’exécution, le taux d’achèvement, les erreurs d’outils, les nouvelles tentatives et les catégories d’échec.

Ils devraient également séparer les échecs du modèle de ceux du harness. Si un éditeur rejette un correctif mal formé, la trace devrait montrer si le schéma, l’analyseur ou le modèle a causé le défaut.

Ce niveau de reporting améliorerait l’ensemble du marché des agents. Les classements actuels compressent souvent un système complexe en un seul pourcentage à côté d’un nom de modèle.

Cette présentation encourage les acheteurs à comparer des endpoints de modèles tout en ignorant l’orchestration. Elle permet également aux fournisseurs de choisir des harnesses favorables sans montrer à quel point leurs résultats y sont sensibles.

DeepSeek Harness pourrait aider à résoudre ce problème si l’entreprise utilise sa conception par plugins pour réaliser des ablations contrôlées. L’équipe peut remplacer un composant à la fois et publier les changements de score qui en résultent.

Les tests d’ablation retirent ou modifient un élément afin de mesurer sa contribution. Ici, ils pourraient quantifier la valeur d’un état shell persistant, d’une politique de compactage, du nommage des outils ou de la longueur du prompt système.

Si le mode Minimal l’emporte parce qu’il supprime des instructions non pertinentes, d’autres développeurs de harnesses pourront tirer parti de cette leçon. S’il l’emporte parce que le modèle attend des tokens exacts issus de l’entraînement, les préoccupations de portabilité se renforceront.

Dans les deux cas, le résultat serait plus instructif qu’une nouvelle démonstration. Le débat exige des mesures, non un concours entre extraits enthousiastes et publications frustrées.

Ce qui confirmerait ou affaiblirait la préoccupation autour de DeepSeek Pro

Trois signaux observables peuvent déterminer si le mode Minimal est une configuration de référence pertinente ou une dépendance de performance.

Le premier signal est une évaluation contrôlée, sur plusieurs harnesses, du modèle 0813. Elle devrait exécuter des tâches identiques via DeepSeek Harness Minimal, son préréglage standard et au moins deux environnements d’agents indépendants.

Chaque configuration doit utiliser le même niveau de raisonnement, le même budget de tokens, la même politique d’échantillonnage, les mêmes capacités d’outils et la même marge de nouvelles tentatives. Les évaluateurs devraient effectuer plusieurs essais, car les résultats des agents varient d’une exécution à l’autre.

Un important avantage de Minimal renforcerait la préoccupation liée à la dépendance de configuration. Des résultats similaires entre environnements équivalents affaibliraient la théorie du surajustement et suggéreraient que les premiers échecs provenaient de problèmes de configuration ou de déploiement.

Le deuxième signal est la résilience face à des modifications inoffensives de l’interface. Les évaluateurs devraient renommer les outils, réordonner les schémas, reformuler les instructions et remplacer les éditeurs par des équivalents fonctionnels.

Les performances devraient rester globalement stables lorsque les informations et les actions disponibles ne changent pas. Une forte baisse montrerait que le modèle dépend de caractéristiques de surface plutôt que d’une compréhension générale des outils.

Ce test importe davantage que la comparaison d’un harness de fournisseur avec un autre. Des produits différents introduisent simultanément de nombreuses variables, ce qui rend difficile l’isolement de la cause d’une variation de score.

Le troisième signal est la transparence de DeepSeek elle-même. L’entreprise devrait publier la composition exacte de l’agent derrière chaque benchmark phare, y compris les prompts, les schémas d’outils, les règles de compactage et les paramètres d’inférence.

Elle devrait également distinguer le modèle en préversion du checkpoint GA du 13 août. Sans résultats versionnés, les utilisateurs ne peuvent pas savoir si un ancien score s’applique à l’endpoint qu’ils utilisent.

DeepSeek n’a pas besoin de révéler des données d’entraînement privées pour offrir cette transparence. Des scripts d’évaluation reproductibles et des configurations d’exécution complètes répondraient à la question centrale.

Des chercheurs indépendants pourraient alors tester si les gains annoncés se maintiennent sur d’autres dépôts, langages, longueurs de tâches et contraintes de sécurité. Les acheteurs en entreprise pourraient déterminer si l’adoption du harness de référence convient à leurs systèmes.

Pour les développeurs, la leçon pratique est déjà claire. N’évaluez pas DeepSeek pro dans une seule fenêtre de chat, et ne considérez pas une seule réussite en mode Minimal comme un résultat universel.

Testez la paire modèle-harness exacte qui passera en production. Consignez les paramètres de raisonnement, la politique de contexte, les définitions d’outils, les nouvelles tentatives et l’achèvement des tâches, plutôt que de juger uniquement le texte final.

Pour les éditeurs de benchmarks, présentez les configurations comme des entrées de premier ordre. « DeepSeek-V4-Pro avec DSH Minimal » est plus honnête qu’une ligne libellée uniquement « DeepSeek-V4-Pro ».

Pour DeepSeek, l’opportunité dépasse la défense d’une seule version. L’entreprise peut transformer cette controverse en une norme plus claire pour l’évaluation des systèmes d’agents.

Le meilleur résultat ne serait pas de prouver que le mode Minimal fait paraître V4-Pro exceptionnel. Ce serait de montrer que le modèle reste utile lorsque de vraies organisations remplacent Minimal par leurs propres environnements complexes.

Tant que ces résultats ne seront pas disponibles, le « surajustement » restera un diagnostic non prouvé. La dépendance de configuration est la préoccupation établie, et elle est déjà suffisamment importante à elle seule.

Si vous testez la version 0813, exécutez la même tâche de dépôt avec au moins deux harnesses et répétez chaque exécution. Conservez les traces, normalisez les budgets et publiez les échecs aux côtés des réussites. Ces éléments permettront de déterminer si DeepSeek pro a appris un comportement d’agent transférable ou un flux de travail inhabituellement familier.

 
 

Commencez pour Gratuit

Un premier assistant IA local avec gestion des connaissances personnelles

Pour une meilleure expérience IA,

remio ne supporte que Windows 10+ (x64) et M-Chip Macs actuellement.

Ajouter une barre de recherche dans votre cerveau

Juste Demandez-remio

Souviens-toi de tout

Ne rien organiser

bottom of page