top of page

Le modèle du monde Pokémon de stmonty fonctionne en local, mais la planification à long terme reste le véritable test

1 oct.
15 min de lecture

Le développeur stmonty a entraîné un modèle du monde Pokémon de 12,5 millions de paramètres sur une RTX 3080 Ti, puis l’a utilisé pour choisir un starter dans Pokémon Red. Le modèle n’a reçu ni les règles du jeu, ni une carte, ni une récompense pour avoir obtenu un Pokémon. Il a appris en prédisant ce qui se produirait après chaque pression de bouton.

Ce résultat pourrait sembler n’être qu’un nouvel exemple dans la collection grandissante de démonstrations d’IA jouant aux jeux vidéo. Pourtant, l’enjeu intéressant n’est pas de savoir si une IA peut accomplir une séquence familière dans un jeu. Des modèles de langage plus vastes et des systèmes classiques d’apprentissage par renforcement se sont déjà attaqués à des défis Pokémon bien plus larges.

Le modèle du monde Pokémon de stmonty teste une proposition plus restreinte. Un petit modèle prédictif peut-il apprendre des dynamiques environnementales utiles à partir de captures d’écran, planifier dans sa représentation apprise et fonctionner sur du matériel accessible à un développeur indépendant ?

La réponse est oui, avec des réserves. Après un affinage, le modèle a obtenu un starter dans 52 des 100 tentatives planifiées. Les séquences de boutons aléatoires n’ont enregistré aucun succès, tandis que le même processus de recherche associé à un prédicteur non entraîné n’a réussi qu’une fois.

Ces chiffres montrent que le modèle appris a apporté des informations utiles. Ils définissent également les limites du projet. La position de départ avait été soigneusement choisie, le plan ne couvrait que 14 pressions de boutons, et appuyer répétitivement sur A constituait déjà une solution valide.

Le projet apporte donc des éléments en faveur d’expérimentations accessibles sur les modèles du monde, et non la preuve d’un joueur Pokémon généraliste. Sa leçon la plus importante provient de l’écart entre prédire une action et maintenir une prédiction utile sur de nombreuses actions.

Cet écart inscrit l’expérience dans une compétition plus large entre deux voies de l’IA. La première utilise de grands modèles polyvalents dotés de connaissances linguistiques, d’outils externes, de mémoire et d’importantes ressources de calcul. L’autre construit des systèmes plus petits autour des dynamiques d’un environnement spécifique.

Le projet de stmonty ne tranche pas ce débat. Il montre toutefois pourquoi les modèles prédictifs compacts restent intéressants, notamment lorsque les développeurs ont besoin d’un entraînement local, d’expérimentations rapides et d’un contrôle direct sur les données.

Ce que le modèle du monde Pokémon de stmonty a réellement fait

Le modèle a appris suffisamment de dynamiques du jeu pour orienter un court plan, mais il n’a pas appris à jouer à Pokémon Red du début à la fin.

stmonty avait d’abord envisagé un objectif bien plus vaste. La séquence proposée consistait à atteindre le laboratoire du Professeur Oak, terminer le dialogue, choisir un starter, quitter le bâtiment et vaincre le rival.

Ce plan s’est rapidement révélé trop ambitieux pour une première expérience. La tâche a été réduite à un état de sauvegarde dans le laboratoire d’Oak, où le personnage pouvait obtenir Bulbasaur, Charmander ou Squirtle.

Depuis cette position, appuyer 12 fois sur A suffisait. Le modèle restait toutefois libre d’utiliser les commandes directionnelles, d’annuler le dialogue avec B ou de suivre une autre séquence valide. Sa mission consistait à identifier un plan de 14 actions rapprochant l’état prédit du jeu d’un exemple de sélection réussie d’un starter.

Le développeur a enregistré 42 382 images en niveaux de gris depuis un émulateur Pokémon Red. Ces images ont formé 1 009 courtes trajectoires contenant une capture d’écran, une pression de bouton et la capture d’écran suivante.

Certaines trajectoires suivaient des itinéraires scriptés. D’autres ajoutaient du bruit ou davantage de mouvements aléatoires. Ce mélange était important, car un planificateur explore à la fois des séquences d’actions sensées et médiocres.

Un jeu de données ne contenant que des démonstrations parfaites pourrait associer A au progrès tout en n’apprenant presque rien sur l’annulation, les déplacements bloqués ou les entrées non pertinentes. Les trajectoires plus désordonnées ont exposé le modèle à une plus grande part du comportement de l’environnement local.

Le système résultant reposait sur LeWorldModel, une architecture prédictive à plongements conjoints, ou JEPA. Une JEPA prédit l’évolution d’une représentation abstraite au lieu de recréer chaque pixel de l’image suivante.

Cette distinction permet de concentrer la cible d’entraînement sur une structure utile. L’encodeur transforme une capture d’écran en embedding, une représentation numérique de l’état observé. Un prédicteur estime ensuite le prochain embedding à partir de la représentation actuelle et de l’action choisie.

Le compte rendu du projet indique que le réseau final comptait environ 12,5 millions de paramètres et a été entraîné localement sur une RTX 3080 Ti. L’implémentation est également disponible dans le dépôt lePokeRed.

Après l’entraînement, stmonty a vérifié si la représentation conservait des informations sur l’objectif. Un petit classificateur pouvait déterminer si l’équipe du joueur contenait un Pokémon alors que l’encodeur sous-jacent restait gelé.

Le prédicteur a également obtenu de meilleurs résultats qu’une référence qui copiait l’embedding actuel. Lui fournir la mauvaise action dégradait sa prédiction, ce qui suggère qu’il avait appris une certaine relation entre les commandes et les changements dans le jeu.

Ces tests n’établissaient pas une planification fiable. Ils montraient seulement que le modèle représentait un état pertinent et réagissait de manière significative au bouton sélectionné.

La véritable évaluation est venue lorsque la séquence du planificateur a été exécutée dans l’émulateur. Après l’affinage par rollout, une séquence proposée a sélectionné Squirtle et fait passer le nombre de Pokémon dans l’équipe de zéro à un.

Sur 100 recherches utilisant différentes graines aléatoires, 52 plans ont obtenu un starter. Ce résultat étaye une affirmation limitée : la représentation du modèle a aidé un planificateur à trouver des actions utiles depuis un point de départ fixe.

Il ne permet pas d’affirmer plus largement que le modèle a maîtrisé Pokémon Red de manière autonome. stmonty a explicitement reconnu cet écart, notant dans la discussion de la communauté que simplement agrandir le modèle actuel ne résoudrait pas les nombreux objectifs intermédiaires du jeu.

Comment le modèle a appris les commandes en prédisant ce qui se produisait ensuite

Le mécanisme central reposait sur une prédiction sans récompenses liées à la tâche, suivie d’une planification vers des exemples du résultat souhaité.

Les données d’entraînement n’étiquetaient jamais une trajectoire comme un succès et ne récompensaient pas le modèle pour l’obtention d’un Pokémon. Lors de son entraînement initial, le système cherchait uniquement à prédire le prochain état intégré.

Si l’image actuelle montrait une boîte de dialogue et que l’action enregistrée était A, le prédicteur apprenait quelle représentation suivait généralement cette combinaison. Si le personnage faisait face à un mur, il pouvait apprendre qu’une entrée directionnelle produisait peu de changements visibles.

Cette configuration sépare l’apprentissage de l’environnement de la sélection de l’objectif. Le modèle apprend d’abord comment les observations tendent à changer après des actions. Plus tard, un planificateur utilise ce mécanisme prédictif pour rechercher un résultat particulier.

Cette séparation est importante, car les développeurs peuvent théoriquement réutiliser un même modèle appris de l’environnement pour plusieurs objectifs. Une nouvelle tâche nécessiterait de nouveaux exemples d’objectifs ou une nouvelle logique d’évaluation, mais pas nécessairement une reconstruction complète de l’environnement.

L’architecture présentait un risque sérieux de défaillance. Un encodeur et un prédicteur entraînés ensemble peuvent réduire leur perte en associant chaque image à la même représentation. Le prédicteur devient alors parfaitement cohérent sans préserver quoi que ce soit d’utile.

Ce problème est appelé effondrement latent. La conception de LeWorldModel y répond avec SIGReg, un régularisateur qui pousse les représentations apprises vers une forme gaussienne distribuée.

L’article LeWorldModel présente cette approche comme un moyen d’entraîner une JEPA de bout en bout à partir de pixels bruts. Ses auteurs comprennent Lucas Maes, Quentin Le Lidec, Damien Scieur, Yann LeCun et Randall Balestriero.

LeWorldModel utilise une perte de prédiction du prochain embedding parallèlement au régularisateur. Son code de recherche officiel fournit des points de contrôle, des références de données et une implémentation de la méthode plus générale.

stmonty a adapté cette orientation de recherche à Pokémon Red. Une fois la représentation entraînée, le développeur a fourni au planificateur des embeddings issus de sélections réussies de Bulbasaur, Charmander et Squirtle.

Ces embeddings d’objectif décrivaient l’apparence du succès sans spécifier le bon itinéraire. Le système imaginait ensuite comment des séquences candidates de pressions de boutons modifieraient l’état actuel.

La recherche utilisait la méthode de l’entropie croisée, un processus d’échantillonnage qui se concentre progressivement sur les meilleurs candidats. Chaque cycle générait 512 plans complets contenant 14 actions.

Le planificateur comparait les états prédits aux trois embeddings d’objectif. Il conservait les 64 plans présentant les distances les plus faibles, puis augmentait la probabilité de leurs choix de boutons lors du cycle d’échantillonnage suivant.

Ce processus n’est pas équivalent à demander à un chatbot quoi faire. Le planificateur effectuait une recherche au sein des dynamiques apprises à partir des captures d’écran enregistrées.

Il ne s’agissait pas non plus d’un apprentissage par renforcement classique guidé par une récompense. Le modèle du monde n’apprenait pas à travers un score continu pour les bonnes et mauvaises actions. L’objectif intervenait après l’entraînement, par similarité avec des exemples de résultats réussis.

Cette conception créait une forme de modularité attrayante. La prédiction capturait l’environnement local, les embeddings d’objectif définissaient le succès et l’algorithme de recherche explorait les séquences d’actions possibles.

La première tentative a néanmoins échoué. La trajectoire planifiée semblait réussie dans la représentation apprise, mais elle n’a pas obtenu de Pokémon lorsqu’elle a été exécutée dans l’émulateur.

Cet échec a révélé un décalage entre l’entraînement et la planification. Lors de l’entraînement ordinaire, chaque prédiction en une étape commençait à partir de l’embedding d’une capture d’écran réelle. Chaque nouvelle image réinitialisait effectivement les erreurs de prédiction précédentes.

La planification fonctionnait différemment. Après la capture d’écran initiale, le prédicteur devait utiliser son propre état estimé comme entrée pour l’étape suivante. Chaque petite erreur pouvait déformer la prédiction qui suivait.

Après plusieurs actions imaginées, le rollout pouvait entrer dans une représentation qui semblait attrayante pour le planificateur, mais ne correspondait plus au jeu réel. Le processus de recherche exploitait alors l’erreur du modèle.

Il s’agit d’un problème courant pour les systèmes prédictifs. Un modèle peut obtenir de bons résultats sur des prévisions isolées à l’étape suivante tout en devenant peu fiable lorsque ses propres sorties alimentent les prédictions futures.

stmonty y a répondu par un affinage par rollout. L’encodeur est resté fixe, tandis que le prédicteur et l’encodeur d’actions se sont entraînés à prévoir à partir de leurs propres états estimés antérieurs.

L’entraînement a commencé avec de courts rollouts et les a progressivement allongés. À la douzième étape prédite, l’erreur quadratique moyenne rapportée est passée de 0,4224 à 0,3045.

La première prédiction est devenue légèrement moins bonne, mais l’erreur s’est accumulée plus lentement tout au long de la séquence. Ce compromis correspondait mieux à la tâche de planification, où la cohérence durable comptait davantage que l’optimisation d’une seule étape isolée.

Pourquoi une seule RTX 3080 Ti est importante

Le GPU grand public est significatif parce qu’il rend l’expérience reproductible dans son esprit, et non parce qu’il prouve que les petits modèles peuvent remplacer les systèmes d’IA généralistes.

La couverture de l’IA moderne traite souvent l’échelle comme l’histoire centrale. Le nombre de paramètres atteint des milliards, les grappes d’entraînement consomment des milliers d’accélérateurs et l’accès dépend d’infrastructures cloud.

Le modèle du monde Pokémon de stmonty déplace l’attention vers un cycle de développement plus réduit. Une seule personne a sélectionné une tâche contrainte, enregistré les données d’entraînement, adapté des recherches récentes, diagnostiqué un échec de planification et réentraîné localement les composants pertinents.

Une RTX 3080 Ti n’est pas un appareil d’entrée de gamme ordinaire. C’est un GPU de jeu performant doté de 12 Go de mémoire. Elle appartient néanmoins à une catégorie différente des clusters spécialisés utilisés pour les modèles fondamentaux de pointe.

Cette différence influe sur qui peut tester une idée. Le développement local donne aux chercheurs un accès direct aux checkpoints, aux traces, aux jeux de données et aux échecs. Il évite également d’envoyer chaque entrée expérimentale vers un modèle hébergé.

L’avantage est particulièrement clair pour les travaux propres à un environnement. Un développeur qui étudie un robot, un jeu, une interface ou une simulation n’a peut-être pas besoin de compétences linguistiques étendues. Un modèle compact peut consacrer sa capacité limitée aux dynamiques qui comptent.

Les petits modèles facilitent aussi l’itération. Un plan qui échoue peut conduire à un ajustement ciblé, comme ce fut le cas ici avec le fine-tuning par rollouts. Les développeurs peuvent comparer les exécutions, examiner la couverture des données et réviser leurs hypothèses sans reconstruire un immense système généraliste.

Cependant, l’entraînement local ne signifie pas automatiquement une accessibilité généralisée. Reproduire l’expérience exige toujours des connaissances en apprentissage automatique, une instrumentation de l’émulateur, la collecte de données, du matériel adapté et de la patience.

Le modèle présenté n’a par ailleurs appris qu’une zone limitée d’un seul jeu. Son jeu de données n’était pas une carte complète de Pokémon Red, et le planificateur partait d’un état de sauvegarde fixe.

Le projet doit donc être compris comme un prototype de recherche accessible. Il abaisse la barrière de calcul pour une catégorie précise d’expériences, tout en laissant intactes d’importantes barrières d’ingénierie.

Les recherches plus larges de LeWorldModel renforcent cette interprétation. L’article décrit une architecture d’environ 15 millions de paramètres, entraînée sur un seul GPU pour ses tâches expérimentales. Il évalue des environnements de navigation, de manipulation et de planification de mouvements, sans prétendre à une intelligence générale.

Pour les développeurs, le signal utile concerne l’efficacité architecturale. Une représentation prédictive n’a pas besoin de générer des images futures photoréalistes ni de verbaliser chaque choix. Elle peut conserver juste assez de structure pour permettre la planification.

Cela peut réduire la taille du modèle et le coût d’évaluation de nombreuses actions candidates. Cela rend aussi l’objectif du système plus spécifique que celui d’un modèle de langage invité à déduire des commandes à partir de captures d’écran et de texte.

La spécialisation engendre toutefois ses propres coûts. Le développeur a dû collecter plus de 42 000 images pour une tâche qu’un humain comprend déjà. Un modèle généraliste pourrait apporter une connaissance préalable de Pokémon, des menus, des dialogues et des objectifs à long terme.

L’opposition ne se résume donc pas à petit contre grand. Elle porte sur les connaissances préalables contre l’apprentissage spécifique à la tâche, le contrôle local contre la compétence générale, et la prédiction efficace contre le raisonnement flexible.

Les récentes expériences sur Pokémon rendent cette comparaison visible. Certains systèmes utilisent des modèles de langage, la mémoire du jeu, des listes d’actions conçues manuellement ou un accompagnement externe. D’autres emploient l’apprentissage par renforcement face à des objectifs explicites.

Le modèle de stmonty a suivi une voie visuelle plus stricte. Il a appris à partir d’images en niveaux de gris et d’entrées enregistrées, puis a planifié à travers la représentation obtenue.

Cette entrée plus restreinte constitue à la fois la force et la limite du projet. Elle donne au résultat une grande clarté technique, mais retire des informations qui aideraient à résoudre le jeu dans son ensemble.

Un modèle qui lit le texte peut comprendre que les badges d’arène débloquent la progression ultérieure. Un modèle prédictif entraîné autour du laboratoire du Professeur Chen ne reçoit aucune explication naturelle de cette hiérarchie.

Le matériel grand public rend cette boucle d’apprentissage locale remarquable. Il n’élimine pas le besoin d’une structure d’objectifs, de données diversifiées ou de systèmes capables d’opérer sur des périodes plus longues.

Le véritable adversaire est l’horizon de planification

Le problème le plus difficile de l’expérience n’était pas de reconnaître les boutons, mais de maintenir l’utilité des prédictions lorsque le plan dépassait les courtes séquences connues.

Un horizon de 14 actions créait déjà suffisamment de dérive pour faire échouer le premier planificateur. L’état prédit par le modèle s’écartait progressivement de l’état réel de l’émulateur, même si ses transitions individuelles semblaient plausibles.

Les objectifs Pokémon plus longs multiplient ce problème. Traverser une pièce exige une navigation spatiale. Les dialogues exigent du contexte sur les sélections précédentes. Les combats ajoutent des menus, des points de vie, des types, des capacités et des adversaires changeants.

Le jeu complet contient aussi des dépendances réparties sur plusieurs heures. Un joueur doit découvrir des objectifs intermédiaires, se souvenir des tâches accomplies, obtenir les objets nécessaires et s’adapter lorsqu’un plan antérieur échoue.

stmonty a identifié directement ce problème dans l’échange sur Hacker News. Passer à une complétion totale exigerait des représentations pour les objectifs intermédiaires et une manière de les organiser dans le temps.

Une version plus grande du même réseau à horizon court manquerait toujours d’un mécanisme explicite pour cette hiérarchie. Davantage de paramètres pourraient améliorer les prédictions, mais ils n’identifieraient pas automatiquement quel badge, objet ou lieu devrait devenir le prochain objectif.

C’est là que les modèles généralistes disposent d’un avantage. Ils peuvent utiliser leurs connaissances linguistiques pour reconnaître les concepts du jeu et raisonner sur des séquences décrites dans des guides, des dialogues ou la mémoire.

Leur faiblesse est différente. Les modèles généralistes peuvent halluciner des actions, perdre la trace de l’état, répéter des erreurs ou consacrer des ressources importantes à raisonner sur de simples décisions de contrôle.

Un modèle du monde spécifique à la tâche peut gérer plus efficacement les dynamiques locales. Un système de niveau supérieur pourrait alors sélectionner les objectifs, tandis que le modèle prédictif gère les séquences courtes.

Cette conception en couches est apparue dans la discussion communautaire. Un participant a suggéré des modèles hiérarchiques du monde fonctionnant à différentes échelles temporelles. Un composant de haut niveau pourrait raisonner sur la façon de battre une arène, tandis qu’un modèle de bas niveau prédit les entrées individuelles.

Un tel système ressemblerait à la façon dont de nombreux agents pratiques sont assemblés. Un composant maintient les objectifs, un autre modélise l’environnement, et un contrôleur choisit ou vérifie les actions.

Cependant, l’expérience actuelle n’a pas testé cette architecture. Elle comportait trois embeddings d’objectifs initiaux, une position de départ et un horizon de planification fixe.

Le taux de réussite de 52 % mérite également une interprétation prudente. Il était bien supérieur au niveau de référence aléatoire, mais provenait de recherches répétées depuis le même état initial.

Le modèle n’a pas démontré de robustesse dans différentes pièces, face à des dialogues inédits, des inventaires changeants ou des combats. Ces tests exigeraient des données plus larges et des conditions de départ plus variées.

Il existe un autre niveau de référence important au sein de l’expérience. Appuyer 12 fois sur A accomplissait déjà la tâche depuis l’état de sauvegarde.

Ce fait n’efface pas la contribution du modèle appris. Les séquences d’actions aléatoires échouaient toujours, et le prédicteur entraîné a aidé la recherche à découvrir des plans valides. Il affaiblit toute affirmation selon laquelle le système aurait manifesté une compréhension stratégique étendue.

La véritable réussite consistait à apprendre une représentation soutenant une recherche guidée par les objectifs. La véritable incertitude est de savoir si cette représentation reste utile lorsque la réussite dépend de chaînes de causalité plus longues et plus variées.

L’apprentissage par renforcement conventionnel offre un autre point de comparaison. Un agent Pokémon lié dans la discussion utilisait l’optimisation proximale de politique pour un objectif de jeu beaucoup plus large.

Cette voie dépend d’une conception explicite de la récompense et d’interactions répétées. Le modèle du monde Pokémon de stmonty a plutôt appris les dynamiques sans recevoir l’objectif du starter lors de son entraînement initial.

Aucune de ces approches ne l’emporte universellement. Les agents guidés par la récompense peuvent optimiser directement leur comportement, tandis que les modèles du monde peuvent séparer la prédiction environnementale des objectifs ultérieurs.

La question pertinente est de savoir quelle méthode demeure efficace à mesure que l’environnement s’étend. Une évaluation plus large comparerait les besoins en données, le temps d’entraînement, les taux d’échec et la généralisation entre différents états de sauvegarde.

Sans ces mesures, le projet ne devrait pas être présenté comme la preuve que les petits modèles du monde surpassent l’apprentissage par renforcement ou les modèles fondamentaux. Il démontre qu’un système prédictif compact peut produire des plans courts utiles à partir de données visuelles.

C’est une conclusion plus modeste, mais c’est aussi celle qui est techniquement pertinente.

Ce qu’il faut surveiller après le modèle du monde de Pokémon Red

Trois tests de suivi montreraient s’il s’agit d’une conception d’agent local réutilisable ou d’une démonstration réussie liée à une tâche soigneusement délimitée.

Le premier indicateur est la performance à travers des états de départ variés. Une évaluation plus solide commencerait depuis plusieurs positions dans le laboratoire du Professeur Chen, y compris avec des orientations inconnues et différentes étapes de dialogue.

La réussite dans ces conditions montrerait que le modèle a capturé davantage qu’un chemin étroit à travers un seul état de sauvegarde. Une forte baisse suggérerait que le planificateur dépend fortement de la distribution exacte d’entraînement.

Le deuxième indicateur est un objectif plus long comportant des étapes intermédiaires. stmonty a proposé de commencer ailleurs dans le laboratoire, de marcher jusqu’au Professeur Chen, de terminer son dialogue, puis de sélectionner un starter.

Cette tâche reste gérable, mais elle oblige le modèle à maintenir un rollout plus long. Elle teste aussi si le planificateur peut relier mouvement, interaction et dialogue dans une séquence cohérente.

Des résultats fiables dans ce cas renforceraient l’argument en faveur de la planification prédictive locale. Des échecs répétés confirmeraient que la longueur de l’horizon, plutôt que le nombre de paramètres ou la capacité GPU, demeure le goulot d’étranglement décisif.

Le troisième indicateur est un contrôleur hiérarchique. Le développeur a indiqué qu’un jeu complet exigerait plusieurs objectifs intermédiaires et des données plus diverses provenant des combats, menus, dialogues et lieux.

Un système futur pourrait associer un sélecteur d’objectifs de haut niveau à un modèle du monde de bas niveau. Le composant de haut niveau pourrait décider d’atteindre le Professeur Chen, de choisir un starter ou de quitter le bâtiment. Le prédicteur local pourrait rechercher les entrées nécessaires pour accomplir chaque étape.

Cette conception créerait également des points d’évaluation plus clairs. Les chercheurs pourraient mesurer séparément si le système a choisi le bon sous-objectif et si le planificateur d’actions l’a exécuté.

Les développeurs devraient également surveiller les reproductions indépendantes. Le code est public, mais le résultat d’un seul auteur ne révèle pas à quel point l’issue est sensible à la collecte de données, aux seeds, aux hyperparamètres ou aux détails d’implémentation.

Une reproduction sur un autre GPU grand public renforcerait l’affirmation d’accessibilité. Tester un autre environnement visuel en dirait davantage sur la capacité de la méthode à se transférer au-delà de Pokémon Red.

La contribution la plus forte du projet n’est pas un jeu terminé. C’est un compte rendu transparent d’un petit modèle qui échoue, révèle pourquoi il a échoué, puis s’améliore grâce à un ajustement ciblé.

Ce flux de travail compte pour la recherche locale en IA. Les systèmes compacts exposent des erreurs qui peuvent devenir difficiles à interpréter au sein d’une pile d’agents beaucoup plus grande.

Le modèle du monde Pokémon de stmonty offre aussi aux développeurs une question concrète à explorer. Quelle quantité de planification une petite représentation prédictive peut-elle prendre en charge avant d’avoir besoin de langage, de mémoire, d’objectifs hiérarchiques ou d’un signal d’entraînement différent ?

Pour l’instant, la réponse s’étend d’un état de sauvegarde dans un laboratoire à un Pokémon starter. Le prochain résultat utile viendra d’une extension de cette limite sans dissimuler de nouvelles aides dans le système.

Si vous construisez des agents locaux, suivez les preuves plutôt que le spectacle. Testez de nouveaux états de départ, mesurez la dérive des rollouts, comparez des niveaux de référence pertinents et consignez chaque intervention. Un plan réussi plus long renforcerait l’argument en faveur des modèles du monde compacts. Un effondrement en dehors du laboratoire du Professeur Chen serait tout aussi utile, car il identifierait la limite architecturale à laquelle la prochaine expérience devra s’attaquer.

 
 

Commencez pour Gratuit

Un premier assistant IA local avec gestion des connaissances personnelles

Pour une meilleure expérience IA,

remio ne supporte que Windows 10+ (x64) et M-Chip Macs actuellement.

Votre partenaire IA au travail
Faites-en plus avec remio

Planifiez. Créez. Livrez.
Tout au même endroit.

bottom of page