top of page

El modelo de mundo de Pokémon de stmonty funciona localmente, pero la planificación a largo plazo es la verdadera prueba

1 oct
14 min de lectura

El desarrollador stmonty entrenó un modelo de mundo de Pokémon de 12,5 millones de parámetros en una RTX 3080 Ti y luego lo utilizó para elegir un inicial en Pokémon Red. El modelo no recibió las reglas del juego, un mapa ni una recompensa por obtener un Pokémon. Aprendió prediciendo qué ocurriría después de cada pulsación de botón.

El resultado podría parecer una nueva entrega de la creciente colección de demostraciones de IA jugando a videojuegos. Sin embargo, la cuestión interesante no es si una IA puede completar una secuencia conocida de un juego. Los modelos de lenguaje más grandes y los sistemas convencionales de aprendizaje por refuerzo ya han asumido retos de Pokémon mucho más amplios.

El modelo de mundo de Pokémon de stmonty pone a prueba una propuesta más acotada. ¿Puede un pequeño modelo predictivo aprender dinámicas útiles del entorno a partir de capturas de pantalla, planificar dentro de su representación aprendida y funcionar en hardware al alcance de un desarrollador independiente?

La respuesta es un sí matizado. Tras el ajuste fino, el modelo obtuvo un inicial en 52 de 100 intentos planificados. Las secuencias aleatorias de botones no registraron éxitos, mientras que el mismo proceso de búsqueda combinado con un predictor sin entrenar tuvo éxito una vez.

Estas cifras muestran que el modelo aprendido aportó información útil. También delimitan el proyecto. La posición inicial se seleccionó cuidadosamente, el plan cubría solo 14 pulsaciones de botón y pulsar A repetidamente ya era una solución válida.

Por tanto, el proyecto ofrece evidencia de que la experimentación con modelos de mundo es accesible, no de que exista un jugador generalista de Pokémon. Su lección más importante surge de la brecha entre predecir una acción y mantener una predicción útil a lo largo de muchas acciones.

Esa brecha sitúa el experimento dentro de una competencia más amplia entre dos enfoques de IA. Uno utiliza grandes modelos de propósito general con conocimiento lingüístico, herramientas externas, memoria y una capacidad de cómputo considerable. El otro construye sistemas más pequeños en torno a las dinámicas de un entorno específico.

El proyecto de stmonty no resuelve esa competencia. Sí muestra por qué los modelos predictivos compactos siguen siendo interesantes, especialmente cuando los desarrolladores necesitan entrenamiento local, experimentación rápida y control directo sobre los datos.

Qué hizo realmente el modelo de mundo de Pokémon de stmonty

El modelo aprendió suficientes dinámicas del juego para guiar un plan corto, pero no aprendió a jugar Pokémon Red de principio a fin.

stmonty consideró inicialmente un objetivo mucho mayor. La secuencia propuesta incluía llegar al laboratorio del Profesor Oak, completar el diálogo, elegir un inicial, salir del edificio y derrotar al rival.

Ese plan pronto resultó demasiado ambicioso para un primer experimento. La tarea se redujo a un estado guardado dentro del laboratorio de Oak, donde el personaje podía obtener a Bulbasaur, Charmander o Squirtle.

Desde esa posición, bastaba con pulsar A 12 veces. El modelo seguía teniendo libertad para pulsar controles direccionales, cancelar el diálogo con B o seguir otra secuencia válida. Su trabajo consistía en identificar un plan de 14 acciones que acercara el estado previsto del juego a un ejemplo de una selección de inicial exitosa.

El desarrollador registró 42.382 fotogramas en escala de grises de un emulador de Pokémon Red. Esos fotogramas formaron 1.009 trayectorias cortas que contenían una captura de pantalla, una pulsación de botón y la siguiente captura.

Algunas trayectorias seguían rutas programadas. Otras añadían ruido o movimientos más aleatorios. Esa mezcla era importante porque un planificador explora secuencias de acciones tanto sensatas como deficientes.

Un conjunto de datos compuesto únicamente por demostraciones perfectas podría asociar A con el progreso, pero aprendería poco sobre cancelaciones, movimientos bloqueados o entradas irrelevantes. Las trayectorias más desordenadas expusieron el modelo a una mayor parte del comportamiento del entorno local.

El sistema resultante se basó en LeWorldModel, una arquitectura predictiva de incrustaciones conjuntas, o JEPA. Una JEPA predice cómo cambia una representación abstracta en lugar de recrear cada píxel de la siguiente imagen.

Esa distinción mantiene el objetivo de entrenamiento centrado en estructuras útiles. El codificador convierte una captura de pantalla en una incrustación, es decir, una representación numérica del estado observado. Después, un predictor estima la siguiente incrustación a partir de la representación actual y la acción seleccionada.

La explicación pública del proyecto señala que la red final contenía unos 12,5 millones de parámetros y se entrenó localmente en una RTX 3080 Ti. La implementación también está disponible en el repositorio lePokeRed.

Tras el entrenamiento, stmonty comprobó si la representación retenía información sobre el objetivo. Un pequeño clasificador podía identificar si el equipo del jugador contenía un Pokémon mientras el codificador subyacente permanecía congelado.

El predictor también rindió mejor que una línea de base que copiaba la incrustación actual. Proporcionarle una acción incorrecta perjudicaba su predicción, lo que sugiere que había aprendido cierta relación entre los controles y los cambios en el juego.

Estas pruebas no establecieron una planificación fiable. Solo mostraron que el modelo representaba un estado relevante y respondía de forma significativa al botón elegido.

La evaluación real llegó cuando la secuencia del planificador se ejecutó dentro del emulador. Tras el ajuste fino de las simulaciones, una secuencia propuesta seleccionó a Squirtle y cambió el número de Pokémon en el equipo de cero a uno.

En 100 búsquedas con distintas semillas aleatorias, 52 planes obtuvieron un inicial. El resultado respalda una afirmación limitada: la representación del modelo ayudó a un planificador a encontrar acciones útiles desde un punto de partida fijo.

No respalda la afirmación más amplia de que el modelo dominó Pokémon Red de forma independiente. stmonty reconoció explícitamente esa brecha y señaló en la discusión de la comunidad que simplemente hacer más grande el modelo actual no resolvería los numerosos objetivos intermedios del juego.

Cómo el modelo aprendió los controles al predecir lo que ocurría después

El mecanismo central fue la predicción sin recompensas por tarea, seguida de una planificación orientada a ejemplos del resultado deseado.

Los registros de entrenamiento nunca etiquetaron una trayectoria como un éxito ni recompensaron al modelo por obtener un Pokémon. Durante su entrenamiento inicial, el sistema solo intentaba predecir el siguiente estado incrustado.

Si la imagen actual mostraba un cuadro de diálogo y la acción registrada era A, el predictor aprendía qué representación seguía normalmente a esa combinación. Si el personaje estaba frente a una pared, podía aprender que una entrada direccional apenas produciría cambios visibles.

Esta configuración separa el aprendizaje del entorno de la selección de objetivos. Primero, el modelo aprende cómo las observaciones tienden a cambiar tras las acciones. Más tarde, un planificador utiliza esa maquinaria predictiva para buscar un resultado concreto.

Esta separación es importante porque, en teoría, los desarrolladores pueden reutilizar un modelo aprendido del entorno para múltiples objetivos. Una nueva tarea requeriría nuevos ejemplos de objetivos o una nueva lógica de puntuación, pero no necesariamente una reconstrucción completa del entorno.

La arquitectura presentaba un modo de fallo grave. Un codificador y un predictor entrenados conjuntamente pueden reducir su pérdida asignando todas las imágenes a la misma representación. El predictor se vuelve entonces perfectamente coherente sin conservar nada útil.

Este problema se conoce como colapso latente. El diseño de LeWorldModel lo contrarresta con SIGReg, un regularizador que empuja las representaciones aprendidas hacia una forma gaussiana distribuida.

El artículo original de LeWorldModel presenta este enfoque como una forma de entrenar una JEPA de extremo a extremo a partir de píxeles sin procesar. Entre sus autores se encuentran Lucas Maes, Quentin Le Lidec, Damien Scieur, Yann LeCun y Randall Balestriero.

LeWorldModel utiliza una pérdida de predicción de la siguiente incrustación junto con el regularizador. Su código de investigación oficial proporciona puntos de control, referencias de datos y una implementación del método más amplio.

stmonty adaptó esta línea de investigación a Pokémon Red. Una vez entrenada la representación, el desarrollador proporcionó al planificador incrustaciones de selecciones exitosas de Bulbasaur, Charmander y Squirtle.

Estas incrustaciones de objetivos describían el aspecto del éxito sin especificar la ruta correcta. El sistema imaginaba entonces cómo las secuencias candidatas de botones cambiarían el estado actual.

La búsqueda utilizó el método de entropía cruzada, un proceso de muestreo que se concentra gradualmente en candidatos mejores. Cada ronda generaba 512 planes completos de 14 acciones.

El planificador comparaba los estados predichos con las tres incrustaciones de objetivos. Conservaba los 64 planes con las distancias más bajas y luego aumentaba la probabilidad de sus elecciones de botones en la siguiente ronda de muestreo.

Este proceso no equivale a preguntarle a un chatbot qué hacer. El planificador buscaba dentro de las dinámicas aprendidas a partir de las capturas de pantalla registradas.

Tampoco era el aprendizaje por refuerzo clásico basado en recompensas. El modelo de mundo no aprendía mediante una puntuación continua de acciones buenas y malas. El objetivo se introducía después del entrenamiento mediante la similitud con ejemplos de resultados exitosos.

Ese diseño creó una atractiva forma de modularidad. La predicción capturaba el entorno local, las incrustaciones de objetivos definían el éxito y el algoritmo de búsqueda exploraba posibles secuencias de acciones.

El primer intento aún falló. La trayectoria planificada parecía exitosa dentro de la representación aprendida, pero no obtuvo un Pokémon al ejecutarse en el emulador.

El fallo reveló una discrepancia entre el entrenamiento y la planificación. Durante el entrenamiento normal, cada predicción de un paso comenzaba a partir de la incrustación de una captura de pantalla real. Cada nuevo fotograma reiniciaba de forma efectiva los errores de predicción anteriores.

La planificación funcionaba de otra manera. Después de la captura inicial, el predictor tenía que utilizar su propio estado estimado como entrada para el siguiente paso. Cada pequeño error podía distorsionar la predicción posterior.

Tras varias acciones imaginadas, la simulación podía entrar en una representación que resultara atractiva para el planificador, pero que ya no coincidiera con el juego real. El proceso de búsqueda explotaba entonces el error del modelo.

Este es un problema común en los sistemas predictivos. Un modelo puede obtener buenos resultados en pronósticos aislados del siguiente paso y, aun así, volverse poco fiable cuando sus propias salidas alimentan predicciones futuras.

stmonty abordó el problema con ajuste fino de simulaciones. El codificador permaneció fijo, mientras que el predictor y el codificador de acciones practicaban la previsión a partir de sus propios estados estimados anteriores.

El entrenamiento comenzó con simulaciones cortas y las amplió gradualmente. En el duodécimo paso predicho, el error cuadrático medio informado descendió de 0,4224 a 0,3045.

La primera predicción empeoró ligeramente, pero el error se acumuló más lentamente a lo largo de la secuencia. Ese equilibrio se ajustaba mejor a la tarea de planificación, donde la coherencia sostenida importaba más que optimizar un único paso aislado.

Por qué importa una sola RTX 3080 Ti

La GPU de consumo es relevante porque hace que el experimento sea reproducible en espíritu, no porque demuestre que los modelos pequeños pueden sustituir a los sistemas de IA generalistas.

La cobertura moderna de IA suele tratar la escala como la historia central. El número de parámetros alcanza los miles de millones, los clústeres de entrenamiento consumen miles de aceleradores y el acceso depende de infraestructura en la nube.

El modelo de mundo de Pokémon de stmonty desplaza la atención hacia un ciclo de desarrollo más pequeño. Una sola persona seleccionó una tarea acotada, registró los datos de entrenamiento, adaptó investigación reciente, diagnosticó un fallo de planificación y reentrenó localmente los componentes pertinentes.

Una RTX 3080 Ti no es un dispositivo de gama baja común. Es una GPU de gaming capaz con 12 GB de memoria. Aun así, pertenece a una categoría distinta de los clústeres especializados utilizados para modelos fundacionales de frontera.

Esa diferencia afecta a quién puede probar una idea. El desarrollo local ofrece a los investigadores acceso directo a checkpoints, trazas, conjuntos de datos y fallos. También evita enviar cada entrada experimental a través de un modelo alojado.

El beneficio resulta especialmente evidente en trabajos específicos de un entorno. Un desarrollador que investiga un robot, juego, interfaz o simulación quizá no necesite una competencia lingüística amplia. Un modelo compacto puede dedicar su capacidad limitada a las dinámicas que importan.

Los modelos pequeños también facilitan la iteración. Un plan fallido puede conducir a un cambio específico, como ocurrió aquí con el ajuste fino mediante rollouts. Los desarrolladores pueden comparar ejecuciones, inspeccionar la cobertura de los datos y revisar supuestos sin reconstruir un sistema masivo de propósito general.

Sin embargo, el entrenamiento local no implica automáticamente una accesibilidad amplia. Reproducir el experimento sigue requiriendo conocimientos de aprendizaje automático, instrumentación del emulador, recopilación de datos, hardware adecuado y paciencia.

El modelo reportado también aprendió una región limitada de un único juego. Su conjunto de datos no era un mapa completo de Pokémon Red, y el planificador partía de un estado de guardado fijo.

Por tanto, el proyecto se entiende mejor como un prototipo de investigación accesible. Reduce la barrera computacional para una clase específica de experimentos, aunque mantiene importantes barreras de ingeniería.

La investigación más amplia de LeWorldModel refuerza esa interpretación. El artículo describe una arquitectura de aproximadamente 15 millones de parámetros entrenada en una sola GPU para sus tareas experimentales. Evalúa entornos de navegación, manipulación y planificación de movimiento, sin afirmar inteligencia general.

Para los desarrolladores, la señal útil es la eficiencia arquitectónica. Una representación predictiva no tiene que generar fotogramas futuros fotorrealistas ni verbalizar cada decisión. Puede conservar la estructura justa para planificar.

Eso puede reducir el tamaño del modelo y el coste de evaluar muchas acciones candidatas. También hace que el objetivo del sistema sea más específico que el de un modelo de lenguaje al que se le pide inferir controles a partir de capturas de pantalla y texto.

Sin embargo, la especialización genera sus propios costes. El desarrollador tuvo que recopilar más de 42.000 fotogramas para una tarea que un humano ya comprende. Un modelo general podría aportar conocimientos previos sobre Pokémon, menús, diálogos y objetivos a largo plazo.

Por tanto, la competencia no es simplemente entre pequeño y grande. Se trata de conocimiento previo frente a aprendizaje específico de la tarea, control local frente a competencia general y predicción eficiente frente a razonamiento flexible.

Los experimentos recientes con Pokémon hacen visible esta comparación. Algunos sistemas utilizan modelos de lenguaje, memoria del juego, listas de acciones elaboradas manualmente o orientación externa. Otros emplean aprendizaje por refuerzo con objetivos explícitos.

El modelo de stmonty siguió una ruta visual más estricta. Aprendió a partir de fotogramas en escala de grises y entradas registradas, y después planificó mediante la representación resultante.

Esa entrada más limitada es tanto la fortaleza como la limitación del proyecto. Aporta claridad técnica al resultado, pero elimina información que ayudaría a resolver el juego completo.

Un modelo que lee texto puede entender que las medallas de gimnasio desbloquean el progreso posterior. Un modelo predictivo entrenado en torno al laboratorio de Oak no recibe ninguna explicación natural de esa jerarquía.

El hardware de consumo hace destacable el ciclo de aprendizaje local. No elimina la necesidad de una estructura de objetivos, datos diversos o sistemas que operen durante períodos más largos.

El verdadero adversario es el horizonte de planificación

El problema más difícil del experimento no era reconocer botones, sino mantener útiles las predicciones a medida que el plan se extendía más allá de secuencias cortas conocidas.

Un horizonte de 14 acciones ya generó suficiente deriva como para derrotar al primer planificador. El estado predicho por el modelo se separó gradualmente del estado real del emulador, aunque sus transiciones individuales parecían plausibles.

Los objetivos más largos de Pokémon multiplican ese problema. Caminar por una habitación requiere navegación espacial. El diálogo requiere contexto sobre selecciones anteriores. Los combates añaden menús, salud, tipos, movimientos y rivales cambiantes.

El juego completo también contiene dependencias repartidas a lo largo de horas. Un jugador debe descubrir objetivos intermedios, recordar tareas completadas, obtener objetos necesarios y ajustarse cuando un plan anterior falla.

stmonty identificó este problema directamente en el intercambio de Hacker News. Escalar hasta completar el juego requeriría representaciones de objetivos intermedios y una forma de organizarlos en el tiempo.

Una versión más grande de la misma red de horizonte corto seguiría careciendo de un mecanismo explícito para esa jerarquía. Más parámetros podrían mejorar las predicciones, pero no identificarían automáticamente qué medalla, objeto o ubicación debería convertirse en el siguiente objetivo.

Aquí es donde los modelos de propósito general tienen ventaja. Pueden utilizar conocimiento lingüístico para reconocer conceptos del juego y razonar sobre secuencias descritas en guías, diálogos o memoria.

Su debilidad es distinta. Los modelos amplios pueden alucinar acciones, perder el seguimiento del estado, repetir errores o gastar recursos considerables razonando sobre decisiones de control sencillas.

Un modelo del mundo específico para una tarea puede gestionar dinámicas locales de forma más eficiente. Un sistema de nivel superior podría seleccionar objetivos, mientras que el modelo predictivo se encarga de las secuencias cortas.

Ese diseño por capas apareció en la discusión de la comunidad. Un participante sugirió modelos del mundo jerárquicos que operan en distintas escalas temporales. Un componente de alto nivel podría razonar sobre derrotar a un líder de gimnasio, mientras que un modelo de nivel inferior predice entradas individuales.

Un sistema así se parecería a cómo se ensamblan muchos agentes prácticos. Un componente mantiene objetivos, otro modela el entorno y un controlador elige o verifica acciones.

Sin embargo, el experimento actual no probó esa arquitectura. Tenía tres embeddings de objetivos iniciales, una posición de partida y un horizonte de planificación fijo.

La tasa de éxito del 52 por ciento también merece una interpretación cuidadosa. Fue mucho mejor que la línea base aleatoria, pero procedía de búsquedas repetidas sobre el mismo estado inicial.

El modelo no demostró resiliencia en diferentes habitaciones, diálogos no vistos, inventarios cambiantes o combates. Esas pruebas requerirían datos más amplios y condiciones iniciales más variadas.

Hay otra línea base importante dentro del experimento. Pulsar A 12 veces ya completaba la tarea desde el estado de guardado.

Ese hecho no elimina la contribución del modelo aprendido. Las secuencias de acciones aleatorias seguían fallando, y el predictor entrenado ayudó a la búsqueda a descubrir planes válidos. Sí debilita cualquier afirmación de que el sistema mostró una comprensión estratégica amplia.

El verdadero logro fue aprender una representación que respaldara la búsqueda orientada a objetivos. La verdadera incertidumbre es si esa representación sigue siendo útil cuando el éxito depende de cadenas de causalidad más largas y variadas.

El aprendizaje por refuerzo convencional ofrece otra comparación. Un agente de Pokémon enlazado en la discusión utilizó optimización de políticas proximales para un objetivo de juego mucho más amplio.

Esa vía depende de un diseño explícito de recompensas y de interacción repetida. En cambio, el modelo del mundo de Pokémon de stmonty aprendió dinámicas sin recibir el objetivo inicial durante su entrenamiento inicial.

Ningún enfoque gana de forma universal. Los agentes guiados por recompensas pueden optimizar el comportamiento directamente, mientras que los modelos del mundo pueden separar la predicción ambiental de los objetivos posteriores.

La pregunta relevante es qué método mantiene la eficiencia a medida que el entorno se expande. Una evaluación más amplia compararía requisitos de datos, tiempo de entrenamiento, tasas de fallo y generalización entre estados de guardado.

Sin esas mediciones, el proyecto no debería presentarse como evidencia de que los modelos del mundo pequeños superan al aprendizaje por refuerzo o a los modelos fundacionales. Es evidencia de que un sistema predictivo compacto puede producir planes cortos útiles a partir de datos visuales.

Es una conclusión más limitada, pero también la técnicamente significativa.

Qué observar después del modelo del mundo de Pokémon Red

Tres pruebas de seguimiento mostrarían si se trata de un diseño reutilizable de agente local o de una demostración exitosa ligada a una tarea cuidadosamente delimitada.

La primera señal es el rendimiento en estados iniciales variados. Una evaluación más sólida comenzaría desde múltiples posiciones dentro del laboratorio de Oak, incluidas orientaciones desconocidas y distintas fases del diálogo.

El éxito en esas condiciones demostraría que el modelo capturó más que una ruta estrecha a través de un estado de guardado. Una caída pronunciada sugeriría que el planificador depende en gran medida de la distribución exacta de entrenamiento.

La segunda señal es un objetivo más largo con pasos intermedios. stmonty propuso comenzar en otra parte del laboratorio, caminar hasta Oak, completar su diálogo y después elegir un Pokémon inicial.

La tarea sigue siendo manejable, pero obliga al modelo a mantener un rollout más largo. También prueba si el planificador puede conectar movimiento, interacción y diálogo en una secuencia coherente.

Resultados fiables en ese caso reforzarían el argumento a favor de la planificación predictiva local. Los fallos repetidos confirmarían que la longitud del horizonte, y no el número de parámetros ni la capacidad de la GPU, sigue siendo el cuello de botella decisivo.

La tercera señal es un controlador jerárquico. El desarrollador dijo que un juego completo requeriría múltiples objetivos intermedios y datos más diversos procedentes de combates, menús, diálogos y ubicaciones.

Un sistema futuro podría combinar un selector de objetivos de alto nivel con un modelo del mundo de bajo nivel. El componente de alto nivel podría decidir llegar hasta Oak, elegir un Pokémon inicial o salir del edificio. El predictor local podría buscar las entradas necesarias para completar cada paso.

Ese diseño también crearía puntos de evaluación más claros. Los investigadores podrían medir por separado si el sistema eligió el subobjetivo correcto y si el planificador de acciones lo ejecutó.

Los desarrolladores también deberían observar reproducciones independientes. El código es público, pero el resultado de un único autor no revela cuán sensible es el resultado a la recopilación de datos, las semillas, los hiperparámetros o los detalles de implementación.

La reproducción en otra GPU de consumo reforzaría la afirmación de accesibilidad. Probar otro entorno visual diría más sobre si el método se transfiere más allá de Pokémon Red.

La contribución más sólida del proyecto no es un juego completado. Es un registro transparente de un modelo pequeño que falla, revela por qué falló y mejora mediante un ajuste específico.

Ese flujo de trabajo importa para la investigación local de IA. Los sistemas compactos exponen errores que pueden resultar difíciles de interpretar dentro de una pila de agentes mucho mayor.

El modelo del mundo de Pokémon de stmonty también plantea a los desarrolladores una pregunta concreta. ¿Cuánta planificación puede respaldar una pequeña representación predictiva antes de necesitar lenguaje, memoria, objetivos jerárquicos o una señal de entrenamiento diferente?

Por ahora, la respuesta abarca desde un estado de guardado en un laboratorio hasta un Pokémon inicial. El siguiente resultado valioso llegará al ampliar ese límite sin ocultar nueva asistencia dentro del sistema.

Si desarrollas agentes locales, sigue la evidencia en lugar del espectáculo. Prueba nuevos estados iniciales, mide la deriva de los rollouts, compara líneas base significativas y registra cada intervención. Un plan exitoso más largo reforzaría el argumento a favor de los modelos del mundo compactos. Un colapso fuera del laboratorio de Oak sería igual de útil, porque identificaría el límite arquitectónico que debe abordar el siguiente experimento.

 
 

Empieza gratis

Un asistente de IA local-first con gestión del conocimiento personal

Para ofrecer una mejor experiencia con la IA,

actualmente remio solo es compatible con Windows 10+ (x64) y M-Chip Macs.

Tu aliado de IA para el trabajo
Haz más con remio

Planifica. Crea. Entrega.
Todo en un solo lugar.

bottom of page