WorldWeaver dota a los modelos de vídeo multiagente de memoria compartida, pero Minecraft es solo la primera prueba
WorldWeaver ha introducido una memoria compartida explícita en un modelo de vídeo de dos agentes, cuestionando los enfoques que reconstruyen el mundo únicamente a partir de fotogramas recientes. El modelo, también llamado W², almacena información evolutiva en registros de estado del mundo mientras genera vistas sincronizadas de Minecraft. Sus resultados sugieren que un vídeo convincente no basta para crear un mundo interactivo persistente.
El trabajo procede de investigadores de UCLA y Adobe Research. Presentaron el artículo de WorldWeaver el 23 de julio de 2026. Su tensión central es arquitectónica: estado compartido persistente frente a historial de observaciones comprimido dentro de una ventana de contexto móvil.
Esta distinción importa porque varios agentes nunca ven exactamente la misma escena. Un jugador puede caminar detrás de una pared mientras otro sigue construyendo fuera. Un modelo que solo recuerda píxeles visibles debe reconstruir cambios ocultos cuando esas vistas vuelven a conectarse.
WorldWeaver, en cambio, mantiene tokens aprendibles que resumen el entorno compartido y el estado de cada agente. Actualiza esos tokens después de cada fragmento generado. El siguiente fragmento depende entonces tanto de los fotogramas recientes como del estado confirmado más reciente.
Las mejoras comunicadas son considerables dentro de la evaluación de Minecraft para dos jugadores realizada por los investigadores. WorldWeaver alcanzó una puntuación agregada de mundo de 105,1, frente a 81,0 para una línea base Solaris reentrenada. Sin embargo, el experimento sigue siendo limitado, basado en un simulador y dependiente de una supervisión que los entornos reales rara vez proporcionan.
WorldWeaver incorpora el estado compartido dentro del generador
El cambio decisivo no es otra mejora de la memoria de vídeo, sino una vía de estado independiente que persiste entre agentes y pasos de generación.
Los modelos de difusión autorregresiva en streaming generan un vídeo en fragmentos consecutivos. Cada fragmento condiciona el siguiente mediante fotogramas recientes y una caché de clave-valor, que almacena información intermedia de atención. Este diseño mantiene la generación controlable sin tener que reabrir todo el historial.
La limitación aparece cuando una observación desaparece de esa ventana reciente. El generador debe volver a inferir la información ausente a partir de los píxeles que queden. Esa reconstrucción puede introducir ubicaciones, estados de objetos, identidades o relaciones incoherentes.
El problema crece en un entorno multiagente. Cada cámara ofrece una proyección parcial de un mismo entorno subyacente. Un modelo válido debe reconciliar esas proyecciones mientras rastrea cambios que ocurren fuera del campo de visión de una cámara concreta.
WorldWeaver añade registros de estado del mundo, que son tokens aprendibles reservados para el estado evolutivo del entorno. Se sitúan junto a los tokens visuales, pero cumplen un propósito distinto. El registro resume información que debería sobrevivir cuando los fotogramas individuales abandonan el contexto activo.
En cada paso de generación, el generador lee su registro anterior, los fotogramas recientes y la acción actual. Después confirma un registro actualizado tras producir el nuevo fragmento visual. Ese registro condiciona el fragmento siguiente.
El proceso crea una secuencia alterna de observaciones y actualizaciones de estado. Los fotogramas recientes aportan evidencia local detallada. El registro proporciona un mecanismo compacto de continuidad a lo largo del tiempo y entre puntos de vista.
Esta estructura difiere de simplemente ampliar la caché de fotogramas. Una caché mayor conserva más observaciones, pero esas observaciones siguen dependiendo de la cámara y están codificadas visualmente. El modelo aún debe extraer el estado pertinente cada vez que necesita esa información.
WorldWeaver pide al modelo que mantenga esa abstracción de forma continua. Los investigadores describen el registro como persistente y actualizable dinámicamente. Cada agente aporta evidencia a la representación compartida a medida que avanza la generación.
El enfoque también limita el historial obsoleto del registro. Durante la inferencia, el sistema conserva el registro inicial y el registro confirmado más reciente, en lugar de acumular todos los estados intermedios. Esta elección acerca el mecanismo más a un estado recurrente que a un archivo de memoria en expansión.
La visión general del método del proyecto muestra generaciones sincronizadas de Minecraft para dos jugadores. Ambos jugadores actúan dentro de un entorno generado, mientras una representación oculta rastrea sus posiciones y la escena circundante.
Minecraft resulta útil porque el entorno expone un estado preciso del simulador. Los investigadores pueden medir las posiciones, la velocidad, la orientación y las entradas de control de los agentes. También pueden capturar una vista cenital que ninguno de los jugadores tiene disponible.
Estas señales hacen que el estado oculto sea inspeccionable. Permiten al equipo preguntarse si un vídeo generado corresponde al mismo mundo subyacente en ambas cámaras. La calidad de los píxeles por sí sola no puede responder a esa pregunta.
Por tanto, la noticia trata menos de imágenes más bonitas de Minecraft. Trata de trasladar la coherencia de un efecto secundario esperado a un componente supervisado de la generación.
Por qué el historial de fotogramas se convierte en un lastre para varios agentes
El historial de observaciones registra lo que vieron las cámaras, mientras que un modelo de mundo interactivo debe preservar lo que sigue siendo cierto después de que esas observaciones desaparezcan.
Un modelo de vídeo de una sola cámara a menudo puede ocultar pequeños errores lógicos. Un objeto podría desplazarse ligeramente entre fotogramas distantes y, aun así, la secuencia puede parecer plausible. La generación multiagente hace que estos errores sean más fáciles de revelar.
Supongamos que Alpha coloca un bloque mientras Bravo mira en otra dirección. La vista posterior de Bravo debería contener ese bloque cuando la cámara vuelva a girar. La acción de Alpha debe alterar un único entorno compartido, no solo el flujo de vídeo de Alpha.
Ahora supongamos que los jugadores se separan. Sus historiales de fotogramas recientes contienen terrenos, objetos y movimientos de cámara distintos. Cuando vuelven a encontrarse, el modelo debe reconciliar ambos historiales sin inventar geometrías contradictorias.
Una caché visual móvil ofrece un apoyo débil para esta tarea. Favorece las observaciones recientes y entrelaza el estado con la apariencia. La información sobre un jugador fuera de vista o una estructura oculta puede desvanecerse a medida que nuevos fotogramas sustituyen a los anteriores.
Un estado explícito puede preservar hechos independientes de la cámara actual. La posición, la orientación, la disposición cercana y las acciones completadas pueden seguir disponibles incluso cuando los píxeles de origen abandonan la ventana.
WorldWeaver supervisa sus registros con tres tipos de objetivos. Las estadísticas de los agentes capturan posición, velocidad y orientación. Las vistas a vista de pájaro restringen la disposición global, mientras que el texto de la escena ofrece una descripción semántica del comportamiento actual.
Cada objetivo aborda un modo de fallo distinto. Las estadísticas de los agentes ayudan a preservar el movimiento local y la identidad. Las representaciones cenitales ofrecen a ambos agentes una referencia geométrica común.
El texto de la escena anima al registro a retener relaciones significativas en lugar de solo características visuales de bajo nivel. El proceso de subtitulado descrito en el artículo detalla el comportamiento de cada jugador, su posición relativa, distancia y dirección de visión.
Estas anotaciones usan vistas sincronizadas de los agentes, fotogramas cenitales y entradas del controlador. Proporcionan un conocimiento inusualmente directo de lo que ocurrió dentro de cada fragmento generado.
Esta supervisión es importante porque el objetivo de generación de vídeo no especifica qué debería recordar el registro. Un token no supervisado puede absorber información útil, textura irrelevante o una mezcla que se vuelve inestable durante la generación.
Los investigadores descubrieron que los objetivos de estado modificaban tanto la generación como la interpretabilidad. Los cabezales de decodificación usados solo durante el entrenamiento pueden recuperar del registro coordenadas de los agentes, características cenitales y descripciones de la escena. Esos cabezales se eliminan durante la inferencia, por lo que no añaden trabajo de decodificación al despliegue.
Aquí es también donde el enfoque ejerce presión sobre los pipelines de streaming existentes. Ampliar las ventanas de contexto mejora el acceso a observaciones previas, pero no crea un estado compartido canónico.
La comparación es especialmente relevante para Solaris, un modelo de mundo multijugador de febrero de 2026. Solaris introdujo la recopilación sincronizada de datos multijugador y la generación coordinada entre las vistas de los jugadores.
Solaris informó de un conjunto de datos con 12,64 millones de fotogramas multijugador. También estableció categorías de evaluación que abarcan movimiento, memoria, anclaje, construcción y coherencia de las vistas.
WorldWeaver adopta ese entorno y reentrena Solaris con los mismos datos de entrenamiento para compararlo. Luego cambia la forma en que la información persiste durante la generación.
Solaris sincroniza las observaciones mediante atención entre jugadores sobre tokens visuales. WorldWeaver conserva esa interacción al tiempo que introduce un canal diferenciado de estado compartido. La cuestión es si el estado explícito perdura de manera más fiable que el contexto visual.
Los resultados del artículo favorecen la vía con estado en este experimento. Sin embargo, no demuestran que un registro de tokens supere siempre a un contexto más largo, una memoria externa o un mapa estructurado.
Muestran algo más acotado y aun así valioso. Cuando dos flujos de vídeo deben describir un entorno cambiante, la supervisión explícita del estado puede mejorar la coherencia lógica medible.
Los registros de estado del mundo modifican el mecanismo de generación
WorldWeaver separa la síntesis visual del mantenimiento del estado y luego entrena ambas vías para resistir sus propios errores acumulados.
El modelo sigue un proceso de entrenamiento de tres etapas. La primera adapta un modelo de vídeo preentrenado para un solo jugador a un profesor multijugador sincronizado. La atención bidireccional permite a ese profesor observar el clip completo mientras aprende la estructura de la escena entre agentes.
La segunda etapa convierte al profesor en un generador causal. La generación causal significa que cada salida depende únicamente de la información disponible en ese punto de la secuencia. Esto es necesario para un flujo interactivo que no puede inspeccionar fotogramas futuros.
Durante esta etapa, los tokens de fotograma utilizan el contexto visual reciente y el registro más reciente. Los tokens de registro leen la ventana de fotogramas local y el registro anterior. El modelo alterna entre predecir observaciones y actualizar el estado.
El registro recibe supervisión auxiliar en cada paso confirmado. Un cabezal de regresión predice las estadísticas de los agentes. Otro decodificador predice características correspondientes a una vista a vista de pájaro alineada.
Un cabezal de texto predice la descripción de la escena. El objetivo general de entrenamiento combina estas pérdidas de estado con la pérdida de generación de fotogramas del modelo de difusión.
Ese objetivo combinado crea un posible conflicto. La generación de píxeles recompensa la reconstrucción visual detallada, mientras que el modelado de estado recompensa información compacta y estable. De otro modo, un único conjunto de pesos del transformer tendría que satisfacer ambos papeles.
WorldWeaver aborda ese conflicto con un diseño Mixture-of-Transformers. Esta arquitectura proporciona a los tokens de registro y a los tokens de fotograma ramas de parámetros separadas, al tiempo que conserva la atención conjunta entre ellos.
La separación no equivale a usar modelos independientes. Los tokens visuales y de estado siguen intercambiando información dentro de la misma secuencia entrelazada. Sin embargo, cada tipo de token recibe pesos adaptados a su función.
Este diseño se vuelve más útil a medida que la supervisión del registro se enriquece. El artículo informa de que los pesos compartidos densos pueden tener dificultades cuando la misma vía debe producir píxeles y codificar semántica del mundo verificable.
La tercera etapa aborda otra fuente de fallo. Los modelos suelen entrenarse con fotogramas históricos correctos, pero se despliegan sobre sus propias salidas imperfectas. Los pequeños errores se acumulan porque cada fotograma generado se convierte en contexto para el siguiente.
WorldWeaver adapta Self Forcing, un método de entrenamiento que hace avanzar un modelo sobre sus propias generaciones. La técnica expone el sistema a sus condiciones de despliegue antes de la inferencia.
Aquí, el problema incluye tanto la deriva de fotogramas como la deriva de registros. Una vista generada incorrectamente puede corromper la siguiente actualización de estado. Un estado corrompido puede entonces distorsionar las vistas posteriores para todos los agentes.
Por lo tanto, el modelo despliega tanto los fotogramas como los registros confirmados durante el entrenamiento. Aprende a continuar a partir del historial que realmente produjo, no solo de datos de referencia limpios.
El calendario de inferencia utiliza cuatro pasos de eliminación de ruido. Después de eliminar el ruido de cada fotograma, el modelo lo añade a la caché visual acumulativa. Luego actualiza el registro antes de iniciar el siguiente paso de generación.
Este ciclo es el mecanismo principal del artículo. WorldWeaver no se limita a recuperar observaciones antiguas ni a adjuntar metadatos después de la generación. La actualización del estado participa directamente en el bucle autorregresivo.
Otras investigaciones han abordado el mismo problema con memoria externa más explícita. MultiGen, por ejemplo, separa la memoria, la observación y la dinámica para mundos de difusión multijugador editables.
La representación externa de MultiGen permite a los usuarios modificar la estructura del entorno. WorldWeaver mantiene su estado dentro del generador como tokens aprendidos. Eso hace que su memoria sea compacta, pero menos directamente editable.
El contraste revela una decisión de diseño importante. Un mapa externo estructurado proporciona un control inspeccionable, pero exige que el sistema mantenga esa representación. Un registro interno ofrece flexibilidad, pero puede ocultar un estado ambiguo o incorrecto.
WorldWeaver intenta situarse en un punto intermedio. Sus registros permanecen latentes durante la inferencia, aunque objetivos de entrenamiento explícitos hacen que su contenido sea parcialmente recuperable. El sistema aprende un estado interno sin abandonar por completo la verificación.
Este mecanismo también sugiere usos más allá de los juegos sintéticos. Un simulador de flotas robóticas podría generar observaciones separadas mientras preserva ubicaciones compartidas de objetos. Los entornos de entrenamiento podrían modelar cómo la acción de un agente cambia lo que otros encuentran después.
Los sistemas de gemelos digitales enfrentan un problema relacionado cuando distintos sensores proporcionan vistas incompletas. El estado persistente puede integrar evidencia entre esas vistas mientras el entorno simulado sigue evolucionando.
Sin embargo, WorldWeaver no prueba esas aplicaciones. Su evidencia procede de sesiones controladas de Minecraft con dos agentes, acciones sincronizadas y una verdad fundamental inusualmente accesible.
La arquitectura plantea una afirmación técnica clara. La afirmación de aplicación más amplia sigue abierta.
Las puntuaciones mejoran, pero persiste la brecha con los datos del mundo real
Las mejoras reportadas respaldan el modelado explícito del estado, pero no demuestran que WorldWeaver pueda recuperar estados complejos sin supervisión del simulador.
Los investigadores evalúan movimiento, anclaje, memoria, construcción y consistencia. Utilizan precisión de modelos visuales-lingüísticos y la distancia de Inception de Fréchet, o FID, que compara distribuciones visuales generadas y de referencia.
También combinan esas mediciones en una puntuación mundial agregada. WorldWeaver alcanza 105.1 en esa medida. El modelo Solaris reentrenado llega a 81.0, mientras que una línea base de concatenación de fotogramas alcanza 49.1.
Las mayores mejoras de precisión aparecen en categorías sensibles al estado. El anclaje sube de 81.3 con Solaris a 93.8 con WorldWeaver. La construcción aumenta de 9.4 a 28.1.
La consistencia pasa de 57.8 a 76.6. El movimiento también mejora, alcanzando 82.8 frente a 79.7 de Solaris.
La memoria muestra una ventaja menor. WorldWeaver registra 46.9, mientras que Solaris llega a 43.8. La línea base de concatenación de fotogramas obtiene 37.5.
Los resultados de FID son más dispares. WorldWeaver mejora varias categorías, incluidas el movimiento y la consistencia, pero no lidera todas las comparaciones visuales. Su FID de memoria es 64.8, frente a 61.2 de Solaris.
Esta división importa porque el estado lógico y la calidad visual están relacionados, pero no son idénticos. Un modelo puede preservar el evento correcto mientras lo representa mal. También puede crear fotogramas atractivos que contradicen acciones anteriores.
El resultado agregado más sólido de WorldWeaver sugiere que el registro ayuda con el objetivo combinado. No elimina todas las compensaciones de calidad.
Los experimentos de ablación aportan respaldo al mecanismo de estado. Los investigadores varían los tipos de supervisión y comparan pesos densos compartidos con la arquitectura de transformador separada.
Los resultados indican que distintos objetivos de estado ayudan a distintos comportamientos. Ninguna señal individual domina todas las categorías. La supervisión combinada produce la configuración general más sólida reportada.
El experimento semisupervisado aborda la preocupación más evidente sobre la escalabilidad. El equipo fija el conjunto etiquetado en 1,000 clips y luego añade cantidades crecientes de vídeo sin etiquetar.
Sin clips sin etiquetar, la puntuación mundial agregada es 63.2. Añadir 5,000 clips sin etiquetar la eleva a 82.3. Con 10,000 clips sin etiquetar, la puntuación alcanza 90.3.
Este resultado sugiere que una colección etiquetada más pequeña puede anclar la semántica de los registros, mientras que el vídeo convencional mejora la generación. No elimina la necesidad de estado etiquetado, pero reduce la proporción necesaria en este entorno controlado.
Persisten varias advertencias.
Primero, el artículo es una prepublicación de arXiv y aún no ha pasado revisión por pares. Su marco de evaluación, puntuación agregada y conclusiones arquitectónicas necesitan reproducción independiente.
Segundo, el modelo opera en Minecraft. El entorno tiene bloques discretos, entradas de controlador accesibles, sincronización limpia y estado exacto del simulador. Las escenas reales rara vez ofrecen anotaciones equivalentes.
Un robot de almacén podría observar superficies reflectantes, objetos deformables, personas y equipos en movimiento. Puede no haber una vista aérea fiable ni un registro completo de interacciones ocultas.
Tercero, los experimentos cubren dos agentes. Añadir más puntos de vista aumenta tanto la información como el conflicto. Los registros deben preservar identidades, observaciones e interacciones adicionales sin colapsarlas en un resumen ambiguo.
Cuarto, el propio registro puede derivar. Self-forcing expone el modelo a sus errores, pero no puede garantizar la recuperación después de una actualización falsa. Un estado equivocado puede influir en todos los agentes posteriores.
Quinto, el estado reportado solo es parcialmente interpretable. Las cabezas de entrenamiento decodifican objetivos seleccionados, pero esas sondas no revelan todo lo almacenado en el registro. Una alta precisión de las sondas no garantiza una representación completa ni causalmente correcta.
El modelo también depende de descripciones automatizadas de escenas. Esos subtítulos utilizan entradas de controlador de verdad fundamental junto con observaciones visuales. Los datos del mundo real requerirían etiquetas de acción más débiles, ruidosas o estimadas.
Los autores reconocen la limitación central en su artículo. Su principal mejora depende de supervisión adicional del estado, mientras que el estado del mundo real es más complejo y a menudo no está disponible.
Esa admisión define la frontera real del trabajo. WorldWeaver presenta una arquitectura de estado creíble bajo una observabilidad fuerte. No ha resuelto el descubrimiento del estado en entornos donde la verdad está oculta.
Qué demostrará si el estado compartido escala
La próxima evidencia debe probar los registros de estado más allá de Minecraft con dos jugadores, aislar sus compensaciones computacionales y medir la recuperación tras actualizaciones incorrectas.
La primera señal es la reproducción independiente con el código y la configuración de evaluación publicados. Los investigadores deberían verificar la puntuación mundial reportada de 105.1 y examinar si las ganancias por categoría se mantienen con diferentes semillas aleatorias.
La reproducción también debería inspeccionar la métrica agregada. Una puntuación combinada puede aclarar el rendimiento general, pero puede ocultar compensaciones entre precisión lógica y fidelidad visual.
La segunda señal es un entorno más amplio con supervisión incompleta. Un seguimiento útil mantendría agentes sincronizados mientras elimina mapas aéreos exactos o coordenadas del simulador.
Esa prueba revelaría si los registros pueden aprender un estado estable a partir de geometría estimada, lenguaje ruidoso y registros parciales de acciones. El éxito reforzaría el argumento a favor de la robótica y la simulación incorporada.
El fracaso sugeriría que las ganancias de WorldWeaver dependen más de anotaciones privilegiadas que del propio diseño del registro. Ese resultado seguiría informando a sistemas futuros, pero limitaría el alcance práctico de la arquitectura.
La tercera señal es el escalado entre agentes y horizontes. Dos vistas proporcionan un punto de partida importante, pero el estado compartido se vuelve más difícil a medida que actores adicionales modifican el mismo entorno.
Las evaluaciones futuras deberían seguir cómo cambia la consistencia con cuatro o más agentes. También deberían informar el punto en el que la capacidad del registro, el tamaño de la caché o el error acumulado se vuelven limitantes.
Los despliegues más largos necesitan pruebas de estrés específicas. Un agente podría ocultar un objeto, abandonar el área y regresar después de que sus fotogramas originales hayan salido de la caché. Otro agente podría modificar ese objeto mientras el primero sigue ausente.
Esas pruebas separarían el estado persistente del recuerdo visual a corto plazo. También revelarían si el registro actualiza relaciones no observadas o simplemente almacena un historial reciente comprimido.
Los investigadores también deberían medir el comportamiento de corrección. Si una vista produce un objeto o una ubicación falsos, la evidencia posterior debería reparar el estado compartido. De lo contrario, la memoria explícita puede convertir una alucinación local en un compromiso de todo el sistema.
Los sistemas de memoria externa ofrecen una comparación útil. Los mapas estructurados pueden imponer geometría y permitir edición directa, pero conllevan su propia carga de reconstrucción. Los registros aprendidos mantienen flexibilidad, pero son más difíciles de auditar.
Un benchmark convincente debería comparar ambos enfoques con datos y capacidad de cómputo idénticos. Debería incluir contexto largo, registros latentes y estado externo explícito en lugar de tratar una sola línea base como definitiva.
Los informes computacionales también serán importantes. Según el artículo, las cabezas de supervisión exclusivas del entrenamiento no añaden trabajo de inferencia. Sin embargo, los tokens de registro y los pesos de transformador separados siguen afectando la memoria, el coste de entrenamiento y el rendimiento de generación.
Los sistemas interactivos en tiempo real deben equilibrar esos costes frente a las ganancias de consistencia. Un estado compartido que funciona demasiado lentamente no puede respaldar agentes receptivos, juegos o simulaciones robóticas.
WorldWeaver ofrece una respuesta útil a una pregunta acotada: los fotogramas de vídeo recientes no son una definición adecuada de un mundo compartido. Sus registros proporcionan al generador un lugar explícito para mantener hechos entre vistas.
La pregunta más difícil es si esos hechos pueden aprenderse cuando ningún simulador revela la respuesta. Los desarrolladores que evalúan modelos de mundo multiagente deberían vigilar de cerca ese límite.
¿Los sistemas futuros mantienen el estado después de que desaparecen las etiquetas privilegiadas? ¿Pueden corregir una memoria compartida después de que un agente introduce un error? ¿Siguen siendo coherentes a medida que crece el número de agentes?
Esas pruebas determinarán si WorldWeaver representa una arquitectura reutilizable o un sólido resultado en Minecraft. Por ahora, precisa más el debate: un modelo de mundo debe recordar el mundo, no solo sus imágenes más recientes.



