El modelo del mundo de ByteDance pone a Zhang Yiming en carrera con Google y Meta
- Olivia Johnson

- hace 2 horas
- 15 min de lectura
Según informes, ByteDance prepara un modelo del mundo que genera video espacial a 20 fotogramas por segundo, desafiando a Google y Meta en la IA interactiva.
El sistema crearía entornos virtuales que responden al movimiento o la voz del usuario, en lugar de producir un video fijo. El fundador Zhang Yiming supervisa personalmente su desarrollo, según personas familiarizadas con el proyecto.
El supuesto modelo del mundo de ByteDance es relevante porque conecta tres activos que pocos laboratorios de IA reúnen. ByteDance cuenta con un modelo de video, un negocio de infraestructura en la nube y visores Pico que podrían ofrecer una vía directa hacia los usuarios.
Google DeepMind y Meta ya han presentado los modelos del mundo como una ruta importante hacia sistemas de IA que comprenden entornos físicos. ByteDance parece ahora dispuesta a poner a prueba una versión más integrada comercialmente de esa tesis.
La cuestión central no es si ByteDance puede generar imágenes impresionantes. Es si las escenas generadas siguen siendo receptivas, coherentes y útiles cuando las personas o las máquinas interactúan con ellas.
El modelo del mundo de ByteDance va más allá de los clips generados
Según informes, ByteDance quiere convertir la generación de video en un entorno que cambia mientras alguien lo utiliza.
El proyecto se está construyendo sobre Seedance, la tecnología existente de generación de video de ByteDance, según un reportaje sobre video espacial publicado el 7 de septiembre. El lanzamiento podría llegar tan pronto como octubre, aunque el calendario sigue sin estar definido.
ByteDance no había anunciado públicamente el modelo cuando apareció el informe. La compañía tampoco hizo comentarios a Bloomberg. Por tanto, la ventana de lanzamiento, el nombre del producto, el modelo de acceso y la arquitectura técnica siguen sin confirmarse.
Esta salvedad importa porque el rendimiento reportado supondría un cambio sustancial respecto al video de IA convencional. Los generadores de video actuales suelen renderizar un clip terminado tras recibir una indicación, una imagen o un video de referencia.
Un modelo del mundo interactivo funciona de otra manera. Predice cómo debe cambiar un entorno después de una acción y luego produce el siguiente estado visual con la rapidez suficiente para preservar la interacción.
El sistema reportado generaría video en la nube a aproximadamente 20 fotogramas por segundo. Su latencia, el retraso entre una entrada y una respuesta visible, sería de unos 0,05 segundos, según los informes.
Estas cifras provienen de fuentes no identificadas y no han sido evaluadas de manera independiente. Deben considerarse objetivos reportados, no rendimiento de producto establecido.
Si ByteDance alcanza esos objetivos, los usuarios podrían entrar en espacios generados que reaccionen a sus voces y movimientos físicos. Entre las aplicaciones reportadas se incluyen juegos, transmisiones en directo y dramas de formato corto.
Un espectador podría cambiar una historia al caminar hacia un personaje. Un presentador de una transmisión en directo podría moverse por un escenario generado sin esperar a que se renderice un clip completo.
Un creador de juegos podría describir una escena y explorarla antes de construir activos tradicionales. Estos ejemplos siguen siendo usos potenciales hasta que ByteDance revele los controles reales y los límites de producción.
El proyecto estaría destinado a funcionar con Pico, el negocio de hardware de realidad extendida de ByteDance. La nube se encargaría del exigente trabajo de generación, mientras que un visor captaría la entrada y mostraría el resultado.
Esa división podría reducir el procesamiento necesario en el visor. También convertiría la fiabilidad de la red, la capacidad de la nube y los costes operativos en elementos centrales de la experiencia de usuario.
ByteDance ya incluye la investigación sobre modelos del mundo junto con la interacción multimodal y la robótica dentro de su organización Seed. Su catálogo público de modelos Seed también muestra una cartera en expansión de video, imágenes, voz y comprensión multimodal.
Sin embargo, ese catálogo no confirma el modelo espacial reportado. Establece el programa técnico circundante, no las especificaciones descritas por fuentes anónimas.
Por tanto, el cambio inmediato es estratégico más que plenamente demostrado. ByteDance parece estar avanzando desde los medios generados hacia entornos generados de forma continua.
Ese movimiento ejerce presión directa sobre el trabajo de simulación interactiva de Google DeepMind. También sitúa a ByteDance junto al esfuerzo de Meta por enseñar a las máquinas cómo evolucionan las situaciones físicas.
Por qué Zhang Yiming vuelve personalmente a la carrera de la IA
La supuesta participación de Zhang Yiming sugiere que ByteDance considera los modelos del mundo una apuesta a nivel de empresa, no otra función experimental para medios.
Zhang dejó el cargo de director ejecutivo de ByteDance en 2021. Su supuesta supervisión del nuevo proyecto da al esfuerzo más peso que una expansión rutinaria de producto.
El relato de Bloomberg lo sitúa junto a investigadores como Yann LeCun, científico jefe de IA de Meta, y Fei-Fei Li, fundadora de World Labs. Ambos han sostenido que la IA necesita una comprensión espacial más rica para operar más allá de las interfaces de texto.
Los grandes modelos de lenguaje predicen patrones en palabras y otros tokens. En cambio, los modelos del mundo intentan representar cómo cambia un entorno, incluidos los efectos de las acciones de un agente.
Esa distinción importa para los robots, los sistemas autónomos, los juegos y la realidad extendida. Cada uno requiere más que una imagen verosímil del siguiente instante.
Un sistema útil debe mantener objetos, posiciones, puntos de vista y relaciones causales. Si un usuario se da la vuelta, una silla antes visible debería permanecer donde el entorno la situó.
Si un robot empuja una taza, el resultado predicho debería respetar el contacto, la dirección y los obstáculos cercanos. La calidad visual por sí sola no puede garantizar ese tipo de fiabilidad.
ByteDance entra en este campo con una amplia experiencia en distribución y generación de video. TikTok y Douyin dieron a la compañía años de experiencia operativa en clasificar, comprimir, distribuir y analizar contenido visual.
Ese historial no genera automáticamente un modelo del mundo fiable. Sí proporciona a ByteDance infraestructura y conocimiento de producto que los participantes centrados en investigación deben adquirir por separado.
Seedance ofrece otro punto de partida. La familia de modelos está diseñada para la creación controlable de video, incluidos planos con múltiples sujetos, cambios de cámara y secuencias visuales coordinadas.
El proyecto reportado tendría que convertir esas fortalezas en predicción de baja latencia. Es un desafío distinto al de mejorar la calidad visual de un clip sin conexión.
Cada nueva entrada del usuario cambia lo que el modelo debe generar después. El sistema debe responder sin perder la identidad, la geometría ni el historial de la escena.
La participación de Zhang también indica que la oportunidad de mercado va más allá del entretenimiento. La simulación interactiva podría respaldar finalmente el entrenamiento robótico, la navegación autónoma y la generación de datos sintéticos.
Los datos sintéticos utilizan ejemplos generados por ordenador para entrenar o probar un sistema de IA. Se vuelven valiosos cuando los datos del mundo real son escasos, peligrosos, costosos o difíciles de etiquetar.
Un desarrollador de robots podría probar muchas distribuciones de habitaciones sin construir cada una. Un sistema autónomo podría encontrarse con configuraciones inusuales de clima o tráfico sin esperar a que ocurran.
Sin embargo, los datos de entrenamiento útiles deben preservar las reglas que importan en el despliegue. Una simulación visualmente convincente aún puede enseñar la lección equivocada si su física es inconsistente.
ByteDance ya ha explorado ese problema mediante Seed3D, un sistema para crear activos preparados para simulación a partir de imágenes individuales. Su informe técnico describe una brecha entre la simulación de video diversa y la retroalimentación física explícita.
La investigación de Seed3D sostiene que los enfoques basados en video pueden escalar el contenido, pero a menudo carecen de una consistencia 3D fiable. Los motores físicos tradicionales ofrecen dinámicas más sólidas, pero requieren una costosa producción manual de activos.
Esa disyuntiva explica por qué el modelo espacial reportado merece atención. ByteDance no se limita a sumarse a una categoría de moda.
Parece estar reuniendo tecnologías separadas para la generación de video, los activos 3D, la simulación y los agentes multimodales. La cuestión sin resolver es si esas piezas forman una plataforma coherente.
Google DeepMind es el objetivo competitivo más claro
La competencia principal es ByteDance contra Google DeepMind, porque ambas persiguen mundos explorables renderizados en tiempo real.
Google presentó Genie 3 como un modelo del mundo de propósito general que crea entornos interactivos a partir de texto. Los usuarios pueden navegar por esos entornos mientras el modelo genera cómo evoluciona cada escena.
Google afirma que Genie 3 puede producir salida en 720p a 24 fotogramas por segundo. Puede mantener un entorno interactivo durante varios minutos, en lugar de generar solo una secuencia fija breve.
Estas especificaciones dan al sistema reportado de ByteDance un punto de referencia evidente. Se dice que ByteDance apunta a 20 fotogramas por segundo, al tiempo que enfatiza una latencia de respuesta muy baja y la integración con Pico.
La tasa de fotogramas por sí sola no decidirá la competencia. Un modelo puede actualizarse rápidamente mientras olvida objetos, cambia distribuciones o produce respuestas físicamente imposibles.
La descripción general de Genie 3 de Google identifica abiertamente varias limitaciones. El sistema no siempre puede reproducir ubicaciones reales con precisión, renderizar texto con claridad o sostener la interacción durante periodos prolongados.
Estas revelaciones ofrecen una base útil para evaluar a ByteDance. Cualquier demostración de lanzamiento debería juzgarse por su persistencia y control, no solo por su apariencia cinematográfica.
Project Genie, el prototipo de Google orientado al usuario, expone límites más prácticos. Google documenta controles retrasados, deterioro de la calidad de la transmisión, oscurecimiento de las escenas y una adhesión imperfecta a la física del mundo real.
El prototipo también impone sesiones cortas. Los problemas conocidos de Google muestran con qué rapidez un logro de investigación puede encontrarse con restricciones ordinarias de producto.
ByteDance podría atacar esas debilidades mediante un sistema estrechamente controlado. Posee el desarrollador del modelo, la vía de entrega en la nube, las plataformas de contenido y la marca de visores prevista.
Esa integración podría ayudar a los ingenieros a optimizar todo el ciclo entre movimiento, transmisión de red, generación y visualización. Google cuenta con amplias ventajas de infraestructura, pero no controla una plataforma de visores de consumo comparable.
ByteDance también dispone de herramientas consolidadas para creadores de video. CapCut, Doubao, TikTok y Douyin ofrecen posibles canales de distribución si la generación interactiva se vuelve útil fuera de los visores.
Google posee ventajas distintas. DeepMind tiene una larga trayectoria en aprendizaje por refuerzo, entornos simulados, robótica y sistemas de planificación.
Google también puede conectar la investigación de Genie con Gemini, Google Cloud, Maps y su trabajo más amplio con agentes. Sus experimentos con Street View ofrecen datos geográficos que ByteDance no puede reproducir fácilmente.
Por tanto, la competencia no es simplemente China contra Estados Unidos. Es una disputa entre dos rutas distintas para convertir los entornos generados en productos.
Google parte de un linaje de investigación centrado en agentes y simulación. ByteDance parte de la creación de video, la distribución de contenido y un punto final de hardware propio.
El modelo del mundo más sólido de ByteDance haría que la generación interactiva se sintiera como un servicio de medios. El producto Genie más sólido convertiría la simulación en una interfaz general para agentes y personas.
Ninguno de los dos enfoques ha demostrado aún que los mundos generados de forma abierta puedan mantenerse fiables durante sesiones prolongadas. Esa limitación común mantiene la competencia más reñida de lo que sugieren las demostraciones pulidas.
ByteDance también debe decidir cuánto del modelo expondrá. Google ha abierto Project Genie a usuarios elegibles, lo que ofrece a observadores externos evidencia imperfecta pero valiosa.
Una demostración controlada de ByteDance revelaría menos. Un acceso amplio, benchmarks reproducibles o herramientas para desarrolladores aportarían pruebas más sólidas de que el modelo funciona más allá de prompts seleccionados.
Meta Está Desarrollando Razonamiento Físico, No un Escenario Virtual
Meta es un competidor importante en modelos de mundo, pero su apuesta central se centra en la predicción y la planificación robótica, no en el entretenimiento renderizado.
Meta lanzó V-JEPA 2 en junio de 2025. El modelo de 1.200 millones de parámetros aprende representaciones a partir de vídeo y predice estados futuros en un espacio abstracto de características.
Ese enfoque difiere de generar cada píxel visible. El modelo de Meta busca captar la información relevante para comprender y planificar, al tiempo que ignora detalles visuales impredecibles.
Meta entrenó V-JEPA 2 con más de un millón de horas de vídeo y un millón de imágenes. Después añadió entrenamiento condicionado por acciones, que vincula los cambios observados con comandos de robots.
La empresa utilizó 62 horas de datos robóticos durante esa etapa posterior. Meta afirma que el sistema resultante permitió la planificación zero-shot para objetos y entornos desconocidos.
La planificación zero-shot consiste en intentar una tarea sin entrenamiento adicional para ese contexto concreto. El robot evalúa posibles acciones mediante el modelo antes de elegir su siguiente movimiento.
En las pruebas de Meta, el sistema realizó tareas como alcanzar objetos, recogerlos y desplazarlos. Las tasas de éxito comunicadas alcanzaron entre el 65% y el 80% en determinadas pruebas de recoger y colocar.
Estos resultados proceden de la propia investigación de Meta y de condiciones de laboratorio especificadas. No demuestran una fiabilidad general para robots que operen en hogares o lugares de trabajo sin control.
La investigación de Meta sobre razonamiento físico también informa de una brecha significativa entre los principales modelos y el rendimiento humano en nuevos benchmarks de evaluación. Esa brecha subraya el carácter inacabado del campo.
El contraste con ByteDance resulta útil. V-JEPA 2 no necesita renderizar un mundo atractivo para una persona que lleva un visor.
Necesita representaciones lo bastante precisas para que una máquina compare acciones y planifique. El sistema del que se informa sobre ByteDance debe generar una salida visible de inmediato mientras preserva la estructura del mundo.
Un generador visual y un predictor latente resuelven problemas relacionados, pero distintos. Latente se refiere a una representación interna, en lugar de a una imagen mostrada directamente al usuario.
La generación de píxeles ofrece una interfaz intuitiva y demostraciones atractivas. También consume recursos de computación en texturas, iluminación y detalles que quizá no ayuden a un agente a elegir una acción.
La predicción latente puede centrarse en cambios relevantes para una tarea. Sin embargo, no ofrece automáticamente un entorno visual para creadores, jugadores o usuarios de visores.
Según los informes, ByteDance busca el atractivo comercial del vídeo generado y la capacidad de respuesta de una simulación. Combinar esas cualidades es más difícil que maximizar cualquiera de ellas por separado.
Su investigación más amplia sugiere que la empresa comprende esa división. Seed3D produce activos destinados a motores físicos convencionales, mientras que el modelo espacial del que se informa generaría vídeo interactivo.
Eso deja al menos dos rutas técnicas posibles. ByteDance podría basarse principalmente en la predicción de vídeo aprendida, o podría combinar generación con componentes explícitos de geometría y simulación.
La empresa no ha revelado qué ruta eligió. Sin detalles arquitectónicos, las comparaciones con Meta deberían limitarse a objetivos y rendimiento observable.
Meta también proporciona a desarrolladores externos acceso al código y a los checkpoints del modelo V-JEPA 2. Eso permite a los investigadores probar el sistema, examinar sus limitaciones y desarrollar evaluaciones competitivas.
ByteDance no ha dicho si su modelo del que se informa se publicará, se ofrecerá mediante una API o permanecerá dentro de sus productos. Las condiciones de distribución determinarán su influencia en la investigación robótica.
Si el acceso queda limitado a Pico o a aplicaciones de ByteDance, el modelo aún podría convertirse en un producto de consumo exitoso. Tendría menos valor como base compartida para equipos independientes de robótica.
El Vídeo en Tiempo Real No Es lo Mismo que un Mundo Fiable
La latencia comunicada resulta impresionante sobre el papel, pero la persistencia, la física, el coste y la seguridad determinarán si el sistema puede considerarse algo más que vídeo interactivo.
Un modelo de mundo debe recordar lo que ocurrió. El metraje generado solo se convierte en un entorno utilizable cuando las acciones anteriores siguen afectando a estados posteriores.
Supongamos que un usuario abre una puerta, mueve un objeto y regresa varios minutos después. La escena debería conservar esos cambios desde múltiples puntos de vista.
Los generadores interactivos actuales suelen tener dificultades con esta persistencia. Los detalles se desvían, los controles se retrasan y los objetos pueden cambiar cuando salen del encuadre visible.
Las sesiones más largas acumulan cada pequeño error de predicción. El modelo utiliza repetidamente sus propios estados generados como contexto, permitiendo que las inconsistencias se acumulen.
La latencia comunicada de 0,05 segundos también necesita una definición clara. Podría describir la inferencia del modelo, la respuesta en la nube o un componente del ciclo completo de interacción.
Una experiencia con visor incluye sensores, procesamiento local, transmisión de red, programación del servidor, generación, compresión y visualización. La latencia de extremo a extremo superará cualquier medición interna individual.
Las condiciones de red crean otra variable. Un mundo generado en la nube puede funcionar bien cerca de un centro de datos, pero responder mal a través de una conexión móvil congestionada.
Este desafío es especialmente importante para la realidad extendida. Las respuestas visuales tardías pueden romper la inmersión y causar molestias a algunos usuarios.
El renderizado en la nube desplaza trabajo fuera del visor, pero no elimina el coste. El proveedor debe generar repetidamente fotogramas para cada sesión activa.
Un vídeo fijo puede renderizarse una vez, almacenarse y verse muchas veces. Un entorno interactivo puede requerir un flujo único para las acciones de cada usuario.
ByteDance podría compensar esa carga mediante optimización de modelos, almacenamiento en caché y patrones de interacción predecibles. Aun así, la economía de uso importará tanto como las tasas de fotogramas anunciadas.
La empresa también debe demostrar qué tipo de control admite el modelo. Mover una cámara por una escena es más fácil que manipular objetos con resultados causales fiables.
La entrada de voz podría alterar la historia sin modificar el sistema espacial subyacente. El seguimiento de movimiento podría afectar al punto de vista sin permitir una interacción física significativa.
Un lanzamiento debería distinguir entre navegación, control narrativo, manipulación de objetos y entrenamiento de agentes. Tratar estas capacidades como intercambiables ocultaría el valor real del modelo.
La evaluación es otro problema sin resolver. Los benchmarks de vídeo suelen premiar la calidad visual o la alineación con el prompt, mientras que los benchmarks de robótica miden la finalización de tareas.
Un mundo interactivo necesita pruebas adicionales de memoria, controlabilidad, tiempo de respuesta, geometría y consistencia causal. También puede requerir evaluaciones de seguridad específicas de cada dominio.
Los entornos generados pueden reproducir personajes protegidos por derechos de autor, lugares reconocibles o escenarios dañinos. Los medios espaciales plantean nuevas preocupaciones porque los usuarios participan dentro del resultado.
El modelo también podría generar simulaciones incorrectas que parezcan físicamente creíbles. Ese riesgo se vuelve serio si los desarrolladores utilizan el resultado para entrenar robots o sistemas autónomos.
Un robot entrenado en un simulador impreciso podría repetir supuestos inseguros en el mundo físico. El realismo visual puede hacer que esos errores sean más difíciles de detectar.
ByteDance tendrá que separar las afirmaciones sobre entretenimiento de las relacionadas con robótica. Un modelo puede respaldar juegos atractivos sin ser lo bastante fiable para una planificación sensible a la seguridad.
El trabajo público de la empresa sobre Seed3D reconoce esta distinción. Sus investigadores describen la física explícita como importante para la interpretación y la seguridad, incluso cuando los sistemas generativos proporcionan contenido más variado.
Esa afirmación no revela cómo el modelo de mundo de ByteDance del que se informa maneja la física. Sí demuestra que los investigadores de ByteDance reconocen la disyuntiva subyacente.
El acceso independiente ayudaría a responder estas preguntas. Los investigadores necesitan pruebas repetidas, prompts adversariales, sesiones largas y tareas de interacción medibles.
Los vídeos seleccionados no pueden mostrar la frecuencia de los fallos. Tampoco pueden establecer si la calidad de salida se mantiene en redes ordinarias, entornos complejos o con usuarios simultáneos.
Hasta que existan esas pruebas, las especificaciones comunicadas de ByteDance siguen siendo un ambicioso objetivo de diseño. Aún no prueban que la empresa haya perfeccionado un modelo de mundo.
Tres Señales Mostrarán si ByteDance Ha Cerrado la Brecha
La próxima fase de esta competencia se decidirá mediante un lanzamiento de producto, una persistencia medible y evidencia de que el sistema va más allá de las demostraciones de entretenimiento.
La primera señal es si ByteDance lanza el modelo del que se informa en el calendario sugerido. Un lanzamiento en octubre respaldaría la afirmación de que el proyecto ha avanzado más allá de la investigación interna.
La forma de ese lanzamiento será importante. Una experiencia para Pico, una herramienta para creadores, una demostración pública, una API y un checkpoint de investigación revelarían cada uno un nivel distinto de preparación.
Una exhibición limitada en visor validaría la estrategia de producto integrado de ByteDance. No demostraría que los desarrolladores externos pueden crear aplicaciones fiables.
La segunda señal es una interacción sostenida bajo pruebas públicas. ByteDance debería divulgar la duración de las sesiones, la resolución, la tasa de fotogramas y la latencia de extremo a extremo en condiciones de red realistas.
Los evaluadores también deberían comprobar si los objetos y las disposiciones persisten después de salir del encuadre. Deberían medir la rapidez con la que se acumulan errores durante una interacción prolongada.
Resultados claros reforzarían la idea de que el modelo de mundo de ByteDance compite directamente con Genie 3. Las demostraciones breves y cuidadosamente seleccionadas debilitarían esa comparación.
La tercera señal es un puente hacia los sistemas físicos. ByteDance debería mostrar si el modelo puede producir simulaciones condicionadas por acciones que respalden la evaluación de robótica o de agentes autónomos.
Esa evidencia podría adoptar la forma de benchmarks de tareas, asociaciones con empresas de robótica o integración con el trabajo 3D de la empresa preparado para simulación. El éxito reproducible importaría más que el acabado visual.
Sin ese puente, ByteDance aún podría crear una plataforma de entretenimiento importante. Ocuparía una posición más limitada que la visión más amplia de modelos de mundo asociada a Meta y Google DeepMind.
Los desarrolladores deberían vigilar las condiciones de acceso junto con el rendimiento técnico. Una API o un artefacto de investigación descargable permitiría a equipos independientes probar la persistencia y el control.
Los compradores empresariales deberían centrarse en la fiabilidad, la gobernanza de datos y los requisitos totales de inferencia. Un prototipo con buena capacidad de respuesta no se convierte automáticamente en un sistema de producción económico.
Los creadores deberían prestar atención al control editable. La pregunta útil es si las escenas se mantienen coherentes durante revisiones, movimientos de personajes y narrativas ramificadas.
Los trabajadores del conocimiento tienen otro motivo para interesarse. Los modelos de mundo apuntan hacia interfaces en las que la IA puede probar acciones dentro de simulaciones antes de recomendar decisiones.
La idea sigue siendo incipiente, pero podría cambiar la forma en que las personas revisan conceptos de producto, escenarios de formación y planes operativos. Mantener organizada la investigación verificada será más importante a medida que se multipliquen las demostraciones.
Las herramientas basadas en una base de conocimientos de IA con capacidad de búsqueda pueden ayudar a los equipos a separar las especificaciones divulgadas de las afirmaciones comunicadas y de los resultados posteriores de benchmarks.
ByteDance aún no ha demostrado que su sistema espacial pueda igualar a Google en generación interactiva o a Meta en razonamiento físico. El informe muestra que pretende competir en ambos terrenos.
Esa intención por sí sola cambia el mercado. Google y Meta ya no se enfrentan únicamente a laboratorios de investigación o startups especializadas en simulación dentro de esta categoría.
Podrían enfrentarse a una empresa con una plataforma global de video, software para creadores, infraestructura en la nube y su propio canal de visores. Esos activos ofrecen a ByteDance varias vías de adopción.
La prueba más difícil comenzará cuando usuarios externos puedan llevar el sistema más allá de sus mejores demostraciones. ¿El entorno recuerda, responde y respeta reglas coherentes cuando desaparece la novedad?
Si ByteDance publica evidencia reproducible sobre estas cuestiones, su modelo de mundo representará más que otro avance en video con IA. Hasta entonces, la carrera sigue abierta.
Observe el formato de lanzamiento, la duración de la interacción estable y cualquier validación en robótica. En conjunto, esas señales mostrarán si Zhang Yiming ha construido un simulador de mundo creíble o un generador de medios inusualmente receptivo.


