top of page

La actualización de IA física de XPENG pone a prueba si los modelos más grandes pueden ofrecer una conducción más segura

XPENG lanzó la primera gran actualización de VLA 2.0, que añade una memoria de 30 segundos y una ventana de predicción de seis segundos a su sistema de conducción. El titular de Google News hace que parezca otro ambicioso anuncio de inteligencia artificial. El conflicto real es más difícil: XPENG debe convertir modelos más grandes y una memoria más prolongada en un comportamiento más seguro en carreteras cotidianas.

La empresa afirma que XOS 6.3.0 desplaza su sistema de una percepción espacial estática hacia una comprensión dinámica y cuatridimensional. Esto significa conectar eventos anteriores con la escena actual antes de predecir lo que ocurrirá después. XPENG planea introducir el software en el G9L y distribuirlo mediante una actualización inalámbrica.

No se trata principalmente de una competencia por quién puede colocar la etiqueta de IA más grande en un vehículo. Pone a prueba si una arquitectura de modelo compartida puede funcionar en automóviles de pasajeros, robotaxis, robots humanoides y otras máquinas físicas. Tesla y varios fabricantes chinos de automóviles siguen enfoques integrales relacionados, pero XPENG está vinculando más productos a una misma base técnica.

Qué cambió en la actualización de IA física de XPENG

XPENG ha ampliado VLA 2.0, pasando de un sistema que interpreta el presente a uno diseñado para recordar, predecir y actuar de forma continua.

XPENG anunció la actualización durante un evento de IA física celebrado el 27 de agosto en Guangzhou. Los detalles de la actualización de VLA de la empresa describen XOS 6.3.0 como la primera revisión importante tras el lanzamiento inicial de VLA 2.0.

VLA significa visión-lenguaje-acción, una estructura de modelo que conecta la percepción visual y el razonamiento semántico con acciones físicas. En un vehículo, esas acciones incluyen frenar, girar, cambiar de carril y seleccionar una trayectoria entre el tráfico.

La incorporación central es Infini-VLA, una arquitectura diseñada para procesar una secuencia más larga de observaciones de la carretera. XPENG afirma que el sistema desplegado conserva 30 segundos de historial de conducción útil. Ese historial ayuda al modelo a conectar eventos que un solo fotograma de cámara no puede explicar.

Pensemos en un vehículo que se aproxima a un paso de peatones parcialmente oculto por una furgoneta de reparto. Una instantánea podría mostrar solo la furgoneta y un carril visible vacío. Un registro temporal puede conservar el movimiento previo de un peatón hacia la zona oculta.

El modelo debe entonces inferir que el peatón podría reaparecer. Ese es el significado práctico de la afirmación de XPENG de que su IA ahora comprende el tiempo. No significa que el sistema posea un concepto humano del tiempo ni razonamiento general.

X-Foresight aporta el componente de anticipación. XPENG afirma que este modelo del mundo predice el comportamiento de los usuarios cercanos de la vía durante los próximos seis segundos. Un modelo del mundo estima cómo puede evolucionar una escena, lo que permite al software evaluar resultados probables antes de seleccionar una acción.

XPENG ha dicho anteriormente que su sistema de investigación puede modelar períodos más largos. La configuración de producción utiliza seis segundos para equilibrar una previsión útil con las limitaciones de computación a bordo. Esta distinción importa porque un máximo de investigación no describe automáticamente un producto comercializado.

La actualización también introduce inferencia en streaming. En lugar de observar, detenerse, razonar y luego generar una trayectoria, el sistema realiza esas operaciones de forma continua. XPENG afirma que esta arquitectura mejora la velocidad de respuesta en un 300 por ciento.

El flow matching genera después varias trayectorias futuras posibles y les asigna probabilidades. El vehículo puede comparar esas trayectorias al responder a un automóvil que se incorpora, una frenada repentina o un peatón que cambia de dirección. Cada componente aborda el mismo problema: las escenas viales siguen moviéndose mientras el ordenador piensa.

XPENG también afirma que el modelo a bordo contiene 3,5 veces más parámetros que su versión anterior. Más parámetros pueden permitir representaciones más ricas, pero también aumentan las exigencias de memoria, energía y latencia. El tamaño del modelo por sí solo no demuestra la calidad de conducción.

Por tanto, el VLA 2.0 actualizado de XPENG importa porque varias ideas de investigación entran juntas en un paquete de software de producción. Su valor dependerá de la consistencia con que maneje carreteras desconocidas, mal tiempo y comportamiento humano impredecible.

Por qué esta historia de Google News importa más allá de un automóvil

La apuesta mayor es que XPENG pueda reutilizar una base de IA física en distintas máquinas sin obligar a cada producto a comenzar desde cero.

Los automóviles generan grandes volúmenes de datos visuales y de comportamiento bajo estrictos requisitos de seguridad y latencia. Los robotaxis afrontan condiciones viales similares, mientras que los robots humanoides deben interpretar espacios dinámicos a velocidades más bajas. El hardware difiere, pero la percepción, la predicción y la acción siguen siendo problemas vinculados.

XPENG presenta esta superposición como una base técnica compartida. La empresa afirma que la infraestructura menos visible, incluidos los sistemas de entrenamiento y la arquitectura del modelo, representa la mayor parte del trabajo común. Los automóviles, robotaxis y robots se convierten en interfaces separadas para esa base.

Esto hace que la actualización sea más importante de lo que su encuadre en Google News sugiere. Si la base compartida funciona, las inversiones en inteligencia de conducción pueden respaldar otras máquinas. Las mejoras procedentes de la investigación en robótica también pueden orientar cómo los vehículos razonan sobre el movimiento y las limitaciones físicas.

XPENG explicó esta estrategia de modelos en CVPR 2026. Su investigación sobre modelos del mundo incluyó X-Foresight, que predice imágenes futuras y acciones del vehículo dentro de un espacio de tokens común. Los tokens son representaciones compactas que un modelo procesa al generar predicciones.

Esta arquitectura compartida crea un posible ciclo virtuoso de datos. Más vehículos pueden encontrarse con más casos límite, generando material para el entrenamiento y la evaluación de modelos. Un software mejor puede a su vez mejorar los vehículos y respaldar nuevos productos.

Sin embargo, el ciclo no es automático. Los datos recopilados deben representar situaciones útiles, cumplir los requisitos de privacidad y recibir etiquetas o retroalimentación precisas. Una flota más grande puede generar más repeticiones sin resolver necesariamente fallos de seguridad poco frecuentes.

El programa de robotaxis de XPENG proporciona una prueba exigente porque reduce la tolerancia a la intervención humana. La empresa afirma que algunas capacidades de robotaxi están llegando a vehículos de producción. Esa frase exige una interpretación cuidadosa, porque una función derivada de investigación de Nivel 4 no es automáticamente Nivel 4 en un automóvil de consumo.

La automatización de Nivel 4 significa que un sistema puede realizar toda la tarea de conducción dentro de condiciones operativas definidas sin esperar intervención humana. El software de asistencia al conductor para consumidores puede adoptar técnicas de planificación y seguir requiriendo supervisión. La distinción debería seguir siendo visible en toda descripción de producto.

Master Agent extiende la idea del modelo compartido al habitáculo. XPENG afirma que el sistema combina su VLA de conducción con un modelo visión-lenguaje, o VLM, que interpreta imágenes y lenguaje. Puede dividir una solicitud verbal en tareas y coordinar funciones especializadas del vehículo.

Un conductor podría pedir un destino cercano, solicitar al coche que seleccione una ruta e indicarle que se detenga. El agente debe traducir esa solicitud en acciones de navegación, conducción y habitáculo. XPENG afirma que un chip Turing dedicado procesa estas interacciones localmente.

El procesamiento local reduce la dependencia de un centro de datos remoto. También puede mejorar la privacidad y el tiempo de respuesta cuando la conectividad es débil. Sin embargo, hace que la eficiencia sea esencial, porque un automóvil tiene límites fijos de energía, refrigeración, memoria y capacidad de computación disponible.

Por eso la IA física de XPENG es una historia de sistemas, no solo una historia de modelos. Los chips, el software, los sensores, la arquitectura eléctrica, las operaciones de datos y los controles de seguridad deben funcionar en conjunto. Una debilidad en cualquier capa puede eliminar las ganancias obtenidas en otras.

La principal disputa es la promesa de XPENG frente a la realidad de la carretera

El principal rival de XPENG no es un solo fabricante de automóviles, sino la brecha de verificación entre las demostraciones controladas y un comportamiento repetible en el tráfico público.

Las presentaciones de conducción pueden destacar incorporaciones exitosas, giros suaves y respuestas seguras ante obstáculos reconocibles. Las vías públicas producen combinaciones que un equipo de demostración no seleccionó. Los trabajadores de construcción improvisan, las marcas de carril desaparecen y otros conductores ignoran las normas formales.

La memoria temporal parece especialmente adecuada para estas situaciones. Un automóvil debería recordar que un ciclista entró en un punto ciego o que un vehículo que se aproxima se comportó de forma errática. La predicción debería ayudarle a prepararse antes de que un riesgo sea completamente visible.

Aun así, la memoria puede conservar información engañosa. El sistema debe decidir qué observaciones históricas siguen siendo relevantes y cuáles se han quedado obsoletas. Las asociaciones incorrectas pueden influir en decisiones posteriores, incluso cuando la escena actual apunta a otra parte.

La predicción también introduce incertidumbre. Una previsión de seis segundos no puede saber exactamente qué hará cada peatón o conductor. Debe representar varios futuros plausibles y evitar comprometerse en exceso con una sola interpretación.

El flow matching aborda esa incertidumbre generando múltiples trayectorias. El software aún necesita una política para seleccionar entre ellas. Un vehículo excesivamente cauteloso puede volverse dubitativo, mientras que una política agresiva puede crear un riesgo inaceptable.

XPENG afirma que los cambios combinados producen una mejora de 20 veces en el rendimiento de seguridad multidimensional. Se trata de una afirmación de la empresa, no de un resultado de seguridad vial establecido de forma independiente. El material publicado no proporciona suficiente detalle para reproducir la comparación.

Siguen sin respuesta preguntas importantes. La empresa no ha especificado públicamente todas las condiciones de prueba, la línea base, la regla de intervención ni la categoría de fallo detrás de ese multiplicador. Sin esos detalles, los lectores no pueden determinar cómo se transfiere la mejora entre carreteras y condiciones meteorológicas.

La inferencia en streaming plantea otra prueba. El procesamiento continuo debería reducir el retraso entre la percepción y la acción. Sin embargo, las mejoras de velocidad comunicadas necesitan contexto, incluida la latencia anterior, la configuración de hardware y el comportamiento bajo carga computacional máxima.

La misma cautela se aplica al tamaño del modelo. Un aumento de parámetros de 3,5 veces puede mejorar la capacidad, pero también puede ampliar los desafíos de despliegue. Las decisiones de compresión y programación determinan si el sistema responde con suficiente rapidez dentro de un vehículo en movimiento.

XPENG afirma que HybridViT ayuda a llevar las funciones de VLA a vehículos con un solo chip Turing. Los transformadores de visión procesan imágenes dividiéndolas en representaciones más pequeñas y analizando sus relaciones. Un diseño híbrido puede reducir el cálculo y conservar capacidades seleccionadas del modelo.

Ese enfoque amplía la posible base instalada. También crea múltiples perfiles de rendimiento entre vehículos con distintos números de chips. Los propietarios necesitarán explicaciones claras sobre qué funciones, límites y actualizaciones futuras se aplican a cada configuración de hardware.

Los propietarios actuales ya están atentos a ese límite. El nuevo software puede generar frustración cuando los vehículos más antiguos no pueden admitirlo. XPENG debe gestionar las expectativas sobre compatibilidad sin presentar capacidades dependientes del hardware como actualizaciones universales.

La evidencia más difícil vendrá del uso cotidiano. Las tasas de intervención, las causas de desconexión, los patrones de casi accidentes y el rendimiento en distintas ciudades ofrecerían una visión más sólida que las demostraciones editadas. Una presentación transparente de informes también ayudaría a separar el progreso significativo del marketing.

Tesla es el punto de referencia, pero no es toda la competencia

XPENG toma elementos de la dirección de IA integral asociada con Tesla, al tiempo que construye un argumento más amplio en torno a chips locales e IA física compartida.

Tesla sigue siendo una referencia ineludible porque llevó los sistemas de conducción neuronal basados en cámaras a una gran flota de consumo. Su estrategia vinculó datos de vehículos, entrenamiento de modelos, inferencia a bordo y frecuentes actualizaciones de software. XPENG persigue un ciclo de retroalimentación relacionado dentro de un entorno regulatorio y de fabricación diferente.

La comparación no debería convertirse en una simple lista de funciones. Los sistemas de Tesla, XPENG VLA 2.0 y otras plataformas de conducción chinas operan con sensores, métodos de entrenamiento, cobertura geográfica y normas de lanzamiento distintos. Sus afirmaciones públicas sobre rendimiento también emplean métricas diferentes.

XPENG pone énfasis en la inferencia local en sus chips Turing. Este enfoque puede reducir la dependencia de la nube y mantener más procesamiento dentro del vehículo. También otorga a la empresa un mayor control sobre la relación entre el diseño del modelo y el hardware automotriz.

Tesla también depende en gran medida de la computación a bordo. La diferencia significativa no radica en si una u otra empresa utiliza chips locales. Está en la eficiencia con la que sus modelos interpretan escenas, predicen el movimiento y eligen acciones seguras dentro de los límites operativos.

Los competidores chinos añaden más presión. Li Auto, NIO, los sistemas respaldados por Huawei y otros fabricantes están invirtiendo en modelos de conducción de extremo a extremo y plataformas de vehículos definidas por IA. Los rápidos ciclos de lanzamiento de software dificultan conservar cualquier ventaja técnica.

El alcance más amplio de productos de XPENG distingue su narrativa actual. La empresa quiere que su base sirva para robotaxis, robots humanoides y vehículos. Esta estrategia puede repartir los costes de investigación, pero también puede dividir la atención entre productos con requisitos de seguridad diferentes.

Volkswagen aporta una prueba comercial de si la tecnología de XPENG tiene valor más allá de su propia marca. Las empresas han desarrollado conjuntamente una arquitectura eléctrica y electrónica centrada en China. Volkswagen afirma que la arquitectura conjunta de vehículos respaldará vehículos eléctricos específicos para China.

La relación ofrece a XPENG otra vía de ingresos técnicos. También somete los sistemas de la empresa a los procesos de un gran fabricante global de automóviles. Una integración exitosa demostraría que XPENG puede adaptar su ingeniería para una organización externa.

Esto importa porque la economía del software difiere de la economía de los vehículos. Una arquitectura reutilizable puede generar potencialmente ingresos por servicios técnicos sin exigir a XPENG fabricar cada automóvil. Sin embargo, el trabajo de integración puede seguir siendo costoso y específico para cada cliente.

Los últimos resultados financieros de la empresa muestran ambas caras de esa ecuación. XPENG informó ingresos trimestrales de 19.740 millones de RMB y un margen bruto del 20,7 por ciento. Sus resultados del segundo trimestre también registraron un margen de vehículos del 12,1 por ciento y una pérdida neta de 1.340 millones de RMB.

Los ingresos por servicios y otros conceptos alcanzaron los 2.700 millones de RMB, un aumento del 93,9 por ciento frente al año anterior. XPENG atribuyó parte de ese incremento a servicios de investigación y desarrollo técnico prestados a otro fabricante de automóviles. Esto proporciona una primera señal comercial para sus alianzas tecnológicas.

Sin embargo, las entregas totales de vehículos del segundo trimestre fueron de 103.295, casi sin cambios respecto al mismo trimestre del año anterior. Los ingresos mejoraron, pero la estrategia de IA física aún no ha producido un claro aumento del volumen anual de vehículos. La capacidad de software todavía debe traducirse en demanda de los clientes.

Por tanto, la competencia principal sigue siendo entre la promesa y el despliegue. Tesla y los competidores chinos ayudan a establecer el ritmo, pero no determinan el éxito de XPENG. Eso lo harán los clientes, los reguladores y el rendimiento independiente en carretera.

La financiación de robótica eleva la apuesta para XPENG VLA 2.0

Una importante ronda de financiación en robótica da a XPENG más recursos, al tiempo que aumenta la presión para demostrar que la IA física compartida puede convertirse en un negocio real.

XPENG anunció en agosto que su negocio de robótica había firmado acuerdos para recaudar más de 900 millones de dólares estadounidenses. La empresa situó la valoración posterior a la inversión por encima de los 6.300 millones de dólares estadounidenses. IDG Capital lideró la ronda, con participación de otros inversores.

La financiación de robótica está destinada a respaldar la producción de robots humanoides, el desarrollo de modelos y la comercialización. XPENG describe el acuerdo como la mayor ronda individual de financiación privada en el sector de la IA incorporada en China.

La financiación cambia el contexto en torno al lanzamiento de VLA. XPENG ya no presenta la IA física únicamente como una visión de investigación a largo plazo. Está vinculando expectativas comerciales financiadas por separado a su operación de robótica humanoide.

IRON, el robot humanoide de XPENG, representa la prueba más clara de reutilización de modelos fuera de un automóvil. Una máquina humanoide debe percibir personas y objetos, predecir el movimiento, mantener el equilibrio y coordinar acciones. Estas tareas se solapan con la conducción a nivel conceptual.

El solapamiento no hace que la transferencia sea sencilla. Un automóvil opera en carreteras y controla un conjunto limitado de movimientos. Un robot humanoide tiene más articulaciones, contacto directo con objetos y una gama mucho más amplia de acciones posibles.

Los datos de entrenamiento también difieren. Los vehículos pueden recopilar observaciones repetidas de carretera a partir de grandes flotas. Los robots humanoides necesitan ejemplos de alta calidad sobre manipulación, locomoción, recuperación e interacción humana. Muchos fallos valiosos son difíciles o inseguros de recopilar de manera informal.

Aquí es donde la base común de XPENG enfrenta su prueba de mecanismo más exigente. Las representaciones compartidas podrían reducir la ingeniería duplicada, especialmente en percepción visual y predicción. Los sistemas de control específicos de cada producto aún necesitarán un desarrollo y una validación extensos.

La empresa afirma que sus productos de IA física comparten infraestructura y software. Esto puede mejorar la eficiencia de la investigación cuando los avances se transfieren con éxito. Puede desperdiciar recursos si los ingenieros fuerzan una arquitectura única sobre tareas que requieren soluciones distintas.

El calendario comercial plantea otra incertidumbre. XPENG afirma que la financiación acelerará la producción en masa y la comercialización global. La preparación para la producción no garantiza demanda, soporte para el despliegue ni una operación rentable durante toda la vida útil.

Los robots humanoides también requieren mantenimiento, procedimientos de seguridad y trabajos claramente definidos. Una demostración convincente puede atraer atención, mientras que un despliegue industrial fiable exige miles de horas repetitivas y sin incidentes. Estos resultados requieren evidencias diferentes.

Los inversores observarán si la robótica genera ingresos independientes de las ventas de vehículos. También examinarán el coste del hardware, las obligaciones de servicio y el desarrollo continuo de software. Una valoración elevada aumenta la importancia del progreso medible.

Para XPENG, la propuesta atractiva es una capa de inteligencia compartida que mejora en todos los productos. El riesgo es una colección de programas costosos conectados principalmente por la marca. El próximo año debería empezar a distinguir entre estas posibilidades.

Qué observar después del ciclo de Google News

Tres señales mostrarán si XPENG ha avanzado en IA física o si simplemente ha ampliado la ambición asociada a su software.

La primera señal es el despliegue de XOS 6.3.0 en el G9L. Observe el calendario de lanzamiento, las configuraciones de hardware elegibles y la disponibilidad geográfica. Los retrasos o una compatibilidad limitada debilitarían la afirmación de que la nueva arquitectura está lista para un uso amplio en producción.

La experiencia de los usuarios importará más que las cifras de descargas. Los informes deberían describir el comportamiento en tráfico denso, carreteras sin señalizar, baja visibilidad y zonas de obras inusuales. Un rendimiento consistente en estas condiciones reforzaría el argumento de XPENG sobre el razonamiento temporal.

La evidencia más útil incluiría patrones de intervención y categorías de fallos. Una menor tasa de intervención solo importa cuando la distancia de prueba, la dificultad de las carreteras y las normas de supervisión son comparables. Los vídeos cuidadosamente seleccionados no pueden aportar ese denominador.

La segunda señal es la validación técnica externa. La mejora de respuesta del 300 por ciento y la afirmación de seguridad 20 veces mayor de XPENG necesitan definiciones, referencias de comparación y evaluaciones reproducibles más claras. Las pruebas independientes pueden mostrar si esas mejoras siguen siendo visibles fuera de los escenarios seleccionados por la empresa.

Los reguladores también pueden proporcionar validación indirecta. La aprobación de áreas operativas ampliadas o de funciones supervisadas menos restrictivas indicaría confianza en el caso de seguridad. Las restricciones, retiradas del mercado o permisos demorados apuntarían en la dirección opuesta.

La tercera señal es la reutilización comercial entre Volkswagen, robotaxis e IRON. XPENG debe demostrar que la infraestructura compartida crea productos funcionales, no solo diapositivas de presentación compartidas. Los hitos deberían incluir vehículos desplegados, operaciones de robots, integraciones con socios e ingresos por servicios comunicados.

La adopción por parte de Volkswagen ofrece una medida especialmente útil porque involucra a un cliente externo. Una integración funcional en producción respaldaría la tesis de plataforma de XPENG. Una implementación limitada o retrasada sugeriría que la reutilización requiere más ingeniería personalizada de lo esperado.

La operación de robotaxis aporta otra medida exigente. XPENG afirma que la misma base de hardware respalda aplicaciones de nivel 4. Los lectores deberían observar los límites operativos, los viajes completados, la asistencia humana, los informes de seguridad y el acceso para pasajeros comunes.

IRON pondrá a prueba la tesis más allá de la movilidad. La pregunta relevante no es si el robot puede caminar sobre un escenario. Es si las unidades pueden completar tareas definidas repetidamente en fábricas, tiendas, oficinas u otros entornos controlados.

Estas señales también importan a desarrolladores y compradores de tecnología empresarial fuera del sector automotriz. La IA física obliga a los modelos a operar bajo restricciones reales de tiempo real, energía, privacidad y seguridad. El progreso en inferencia local puede influir en la robótica, la computación perimetral y los agentes integrados.

Los trabajadores del conocimiento deberían prestar atención por un motivo diferente. Las vistas previas de Master Agent apuntan a un cambio desde asistentes conversacionales hacia sistemas que coordinan herramientas y acciones físicas. El valor proviene de una ejecución fiable, mientras que el riesgo surge de una intención malinterpretada.

Los equipos que evalúan estos agentes deberían documentar afirmaciones, pruebas, fallos y condiciones de lanzamiento cambiantes. Una base de conocimientos de IA con capacidad de búsqueda puede ayudar a conservar esa evidencia durante las revisiones de ingeniería, compras y cumplimiento normativo.

El artículo original de Google News captó una semana intensa para XPENG. La historia más profunda es la de una empresa que intenta conectar investigación de modelos, chips a bordo, vehículos de consumo, robotaxis, alianzas y robots humanoides.

Esta combinación ofrece a XPENG varias formas de validar su estrategia. También crea varias formas de que una ejecución deficiente se haga visible. Cada producto debe ofrecer un comportamiento útil dentro de sus propias restricciones.

Por tanto, la siguiente pregunta es concreta: ¿producirá XOS 6.3.0 mejoras medibles en carreteras comunes, seguidas de resultados repetibles en las demás máquinas de XPENG? Observe el despliegue, la evidencia independiente de seguridad y los implementaciones externas antes de considerar la IA física como una ventaja consolidada.

 
 

Empieza gratis

Un asistente de IA local-first con gestión del conocimiento personal

Para ofrecer una mejor experiencia con la IA,

actualmente remio solo es compatible con Windows 10+ (x64) y M-Chip Macs.

Tu aliado de IA para el trabajo
Haz más con remio

Planifica. Crea. Entrega.
Todo en un solo lugar.

bottom of page