El modelo robótico S1 de Skild AI convierte el entrenamiento de robots en un prompt
Skild AI ha presentado S1, un modelo robótico que intenta realizar tareas inéditas de hasta 10 minutos tras recibir una única demostración en video. El modelo robótico Skild AI S1 no actualiza sus pesos ni pasa por un posentrenamiento específico para cada tarea antes de actuar. Esto cambia la cuestión central del aprendizaje robótico: ya no se trata de cómo los ingenieros reentrenan una máquina, sino de si un operador puede simplemente mostrarle un nuevo trabajo.
Skild denomina a este proceso aprendizaje en contexto, lo que significa que la demostración guía el comportamiento sin modificar el modelo subyacente. La compañía afirma que S1 puede interpretar la intención, los objetos y el orden de las tareas en distintas escenas y cuerpos robóticos. Sus ejemplos reportados incluyen trasplantar plantas, preparar café, cocinar panqueques y ensamblar kits.
La competencia relevante no enfrenta a Skild con un único fabricante de robots. Enfrenta la adaptación basada en prompts con la práctica establecida de recopilar datos de tareas, ajustar finamente una política y validar cada despliegue. La propia plataforma GR00T de NVIDIA sigue admitiendo posentrenamiento para robots y entornos concretos, mientras que Physical Intelligence también busca una amplia generalización mediante sus modelos robóticos.
El modelo robótico Skild AI S1 aprende trabajo a partir de un video
S1 convierte una demostración grabada en una especificación temporal de la tarea, en lugar de un nuevo conjunto de datos de entrenamiento.
Primero, un operador graba la tarea desde una perspectiva humana. S1 recibe ese video dentro de su ventana de contexto, es decir, la información disponible durante una única sesión de ejecución. Después, la política asigna el objetivo y la secuencia demostrados al robot, su vista de cámara y los objetos que tiene delante.
Esta traducción importa porque la demostración puede diferir de la situación real del robot. El ángulo de cámara, la distribución de la escena, las herramientas disponibles y la encarnación física no tienen que coincidir exactamente. Según la investigación detallada sobre S1 de Skild, el preentrenamiento enseña a la política a inferir relaciones funcionales en lugar de reproducir una trayectoria fija.
Skild afirma que los mismos pesos del modelo generaron todos los ejemplos de su lanzamiento inicial. No se produjo ningún ajuste fino específico para cada tarea después de cada demostración. La compañía presenta esta distinción como la diferencia esencial entre S1 y los sistemas que requieren entrenamiento adicional antes de abordar un nuevo flujo de trabajo.
Los ejemplos más largos van más allá de acciones aisladas de recoger y colocar. Incluyen tareas de hasta 10 minutos y decenas de pasos de manipulación. Este trabajo exige que el robot recuerde el progreso, componga movimientos conocidos en un orden nuevo y se recupere cuando una acción sale mal.
El trasplante de plantas ofrece el ejemplo reportado más claro. Skild grabó una demostración, se la proporcionó a S1 e inició la ejecución autónoma en hardware en un plazo de 11 minutos. Ese intervalo cubrió el proceso desde la grabación del prompt hasta la ejecución de la tarea, según un relato de NVIDIA sobre la colaboración.
La compañía también mostró casos en los que la ejecución difería razonablemente del prompt. Cuando una demostración utilizaba una regadera, pero solo había una taza disponible, se informó de que S1 eligió la taza. Cuando un vaso ya estaba casi lleno, el sistema añadió únicamente la cantidad restante.
Otra demostración mostraba a una persona dejando caer un huevo demasiado pronto. Skild afirma que S1 completó el paso previsto con un movimiento controlado en lugar de reproducir el error. Estos ejemplos sugieren que el modelo trata el video como evidencia de un objetivo, no como un guion fotograma a fotograma.
Esa interpretación separa el prompting físico de la imitación convencional. La copia literal fallaría siempre que el cuerpo, el punto de vista o el entorno del robot difirieran del ejemplo humano. En cambio, S1 necesita inferir qué resultado pretendía el demostrador y qué acciones siguen siendo prácticas en la nueva escena.
La afirmación tiene consecuencias importantes, pero su alcance requiere una formulación cuidadosa. Skild ha presentado demostraciones seleccionadas y resultados de evaluaciones internas, no una evaluación independiente completa en fábricas. La capacidad de S1 para generalizar más allá de esas condiciones sigue siendo un resultado reportado por la compañía.
Aun así, el modelo operativo es claro. El prompt aporta información específica de la tarea en el momento de la ejecución, mientras que los pesos del modelo permanecen fijos. Este enfoque cuestiona directamente el costoso ciclo de adaptación que ha limitado la automatización industrial flexible.
Por qué el prompting físico presiona el modelo de reentrenamiento
Si los prompts en video funcionan de forma fiable, los equipos de despliegue pueden trasladar parte de la programación de robots de los especialistas a los operadores de primera línea.
La automatización industrial convencional funciona bien cuando los productos, las fijaciones y los movimientos permanecen estables. Los ingenieros pueden optimizar un robot para una secuencia repetible y rodearlo de equipos controlados. La economía se vuelve menos atractiva cuando los productos o las distribuciones cambian con frecuencia.
Las políticas robóticas aprendidas prometen más flexibilidad, pero a menudo mantienen un ciclo de despliegue exigente. Los equipos recopilan demostraciones en el entorno objetivo, ajustan finamente el modelo, prueban la política actualizada y repiten el proceso tras los cambios. Cada paso requiere experiencia, acceso a equipos y tiempo.
Skild sostiene que las políticas moderadamente complejas pueden requerir decenas o cientos de horas de datos procedentes de las condiciones de despliegue. Incluso un modelo preentrenado puede perder gran parte de su ventaja económica si cada tarea de cliente sigue necesitando una amplia campaña de posentrenamiento.
S1 traslada esa carga de adaptación al prompt. Un trabajador que comprende el proceso puede grabar una demostración y pedir a la política existente que la interprete. El modelo no necesita otra actualización de gradiente, que es el ajuste matemático utilizado normalmente durante el entrenamiento.
Skild estima que un breve prompt en video puede aportar una utilidad comparable a aproximadamente 380 ejemplos recopilados manualmente. Afirma que reunir esos ejemplos podría consumir entre 50 y 100 horas. Ambas cifras proceden de la compañía y no han recibido validación independiente.
La brecha de rendimiento reportada también es considerable. En las nuevas pruebas de múltiples pasos de Skild, S1 promedió aproximadamente un 66 por ciento de éxito por paso. El sistema de comparación alcanzó cerca de un 9 por ciento por paso, lo que supone una diferencia de más de siete veces.
El éxito por paso no equivale a completar con éxito una tarea. Una secuencia con muchos pasos dependientes puede fallar si una sola acción sale mal. Por tanto, incluso un promedio sólido puede producir tasas de finalización decepcionantes en un flujo de trabajo largo.
Supongamos que una tarea contiene diez pasos y que cada paso tiene, de forma independiente, un 66 por ciento de probabilidades de éxito. La probabilidad de completar todos los pasos seguiría siendo muy baja. Los resultados reales no son necesariamente independientes, pero el ejemplo muestra por qué la métrica requiere contexto.
El comportamiento de recuperación puede cambiar ese cálculo. Un robot que detecta un objeto mal colocado y vuelve a intentarlo de forma inteligente tiene más valor que otro que trata cada error como definitivo. Skild afirma que S1 se ajusta cuando los objetos se mueven y se recupera de errores, pero no ha publicado suficientes detalles operativos para realizar comparaciones amplias de fiabilidad.
La presión comercial recae en la integración específica de cada tarea, no solo en los modelos fundacionales competidores. Los integradores de sistemas suelen dedicar un esfuerzo significativo a adaptar hardware y software a una línea concreta. Un prompting más rápido desplazaría el valor hacia modelos reutilizables, sistemas de validación y soporte de despliegue.
Los fabricantes seguirían necesitando controles de seguridad y cualificación de procesos. Una demostración en video no puede establecer límites de carga, límites de colisión, normas de higiene ni tolerancias de producto. El prompting físico cambia cómo la tarea llega a la política, pero no elimina la ingeniería industrial.
La oportunidad más sólida a corto plazo se encuentra en el trabajo de alta variedad que se resiste a la programación fija. Estos entornos cambian con la frecuencia suficiente para encarecer la ingeniería repetida, pero siguen estando lo bastante estructurados como para admitir supervisión. El ensamblaje en pequeñas series, la preparación de kits, la preparación de alimentos y la inspección encajan en ese patrón.
Skild afirma que ahora trabaja con más de 60 clientes de despliegue que pagan. La compañía reportó una tasa anual de ingresos recurrentes de 100 millones de dólares apenas 10 meses después de su primer despliegue comercial. Su actualización comercial señala que la manipulación genera cerca del 90 por ciento de los ingresos, mientras que la movilidad aporta el resto.
Estas cifras son reportadas por la compañía y resultan inusualmente rápidas para la robótica. No revelan la duración de los contratos, la concentración de clientes, los márgenes de despliegue ni qué parte de los ingresos depende de los servicios. Sin embargo, indican que Skild está poniendo a prueba su tesis técnica en operaciones de pago, y no solo mediante demostraciones de laboratorio.
Cómo funciona Skild S1 en la pila de Physical AI de NVIDIA
S1 depende de una canalización completa de datos, simulación, entrenamiento y despliegue, aunque cada nueva tarea evita el posentrenamiento.
La sencilla experiencia de usuario oculta una preparación considerable. Un modelo no puede interpretar una demostración si el preentrenamiento no lo ha expuesto previamente a tareas, escenas, objetos, fallos y cuerpos robóticos diversos. El prompt de un video reduce el trabajo de adaptación después del entrenamiento, no el coste de construir el modelo fundacional.
Skild afirma que ninguna fuente de datos individual proporciona simultáneamente realismo de hardware, diversidad y escala. Las demostraciones robóticas teleoperadas se ajustan estrechamente al hardware de despliegue, pero las personas deben recopilarlas lentamente. El video humano es abundante y variado, aunque no contiene acciones robóticas nativas.
La simulación puede generar grandes volúmenes de experiencia y fallos poco frecuentes. Su debilidad es la brecha entre simulación y realidad, en la que el contacto virtual, la fricción, la iluminación o el comportamiento de los sensores difieren de las condiciones físicas. S1 combina estas fuentes en lugar de considerar suficiente una sola.
La infraestructura de NVIDIA conecta las etapas. La computación acelerada permite entrenar modelos con simulación, video humano, teleoperación y datos de despliegue permitidos. Los modelos Cosmos procesan video y ayudan a crear entradas de entrenamiento variadas, mientras que Cosmos Curator facilita la anotación, el filtrado y la organización.
Omniverse e Isaac Sim proporcionan entornos virtuales basados en la física. Skild puede generar datos, probar casos límite y validar comportamientos antes de llevarlos al hardware. Esto reduce el coste y el peligro de aprender todos los modos de fallo en el suelo de una fábrica.
Isaac Lab proporciona un entorno de aprendizaje por refuerzo, donde las políticas mejoran mediante interacción y retroalimentación simuladas. El motor de física Newton modela fuerzas, colisiones, presión y contacto. Skild y NVIDIA también están desarrollando solucionadores acelerados por GPU para el agarre y la manipulación de objetos sólidos.
Las herramientas Nsight ayudan a los ingenieros a identificar cuellos de botella computacionales durante el entrenamiento. TensorRT optimiza la inferencia, que es el proceso de ejecutar el modelo entrenado para seleccionar acciones. La baja latencia importa porque un robot físico debe responder mientras los objetos, las personas y su propio cuerpo siguen moviéndose.
Esta infraestructura también revela una distinción importante. Skild entrena S1 en sistemas NVIDIA, pero S1 no es simplemente un modelo robótico de NVIDIA renombrado. Skild controla la política y la estrategia de datos, mientras que NVIDIA suministra la computación y una amplia colección de herramientas de desarrollo.
NVIDIA también compite en la capa de modelos mediante Isaac GR00T. La compañía describe GR00T 1.7 como un modelo abierto de visión, lenguaje y acción apto para uso comercial, con un punto de control base de tres mil millones de parámetros.
Un modelo de visión-lenguaje-acción conecta observaciones visuales e instrucciones con acciones robóticas. GR00T 1.7 acepta imágenes, lenguaje y estado del robot, y luego produce comandos de movimiento. NVIDIA afirma que fue preentrenado con aproximadamente 32.000 horas de datos reales y 8.000 horas de datos simulados.
GR00T ofrece una vía de adaptación diferente. Los desarrolladores pueden partir de su checkpoint preentrenado y realizar postentrenamiento para su robot, entorno y tarea específicos. La promesa principal de S1 es que un prompt de video puede definir la nueva tarea sin esa actualización adicional del modelo.
Estos enfoques no se excluyen mutuamente. El postentrenamiento puede maximizar el rendimiento para trabajos estables y de gran volumen. El aprendizaje en contexto puede mejorar la flexibilidad cuando las tareas cambian más rápido de lo que los ingenieros pueden reconstruir políticas.
NVIDIA se beneficia de cualquiera de las dos vías. Suministra cómputo, simulación, procesamiento de datos, software de despliegue y sus propios modelos fundacionales. Por tanto, el éxito de Skild validaría la infraestructura de NVIDIA incluso si los clientes eligen S1 en lugar de GR00T.
La relación se parece a la de un proveedor de plataforma y un proveedor de aplicaciones que trabajan juntos mientras sus límites técnicos se solapan. Skild necesita la pila de desarrollo subyacente, y NVIDIA obtiene una carga de trabajo comercialmente visible. Ambas buscan que los despliegues de IA física escalen más allá de demostraciones aisladas.
El proyecto de ensamblaje Blackwell da a esa colaboración un contexto concreto. Skild, NVIDIA y Foxconn están desplegando el Skild Brain en manipuladores de doble brazo utilizados en la producción de sistemas NVIDIA Blackwell.
En un flujo de trabajo demostrado, el robot instala una barra colectora y un bloque de límite, y luego fija 16 tornillos. Debe seguir la secuencia, controlar el contacto con precisión y responder cuando las condiciones físicas difieren de su plan.
Esta es una prueba más significativa que preparar café para un video. El ensamblaje de hardware tiene tolerancias definidas, errores costosos y rendimiento medible. También plantea una pregunta exigente: si la flexibilidad impulsada por prompts puede coexistir con una consistencia de nivel de producción.
Skild S1 frente a GR00T es realmente adaptación frente a fiabilidad
La disyuntiva central no es si S1 puede realizar una tarea novedosa una vez, sino si puede repetirla de forma segura con un rendimiento útil.
Una demostración pulida establece capacidad, no operación fiable. Las fábricas miden unidades completadas, tiempo de ciclo, frecuencia de intervención, defectos, tiempo de inactividad e incidentes de seguridad. Un modelo puede parecer adaptable y, aun así, perder económicamente en varias de esas métricas.
La tasa de éxito por paso del 66 por ciento que Skild reporta exige especial cautela. Representa una mejora importante respecto a la línea base citada, pero sigue estando muy por debajo de la fiabilidad asociada con la automatización fija madura. El umbral práctico depende de la recuperación, la supervisión, el valor de la tarea y el coste del fallo.
Algunas aplicaciones pueden tolerar reintentos. Un robot de almacén podría volver a intentar un agarre después de que un artículo se desplace. Otros fallos pueden dañar componentes, contaminar alimentos o poner a los trabajadores en riesgo. Por lo tanto, la misma puntuación de un modelo puede respaldar el despliegue en un entorno e impedirlo en otro.
Las tareas de largo horizonte amplifican el problema. S1 debe mantener el contexto a lo largo de decenas de movimientos mientras registra qué pasos se completaron correctamente. Un error inicial puede alterar la escena y hacer que la demostración restante sea menos relevante.
El modelo debe entonces decidir si reintenta, sustituye otro objeto, omite un paso o solicita ayuda humana. Cada decisión introduce otra oportunidad de interpretación incorrecta. Un comportamiento de sentido común en ejemplos seleccionados no establece una política de error fiable.
La evaluación independiente sigue siendo limitada en todo el sector de los modelos fundacionales para robots. Diferentes empresas utilizan hardware, tareas, distribuciones de entrenamiento, definiciones de éxito y prácticas de edición distintos. Las comparaciones principales rara vez aportan evidencia controlada de que una política generalice mejor que otra.
Physical Intelligence ofrece una comparación útil. Su investigación sobre modelos robóticos incluye generalización en entornos abiertos, transferencia de humano a robot, memoria a largo plazo y tareas que superan los 10 minutos. Su modelo π0.7 también apunta a un rendimiento listo para usar en entornos desconocidos y trabajos de múltiples etapas.
La investigación de GR00T de NVIDIA hace hincapié en checkpoints abiertos, flujos de trabajo estándar, simulación y postentrenamiento. Figure desarrolla Helix junto con su propio hardware humanoide. Cada vía equilibra de forma distinta la generalización, la especialización por corporización, la recopilación de datos y el control del despliegue.
La apuesta distintiva de Skild es que la intención de la tarea pueda llegar mediante un prompt de video en el momento de la ejecución. Esto podría reducir el trabajo de personalización y mantener una política compartida entre varios tipos de robots. También convierte la interpretación del prompt en parte del límite de seguridad operativo.
Una demostración vaga o defectuosa puede generar ambigüedad. Skild afirma que S1 a veces corrige errores humanos, lo que parece útil. Sin embargo, la corrección también implica que el modelo decide cuándo apartarse del ejemplo proporcionado.
Esa discreción necesita límites. Un operador debe entender si el modelo reconoció correctamente el objetivo y por qué eligió un movimiento distinto. De lo contrario, una corrección aparentemente inteligente puede convertirse en una desviación impredecible.
La literatura de investigación identifica problemas sin resolver más amplios. Una encuesta revisada por pares sobre robótica destaca la escasez de datos robóticos, las garantías de seguridad, la medición de incertidumbre y la ejecución en tiempo real como desafíos persistentes para los modelos fundacionales.
El lanzamiento de S1 no elimina esas limitaciones. Presenta una interfaz diferente para la adaptación y una estrategia de entrenamiento diseñada en torno a esa interfaz. La evidencia de producción debe demostrar que el método resiste equipos, iluminación, desgaste, materiales y comportamiento humano variados.
Los informes comerciales requieren un escrutinio similar. Una proyección de ingresos anualizados extrapola el negocio recurrente actual a un año. No equivale a ingresos anuales auditados, efectivo cobrado ni despliegues rentables.
Skild afirma que reconoció 50 millones de dólares durante sus primeros 10 meses de despliegues. También menciona proyectos en logística, seguridad, inspección, preparación de alimentos, centros de datos y manufactura. Estos detalles respaldan actividad real de clientes, pero no revelan la economía unitaria.
La estrategia de despliegue de la empresa podría fortalecer S1 con el tiempo. Con permiso de los clientes, la experiencia operativa puede alimentar el modelo más amplio. Más despliegues podrían producir entonces mejores políticas, reducir el trabajo de adaptación y respaldar nuevos despliegues.
Ese ciclo también plantea preguntas de gobernanza. Los clientes necesitan claridad sobre qué datos operativos salen de sus instalaciones, cómo se filtran y si mejoran modelos utilizados en otros lugares. El video sensible de manufactura puede revelar diseños de productos, procedimientos y disposiciones de seguridad.
La dependencia de NVIDIA genera otra consideración estratégica. Su pila cubre entrenamiento, simulación, optimización y despliegue, lo que puede acelerar el desarrollo. Una integración profunda también puede hacer que las decisiones de infraestructura sean más difíciles de cambiar después.
Ninguna de estas preocupaciones invalida el enfoque S1. Definen la evidencia necesaria para distinguir un modelo de investigación flexible de una infraestructura industrial fiable. Skild ha mostrado un mecanismo atractivo, pero los clientes juzgarán el sistema operativo que lo rodea.
Tres señales que mostrarán si S1 escala
La siguiente fase debería medirse mediante tasas de finalización en producción, evidencia de hardware más amplia y evaluación reproducible de forma independiente.
La primera señal es un rendimiento sostenido en el despliegue de ensamblaje Blackwell. Skild ha identificado un flujo de trabajo específico que implica dos brazos, varios componentes y 16 tornillos. Esto ofrece a los observadores más elementos para evaluar que una demostración doméstica definida de forma imprecisa.
Una divulgación útil incluiría éxito de la tarea completa, tiempo de ciclo medio, frecuencia de intervención humana y tasas de defectos. Los resultados deberían abarcar períodos de producción prolongados en lugar de una ejecución seleccionada. Un rendimiento estable reforzaría el argumento de que los prompts físicos pueden respaldar la manufactura de precisión.
Tasas de finalización débiles apuntarían en otra dirección. Sugerirían que el prompting flexible de S1 todavía necesita ingeniería específica para cada tarea, postentrenamiento o un control ambiental más estricto. El modelo podría seguir siendo valioso, pero su ventaja económica se reduciría.
La segunda señal es la transferencia repetible entre clientes y cuerpos robóticos. Skild denomina a su sistema más amplio un cerebro robótico omni-cuerpo, lo que significa que una capa de inteligencia puede controlar distintas plataformas físicas. El valor de S1 aumenta sustancialmente si la misma política maneja brazos, manipuladores móviles y otras máquinas.
La empresa ha mencionado trabajo con Foxconn, Sumitomo Wiring Systems y Mitsui. Estos proyectos abarcan ensamblaje electrónico, fabricación de arneses de cableado y cocinas comerciales. También exponen el modelo a distintos materiales, requisitos de seguridad y definiciones de éxito.
La evidencia procedente de varios despliegues pondría a prueba cómo funciona Skild S1 fuera de sus demostraciones de lanzamiento. La pregunta clave es si la adaptación mediante un solo video sigue siendo rápida cuando cambian al mismo tiempo el hardware, las cámaras, las herramientas y las normas del lugar de trabajo.
La intervención frecuente de ingeniería debilitaría la afirmación generalista. Indicará que el prompt visible es solo una pequeña parte del trabajo de despliegue. Por el contrario, que los operadores enseñen nuevos flujos de trabajo sin actualizaciones del modelo respaldaría el argumento central de Skild.
La tercera señal es un marco de evaluación más claro. Skild ha proporcionado resultados por paso y una comparación con una línea base, pero los lectores externos necesitan definiciones de tareas, número de ensayos, categorías de fallos y tasas de finalización completas. También necesitan información sobre la distancia respecto de la distribución de preentrenamiento.
Este último punto es esencial. Una tarea puede parecer nueva mientras comparte objetos y movimientos con muchos ejemplos de entrenamiento. Un aprendizaje en contexto sólido debería manejar cambios tanto en la estructura de la tarea como en las condiciones de despliegue, no simplemente recombinar escenas conocidas.
Las comparaciones controladas con GR00T, modelos de Physical Intelligence o políticas especializadas serían útiles. El objetivo no debería ser un único número en una clasificación. Las evaluaciones deberían separar adaptabilidad, precisión, recuperación, latencia y seguridad.
Skild ha anunciado que futuras publicaciones técnicas explicarán el entrenamiento de S1 con mayor profundidad. Esas divulgaciones pueden aclarar la composición del conjunto de datos, la arquitectura, el diseño de evaluación y los controles de contaminación. Métodos reproducibles proporcionarían a los investigadores una base más firme para evaluar las afirmaciones de la empresa.
Para los desarrolladores, S1 sugiere que las demostraciones podrían convertirse en una interfaz robótica práctica junto con el lenguaje y el código. Los compradores empresariales deberían centrarse en la economía de finalización, los controles de seguridad y los derechos sobre los datos antes de considerar el aprendizaje de una sola vez como listo para el despliegue.
El modelo robótico Skild AI S1 importa porque pone a prueba si un robot puede recibir trabajo nuevo mediante contexto en lugar de reentrenamiento. Su próximo hito no es otro video pulido de una tarea. Es evidencia de que operadores corrientes pueden enseñar trabajos cambiantes mientras el sistema mantiene una calidad predecible.
Observe el despliegue Blackwell, la transferencia entre clientes y los detalles de evaluación en los próximos meses. Si los tres se sostienen, el prompting de video se convertirá en una alternativa creíble a la personalización repetida de políticas. ¿Qué tarea de su operación ofrecería la prueba más clara y segura de esa afirmación?



