Skild AI afirma que S1 puede ejecutar tareas inéditas y de varios pasos, de hasta 10 minutos, después de ver un solo vídeo humano y sin fine tuning. El vídeo funciona como una instrucción durante la ejecución: S1 combina habilidades aprendidas previamente —como agarrar, mover y colocar objetos— para completar una nu...
Publicado porEditado con GPT-5.6 LunaImágenes generadas con GPT Image 1.5
Respuesta de investigación

Create a landscape editorial hero image for this Studio Global article: What is Skild AI’s S1 robotics foundation model, how does it enable robots to learn and perform previously unseen long-horizon manipulation. Article summary: Skild AI’s S1 is a robotics foundation model designed for visual in-context learning: rather than retraining a policy for each new job, a robot conditions on one video demonstration and then attempts the task in real tim. Topic tags: general, general web, news, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts wi
La propuesta de Skild AI con S1 es sencilla de entender, aunque técnicamente ambiciosa: en lugar de programar un robot desde cero para cada tarea, una persona le muestra un vídeo y el modelo intenta reproducir el objetivo en el entorno real. Según Skild, S1 puede abordar tareas inéditas y de varios pasos que duran hasta 10 minutos, sin fine-tuning ni una fase posterior de entrenamiento específica para esa demostración. 1
La diferencia es importante. La robótica tradicional suele depender de grandes cantidades de datos específicos, teleoperación, ingeniería y nuevos entrenamientos antes de que una máquina pueda asumir un trabajo distinto. S1 no pretende memorizar cada fotograma del vídeo, sino interpretar qué se quiere conseguir y combinar habilidades que ya aprendió durante su entrenamiento.
S1 utiliza aprendizaje visual en contexto (visual in-context learning). La demostración humana actúa como una instrucción visual en el momento de la ejecución: el modelo observa lo ocurrido, infiere el objetivo y el orden de los pasos, y traduce esa información en acciones para el robot que tiene delante. De acuerdo con la descripción de Skild, los pesos del modelo no se modifican cada vez que recibe un vídeo nuevo. 1
El proceso se parece más a enseñar con el ejemplo que a entrenar un robot convencional. S1 debe relacionar lo que ve con capacidades previamente aprendidas —agarrar, desplazar, colocar y manipular objetos— y organizarlas en un procedimiento más largo. Las demostraciones públicas incluyen preparar café de filtro, plantar una planta en una maceta, montar un kit y dar la vuelta a tortitas. 1
35
El reto principal es el horizonte largo. Un movimiento aislado puede programarse o aprenderse con relativa facilidad; una tarea de 10 minutos puede contener decenas de decisiones, objetos que cambian de posición y múltiples oportunidades de error. S1 está pensado para mantener el objetivo durante toda la secuencia y adaptar sus movimientos a la escena, en vez de repetir mecánicamente los gestos exactos de la persona.
Skild informa de una diferencia considerable entre dar instrucciones mediante vídeo y hacerlo mediante lenguaje en su evaluación de tareas inéditas. Con una escala de entrenamiento declarada de 100.000 horas, la política guiada por vídeo alcanzó un 66 % de éxito medio por paso, frente al 9 % de una política comparable de visión-lenguaje-acción guiada por lenguaje. 32
El resultado apunta a una ventaja práctica de las demostraciones visuales: un vídeo puede mostrar detalles físicos que las palabras dejan ambiguos, como qué objeto agarrar, cómo orientarlo, en qué orden actuar o cómo responder a cambios en el entorno.
Aun así, la cifra necesita contexto. Procede de una evaluación comunicada por Skild y no de una prueba industrial independiente reproducida por terceros. Además, un 66 % de éxito por paso no equivale a una garantía del 66 % de completar una tarea de 10 minutos de principio a fin: cuantos más pasos tenga una tarea, más ocasiones hay para que un error interrumpa la secuencia.
Los ejemplos públicos de S1 incluyen:
Estas tareas combinan percepción, identificación y manipulación de objetos, orden de acciones y control sostenido. Por eso resultan más exigentes que una prueba centrada en un único movimiento. Skild las describe como tareas no vistas durante el preentrenamiento, aunque la evidencia pública procede principalmente de la propia empresa y de medios que resumen sus afirmaciones. 1
33
Las demostraciones ilustran la interfaz que Skild quiere construir: una persona realiza la tarea una vez y el robot intenta generalizar el procedimiento. Sin embargo, no prueban que S1 pueda encargarse de cualquier trabajo doméstico, operar sin supervisión o responder de forma fiable a todas las variaciones físicas de una planta industrial.
Una de las ventajas anunciadas es que el robot puede comenzar a actuar después de observar la demostración, sin un ciclo de entrenamiento posterior específico para la tarea. Skild y la cobertura del lanzamiento describen esta ejecución en contexto como funcionamiento en tiempo real. 1
30
No obstante, las fuentes disponibles no ofrecen una medición precisa y fiable de la latencia: por ejemplo, cuántos segundos pasan entre el final del vídeo y el primer movimiento del robot. Que no haya fine-tuning significa que el modelo no actualiza sus pesos para esa tarea concreta; no implica necesariamente que el vídeo se procese de forma instantánea ni que desaparezcan la calibración, la configuración o las comprobaciones de seguridad.
S1 forma parte de la estrategia más amplia de Skild Brain, un modelo generalista entrenado con tareas, cuerpos robóticos, simulaciones y datos visuales humanos. La idea es evitar una política independiente para cada robot y cada trabajo. Skild afirma haber creado un universo simulado con 100.000 variantes de robots y haber probado la generalización hacia cuerpos excluidos de los datos de entrenamiento. 6
El entrenamiento con distintos tipos de cuerpo busca que el modelo aprenda principios generales de control. Los materiales de Skild describen un sistema destinado a funcionar con humanoides, robots cuadrúpedos, brazos de sobremesa y manipuladores móviles. 3
10
Las afirmaciones de que Skild dispone de entre 100 y 1.000 veces más datos que sus competidores deben tomarse con cautela. Las fuentes proporcionadas no ofrecen una comparación estandarizada y auditable de tamaño, calidad o utilidad de los conjuntos de datos de las distintas empresas. La conclusión más sólida es que Skild apuesta por escalar mediante entrenamiento entre distintos cuerpos y simulación, en lugar de depender únicamente de demostraciones diseñadas para una plataforma concreta.
Omni-bodied es el término de Skild para describir un modelo capaz de transferirse entre cuerpos robóticos diferentes. En teoría, un modelo compartido puede aprender conceptos relacionados con la tarea sin quedar atado a la geometría exacta de una sola máquina. Eso le permitiría adaptarse a robots con piernas, ruedas, brazos, pinzas y distribuciones de actuadores distintas. Skild afirma que sus pruebas simuladas incluyeron formas robóticas reservadas para evaluación y controladas sin entrenamiento específico previo. 6
Esto no significa que el hardware deje de importar. Los robots siguen teniendo sensores, pinzas, límites articulares, interfaces de control, latencias, capacidades de carga y requisitos de seguridad diferentes. Un modelo que generaliza entre cuerpos puede reducir el trabajo de adaptación, pero el despliegue continúa necesitando hardware compatible, integración del sistema y validación en el entorno de destino.
Según informaciones públicas, el software de Skild funciona en cientos de robots dentro de fábricas, centros de datos y entornos logísticos. Entre los ejemplos citados aparecen la fábrica de NVIDIA en Houston, una prueba en LaGuardia y trabajos con empresas de cableado y construcción. La compañía también ha anunciado relaciones con ABB Robotics, Universal Robots y NVIDIA. 17
4
Estos casos indican interés comercial y pruebas en entornos reales, pero no aportan suficiente información pública para calcular tasas de finalización en producción, disponibilidad, ahorro de costes o retorno de la inversión. Un resultado de laboratorio o de una evaluación controlada no debe confundirse con una métrica industrial. Un informe también describe un despliegue previsto con Foxconn en líneas de ensamblaje asociadas a los sistemas de servidores con GPU Blackwell de NVIDIA; eso demuestra un esfuerzo de prueba o despliegue, no una operación autónoma generalizada de la fábrica. 43
La financiación de Skild ha convertido su enfoque en uno de los más observados dentro de la inteligencia artificial física. Bloomberg informó de que la empresa captó unos 1.400 millones de dólares en una ronda Serie C liderada por SoftBank en enero de 2026, con una valoración superior a 14.000 millones de dólares. 13 Su Serie A, anunciada en julio de 2024, fue de 300 millones de dólares y situó su valoración comunicada en 1.500 millones.
9
La comparación con un “momento ChatGPT” describe el cambio de experiencia que la empresa espera conseguir: en vez de programar o reentrenar un robot para cada trabajo, un operario podría mostrarle el comportamiento deseado y dejar que un modelo general traduzca esa demostración en acciones. S1 representa un paso relevante hacia esa interfaz.
Pero todavía no demuestra que hayan llegado los robots generalistas. Los resultados públicos más destacados proceden de la propia empresa, el conjunto de tareas sigue siendo limitado y no hay métricas industriales independientes verificadas en la evidencia disponible. La conclusión más prudente es que S1 muestra una vía prometedora para reducir el entrenamiento específico: usar un vídeo como instrucción, aprovechar habilidades reutilizables aprendidas durante el preentrenamiento y comprobar si pueden combinarse para resolver tareas nuevas y prolongadas.
Studio Global AI
Esta página incluye una respuesta respaldada por fuentes que puede continuar dentro de Studio Global.
Skild AI afirma que S1 puede ejecutar tareas inéditas y de varios pasos, de hasta 10 minutos, después de ver un solo vídeo humano y sin fine tuning.
Skild AI afirma que S1 puede ejecutar tareas inéditas y de varios pasos, de hasta 10 minutos, después de ver un solo vídeo humano y sin fine tuning. El vídeo funciona como una instrucción durante la ejecución: S1 combina habilidades aprendidas previamente —como agarrar, mover y colocar objetos— para completar una nueva secuencia en el entorno actual.
La estrategia Skild Brain busca generalizar entre distintos cuerpos robóticos y variantes simuladas, pero las pruebas públicas todavía no permiten confirmar tasas independientes de finalización en producción, disponib...
Skild AI afirma que S1 puede ejecutar tareas inéditas y de varios pasos, de hasta 10 minutos, después de ver un solo vídeo humano y sin fine tuning. El vídeo funciona como una instrucción durante la ejecución: S1 combina habilidades aprendidas previamente —como agarrar, mover y colocar objetos— para completar una nu...
Publicado porEditado con GPT-5.6 LunaImágenes generadas con GPT Image 1.5
Respuesta de investigación

Create a landscape editorial hero image for this Studio Global article: What is Skild AI’s S1 robotics foundation model, how does it enable robots to learn and perform previously unseen long-horizon manipulation. Article summary: Skild AI’s S1 is a robotics foundation model designed for visual in-context learning: rather than retraining a policy for each new job, a robot conditions on one video demonstration and then attempts the task in real tim. Topic tags: general, general web, news, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts wi
La propuesta de Skild AI con S1 es sencilla de entender, aunque técnicamente ambiciosa: en lugar de programar un robot desde cero para cada tarea, una persona le muestra un vídeo y el modelo intenta reproducir el objetivo en el entorno real. Según Skild, S1 puede abordar tareas inéditas y de varios pasos que duran hasta 10 minutos, sin fine-tuning ni una fase posterior de entrenamiento específica para esa demostración. 1
La diferencia es importante. La robótica tradicional suele depender de grandes cantidades de datos específicos, teleoperación, ingeniería y nuevos entrenamientos antes de que una máquina pueda asumir un trabajo distinto. S1 no pretende memorizar cada fotograma del vídeo, sino interpretar qué se quiere conseguir y combinar habilidades que ya aprendió durante su entrenamiento.
S1 utiliza aprendizaje visual en contexto (visual in-context learning). La demostración humana actúa como una instrucción visual en el momento de la ejecución: el modelo observa lo ocurrido, infiere el objetivo y el orden de los pasos, y traduce esa información en acciones para el robot que tiene delante. De acuerdo con la descripción de Skild, los pesos del modelo no se modifican cada vez que recibe un vídeo nuevo. 1
El proceso se parece más a enseñar con el ejemplo que a entrenar un robot convencional. S1 debe relacionar lo que ve con capacidades previamente aprendidas —agarrar, desplazar, colocar y manipular objetos— y organizarlas en un procedimiento más largo. Las demostraciones públicas incluyen preparar café de filtro, plantar una planta en una maceta, montar un kit y dar la vuelta a tortitas. 1
35
El reto principal es el horizonte largo. Un movimiento aislado puede programarse o aprenderse con relativa facilidad; una tarea de 10 minutos puede contener decenas de decisiones, objetos que cambian de posición y múltiples oportunidades de error. S1 está pensado para mantener el objetivo durante toda la secuencia y adaptar sus movimientos a la escena, en vez de repetir mecánicamente los gestos exactos de la persona.
Skild informa de una diferencia considerable entre dar instrucciones mediante vídeo y hacerlo mediante lenguaje en su evaluación de tareas inéditas. Con una escala de entrenamiento declarada de 100.000 horas, la política guiada por vídeo alcanzó un 66 % de éxito medio por paso, frente al 9 % de una política comparable de visión-lenguaje-acción guiada por lenguaje. 32
El resultado apunta a una ventaja práctica de las demostraciones visuales: un vídeo puede mostrar detalles físicos que las palabras dejan ambiguos, como qué objeto agarrar, cómo orientarlo, en qué orden actuar o cómo responder a cambios en el entorno.
Aun así, la cifra necesita contexto. Procede de una evaluación comunicada por Skild y no de una prueba industrial independiente reproducida por terceros. Además, un 66 % de éxito por paso no equivale a una garantía del 66 % de completar una tarea de 10 minutos de principio a fin: cuantos más pasos tenga una tarea, más ocasiones hay para que un error interrumpa la secuencia.
Los ejemplos públicos de S1 incluyen:
Estas tareas combinan percepción, identificación y manipulación de objetos, orden de acciones y control sostenido. Por eso resultan más exigentes que una prueba centrada en un único movimiento. Skild las describe como tareas no vistas durante el preentrenamiento, aunque la evidencia pública procede principalmente de la propia empresa y de medios que resumen sus afirmaciones. 1
33
Las demostraciones ilustran la interfaz que Skild quiere construir: una persona realiza la tarea una vez y el robot intenta generalizar el procedimiento. Sin embargo, no prueban que S1 pueda encargarse de cualquier trabajo doméstico, operar sin supervisión o responder de forma fiable a todas las variaciones físicas de una planta industrial.
Una de las ventajas anunciadas es que el robot puede comenzar a actuar después de observar la demostración, sin un ciclo de entrenamiento posterior específico para la tarea. Skild y la cobertura del lanzamiento describen esta ejecución en contexto como funcionamiento en tiempo real. 1
30
No obstante, las fuentes disponibles no ofrecen una medición precisa y fiable de la latencia: por ejemplo, cuántos segundos pasan entre el final del vídeo y el primer movimiento del robot. Que no haya fine-tuning significa que el modelo no actualiza sus pesos para esa tarea concreta; no implica necesariamente que el vídeo se procese de forma instantánea ni que desaparezcan la calibración, la configuración o las comprobaciones de seguridad.
S1 forma parte de la estrategia más amplia de Skild Brain, un modelo generalista entrenado con tareas, cuerpos robóticos, simulaciones y datos visuales humanos. La idea es evitar una política independiente para cada robot y cada trabajo. Skild afirma haber creado un universo simulado con 100.000 variantes de robots y haber probado la generalización hacia cuerpos excluidos de los datos de entrenamiento. 6
El entrenamiento con distintos tipos de cuerpo busca que el modelo aprenda principios generales de control. Los materiales de Skild describen un sistema destinado a funcionar con humanoides, robots cuadrúpedos, brazos de sobremesa y manipuladores móviles. 3
10
Las afirmaciones de que Skild dispone de entre 100 y 1.000 veces más datos que sus competidores deben tomarse con cautela. Las fuentes proporcionadas no ofrecen una comparación estandarizada y auditable de tamaño, calidad o utilidad de los conjuntos de datos de las distintas empresas. La conclusión más sólida es que Skild apuesta por escalar mediante entrenamiento entre distintos cuerpos y simulación, en lugar de depender únicamente de demostraciones diseñadas para una plataforma concreta.
Omni-bodied es el término de Skild para describir un modelo capaz de transferirse entre cuerpos robóticos diferentes. En teoría, un modelo compartido puede aprender conceptos relacionados con la tarea sin quedar atado a la geometría exacta de una sola máquina. Eso le permitiría adaptarse a robots con piernas, ruedas, brazos, pinzas y distribuciones de actuadores distintas. Skild afirma que sus pruebas simuladas incluyeron formas robóticas reservadas para evaluación y controladas sin entrenamiento específico previo. 6
Esto no significa que el hardware deje de importar. Los robots siguen teniendo sensores, pinzas, límites articulares, interfaces de control, latencias, capacidades de carga y requisitos de seguridad diferentes. Un modelo que generaliza entre cuerpos puede reducir el trabajo de adaptación, pero el despliegue continúa necesitando hardware compatible, integración del sistema y validación en el entorno de destino.
Según informaciones públicas, el software de Skild funciona en cientos de robots dentro de fábricas, centros de datos y entornos logísticos. Entre los ejemplos citados aparecen la fábrica de NVIDIA en Houston, una prueba en LaGuardia y trabajos con empresas de cableado y construcción. La compañía también ha anunciado relaciones con ABB Robotics, Universal Robots y NVIDIA. 17
4
Estos casos indican interés comercial y pruebas en entornos reales, pero no aportan suficiente información pública para calcular tasas de finalización en producción, disponibilidad, ahorro de costes o retorno de la inversión. Un resultado de laboratorio o de una evaluación controlada no debe confundirse con una métrica industrial. Un informe también describe un despliegue previsto con Foxconn en líneas de ensamblaje asociadas a los sistemas de servidores con GPU Blackwell de NVIDIA; eso demuestra un esfuerzo de prueba o despliegue, no una operación autónoma generalizada de la fábrica. 43
La financiación de Skild ha convertido su enfoque en uno de los más observados dentro de la inteligencia artificial física. Bloomberg informó de que la empresa captó unos 1.400 millones de dólares en una ronda Serie C liderada por SoftBank en enero de 2026, con una valoración superior a 14.000 millones de dólares. 13 Su Serie A, anunciada en julio de 2024, fue de 300 millones de dólares y situó su valoración comunicada en 1.500 millones.
9
La comparación con un “momento ChatGPT” describe el cambio de experiencia que la empresa espera conseguir: en vez de programar o reentrenar un robot para cada trabajo, un operario podría mostrarle el comportamiento deseado y dejar que un modelo general traduzca esa demostración en acciones. S1 representa un paso relevante hacia esa interfaz.
Pero todavía no demuestra que hayan llegado los robots generalistas. Los resultados públicos más destacados proceden de la propia empresa, el conjunto de tareas sigue siendo limitado y no hay métricas industriales independientes verificadas en la evidencia disponible. La conclusión más prudente es que S1 muestra una vía prometedora para reducir el entrenamiento específico: usar un vídeo como instrucción, aprovechar habilidades reutilizables aprendidas durante el preentrenamiento y comprobar si pueden combinarse para resolver tareas nuevas y prolongadas.
Studio Global AI
Esta página incluye una respuesta respaldada por fuentes que puede continuar dentro de Studio Global.
Skild AI afirma que S1 puede ejecutar tareas inéditas y de varios pasos, de hasta 10 minutos, después de ver un solo vídeo humano y sin fine tuning.
Skild AI afirma que S1 puede ejecutar tareas inéditas y de varios pasos, de hasta 10 minutos, después de ver un solo vídeo humano y sin fine tuning. El vídeo funciona como una instrucción durante la ejecución: S1 combina habilidades aprendidas previamente —como agarrar, mover y colocar objetos— para completar una nueva secuencia en el entorno actual.
La estrategia Skild Brain busca generalizar entre distintos cuerpos robóticos y variantes simuladas, pero las pruebas públicas todavía no permiten confirmar tasas independientes de finalización en producción, disponib...