Selon Skild AI, S1 peut exécuter des tâches inédites en plusieurs étapes, durant jusqu’à 10 minutes, après avoir observé une seule vidéo humaine et sans fine tuning. La vidéo sert de consigne au moment de l’exécution : S1 assemble des compétences acquises pendant son préentraînement pour agir dans l’environnement pr...
Publié parModifié avec GPT-5.6 LunaImages générées avec GPT Image 1.5
Réponse de recherche

Create a landscape editorial hero image for this Studio Global article: What is Skild AI’s S1 robotics foundation model, how does it enable robots to learn and perform previously unseen long-horizon manipulation. Article summary: Skild AI’s S1 is a robotics foundation model designed for visual in-context learning: rather than retraining a policy for each new job, a robot conditions on one video demonstration and then attempts the task in real tim. Topic tags: general, general web, news, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts wi
Skild AI veut changer la manière dont on programme les robots : plutôt que de coder chaque geste ou de réentraîner un modèle pour chaque nouvelle mission, il suffirait de montrer l’exemple. Son modèle S1 observe une vidéo d’une personne réalisant une tâche, puis tente de la reproduire dans son propre environnement.
Skild affirme que S1 peut traiter des tâches inédites, comportant plusieurs étapes et pouvant durer jusqu’à 10 minutes, sans fine-tuning ni phase d’entraînement supplémentaire après l’observation. 1
L’enjeu est important pour la robotique. Jusqu’à présent, apprendre à un robot un nouveau travail nécessitait souvent des données propres à la tâche, de la téléopération, du travail d’intégration et parfois un nouvel entraînement complet. S1 ne mémorise pas simplement chaque image de la vidéo : il cherche à comprendre l’objectif, puis à combiner des compétences déjà acquises pour construire une nouvelle séquence d’actions.
S1 repose sur ce que Skild appelle l’apprentissage contextuel visuel — ou visual in-context learning. La démonstration humaine joue le rôle d’une consigne au moment de l’inférence, c’est-à-dire pendant l’utilisation du modèle. S1 observe la scène, déduit l’objectif et l’ordre des opérations, puis convertit ces informations en actions adaptées au robot et à son environnement. D’après Skild, les paramètres du modèle ne sont pas modifiés pour chaque nouvelle vidéo. 1
La nuance est essentielle : il ne s’agit pas d’un nouveau cycle de fine-tuning, mais d’une interprétation immédiate d’un exemple. Le système doit relier ce qu’il voit à des aptitudes apprises auparavant — saisir, déplacer, verser, placer ou manipuler un objet — puis les organiser dans une procédure plus longue.
Les exemples rendus publics comprennent la préparation d’un café filtre, le rempotage d’une plante, l’assemblage d’un kit et le retournement de crêpes. 1
35
Réaliser un geste isolé est une chose. Maintenir le bon objectif pendant dix minutes en est une autre. Une tâche longue peut inclure des dizaines d’actions, des objets qui changent de position et plusieurs occasions de se tromper.
S1 est conçu pour conserver le fil de la tâche tout au long de cette séquence et adapter ses mouvements à la situation, au lieu de rejouer mécaniquement les gestes exacts de la personne filmée. C’est cette capacité à enchaîner des compétences sur une longue durée qui constitue l’une des principales promesses du modèle.
Dans une évaluation consacrée à des tâches inédites, Skild rapporte un taux de réussite moyen par étape de 66 % pour la politique guidée par une vidéo, contre 9 % pour une politique comparable de type vision-langage-action, ou VLA, guidée par une instruction textuelle. La comparaison a été menée à une échelle annoncée de 100 000 heures d’entraînement. 32
Une démonstration visuelle peut transmettre des informations difficiles à exprimer avec des mots : quel objet saisir, dans quelle orientation le tenir, dans quel ordre agir et comment réagir aux changements de la scène.
Ces chiffres doivent toutefois être interprétés avec prudence. Il s’agit d’une évaluation rapportée par Skild, et non d’un benchmark industriel reproduit indépendamment. De plus, un taux de réussite par étape de 66 % ne signifie pas qu’un robot terminera 66 % des tâches de 10 minutes du début à la fin. Plus une mission comporte d’étapes, plus les erreurs peuvent se cumuler.
Les démonstrations publiques portent notamment sur :
Ces activités combinent perception, manipulation d’objets, respect d’un ordre précis et contrôle continu. Elles sont donc plus représentatives d’une tâche complète qu’un simple test de déplacement d’un objet. Skild les présente comme des tâches non vues pendant le préentraînement, même si les éléments disponibles proviennent principalement de l’entreprise et de publications relayant ses affirmations. 1
33
Ces démonstrations illustrent l’interface visée : une personne réalise la tâche une fois, puis le robot tente de généraliser la procédure. Elles ne prouvent pas que S1 peut accomplir de manière fiable n’importe quelle tâche domestique, fonctionner sans supervision ou gérer toutes les variations physiques d’un environnement industriel.
L’avantage annoncé par Skild est l’absence de phase d’entraînement postérieure à la démonstration. Après avoir observé l’exemple, le robot peut passer à l’exécution au moment de l’inférence ; l’entreprise et les articles consacrés au lancement parlent d’un fonctionnement en temps réel. 1
30
Les sources disponibles ne donnent cependant pas de mesure précise et fiable de la latence — par exemple, le nombre de secondes entre la fin de la vidéo et le premier mouvement du robot. « Sans fine-tuning » signifie que le modèle ne subit pas de mise à jour de ses paramètres pour cette tâche. Cela ne veut pas nécessairement dire que chaque vidéo est analysée instantanément, ni que le système n’a besoin d’aucun réglage, d’aucune calibration ou d’aucune vérification de sécurité.
S1 s’inscrit dans une stratégie plus vaste baptisée Skild Brain. L’objectif est de développer un modèle général capable de fonctionner sur plusieurs tâches et plusieurs architectures robotiques, plutôt que de créer une politique distincte pour chaque robot et chaque usage.
Skild dit avoir créé un univers simulé comprenant 100 000 variantes de robots et avoir testé la capacité du modèle à se généraliser à des corps qui n’avaient pas été inclus dans les données d’entraînement. 6
L’entraînement sur des morphologies différentes doit aider le modèle à apprendre des principes généraux de contrôle. Les documents de Skild citent notamment les humanoïdes, les robots quadrupèdes, les bras de table et les manipulateurs mobiles. 3
10
On voit aussi circuler l’affirmation selon laquelle Skild disposerait de 100 à 1 000 fois plus de données que ses concurrents. Elle doit être considérée avec réserve : les sources fournies ne présentent pas de comparaison standardisée et vérifiable indépendamment de la taille, de la qualité ou de la valeur opérationnelle des jeux de données des différentes entreprises.
Le point le plus solide est ailleurs : Skild cherche à augmenter son volume d’expérience grâce à l’entraînement inter-embodiments, à la simulation et aux données vidéo humaines, plutôt qu’en dépendant uniquement de démonstrations conçues pour une plateforme matérielle précise.
Le terme « omni-bodied », utilisé par Skild, désigne un modèle censé pouvoir transférer ses compétences d’un type de robot à un autre. En théorie, un même modèle peut séparer la compréhension de haut niveau de la tâche de la géométrie exacte d’une machine donnée. Il pourrait ainsi s’adapter à des bras, des roues, des jambes ou des préhenseurs différents. Skild affirme que ses essais simulés ont inclus des formes de robots mises de côté pendant l’entraînement, contrôlées en zéro-shot. 6
Cela ne rend pas le matériel interchangeable pour autant. Les robots possèdent des capteurs, des préhenseurs, des limites articulaires, des interfaces de commande, des délais de réponse, des capacités de charge et des contraintes de sécurité différents. Un modèle généraliste peut réduire le travail d’adaptation, mais son déploiement exige toujours une intégration avec le matériel et une validation dans l’environnement cible.
Des informations publiques indiquent que le logiciel de Skild fonctionne sur des centaines de robots dans des usines, des centres de données et des environnements logistiques. Les exemples cités comprennent l’usine de NVIDIA à Houston, un essai à l’aéroport de LaGuardia ainsi que des collaborations avec des entreprises du câblage et de la construction. Skild a également annoncé des relations avec ABB Robotics, Universal Robots et NVIDIA. 17
4
Ces éléments témoignent d’un intérêt commercial et de tests en conditions réelles, mais ils ne suffisent pas à calculer des taux de production, une disponibilité, des économies ou un retour sur investissement vérifiés de manière indépendante. Un résultat obtenu en laboratoire ou dans un environnement contrôlé ne doit pas être confondu avec une métrique de production.
Un autre article décrit par ailleurs un déploiement prévu avec Foxconn sur des lignes d’assemblage associées aux serveurs GPU Blackwell de NVIDIA. Cela constitue un projet de test ou de déploiement, et non la preuve d’un fonctionnement autonome généralisé dans les usines. 43
Les financements de Skild ont contribué à placer l’entreprise parmi les acteurs les plus suivis de l’intelligence artificielle physique. Bloomberg a rapporté une levée d’environ 1,4 milliard de dollars lors d’une série C menée par SoftBank en janvier 2026, pour une valorisation supérieure à 14 milliards de dollars. 13 En juillet 2024, la série A annoncée par l’entreprise s’élevait à 300 millions de dollars, pour une valorisation déclarée de 1,5 milliard de dollars.
9
L’expression « moment ChatGPT » appliquée aux robots décrit un changement d’interface espéré : au lieu de programmer ou de réentraîner une machine pour chaque opération, un salarié pourrait lui montrer le comportement attendu et laisser un modèle général traduire cette démonstration en actions.
S1 représente une avancée intéressante vers cette vision, mais ne prouve pas encore que les robots généralistes sont arrivés. Les principaux résultats publics sont communiqués par l’entreprise, le nombre de tâches démontrées reste limité et les indicateurs industriels vérifiés indépendamment ne sont pas disponibles dans les sources examinées.
La conclusion la plus mesurée est donc la suivante : S1 propose une méthode prometteuse pour réduire l’entraînement spécifique à chaque tâche. Une vidéo sert d’instruction, le préentraînement fournit des compétences réutilisables et le modèle tente de les combiner dans une mission longue et nouvelle. Reste à démontrer que cette approche conserve sa fiabilité lorsque les robots sortent des vidéos de présentation et entrent dans la complexité du monde réel.
Studio Global AI
Cette page comprend une réponse basée sur la source que vous pouvez continuer dans Studio Global.
Selon Skild AI, S1 peut exécuter des tâches inédites en plusieurs étapes, durant jusqu’à 10 minutes, après avoir observé une seule vidéo humaine et sans fine tuning.
Selon Skild AI, S1 peut exécuter des tâches inédites en plusieurs étapes, durant jusqu’à 10 minutes, après avoir observé une seule vidéo humaine et sans fine tuning. La vidéo sert de consigne au moment de l’exécution : S1 assemble des compétences acquises pendant son préentraînement pour agir dans l’environnement présent du robot.
Lors d’une évaluation interne, Skild a rapporté un taux de réussite moyen par étape de 66 % avec une consigne vidéo, contre 9 % pour une approche comparable guidée par le langage.
Selon Skild AI, S1 peut exécuter des tâches inédites en plusieurs étapes, durant jusqu’à 10 minutes, après avoir observé une seule vidéo humaine et sans fine tuning. La vidéo sert de consigne au moment de l’exécution : S1 assemble des compétences acquises pendant son préentraînement pour agir dans l’environnement pr...
Publié parModifié avec GPT-5.6 LunaImages générées avec GPT Image 1.5
Réponse de recherche

Create a landscape editorial hero image for this Studio Global article: What is Skild AI’s S1 robotics foundation model, how does it enable robots to learn and perform previously unseen long-horizon manipulation. Article summary: Skild AI’s S1 is a robotics foundation model designed for visual in-context learning: rather than retraining a policy for each new job, a robot conditions on one video demonstration and then attempts the task in real tim. Topic tags: general, general web, news, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts wi
Skild AI veut changer la manière dont on programme les robots : plutôt que de coder chaque geste ou de réentraîner un modèle pour chaque nouvelle mission, il suffirait de montrer l’exemple. Son modèle S1 observe une vidéo d’une personne réalisant une tâche, puis tente de la reproduire dans son propre environnement.
Skild affirme que S1 peut traiter des tâches inédites, comportant plusieurs étapes et pouvant durer jusqu’à 10 minutes, sans fine-tuning ni phase d’entraînement supplémentaire après l’observation. 1
L’enjeu est important pour la robotique. Jusqu’à présent, apprendre à un robot un nouveau travail nécessitait souvent des données propres à la tâche, de la téléopération, du travail d’intégration et parfois un nouvel entraînement complet. S1 ne mémorise pas simplement chaque image de la vidéo : il cherche à comprendre l’objectif, puis à combiner des compétences déjà acquises pour construire une nouvelle séquence d’actions.
S1 repose sur ce que Skild appelle l’apprentissage contextuel visuel — ou visual in-context learning. La démonstration humaine joue le rôle d’une consigne au moment de l’inférence, c’est-à-dire pendant l’utilisation du modèle. S1 observe la scène, déduit l’objectif et l’ordre des opérations, puis convertit ces informations en actions adaptées au robot et à son environnement. D’après Skild, les paramètres du modèle ne sont pas modifiés pour chaque nouvelle vidéo. 1
La nuance est essentielle : il ne s’agit pas d’un nouveau cycle de fine-tuning, mais d’une interprétation immédiate d’un exemple. Le système doit relier ce qu’il voit à des aptitudes apprises auparavant — saisir, déplacer, verser, placer ou manipuler un objet — puis les organiser dans une procédure plus longue.
Les exemples rendus publics comprennent la préparation d’un café filtre, le rempotage d’une plante, l’assemblage d’un kit et le retournement de crêpes. 1
35
Réaliser un geste isolé est une chose. Maintenir le bon objectif pendant dix minutes en est une autre. Une tâche longue peut inclure des dizaines d’actions, des objets qui changent de position et plusieurs occasions de se tromper.
S1 est conçu pour conserver le fil de la tâche tout au long de cette séquence et adapter ses mouvements à la situation, au lieu de rejouer mécaniquement les gestes exacts de la personne filmée. C’est cette capacité à enchaîner des compétences sur une longue durée qui constitue l’une des principales promesses du modèle.
Dans une évaluation consacrée à des tâches inédites, Skild rapporte un taux de réussite moyen par étape de 66 % pour la politique guidée par une vidéo, contre 9 % pour une politique comparable de type vision-langage-action, ou VLA, guidée par une instruction textuelle. La comparaison a été menée à une échelle annoncée de 100 000 heures d’entraînement. 32
Une démonstration visuelle peut transmettre des informations difficiles à exprimer avec des mots : quel objet saisir, dans quelle orientation le tenir, dans quel ordre agir et comment réagir aux changements de la scène.
Ces chiffres doivent toutefois être interprétés avec prudence. Il s’agit d’une évaluation rapportée par Skild, et non d’un benchmark industriel reproduit indépendamment. De plus, un taux de réussite par étape de 66 % ne signifie pas qu’un robot terminera 66 % des tâches de 10 minutes du début à la fin. Plus une mission comporte d’étapes, plus les erreurs peuvent se cumuler.
Les démonstrations publiques portent notamment sur :
Ces activités combinent perception, manipulation d’objets, respect d’un ordre précis et contrôle continu. Elles sont donc plus représentatives d’une tâche complète qu’un simple test de déplacement d’un objet. Skild les présente comme des tâches non vues pendant le préentraînement, même si les éléments disponibles proviennent principalement de l’entreprise et de publications relayant ses affirmations. 1
33
Ces démonstrations illustrent l’interface visée : une personne réalise la tâche une fois, puis le robot tente de généraliser la procédure. Elles ne prouvent pas que S1 peut accomplir de manière fiable n’importe quelle tâche domestique, fonctionner sans supervision ou gérer toutes les variations physiques d’un environnement industriel.
L’avantage annoncé par Skild est l’absence de phase d’entraînement postérieure à la démonstration. Après avoir observé l’exemple, le robot peut passer à l’exécution au moment de l’inférence ; l’entreprise et les articles consacrés au lancement parlent d’un fonctionnement en temps réel. 1
30
Les sources disponibles ne donnent cependant pas de mesure précise et fiable de la latence — par exemple, le nombre de secondes entre la fin de la vidéo et le premier mouvement du robot. « Sans fine-tuning » signifie que le modèle ne subit pas de mise à jour de ses paramètres pour cette tâche. Cela ne veut pas nécessairement dire que chaque vidéo est analysée instantanément, ni que le système n’a besoin d’aucun réglage, d’aucune calibration ou d’aucune vérification de sécurité.
S1 s’inscrit dans une stratégie plus vaste baptisée Skild Brain. L’objectif est de développer un modèle général capable de fonctionner sur plusieurs tâches et plusieurs architectures robotiques, plutôt que de créer une politique distincte pour chaque robot et chaque usage.
Skild dit avoir créé un univers simulé comprenant 100 000 variantes de robots et avoir testé la capacité du modèle à se généraliser à des corps qui n’avaient pas été inclus dans les données d’entraînement. 6
L’entraînement sur des morphologies différentes doit aider le modèle à apprendre des principes généraux de contrôle. Les documents de Skild citent notamment les humanoïdes, les robots quadrupèdes, les bras de table et les manipulateurs mobiles. 3
10
On voit aussi circuler l’affirmation selon laquelle Skild disposerait de 100 à 1 000 fois plus de données que ses concurrents. Elle doit être considérée avec réserve : les sources fournies ne présentent pas de comparaison standardisée et vérifiable indépendamment de la taille, de la qualité ou de la valeur opérationnelle des jeux de données des différentes entreprises.
Le point le plus solide est ailleurs : Skild cherche à augmenter son volume d’expérience grâce à l’entraînement inter-embodiments, à la simulation et aux données vidéo humaines, plutôt qu’en dépendant uniquement de démonstrations conçues pour une plateforme matérielle précise.
Le terme « omni-bodied », utilisé par Skild, désigne un modèle censé pouvoir transférer ses compétences d’un type de robot à un autre. En théorie, un même modèle peut séparer la compréhension de haut niveau de la tâche de la géométrie exacte d’une machine donnée. Il pourrait ainsi s’adapter à des bras, des roues, des jambes ou des préhenseurs différents. Skild affirme que ses essais simulés ont inclus des formes de robots mises de côté pendant l’entraînement, contrôlées en zéro-shot. 6
Cela ne rend pas le matériel interchangeable pour autant. Les robots possèdent des capteurs, des préhenseurs, des limites articulaires, des interfaces de commande, des délais de réponse, des capacités de charge et des contraintes de sécurité différents. Un modèle généraliste peut réduire le travail d’adaptation, mais son déploiement exige toujours une intégration avec le matériel et une validation dans l’environnement cible.
Des informations publiques indiquent que le logiciel de Skild fonctionne sur des centaines de robots dans des usines, des centres de données et des environnements logistiques. Les exemples cités comprennent l’usine de NVIDIA à Houston, un essai à l’aéroport de LaGuardia ainsi que des collaborations avec des entreprises du câblage et de la construction. Skild a également annoncé des relations avec ABB Robotics, Universal Robots et NVIDIA. 17
4
Ces éléments témoignent d’un intérêt commercial et de tests en conditions réelles, mais ils ne suffisent pas à calculer des taux de production, une disponibilité, des économies ou un retour sur investissement vérifiés de manière indépendante. Un résultat obtenu en laboratoire ou dans un environnement contrôlé ne doit pas être confondu avec une métrique de production.
Un autre article décrit par ailleurs un déploiement prévu avec Foxconn sur des lignes d’assemblage associées aux serveurs GPU Blackwell de NVIDIA. Cela constitue un projet de test ou de déploiement, et non la preuve d’un fonctionnement autonome généralisé dans les usines. 43
Les financements de Skild ont contribué à placer l’entreprise parmi les acteurs les plus suivis de l’intelligence artificielle physique. Bloomberg a rapporté une levée d’environ 1,4 milliard de dollars lors d’une série C menée par SoftBank en janvier 2026, pour une valorisation supérieure à 14 milliards de dollars. 13 En juillet 2024, la série A annoncée par l’entreprise s’élevait à 300 millions de dollars, pour une valorisation déclarée de 1,5 milliard de dollars.
9
L’expression « moment ChatGPT » appliquée aux robots décrit un changement d’interface espéré : au lieu de programmer ou de réentraîner une machine pour chaque opération, un salarié pourrait lui montrer le comportement attendu et laisser un modèle général traduire cette démonstration en actions.
S1 représente une avancée intéressante vers cette vision, mais ne prouve pas encore que les robots généralistes sont arrivés. Les principaux résultats publics sont communiqués par l’entreprise, le nombre de tâches démontrées reste limité et les indicateurs industriels vérifiés indépendamment ne sont pas disponibles dans les sources examinées.
La conclusion la plus mesurée est donc la suivante : S1 propose une méthode prometteuse pour réduire l’entraînement spécifique à chaque tâche. Une vidéo sert d’instruction, le préentraînement fournit des compétences réutilisables et le modèle tente de les combiner dans une mission longue et nouvelle. Reste à démontrer que cette approche conserve sa fiabilité lorsque les robots sortent des vidéos de présentation et entrent dans la complexité du monde réel.
Studio Global AI
Cette page comprend une réponse basée sur la source que vous pouvez continuer dans Studio Global.
Selon Skild AI, S1 peut exécuter des tâches inédites en plusieurs étapes, durant jusqu’à 10 minutes, après avoir observé une seule vidéo humaine et sans fine tuning.
Selon Skild AI, S1 peut exécuter des tâches inédites en plusieurs étapes, durant jusqu’à 10 minutes, après avoir observé une seule vidéo humaine et sans fine tuning. La vidéo sert de consigne au moment de l’exécution : S1 assemble des compétences acquises pendant son préentraînement pour agir dans l’environnement présent du robot.
Lors d’une évaluation interne, Skild a rapporté un taux de réussite moyen par étape de 66 % avec une consigne vidéo, contre 9 % pour une approche comparable guidée par le langage.