Secondo Skild AI, S1 può eseguire compiti inediti e composti da più passaggi, della durata massima di 10 minuti, dopo aver osservato un solo video umano e senza fine tuning. S1 tratta il video come un’istruzione ricevuta al momento dell’esecuzione: combina abilità apprese in precedenza e le adatta all’ambiente in cu...
Pubblicato daModificato con GPT-5.6 LunaImmagini generate con GPT Image 1.5
Research answer

Create a landscape editorial hero image for this Studio Global article: What is Skild AI’s S1 robotics foundation model, how does it enable robots to learn and perform previously unseen long-horizon manipulation. Article summary: Skild AI’s S1 is a robotics foundation model designed for visual in-context learning: rather than retraining a policy for each new job, a robot conditions on one video demonstration and then attempts the task in real tim. Topic tags: general, general web, news, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts wi
L’idea di Skild AI è semplice da capire, ma ambiziosa da realizzare: invece di programmare un robot per ogni singolo compito, gli si mostra una persona mentre lo esegue. Il modello S1 usa quel video come una sorta di istruzione visiva e prova a riprodurre l’obiettivo in un ambiente reale, anche quando il compito non faceva parte dei dati usati per l’addestramento.
Skild sostiene che S1 sia in grado di affrontare attività inedite, composte da più passaggi e della durata massima di 10 minuti, senza un nuovo ciclo di addestramento dopo la dimostrazione e senza modificare i pesi del modello. 1
La tecnologia alla base è chiamata apprendimento visivo contestuale (visual in-context learning). Il video della persona non serve, secondo la descrizione di Skild, a creare un nuovo modello specializzato: funziona invece come un prompt, cioè come un’istruzione fornita al momento dell’esecuzione. 1
S1 osserva la dimostrazione, cerca di ricostruire l’obiettivo e la sequenza di azioni, quindi traduce quelle informazioni nei comandi del robot che opera nell’ambiente corrente. Per farlo deve collegare ciò che vede a capacità già apprese, come afferrare, spostare, versare, posizionare e manipolare oggetti, e poi combinarle nell’ordine corretto.
Tra gli esempi pubblicati da Skild figurano la preparazione del caffè filtrato con metodo pour-over, il rinvaso di una pianta, l’assemblaggio di un kit e il capovolgimento di pancake. 1
35
La difficoltà principale è la lunghezza dell’orizzonte operativo. Un singolo movimento può essere programmato o valutato in modo relativamente isolato; un’attività di 10 minuti può invece includere decine di decisioni, oggetti che cambiano posizione e numerose occasioni di errore. S1 dovrebbe mantenere l’obiettivo complessivo e adattare le azioni alla scena, anziché limitarsi a ripetere alla lettera i movimenti della persona nel video.
Nei test su compiti inediti riportati da Skild, l’approccio basato sul video avrebbe ottenuto risultati molto migliori rispetto a un modello analogo guidato da istruzioni linguistiche. Alla scala dichiarata di 100.000 ore di addestramento, la politica sollecitata dal video ha raggiunto un 66% di successo medio per passaggio, contro il 9% di una politica vision-language-action comparabile, cioè un modello che combina immagini, linguaggio e azioni. 32
Il risultato suggerisce che una dimostrazione visiva può trasmettere dettagli fisici difficili da esprimere a parole: quale oggetto afferrare, con quale orientamento, in quale ordine agire e come reagire a ciò che cambia nell’ambiente.
Il dato va però letto con cautela. Si tratta di una valutazione riportata da Skild e non di un benchmark industriale replicato in modo indipendente. Inoltre, un tasso medio di successo per singolo passaggio non equivale alla probabilità che il robot completi senza errori un intero compito di 10 minuti. 32
Le dimostrazioni pubbliche includono:
Sono esempi interessanti perché richiedono riconoscimento degli oggetti, manipolazione, sequenze ordinate e controllo prolungato, non soltanto l’esecuzione di un movimento singolo. Skild descrive questi compiti come non presenti nel preaddestramento, ma le prove disponibili provengono soprattutto dall’azienda e da articoli che ne riportano le dichiarazioni. 1
33
Le dimostrazioni mostrano dunque l’interfaccia proposta: una persona esegue il compito una volta e il robot prova a generalizzare la procedura. Non dimostrano, però, che S1 sappia svolgere in modo affidabile qualsiasi attività domestica, operare senza supervisione o gestire tutte le varianti fisiche di un ambiente produttivo.
Il vantaggio dichiarato è l’assenza di una fase separata di addestramento dopo l’osservazione. Una volta visto l’esempio, il sistema dovrebbe poter usare il video direttamente durante l’inferenza, cioè nel momento in cui deve produrre le azioni. Skild e le fonti che hanno raccontato il lancio parlano di esecuzione in tempo reale. 1
30
Le fonti disponibili non indicano tuttavia una latenza precisa e verificabile: per esempio, quanti secondi passino dalla fine del video al primo movimento del robot. Dire “senza fine-tuning” significa che il modello non affronta un nuovo ciclo di aggiornamento dei pesi specifico per quel compito; non significa necessariamente che ogni video venga elaborato istantaneamente o che non siano necessari configurazione, calibrazione e controlli di sicurezza.
S1 fa parte della strategia più ampia di Skild Brain, un modello generale pensato per funzionare su compiti e robot diversi. L’obiettivo è addestrare un unico sistema usando esperienze robotiche, simulazioni e dati visivi umani, invece di creare una politica separata per ogni combinazione di macchina e attività. 3
10
Skild afferma di aver creato un universo simulato con 100.000 varianti di robot e di aver testato la capacità del modello di generalizzare a corpi esclusi dai dati di addestramento. 6 I materiali dell’azienda descrivono un sistema destinato a funzionare con umanoidi, robot quadrupedi, bracci da tavolo e manipolatori mobili.
3
10
La tesi spesso ripetuta secondo cui Skild disporrebbe di una quantità di dati da 100 a 1.000 volte superiore a quella dei concorrenti va invece considerata con prudenza. Le fonti disponibili non offrono un confronto standardizzato e verificabile sulla dimensione, sulla qualità o sull’utilità dei dataset delle diverse aziende. Il punto più solido è che Skild punta ad aumentare la scala attraverso simulazioni e addestramento su più tipi di robot, invece di basarsi soltanto su dimostrazioni personalizzate per una singola piattaforma hardware.
Con omni-bodied, espressione coniata da Skild, l’azienda indica un modello pensato per trasferire le proprie capacità tra corpi robotici differenti. In teoria, un sistema condiviso può apprendere concetti legati al compito separandoli dalla geometria precisa di una macchina: arti, ruote, pinze, articolazioni e disposizione degli attuatori possono cambiare, mentre l’obiettivo di alto livello resta simile.
Skild afferma che i test simulati includevano forme robotiche escluse dall’addestramento e controllate in modalità zero-shot, cioè senza esempi specifici per quel corpo. 6
Questo non rende irrilevante l’hardware. I robot possono avere sensori, pinze, limiti articolari, interfacce di controllo, tempi di risposta, capacità di carico e vincoli di sicurezza molto diversi. Un modello capace di generalizzare tra più forme può ridurre il lavoro di adattamento, ma l’impiego concreto richiede comunque integrazione con la macchina, compatibilità del sistema e validazione nell’ambiente di destinazione.
Secondo quanto riportato pubblicamente, il software di Skild opera su centinaia di robot in fabbriche, centri dati e contesti logistici. Tra gli esempi citati figurano lo stabilimento NVIDIA di Houston, una sperimentazione a LaGuardia e collaborazioni con aziende nei settori dei cablaggi e delle costruzioni. Skild ha inoltre annunciato rapporti con ABB Robotics, Universal Robots e NVIDIA. 17
4
Questi elementi indicano interesse commerciale e attività di test nel mondo reale, ma non permettono di calcolare tassi di completamento in produzione, disponibilità operativa, risparmi o ritorno sull’investimento. Un risultato ottenuto in laboratorio o in una valutazione controllata non deve essere interpretato come una metrica industriale.
Un altro resoconto descrive una prevista implementazione con Foxconn sulle linee di assemblaggio associate ai sistemi server NVIDIA Blackwell. Anche in questo caso si tratta di un progetto di test o deployment, non della prova che il modello gestisca già in autonomia ampie operazioni di fabbrica. 43
La raccolta di capitali ha contribuito a rendere Skild AI una delle startup più osservate nel settore della cosiddetta physical AI, l’intelligenza artificiale capace di agire nel mondo fisico. Bloomberg ha riferito che l’azienda ha raccolto circa 1,4 miliardi di dollari in un round Series C guidato da SoftBank nel gennaio 2026, raggiungendo una valutazione superiore a 14 miliardi di dollari. 13
Nel luglio 2024 Skild aveva annunciato una Series A da 300 milioni di dollari, con una valutazione dichiarata di 1,5 miliardi. 9
Il paragone con il “momento ChatGPT” descrive il cambiamento di esperienza che l’azienda spera di rendere possibile: invece di programmare o riaddestrare un robot per ogni mansione, un lavoratore potrebbe mostrare il comportamento desiderato e lasciare a un modello generale il compito di tradurlo in azioni. S1 rappresenta un passo significativo verso questa interfaccia.
Non è però ancora la dimostrazione che siano arrivati i robot generalisti. I risultati pubblici più rilevanti sono dichiarati dall’azienda, il numero di compiti mostrati è limitato e non sono disponibili, nelle fonti considerate, metriche industriali indipendentemente verificate.
La conclusione più prudente è che S1 mostri un approccio promettente per ridurre la formazione specifica dei robot: usare un video come istruzione, affidarsi al preaddestramento per fornire abilità riutilizzabili e verificare se queste possano essere combinate in compiti nuovi e articolati. Il salto dall’esempio controllato a un robot affidabile in qualunque ambiente, però, resta ancora da dimostrare.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Secondo Skild AI, S1 può eseguire compiti inediti e composti da più passaggi, della durata massima di 10 minuti, dopo aver osservato un solo video umano e senza fine tuning.
Secondo Skild AI, S1 può eseguire compiti inediti e composti da più passaggi, della durata massima di 10 minuti, dopo aver osservato un solo video umano e senza fine tuning. S1 tratta il video come un’istruzione ricevuta al momento dell’esecuzione: combina abilità apprese in precedenza e le adatta all’ambiente in cui si trova il robot.
La strategia più ampia di Skild Brain punta sull’addestramento con molte forme di robot e varianti simulate.
Secondo Skild AI, S1 può eseguire compiti inediti e composti da più passaggi, della durata massima di 10 minuti, dopo aver osservato un solo video umano e senza fine tuning. S1 tratta il video come un’istruzione ricevuta al momento dell’esecuzione: combina abilità apprese in precedenza e le adatta all’ambiente in cu...
Pubblicato daModificato con GPT-5.6 LunaImmagini generate con GPT Image 1.5
Research answer

Create a landscape editorial hero image for this Studio Global article: What is Skild AI’s S1 robotics foundation model, how does it enable robots to learn and perform previously unseen long-horizon manipulation. Article summary: Skild AI’s S1 is a robotics foundation model designed for visual in-context learning: rather than retraining a policy for each new job, a robot conditions on one video demonstration and then attempts the task in real tim. Topic tags: general, general web, news, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts wi
L’idea di Skild AI è semplice da capire, ma ambiziosa da realizzare: invece di programmare un robot per ogni singolo compito, gli si mostra una persona mentre lo esegue. Il modello S1 usa quel video come una sorta di istruzione visiva e prova a riprodurre l’obiettivo in un ambiente reale, anche quando il compito non faceva parte dei dati usati per l’addestramento.
Skild sostiene che S1 sia in grado di affrontare attività inedite, composte da più passaggi e della durata massima di 10 minuti, senza un nuovo ciclo di addestramento dopo la dimostrazione e senza modificare i pesi del modello. 1
La tecnologia alla base è chiamata apprendimento visivo contestuale (visual in-context learning). Il video della persona non serve, secondo la descrizione di Skild, a creare un nuovo modello specializzato: funziona invece come un prompt, cioè come un’istruzione fornita al momento dell’esecuzione. 1
S1 osserva la dimostrazione, cerca di ricostruire l’obiettivo e la sequenza di azioni, quindi traduce quelle informazioni nei comandi del robot che opera nell’ambiente corrente. Per farlo deve collegare ciò che vede a capacità già apprese, come afferrare, spostare, versare, posizionare e manipolare oggetti, e poi combinarle nell’ordine corretto.
Tra gli esempi pubblicati da Skild figurano la preparazione del caffè filtrato con metodo pour-over, il rinvaso di una pianta, l’assemblaggio di un kit e il capovolgimento di pancake. 1
35
La difficoltà principale è la lunghezza dell’orizzonte operativo. Un singolo movimento può essere programmato o valutato in modo relativamente isolato; un’attività di 10 minuti può invece includere decine di decisioni, oggetti che cambiano posizione e numerose occasioni di errore. S1 dovrebbe mantenere l’obiettivo complessivo e adattare le azioni alla scena, anziché limitarsi a ripetere alla lettera i movimenti della persona nel video.
Nei test su compiti inediti riportati da Skild, l’approccio basato sul video avrebbe ottenuto risultati molto migliori rispetto a un modello analogo guidato da istruzioni linguistiche. Alla scala dichiarata di 100.000 ore di addestramento, la politica sollecitata dal video ha raggiunto un 66% di successo medio per passaggio, contro il 9% di una politica vision-language-action comparabile, cioè un modello che combina immagini, linguaggio e azioni. 32
Il risultato suggerisce che una dimostrazione visiva può trasmettere dettagli fisici difficili da esprimere a parole: quale oggetto afferrare, con quale orientamento, in quale ordine agire e come reagire a ciò che cambia nell’ambiente.
Il dato va però letto con cautela. Si tratta di una valutazione riportata da Skild e non di un benchmark industriale replicato in modo indipendente. Inoltre, un tasso medio di successo per singolo passaggio non equivale alla probabilità che il robot completi senza errori un intero compito di 10 minuti. 32
Le dimostrazioni pubbliche includono:
Sono esempi interessanti perché richiedono riconoscimento degli oggetti, manipolazione, sequenze ordinate e controllo prolungato, non soltanto l’esecuzione di un movimento singolo. Skild descrive questi compiti come non presenti nel preaddestramento, ma le prove disponibili provengono soprattutto dall’azienda e da articoli che ne riportano le dichiarazioni. 1
33
Le dimostrazioni mostrano dunque l’interfaccia proposta: una persona esegue il compito una volta e il robot prova a generalizzare la procedura. Non dimostrano, però, che S1 sappia svolgere in modo affidabile qualsiasi attività domestica, operare senza supervisione o gestire tutte le varianti fisiche di un ambiente produttivo.
Il vantaggio dichiarato è l’assenza di una fase separata di addestramento dopo l’osservazione. Una volta visto l’esempio, il sistema dovrebbe poter usare il video direttamente durante l’inferenza, cioè nel momento in cui deve produrre le azioni. Skild e le fonti che hanno raccontato il lancio parlano di esecuzione in tempo reale. 1
30
Le fonti disponibili non indicano tuttavia una latenza precisa e verificabile: per esempio, quanti secondi passino dalla fine del video al primo movimento del robot. Dire “senza fine-tuning” significa che il modello non affronta un nuovo ciclo di aggiornamento dei pesi specifico per quel compito; non significa necessariamente che ogni video venga elaborato istantaneamente o che non siano necessari configurazione, calibrazione e controlli di sicurezza.
S1 fa parte della strategia più ampia di Skild Brain, un modello generale pensato per funzionare su compiti e robot diversi. L’obiettivo è addestrare un unico sistema usando esperienze robotiche, simulazioni e dati visivi umani, invece di creare una politica separata per ogni combinazione di macchina e attività. 3
10
Skild afferma di aver creato un universo simulato con 100.000 varianti di robot e di aver testato la capacità del modello di generalizzare a corpi esclusi dai dati di addestramento. 6 I materiali dell’azienda descrivono un sistema destinato a funzionare con umanoidi, robot quadrupedi, bracci da tavolo e manipolatori mobili.
3
10
La tesi spesso ripetuta secondo cui Skild disporrebbe di una quantità di dati da 100 a 1.000 volte superiore a quella dei concorrenti va invece considerata con prudenza. Le fonti disponibili non offrono un confronto standardizzato e verificabile sulla dimensione, sulla qualità o sull’utilità dei dataset delle diverse aziende. Il punto più solido è che Skild punta ad aumentare la scala attraverso simulazioni e addestramento su più tipi di robot, invece di basarsi soltanto su dimostrazioni personalizzate per una singola piattaforma hardware.
Con omni-bodied, espressione coniata da Skild, l’azienda indica un modello pensato per trasferire le proprie capacità tra corpi robotici differenti. In teoria, un sistema condiviso può apprendere concetti legati al compito separandoli dalla geometria precisa di una macchina: arti, ruote, pinze, articolazioni e disposizione degli attuatori possono cambiare, mentre l’obiettivo di alto livello resta simile.
Skild afferma che i test simulati includevano forme robotiche escluse dall’addestramento e controllate in modalità zero-shot, cioè senza esempi specifici per quel corpo. 6
Questo non rende irrilevante l’hardware. I robot possono avere sensori, pinze, limiti articolari, interfacce di controllo, tempi di risposta, capacità di carico e vincoli di sicurezza molto diversi. Un modello capace di generalizzare tra più forme può ridurre il lavoro di adattamento, ma l’impiego concreto richiede comunque integrazione con la macchina, compatibilità del sistema e validazione nell’ambiente di destinazione.
Secondo quanto riportato pubblicamente, il software di Skild opera su centinaia di robot in fabbriche, centri dati e contesti logistici. Tra gli esempi citati figurano lo stabilimento NVIDIA di Houston, una sperimentazione a LaGuardia e collaborazioni con aziende nei settori dei cablaggi e delle costruzioni. Skild ha inoltre annunciato rapporti con ABB Robotics, Universal Robots e NVIDIA. 17
4
Questi elementi indicano interesse commerciale e attività di test nel mondo reale, ma non permettono di calcolare tassi di completamento in produzione, disponibilità operativa, risparmi o ritorno sull’investimento. Un risultato ottenuto in laboratorio o in una valutazione controllata non deve essere interpretato come una metrica industriale.
Un altro resoconto descrive una prevista implementazione con Foxconn sulle linee di assemblaggio associate ai sistemi server NVIDIA Blackwell. Anche in questo caso si tratta di un progetto di test o deployment, non della prova che il modello gestisca già in autonomia ampie operazioni di fabbrica. 43
La raccolta di capitali ha contribuito a rendere Skild AI una delle startup più osservate nel settore della cosiddetta physical AI, l’intelligenza artificiale capace di agire nel mondo fisico. Bloomberg ha riferito che l’azienda ha raccolto circa 1,4 miliardi di dollari in un round Series C guidato da SoftBank nel gennaio 2026, raggiungendo una valutazione superiore a 14 miliardi di dollari. 13
Nel luglio 2024 Skild aveva annunciato una Series A da 300 milioni di dollari, con una valutazione dichiarata di 1,5 miliardi. 9
Il paragone con il “momento ChatGPT” descrive il cambiamento di esperienza che l’azienda spera di rendere possibile: invece di programmare o riaddestrare un robot per ogni mansione, un lavoratore potrebbe mostrare il comportamento desiderato e lasciare a un modello generale il compito di tradurlo in azioni. S1 rappresenta un passo significativo verso questa interfaccia.
Non è però ancora la dimostrazione che siano arrivati i robot generalisti. I risultati pubblici più rilevanti sono dichiarati dall’azienda, il numero di compiti mostrati è limitato e non sono disponibili, nelle fonti considerate, metriche industriali indipendentemente verificate.
La conclusione più prudente è che S1 mostri un approccio promettente per ridurre la formazione specifica dei robot: usare un video come istruzione, affidarsi al preaddestramento per fornire abilità riutilizzabili e verificare se queste possano essere combinate in compiti nuovi e articolati. Il salto dall’esempio controllato a un robot affidabile in qualunque ambiente, però, resta ancora da dimostrare.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Secondo Skild AI, S1 può eseguire compiti inediti e composti da più passaggi, della durata massima di 10 minuti, dopo aver osservato un solo video umano e senza fine tuning.
Secondo Skild AI, S1 può eseguire compiti inediti e composti da più passaggi, della durata massima di 10 minuti, dopo aver osservato un solo video umano e senza fine tuning. S1 tratta il video come un’istruzione ricevuta al momento dell’esecuzione: combina abilità apprese in precedenza e le adatta all’ambiente in cui si trova il robot.
La strategia più ampia di Skild Brain punta sull’addestramento con molte forme di robot e varianti simulate.