Skild AI zufolge kann S1 bisher unbekannte, mehrstufige Aufgaben von bis zu zehn Minuten Dauer nach einem menschlichen Video ausführen – ohne Fine Tuning oder nachträgliche Trainingsphase. S1 behandelt das Video als Anweisung zur Laufzeit.
Veröffentlicht vonBearbeitet mit GPT-5.6 LunaBilder erstellt mit GPT Image 1.5
Forschungsantwort

Create a landscape editorial hero image for this Studio Global article: What is Skild AI’s S1 robotics foundation model, how does it enable robots to learn and perform previously unseen long-horizon manipulation. Article summary: Skild AI’s S1 is a robotics foundation model designed for visual in-context learning: rather than retraining a policy for each new job, a robot conditions on one video demonstration and then attempts the task in real tim. Topic tags: general, general web, news, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts wi
Skild AI will die Programmierung von Robotern stärker an menschliches Lernen durch Beobachtung annähern: Eine Person führt eine Aufgabe in einem Video vor, und das Modell nutzt diese Demonstration als visuelle Anweisung. Nach Angaben des Unternehmens kann S1 damit bisher unbekannte, mehrstufige Manipulationsaufgaben von bis zu zehn Minuten Dauer ausführen – ohne ein neues, auf diese Aufgabe zugeschnittenes Training oder Fine-Tuning. 1
Der Unterschied zu klassischer Robotik ist erheblich. Für eine neue Tätigkeit waren bislang oft große Mengen aufgabenspezifischer Daten, Teleoperation, technische Integration oder ein erneutes Training nötig. S1 soll ein Video jedoch nicht Bild für Bild kopieren. Stattdessen interpretiert das Modell Ziel und Ablauf und kombiniert bereits gelernte Fähigkeiten zu einer neuen Folge von Aktionen.
S1 setzt auf visuelles In-Context Learning. Die menschliche Demonstration dient bei der Ausführung als Prompt – also als unmittelbare Aufgabenbeschreibung. Das Modell beobachtet den Ablauf, erschließt Ziel und Reihenfolge und übersetzt diese Informationen in Bewegungen des Roboters in dessen aktueller Umgebung. Laut Skild werden die Modellgewichte für jede neue Demonstration nicht verändert. 1
Das ähnelt eher dem Vormachen als dem herkömmlichen Anlernen eines Roboters. S1 muss visuelle Eindrücke mit zuvor erlernten Grundfertigkeiten verknüpfen, etwa Greifen, Bewegen, Absetzen und Objektmanipulation, und diese anschließend zu einem längeren Ablauf ordnen. Zu den öffentlich gezeigten Beispielen zählen Pour-over-Kaffee, das Eintopfen einer Pflanze, der Zusammenbau eines Kits und das Wenden von Pfannkuchen. 1
35
Die eigentliche Herausforderung ist der lange Zeithorizont. Eine einzelne Bewegung lässt sich vergleichsweise leicht skripten oder isoliert trainieren. Eine zehnminütige Aufgabe kann dagegen Dutzende Entscheidungen, sich verändernde Objektpositionen und zahlreiche Fehlergelegenheiten enthalten. S1 soll das übergeordnete Ziel über diese längere Sequenz hinweg beibehalten und seine Aktionen an die jeweilige Szene anpassen, statt die exakten Bewegungen der vorführenden Person einfach abzuspielen.
Skild berichtet bei einer Evaluation unbekannter Aufgaben von einem deutlichen Vorteil des Videoprompts gegenüber einer Sprachanweisung. Bei einem angegebenen Trainingsumfang von 100.000 Stunden erreichte die videogesteuerte Policy eine durchschnittliche Erfolgsrate von 66 Prozent pro Schritt. Eine vergleichbare sprachgesteuerte Vision-Language-Action-Policy kam auf 9 Prozent. 32
Das legt nahe, dass eine visuelle Demonstration physische Details besser vermitteln kann als Worte allein: Welches Objekt soll gegriffen werden? Wie muss es ausgerichtet sein? In welcher Reihenfolge erfolgen die Schritte? Und wie reagiert die vorführende Person auf die Umgebung?
Die Zahlen müssen allerdings eingeordnet werden. Sie stammen aus einer von Skild beschriebenen Evaluation und sind hier nicht als unabhängig reproduzierter Branchen-Benchmark zu verstehen. Außerdem bedeutet eine Erfolgsrate von 66 Prozent pro Schritt nicht, dass eine komplette zehnminütige Aufgabe mit 66-prozentiger Wahrscheinlichkeit vom Anfang bis zum Ende gelingt.
Die öffentlich präsentierten Beispiele umfassen unter anderem:
Diese Aufgaben sind deshalb interessant, weil sie Wahrnehmung, Objekt-handling, die richtige Reihenfolge und anhaltende Steuerung verbinden – und nicht nur eine einzelne Bewegung testen. Skild beschreibt sie als Aufgaben, die während des Vortrainings nicht gesehen worden seien. Die öffentlich verfügbare Beleglage stammt jedoch überwiegend vom Unternehmen selbst sowie aus Berichten, die dessen Angaben zusammenfassen. 1
33
Die Demonstrationen zeigen die beabsichtigte Bedienoberfläche: Ein Mensch führt eine Aufgabe einmal vor, anschließend versucht der Roboter, das Vorgehen zu verallgemeinern. Daraus folgt nicht, dass S1 beliebige Hausarbeit zuverlässig erledigen, ohne Aufsicht arbeiten oder jede physische Abweichung in einer Produktionsumgebung bewältigen kann.
Der beworbene Vorteil von S1 besteht darin, dass der Roboter nach der Beobachtung der Demonstration mit der Ausführung beginnen kann – ohne separate Trainingsphase nach dem Video. Skild und die Berichte zur Vorstellung des Modells beschreiben diesen Ablauf als Echtzeit-Ausführung im Kontext. 1
30
Eine belastbare, präzise Latenzmessung liegt in den verfügbaren Quellen allerdings nicht vor. Unklar bleibt beispielsweise, wie viele Sekunden zwischen dem Ende des Videos und der ersten Roboterbewegung vergehen. „Kein Fine-Tuning“ bedeutet, dass keine neue, aufgabenspezifische Aktualisierung der Modellgewichte erfolgt. Es bedeutet nicht zwingend, dass jedes Video sofort verarbeitet wird oder dass Einrichtung, Kalibrierung und Sicherheitsprüfungen entfallen.
S1 ist Teil der umfassenderen Skild-Brain-Strategie. Dabei soll ein allgemeines Modell über viele Aufgaben, Roboterformen, Simulationen und visuelle Daten von Menschen hinweg trainiert werden, anstatt für jeden Roboter und jede Tätigkeit eine eigene Policy zu bauen. Skild zufolge wurde eine simulierte Welt mit 100.000 verschiedenen Robotervarianten erstellt. Das Unternehmen testete zudem die Verallgemeinerung auf Roboterkörper, die aus den Trainingsdaten ausgeschlossen waren. 6
Das Training über unterschiedliche Verkörperungen hinweg – in der Robotik spricht man von „Embodiments“ – soll dem Modell allgemeine Prinzipien der Steuerung vermitteln. Nach den Unternehmensangaben ist das System für humanoide Roboter, Vierbeiner, Tischroboterarme und mobile Manipulatoren gedacht. 3
10
Die häufig wiederholte Behauptung, Skild verfüge über 100- bis 1.000-mal mehr Daten als Wettbewerber, sollte vorsichtig bewertet werden. Die vorliegenden Quellen liefern keinen standardisierten und unabhängig prüfbaren Vergleich von Umfang, Qualität und verwertbarer Robotererfahrung verschiedener Datensätze. Belastbarer ist die Aussage, dass Skild auf Skalierung durch Training über verschiedene Roboterkörper und Simulationen hinweg setzt, statt sich ausschließlich auf maßgeschneiderte Demonstrationen für eine einzelne Hardwareplattform zu stützen.
„Omni-bodied“ ist Skilds Bezeichnung für ein Modell, das zwischen unterschiedlichen Roboterkörpern übertragen können soll. Im Prinzip kann ein gemeinsames Modell Konzepte auf Aufgabenebene von der konkreten Geometrie einer einzelnen Maschine trennen. Dadurch soll es sich an unterschiedliche Gliedmaßen, Räder, Greifer und Antriebsanordnungen anpassen können. Skild zufolge wurden in Simulationen auch zurückgehaltene Roboterformen im Zero-Shot-Verfahren gesteuert – also ohne vorheriges Training genau auf diesen Körpern. 6
Das macht die Hardware nicht nebensächlich. Roboter unterscheiden sich weiterhin bei Sensoren, Greifern, Gelenkgrenzen, Steuerungsschnittstellen, Latenzen, Traglasten und Sicherheitsvorgaben. Ein Modell, das über verschiedene Verkörperungen generalisiert, kann den Anpassungsaufwand verringern. Für den Einsatz in der Praxis sind aber weiterhin kompatible Hardware, Systemintegration und Tests in der Zielumgebung erforderlich.
Öffentliche Berichte zufolge läuft die Software von Skild auf Hunderten Robotern in Fabriken, Rechenzentren und Logistikstandorten. Genannt werden unter anderem eine NVIDIA-Fabrik in Houston, ein Versuch am Flughafen LaGuardia sowie Einsätze bei Unternehmen aus den Bereichen Verkabelung und Bau. Zudem hat Skild Partnerschaften beziehungsweise Kooperationen mit ABB Robotics, Universal Robots und NVIDIA angekündigt. 17
4
Diese Berichte zeigen kommerzielles Interesse und Erprobungen unter realen Bedingungen. Sie liefern jedoch nicht genügend öffentlich überprüfbare Daten, um Produktionsabschlussraten, Verfügbarkeit, Kosteneinsparungen oder den Return on Investment zu berechnen. Ein Ergebnis aus einem Labor oder einer kontrollierten Evaluation darf nicht als Produktionskennzahl verstanden werden. Ein weiterer Bericht beschreibt eine geplante Zusammenarbeit mit Foxconn an Montagelinien für NVIDIA-Blackwell-GPU-Serversysteme. Das belegt eine Test- oder Einsatzinitiative, aber noch keinen flächendeckenden autonomen Fabrikbetrieb. 43
Die Finanzierung von Skild hat dazu beigetragen, dass der Ansatz zu den meistbeobachteten Projekten im Bereich der physischen KI gehört. Bloomberg berichtete, dass das Unternehmen im Januar 2026 in einer von SoftBank angeführten Series-C-Runde rund 1,4 Milliarden US-Dollar einsammelte und dabei mit mehr als 14 Milliarden US-Dollar bewertet wurde. 13 Die zuvor im Juli 2024 angekündigte Series A umfasste 300 Millionen US-Dollar bei einer gemeldeten Bewertung von 1,5 Milliarden US-Dollar.
9
Der Vergleich mit einem „ChatGPT-Moment“ beschreibt die erhoffte Veränderung der Bedienung: Statt einen Roboter für jede Aufgabe zu programmieren oder neu zu trainieren, könnte ein Beschäftigter das gewünschte Verhalten vorführen und ein allgemeines Modell die Übertragung in konkrete Bewegungen übernehmen. S1 ist ein bemerkenswerter Schritt in Richtung dieser Schnittstelle.
Ein Beweis dafür, dass nun allgemeine Roboter verfügbar sind, ist das noch nicht. Die stärksten öffentlich bekannten Ergebnisse stammen vom Unternehmen selbst, der Aufgabenkatalog ist begrenzt, und unabhängig verifizierte Kennzahlen aus der Industrie fehlen in der vorliegenden Evidenz. Die vorsichtigere Schlussfolgerung lautet: S1 zeigt einen vielversprechenden Weg, den aufgabenspezifischen Trainingsaufwand in der Robotik zu reduzieren – ein Video dient als Anweisung, ein breit vortrainiertes Modell liefert wiederverwendbare Fähigkeiten, und anschließend wird geprüft, ob sich diese Fähigkeiten zu einer neuen, lang andauernden Aufgabe kombinieren lassen.
Studio Global AI
Diese Seite enthält eine quellengestützte Antwort, die Sie in Studio Global fortsetzen können.
Skild AI zufolge kann S1 bisher unbekannte, mehrstufige Aufgaben von bis zu zehn Minuten Dauer nach einem menschlichen Video ausführen – ohne Fine Tuning oder nachträgliche Trainingsphase.
Skild AI zufolge kann S1 bisher unbekannte, mehrstufige Aufgaben von bis zu zehn Minuten Dauer nach einem menschlichen Video ausführen – ohne Fine Tuning oder nachträgliche Trainingsphase. S1 behandelt das Video als Anweisung zur Laufzeit. Das Modell verbindet zuvor gelernte Fähigkeiten wie Greifen, Bewegen und Platzieren zu einer neuen Handlungsfolge in der aktuellen Umgebung.
Die übergeordnete Skild Brain Strategie trainiert über viele Roboterformen und simulierte Varianten hinweg.
Skild AI zufolge kann S1 bisher unbekannte, mehrstufige Aufgaben von bis zu zehn Minuten Dauer nach einem menschlichen Video ausführen – ohne Fine Tuning oder nachträgliche Trainingsphase. S1 behandelt das Video als Anweisung zur Laufzeit.
Veröffentlicht vonBearbeitet mit GPT-5.6 LunaBilder erstellt mit GPT Image 1.5
Forschungsantwort

Create a landscape editorial hero image for this Studio Global article: What is Skild AI’s S1 robotics foundation model, how does it enable robots to learn and perform previously unseen long-horizon manipulation. Article summary: Skild AI’s S1 is a robotics foundation model designed for visual in-context learning: rather than retraining a policy for each new job, a robot conditions on one video demonstration and then attempts the task in real tim. Topic tags: general, general web, news, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts wi
Skild AI will die Programmierung von Robotern stärker an menschliches Lernen durch Beobachtung annähern: Eine Person führt eine Aufgabe in einem Video vor, und das Modell nutzt diese Demonstration als visuelle Anweisung. Nach Angaben des Unternehmens kann S1 damit bisher unbekannte, mehrstufige Manipulationsaufgaben von bis zu zehn Minuten Dauer ausführen – ohne ein neues, auf diese Aufgabe zugeschnittenes Training oder Fine-Tuning. 1
Der Unterschied zu klassischer Robotik ist erheblich. Für eine neue Tätigkeit waren bislang oft große Mengen aufgabenspezifischer Daten, Teleoperation, technische Integration oder ein erneutes Training nötig. S1 soll ein Video jedoch nicht Bild für Bild kopieren. Stattdessen interpretiert das Modell Ziel und Ablauf und kombiniert bereits gelernte Fähigkeiten zu einer neuen Folge von Aktionen.
S1 setzt auf visuelles In-Context Learning. Die menschliche Demonstration dient bei der Ausführung als Prompt – also als unmittelbare Aufgabenbeschreibung. Das Modell beobachtet den Ablauf, erschließt Ziel und Reihenfolge und übersetzt diese Informationen in Bewegungen des Roboters in dessen aktueller Umgebung. Laut Skild werden die Modellgewichte für jede neue Demonstration nicht verändert. 1
Das ähnelt eher dem Vormachen als dem herkömmlichen Anlernen eines Roboters. S1 muss visuelle Eindrücke mit zuvor erlernten Grundfertigkeiten verknüpfen, etwa Greifen, Bewegen, Absetzen und Objektmanipulation, und diese anschließend zu einem längeren Ablauf ordnen. Zu den öffentlich gezeigten Beispielen zählen Pour-over-Kaffee, das Eintopfen einer Pflanze, der Zusammenbau eines Kits und das Wenden von Pfannkuchen. 1
35
Die eigentliche Herausforderung ist der lange Zeithorizont. Eine einzelne Bewegung lässt sich vergleichsweise leicht skripten oder isoliert trainieren. Eine zehnminütige Aufgabe kann dagegen Dutzende Entscheidungen, sich verändernde Objektpositionen und zahlreiche Fehlergelegenheiten enthalten. S1 soll das übergeordnete Ziel über diese längere Sequenz hinweg beibehalten und seine Aktionen an die jeweilige Szene anpassen, statt die exakten Bewegungen der vorführenden Person einfach abzuspielen.
Skild berichtet bei einer Evaluation unbekannter Aufgaben von einem deutlichen Vorteil des Videoprompts gegenüber einer Sprachanweisung. Bei einem angegebenen Trainingsumfang von 100.000 Stunden erreichte die videogesteuerte Policy eine durchschnittliche Erfolgsrate von 66 Prozent pro Schritt. Eine vergleichbare sprachgesteuerte Vision-Language-Action-Policy kam auf 9 Prozent. 32
Das legt nahe, dass eine visuelle Demonstration physische Details besser vermitteln kann als Worte allein: Welches Objekt soll gegriffen werden? Wie muss es ausgerichtet sein? In welcher Reihenfolge erfolgen die Schritte? Und wie reagiert die vorführende Person auf die Umgebung?
Die Zahlen müssen allerdings eingeordnet werden. Sie stammen aus einer von Skild beschriebenen Evaluation und sind hier nicht als unabhängig reproduzierter Branchen-Benchmark zu verstehen. Außerdem bedeutet eine Erfolgsrate von 66 Prozent pro Schritt nicht, dass eine komplette zehnminütige Aufgabe mit 66-prozentiger Wahrscheinlichkeit vom Anfang bis zum Ende gelingt.
Die öffentlich präsentierten Beispiele umfassen unter anderem:
Diese Aufgaben sind deshalb interessant, weil sie Wahrnehmung, Objekt-handling, die richtige Reihenfolge und anhaltende Steuerung verbinden – und nicht nur eine einzelne Bewegung testen. Skild beschreibt sie als Aufgaben, die während des Vortrainings nicht gesehen worden seien. Die öffentlich verfügbare Beleglage stammt jedoch überwiegend vom Unternehmen selbst sowie aus Berichten, die dessen Angaben zusammenfassen. 1
33
Die Demonstrationen zeigen die beabsichtigte Bedienoberfläche: Ein Mensch führt eine Aufgabe einmal vor, anschließend versucht der Roboter, das Vorgehen zu verallgemeinern. Daraus folgt nicht, dass S1 beliebige Hausarbeit zuverlässig erledigen, ohne Aufsicht arbeiten oder jede physische Abweichung in einer Produktionsumgebung bewältigen kann.
Der beworbene Vorteil von S1 besteht darin, dass der Roboter nach der Beobachtung der Demonstration mit der Ausführung beginnen kann – ohne separate Trainingsphase nach dem Video. Skild und die Berichte zur Vorstellung des Modells beschreiben diesen Ablauf als Echtzeit-Ausführung im Kontext. 1
30
Eine belastbare, präzise Latenzmessung liegt in den verfügbaren Quellen allerdings nicht vor. Unklar bleibt beispielsweise, wie viele Sekunden zwischen dem Ende des Videos und der ersten Roboterbewegung vergehen. „Kein Fine-Tuning“ bedeutet, dass keine neue, aufgabenspezifische Aktualisierung der Modellgewichte erfolgt. Es bedeutet nicht zwingend, dass jedes Video sofort verarbeitet wird oder dass Einrichtung, Kalibrierung und Sicherheitsprüfungen entfallen.
S1 ist Teil der umfassenderen Skild-Brain-Strategie. Dabei soll ein allgemeines Modell über viele Aufgaben, Roboterformen, Simulationen und visuelle Daten von Menschen hinweg trainiert werden, anstatt für jeden Roboter und jede Tätigkeit eine eigene Policy zu bauen. Skild zufolge wurde eine simulierte Welt mit 100.000 verschiedenen Robotervarianten erstellt. Das Unternehmen testete zudem die Verallgemeinerung auf Roboterkörper, die aus den Trainingsdaten ausgeschlossen waren. 6
Das Training über unterschiedliche Verkörperungen hinweg – in der Robotik spricht man von „Embodiments“ – soll dem Modell allgemeine Prinzipien der Steuerung vermitteln. Nach den Unternehmensangaben ist das System für humanoide Roboter, Vierbeiner, Tischroboterarme und mobile Manipulatoren gedacht. 3
10
Die häufig wiederholte Behauptung, Skild verfüge über 100- bis 1.000-mal mehr Daten als Wettbewerber, sollte vorsichtig bewertet werden. Die vorliegenden Quellen liefern keinen standardisierten und unabhängig prüfbaren Vergleich von Umfang, Qualität und verwertbarer Robotererfahrung verschiedener Datensätze. Belastbarer ist die Aussage, dass Skild auf Skalierung durch Training über verschiedene Roboterkörper und Simulationen hinweg setzt, statt sich ausschließlich auf maßgeschneiderte Demonstrationen für eine einzelne Hardwareplattform zu stützen.
„Omni-bodied“ ist Skilds Bezeichnung für ein Modell, das zwischen unterschiedlichen Roboterkörpern übertragen können soll. Im Prinzip kann ein gemeinsames Modell Konzepte auf Aufgabenebene von der konkreten Geometrie einer einzelnen Maschine trennen. Dadurch soll es sich an unterschiedliche Gliedmaßen, Räder, Greifer und Antriebsanordnungen anpassen können. Skild zufolge wurden in Simulationen auch zurückgehaltene Roboterformen im Zero-Shot-Verfahren gesteuert – also ohne vorheriges Training genau auf diesen Körpern. 6
Das macht die Hardware nicht nebensächlich. Roboter unterscheiden sich weiterhin bei Sensoren, Greifern, Gelenkgrenzen, Steuerungsschnittstellen, Latenzen, Traglasten und Sicherheitsvorgaben. Ein Modell, das über verschiedene Verkörperungen generalisiert, kann den Anpassungsaufwand verringern. Für den Einsatz in der Praxis sind aber weiterhin kompatible Hardware, Systemintegration und Tests in der Zielumgebung erforderlich.
Öffentliche Berichte zufolge läuft die Software von Skild auf Hunderten Robotern in Fabriken, Rechenzentren und Logistikstandorten. Genannt werden unter anderem eine NVIDIA-Fabrik in Houston, ein Versuch am Flughafen LaGuardia sowie Einsätze bei Unternehmen aus den Bereichen Verkabelung und Bau. Zudem hat Skild Partnerschaften beziehungsweise Kooperationen mit ABB Robotics, Universal Robots und NVIDIA angekündigt. 17
4
Diese Berichte zeigen kommerzielles Interesse und Erprobungen unter realen Bedingungen. Sie liefern jedoch nicht genügend öffentlich überprüfbare Daten, um Produktionsabschlussraten, Verfügbarkeit, Kosteneinsparungen oder den Return on Investment zu berechnen. Ein Ergebnis aus einem Labor oder einer kontrollierten Evaluation darf nicht als Produktionskennzahl verstanden werden. Ein weiterer Bericht beschreibt eine geplante Zusammenarbeit mit Foxconn an Montagelinien für NVIDIA-Blackwell-GPU-Serversysteme. Das belegt eine Test- oder Einsatzinitiative, aber noch keinen flächendeckenden autonomen Fabrikbetrieb. 43
Die Finanzierung von Skild hat dazu beigetragen, dass der Ansatz zu den meistbeobachteten Projekten im Bereich der physischen KI gehört. Bloomberg berichtete, dass das Unternehmen im Januar 2026 in einer von SoftBank angeführten Series-C-Runde rund 1,4 Milliarden US-Dollar einsammelte und dabei mit mehr als 14 Milliarden US-Dollar bewertet wurde. 13 Die zuvor im Juli 2024 angekündigte Series A umfasste 300 Millionen US-Dollar bei einer gemeldeten Bewertung von 1,5 Milliarden US-Dollar.
9
Der Vergleich mit einem „ChatGPT-Moment“ beschreibt die erhoffte Veränderung der Bedienung: Statt einen Roboter für jede Aufgabe zu programmieren oder neu zu trainieren, könnte ein Beschäftigter das gewünschte Verhalten vorführen und ein allgemeines Modell die Übertragung in konkrete Bewegungen übernehmen. S1 ist ein bemerkenswerter Schritt in Richtung dieser Schnittstelle.
Ein Beweis dafür, dass nun allgemeine Roboter verfügbar sind, ist das noch nicht. Die stärksten öffentlich bekannten Ergebnisse stammen vom Unternehmen selbst, der Aufgabenkatalog ist begrenzt, und unabhängig verifizierte Kennzahlen aus der Industrie fehlen in der vorliegenden Evidenz. Die vorsichtigere Schlussfolgerung lautet: S1 zeigt einen vielversprechenden Weg, den aufgabenspezifischen Trainingsaufwand in der Robotik zu reduzieren – ein Video dient als Anweisung, ein breit vortrainiertes Modell liefert wiederverwendbare Fähigkeiten, und anschließend wird geprüft, ob sich diese Fähigkeiten zu einer neuen, lang andauernden Aufgabe kombinieren lassen.
Studio Global AI
Diese Seite enthält eine quellengestützte Antwort, die Sie in Studio Global fortsetzen können.
Skild AI zufolge kann S1 bisher unbekannte, mehrstufige Aufgaben von bis zu zehn Minuten Dauer nach einem menschlichen Video ausführen – ohne Fine Tuning oder nachträgliche Trainingsphase.
Skild AI zufolge kann S1 bisher unbekannte, mehrstufige Aufgaben von bis zu zehn Minuten Dauer nach einem menschlichen Video ausführen – ohne Fine Tuning oder nachträgliche Trainingsphase. S1 behandelt das Video als Anweisung zur Laufzeit. Das Modell verbindet zuvor gelernte Fähigkeiten wie Greifen, Bewegen und Platzieren zu einer neuen Handlungsfolge in der aktuellen Umgebung.
Die übergeordnete Skild Brain Strategie trainiert über viele Roboterformen und simulierte Varianten hinweg.