A Skild AI afirma que o S1 consegue executar tarefas inéditas e com várias etapas, de até 10 minutos, depois de assistir a um único vídeo humano, sem ajuste fino; em seu teste, o modelo alcançou 66% de sucesso médio p... O vídeo funciona como uma instrução durante a execução: o S1 combina habilidades aprendidas no p...
Publicado porEditado com GPT-5.6 LunaImagens geradas com GPT Image 1.5
Resposta de pesquisa

Create a landscape editorial hero image for this Studio Global article: What is Skild AI’s S1 robotics foundation model, how does it enable robots to learn and perform previously unseen long-horizon manipulation. Article summary: Skild AI’s S1 is a robotics foundation model designed for visual in-context learning: rather than retraining a policy for each new job, a robot conditions on one video demonstration and then attempts the task in real tim. Topic tags: general, general web, news, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts wi
A Skild AI quer fazer a programação de robôs parecer mais uma demonstração do que uma sessão de engenharia. Uma pessoa realiza uma tarefa diante de uma câmera; então, o modelo usa esse vídeo como uma instrução visual para tentar reproduzir o objetivo em outro ambiente. Segundo a empresa, o S1 consegue lidar com tarefas inéditas, com várias etapas e duração de até 10 minutos, sem ajuste fino nem um novo ciclo de treinamento depois da observação. 1
A diferença é importante. Tradicionalmente, ensinar um robô a fazer um trabalho novo exige dados específicos da tarefa, teleoperação, programação ou novo treinamento. A proposta do S1 não é memorizar cada quadro do vídeo, mas interpretar o objetivo e combinar habilidades que já aprendeu — como pegar, mover, posicionar e manipular objetos — em uma sequência inédita de ações.
O S1 usa o que a Skild chama de aprendizagem visual em contexto (visual in-context learning). A demonstração humana funciona como um prompt de tarefa no momento da inferência: o modelo observa o que acontece, deduz a intenção e a ordem das ações e transforma essa informação em comandos para o robô no ambiente atual. De acordo com a descrição da Skild, os pesos do modelo não são alterados a cada nova demonstração. 1
Na prática, isso se aproxima mais de “mostrar como fazer” do que de treinar um robô do zero. O sistema precisa conectar imagens a habilidades previamente aprendidas e organizá-las em um procedimento mais longo. Entre os exemplos divulgados pela empresa estão preparar café filtrado, plantar uma muda, montar um kit e virar panquecas. 1
35
O desafio central é o chamado horizonte longo. Uma ação curta pode ser programada ou aprendida isoladamente; já uma tarefa de 10 minutos pode envolver dezenas de decisões, objetos que mudam de posição e várias chances de erro. O objetivo do S1 é manter a finalidade da tarefa ao longo de toda a sequência e ajustar os movimentos à cena, em vez de simplesmente repetir os gestos exatos da pessoa que fez a demonstração.
Em uma avaliação de tarefas inéditas, a Skild relata uma diferença expressiva entre o uso de vídeo e o uso de linguagem. Na escala de treinamento declarada de 100 mil horas, a política orientada por vídeo atingiu 66% de sucesso médio por etapa, contra 9% de uma política comparável de visão-linguagem-ação orientada por texto. 32
O resultado sugere que uma demonstração visual pode transmitir detalhes físicos que as palavras deixam ambíguos: qual objeto pegar, como orientá-lo, em que ordem realizar as ações e como reagir ao ambiente. Ainda assim, o número precisa ser interpretado com cautela. Trata-se de uma avaliação divulgada pela própria Skild, não de um benchmark industrial reproduzido de forma independente. Além disso, uma taxa de sucesso por etapa não equivale a uma garantia de 66% de conclusão de uma tarefa inteira de 10 minutos.
Os exemplos públicos incluem tarefas de manipulação como:
Esses casos combinam percepção, identificação de objetos, manipulação, ordem de ações e controle contínuo — algo mais complexo do que testar apenas um movimento isolado. A Skild diz que as tarefas não estavam presentes no pré-treinamento, embora as evidências disponíveis venham principalmente da empresa e de reportagens que resumem suas afirmações. 1
33
As demonstrações mostram a interface pretendida: uma pessoa executa a tarefa uma vez e o robô tenta generalizar o procedimento. Elas não comprovam que o S1 consiga realizar qualquer trabalho doméstico, operar sem supervisão ou lidar com todas as variações físicas de uma linha de produção.
A vantagem anunciada do S1 é começar a operar depois de observar a demonstração, sem uma etapa separada de treinamento posterior. A Skild e as reportagens sobre o lançamento descrevem essa execução em tempo real. 1
30
As fontes disponíveis, porém, não informam uma latência precisa e confiável — por exemplo, quantos segundos se passam entre o fim do vídeo e o primeiro movimento do robô. “Sem ajuste fino” significa que o modelo não passa por uma nova atualização de pesos específica para aquela tarefa. Isso não quer dizer necessariamente que todo vídeo seja processado de forma instantânea ou que o sistema dispense configuração, calibração e verificações de segurança.
O S1 faz parte da estratégia mais ampla do Skild Brain, que busca treinar um modelo geral em diferentes tarefas, corpos robóticos, ambientes simulados e dados visuais humanos. A ideia é evitar a criação de uma política separada para cada combinação de robô e trabalho. A Skild afirma ter criado um universo simulado com 100 mil variantes de robôs e testado a generalização para corpos que ficaram fora do conjunto de treinamento. 6
O treinamento em diferentes configurações físicas pretende expor o modelo a princípios gerais de controle. Os materiais da empresa descrevem um sistema pensado para operar em robôs humanoides, quadrúpedes, braços de mesa e manipuladores móveis. 3
10
A afirmação recorrente de que a Skild teria de 100 a 1.000 vezes mais dados que os concorrentes deve ser vista com cautela. As fontes fornecidas não apresentam uma comparação padronizada e auditável, entre empresas, de tamanho, qualidade ou utilidade dos conjuntos de dados. O ponto mais defensável é que a Skild aposta em escala por meio de treinamento entre diferentes corpos e simulação, em vez de depender apenas de demonstrações específicas para uma plataforma de hardware.
“Omni-bodied” — algo como “para todos os corpos” — é o termo usado pela Skild para descrever um modelo capaz de ser transferido entre diferentes tipos de robô. Em princípio, um modelo compartilhado pode aprender conceitos de alto nível da tarefa separadamente da geometria exata de uma máquina, adaptando-se a pernas, rodas, braços, garras e configurações de atuadores diferentes. A empresa afirma que seus testes simulados incluíram formas robóticas excluídas do treinamento, controladas em regime zero-shot, ou seja, sem exemplos específicos daquele corpo. 6
Isso não torna o hardware irrelevante. Robôs continuam tendo sensores, garras, limites articulares, interfaces de controle, latência, capacidade de carga e requisitos de segurança distintos. Um modelo que generaliza entre diferentes corpos pode reduzir o trabalho de adaptação, mas a implantação ainda exige hardware compatível, integração de sistemas e validação no ambiente de destino.
Reportagens afirmam que o software da Skild opera em centenas de robôs em fábricas, data centers e operações de logística. Os exemplos citados incluem a fábrica da NVIDIA em Houston, um teste no aeroporto LaGuardia e trabalhos com empresas dos setores de cabeamento e construção. A empresa também anunciou relações com ABB Robotics, Universal Robots e NVIDIA. 17
4
Esses relatos indicam interesse comercial e testes no mundo real, mas não oferecem evidências públicas suficientes para calcular taxas de conclusão em produção, tempo de atividade, economia de custos ou retorno sobre o investimento. Um resultado de laboratório ou de um ambiente controlado não deve ser tratado como métrica industrial. Uma reportagem também descreve uma implantação planejada com a Foxconn em linhas de montagem associadas aos sistemas de servidores com GPUs Blackwell da NVIDIA — evidência de um teste ou esforço de implantação, não de uma operação fabril autônoma em larga escala já comprovada. 43
O financiamento da Skild ajudou a colocar sua abordagem entre as iniciativas mais observadas da chamada IA física. A Bloomberg informou que a empresa captou cerca de US$ 1,4 bilhão em uma rodada Série C liderada pelo SoftBank, em janeiro de 2026, alcançando uma avaliação superior a US$ 14 bilhões. 13 A rodada Série A, anunciada em julho de 2024, havia sido de US$ 300 milhões, com avaliação divulgada de US$ 1,5 bilhão.
9
A comparação com um “momento ChatGPT” resume a mudança de experiência que a empresa espera promover: em vez de programar ou retreinar um robô para cada tarefa, um trabalhador poderia demonstrar o comportamento desejado e deixar um modelo geral traduzi-lo em ações. O S1 é um passo relevante nessa direção.
Mas isso ainda não prova que os robôs generalistas chegaram. Os principais resultados públicos são divulgados pela própria empresa, o conjunto de tarefas continua limitado e não há, nas evidências fornecidas, métricas industriais independentes sobre desempenho em produção. A conclusão mais prudente é que o S1 demonstra uma forma promissora de reduzir o treinamento específico de robôs: usar um vídeo como instrução, aproveitar habilidades reutilizáveis adquiridas no pré-treinamento e verificar se elas podem ser combinadas em uma tarefa nova e de longa duração.
Studio Global AI
Esta página inclui uma resposta baseada na fonte que você pode continuar em Studio Global.
A Skild AI afirma que o S1 consegue executar tarefas inéditas e com várias etapas, de até 10 minutos, depois de assistir a um único vídeo humano, sem ajuste fino; em seu teste, o modelo alcançou 66% de sucesso médio p...
A Skild AI afirma que o S1 consegue executar tarefas inéditas e com várias etapas, de até 10 minutos, depois de assistir a um único vídeo humano, sem ajuste fino; em seu teste, o modelo alcançou 66% de sucesso médio p... O vídeo funciona como uma instrução durante a execução: o S1 combina habilidades aprendidas no pré treinamento e as adapta ao ambiente atual do robô.
A estratégia mais ampla da Skild inclui treinamento em diferentes corpos robóticos e 100 mil variantes simuladas, mas ainda não há dados públicos independentes sobre taxas de conclusão em produção, disponibilidade ou...
A Skild AI afirma que o S1 consegue executar tarefas inéditas e com várias etapas, de até 10 minutos, depois de assistir a um único vídeo humano, sem ajuste fino; em seu teste, o modelo alcançou 66% de sucesso médio p... O vídeo funciona como uma instrução durante a execução: o S1 combina habilidades aprendidas no p...
Publicado porEditado com GPT-5.6 LunaImagens geradas com GPT Image 1.5
Resposta de pesquisa

Create a landscape editorial hero image for this Studio Global article: What is Skild AI’s S1 robotics foundation model, how does it enable robots to learn and perform previously unseen long-horizon manipulation. Article summary: Skild AI’s S1 is a robotics foundation model designed for visual in-context learning: rather than retraining a policy for each new job, a robot conditions on one video demonstration and then attempts the task in real tim. Topic tags: general, general web, news, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts wi
A Skild AI quer fazer a programação de robôs parecer mais uma demonstração do que uma sessão de engenharia. Uma pessoa realiza uma tarefa diante de uma câmera; então, o modelo usa esse vídeo como uma instrução visual para tentar reproduzir o objetivo em outro ambiente. Segundo a empresa, o S1 consegue lidar com tarefas inéditas, com várias etapas e duração de até 10 minutos, sem ajuste fino nem um novo ciclo de treinamento depois da observação. 1
A diferença é importante. Tradicionalmente, ensinar um robô a fazer um trabalho novo exige dados específicos da tarefa, teleoperação, programação ou novo treinamento. A proposta do S1 não é memorizar cada quadro do vídeo, mas interpretar o objetivo e combinar habilidades que já aprendeu — como pegar, mover, posicionar e manipular objetos — em uma sequência inédita de ações.
O S1 usa o que a Skild chama de aprendizagem visual em contexto (visual in-context learning). A demonstração humana funciona como um prompt de tarefa no momento da inferência: o modelo observa o que acontece, deduz a intenção e a ordem das ações e transforma essa informação em comandos para o robô no ambiente atual. De acordo com a descrição da Skild, os pesos do modelo não são alterados a cada nova demonstração. 1
Na prática, isso se aproxima mais de “mostrar como fazer” do que de treinar um robô do zero. O sistema precisa conectar imagens a habilidades previamente aprendidas e organizá-las em um procedimento mais longo. Entre os exemplos divulgados pela empresa estão preparar café filtrado, plantar uma muda, montar um kit e virar panquecas. 1
35
O desafio central é o chamado horizonte longo. Uma ação curta pode ser programada ou aprendida isoladamente; já uma tarefa de 10 minutos pode envolver dezenas de decisões, objetos que mudam de posição e várias chances de erro. O objetivo do S1 é manter a finalidade da tarefa ao longo de toda a sequência e ajustar os movimentos à cena, em vez de simplesmente repetir os gestos exatos da pessoa que fez a demonstração.
Em uma avaliação de tarefas inéditas, a Skild relata uma diferença expressiva entre o uso de vídeo e o uso de linguagem. Na escala de treinamento declarada de 100 mil horas, a política orientada por vídeo atingiu 66% de sucesso médio por etapa, contra 9% de uma política comparável de visão-linguagem-ação orientada por texto. 32
O resultado sugere que uma demonstração visual pode transmitir detalhes físicos que as palavras deixam ambíguos: qual objeto pegar, como orientá-lo, em que ordem realizar as ações e como reagir ao ambiente. Ainda assim, o número precisa ser interpretado com cautela. Trata-se de uma avaliação divulgada pela própria Skild, não de um benchmark industrial reproduzido de forma independente. Além disso, uma taxa de sucesso por etapa não equivale a uma garantia de 66% de conclusão de uma tarefa inteira de 10 minutos.
Os exemplos públicos incluem tarefas de manipulação como:
Esses casos combinam percepção, identificação de objetos, manipulação, ordem de ações e controle contínuo — algo mais complexo do que testar apenas um movimento isolado. A Skild diz que as tarefas não estavam presentes no pré-treinamento, embora as evidências disponíveis venham principalmente da empresa e de reportagens que resumem suas afirmações. 1
33
As demonstrações mostram a interface pretendida: uma pessoa executa a tarefa uma vez e o robô tenta generalizar o procedimento. Elas não comprovam que o S1 consiga realizar qualquer trabalho doméstico, operar sem supervisão ou lidar com todas as variações físicas de uma linha de produção.
A vantagem anunciada do S1 é começar a operar depois de observar a demonstração, sem uma etapa separada de treinamento posterior. A Skild e as reportagens sobre o lançamento descrevem essa execução em tempo real. 1
30
As fontes disponíveis, porém, não informam uma latência precisa e confiável — por exemplo, quantos segundos se passam entre o fim do vídeo e o primeiro movimento do robô. “Sem ajuste fino” significa que o modelo não passa por uma nova atualização de pesos específica para aquela tarefa. Isso não quer dizer necessariamente que todo vídeo seja processado de forma instantânea ou que o sistema dispense configuração, calibração e verificações de segurança.
O S1 faz parte da estratégia mais ampla do Skild Brain, que busca treinar um modelo geral em diferentes tarefas, corpos robóticos, ambientes simulados e dados visuais humanos. A ideia é evitar a criação de uma política separada para cada combinação de robô e trabalho. A Skild afirma ter criado um universo simulado com 100 mil variantes de robôs e testado a generalização para corpos que ficaram fora do conjunto de treinamento. 6
O treinamento em diferentes configurações físicas pretende expor o modelo a princípios gerais de controle. Os materiais da empresa descrevem um sistema pensado para operar em robôs humanoides, quadrúpedes, braços de mesa e manipuladores móveis. 3
10
A afirmação recorrente de que a Skild teria de 100 a 1.000 vezes mais dados que os concorrentes deve ser vista com cautela. As fontes fornecidas não apresentam uma comparação padronizada e auditável, entre empresas, de tamanho, qualidade ou utilidade dos conjuntos de dados. O ponto mais defensável é que a Skild aposta em escala por meio de treinamento entre diferentes corpos e simulação, em vez de depender apenas de demonstrações específicas para uma plataforma de hardware.
“Omni-bodied” — algo como “para todos os corpos” — é o termo usado pela Skild para descrever um modelo capaz de ser transferido entre diferentes tipos de robô. Em princípio, um modelo compartilhado pode aprender conceitos de alto nível da tarefa separadamente da geometria exata de uma máquina, adaptando-se a pernas, rodas, braços, garras e configurações de atuadores diferentes. A empresa afirma que seus testes simulados incluíram formas robóticas excluídas do treinamento, controladas em regime zero-shot, ou seja, sem exemplos específicos daquele corpo. 6
Isso não torna o hardware irrelevante. Robôs continuam tendo sensores, garras, limites articulares, interfaces de controle, latência, capacidade de carga e requisitos de segurança distintos. Um modelo que generaliza entre diferentes corpos pode reduzir o trabalho de adaptação, mas a implantação ainda exige hardware compatível, integração de sistemas e validação no ambiente de destino.
Reportagens afirmam que o software da Skild opera em centenas de robôs em fábricas, data centers e operações de logística. Os exemplos citados incluem a fábrica da NVIDIA em Houston, um teste no aeroporto LaGuardia e trabalhos com empresas dos setores de cabeamento e construção. A empresa também anunciou relações com ABB Robotics, Universal Robots e NVIDIA. 17
4
Esses relatos indicam interesse comercial e testes no mundo real, mas não oferecem evidências públicas suficientes para calcular taxas de conclusão em produção, tempo de atividade, economia de custos ou retorno sobre o investimento. Um resultado de laboratório ou de um ambiente controlado não deve ser tratado como métrica industrial. Uma reportagem também descreve uma implantação planejada com a Foxconn em linhas de montagem associadas aos sistemas de servidores com GPUs Blackwell da NVIDIA — evidência de um teste ou esforço de implantação, não de uma operação fabril autônoma em larga escala já comprovada. 43
O financiamento da Skild ajudou a colocar sua abordagem entre as iniciativas mais observadas da chamada IA física. A Bloomberg informou que a empresa captou cerca de US$ 1,4 bilhão em uma rodada Série C liderada pelo SoftBank, em janeiro de 2026, alcançando uma avaliação superior a US$ 14 bilhões. 13 A rodada Série A, anunciada em julho de 2024, havia sido de US$ 300 milhões, com avaliação divulgada de US$ 1,5 bilhão.
9
A comparação com um “momento ChatGPT” resume a mudança de experiência que a empresa espera promover: em vez de programar ou retreinar um robô para cada tarefa, um trabalhador poderia demonstrar o comportamento desejado e deixar um modelo geral traduzi-lo em ações. O S1 é um passo relevante nessa direção.
Mas isso ainda não prova que os robôs generalistas chegaram. Os principais resultados públicos são divulgados pela própria empresa, o conjunto de tarefas continua limitado e não há, nas evidências fornecidas, métricas industriais independentes sobre desempenho em produção. A conclusão mais prudente é que o S1 demonstra uma forma promissora de reduzir o treinamento específico de robôs: usar um vídeo como instrução, aproveitar habilidades reutilizáveis adquiridas no pré-treinamento e verificar se elas podem ser combinadas em uma tarefa nova e de longa duração.
Studio Global AI
Esta página inclui uma resposta baseada na fonte que você pode continuar em Studio Global.
A Skild AI afirma que o S1 consegue executar tarefas inéditas e com várias etapas, de até 10 minutos, depois de assistir a um único vídeo humano, sem ajuste fino; em seu teste, o modelo alcançou 66% de sucesso médio p...
A Skild AI afirma que o S1 consegue executar tarefas inéditas e com várias etapas, de até 10 minutos, depois de assistir a um único vídeo humano, sem ajuste fino; em seu teste, o modelo alcançou 66% de sucesso médio p... O vídeo funciona como uma instrução durante a execução: o S1 combina habilidades aprendidas no pré treinamento e as adapta ao ambiente atual do robô.
A estratégia mais ampla da Skild inclui treinamento em diferentes corpos robóticos e 100 mil variantes simuladas, mas ainda não há dados públicos independentes sobre taxas de conclusão em produção, disponibilidade ou...