Skild AI称,S1只需观看一段示范视频,就能执行最长约10分钟、此前未见过的任务,无需针对任务微调或修改模型权重。 S1展示过手冲咖啡、移栽盆栽、组装套件和翻煎饼等操作,并据称能应对物体变化、重试部分失败动作。 Skild报告的内部测试显示,视频提示策略的平均逐步成功率为66%,语言提示VLA基线为9%;但这一结果尚未由独立机构复现。
研究答案

Create a landscape editorial hero image for this Studio Global article: What is Skild AI’s S1 robotics foundation model, unveiled by co-founder Abhinav Gupta at SMARTCLOUD SHOW 2026 in Seoul on August 25, 2026, a. Article summary: S1 is Skild AI’s flagship robotics foundation model for in-context learning: a robot watches one video demonstration—including an unseen task lasting up to 10 minutes—and then executes it without collecting task-specific. Topic tags: general, general web, user generated, news. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts w
Skild AI的S1,是一款围绕**上下文学习(in-context learning)**构建的机器人基础模型。它的核心思路很直观:与其每接到一个新任务就重新收集数据、训练模型,不如先让机器人观看一段人类示范视频,再把视频当作“做什么、如何做”的任务说明书。
Skild AI称,S1能够执行此前没有见过、最长约10分钟的任务,而且不需要针对具体任务进行微调,也不用修改模型权重。1
5
这使S1成为实体人工智能领域一个颇具吸引力的方向。不过,这并不等于通用机器人已经可以不受限制地承担家务或工厂工作。目前最有力的证据仍主要来自Skild AI自己的演示和基准测试,独立测试仍然不可或缺。
许多机器人学习系统都围绕特定任务、特定机器人形态或特定运行环境训练。S1则把示范视频视为一种可以执行的提示:模型需要从视频中推断目标、动作顺序、物体之间的关系,以及完成任务时所需的力度和姿态调整。1
3
这与直接对机器人说“煮咖啡”或“把植物搬过去”并不相同。语言可以描述目标,但视频还能展示操作先后、抓取方式、工具如何使用,以及任务如何在多个步骤中展开。Skild AI的核心主张是,这种信息更丰富的提示,有助于S1把能力推广到预训练阶段没有出现过的长流程任务。1
5
公司将这一方式描述为机器人领域对应于大语言模型提示词的机制:模型本身的能力保持不变,而示范视频提供当前任务所需的具体上下文。
Skild AI公布过的操作演示包括:
Skild AI还介绍了几项旨在检验行为灵活性的定性测试。公司称,在这些测试中,S1能够应对场景变化,在部分出错后重新尝试;当示范中的浇水壶不可用时,它会改用杯子;面对示范者处理鸡蛋时略显笨拙的动作,它也会进行修正,而不是机械照搬。5
这些现象说明模型可能具备一定的适应性,但单凭视频演示,仍不能证明它在广泛环境中都能稳定可靠地工作。
Skild AI提供的最具体比较,来自一项针对陌生任务的内部评估。在使用10万小时训练数据时,公司报告称,视频提示的上下文策略平均逐步成功率为66%,而匹配的语言提示视觉—语言—动作(VLA)基线为9%。1
4
Skild AI还表示,当部署条件发生较大变化时,例如物体与示范中的物体不同,或执行计划要求改用另一只机械臂,语言提示VLA的性能下降幅度最多是S1的三倍。1
另一项公司报告的比较估计显示,一段视频提示带来的表现,约相当于在预训练策略上进行380次针对特定任务的后训练。1
这些数字解释了视频提示为何可能具有价值:一段视频不仅传达最终结果,还能同时传达动作顺序、节奏、物体摆放、工具使用方式和身体操作策略。但需要强调的是,这些结果属于Skild AI的内部证据,并非已经由外部机构独立复现的同场对比测试。现有材料中没有公开论文、模型权重或标准化的第三方评估。4
15
Skild AI将S1描述为观看示范后能够实时运行。发布相关报道也称,机器人观看视频后可以立即执行任务。2
5
但现有证据不足以支持“几秒内”或“11分钟内”等适用于一般系统的确定说法。公开资料没有明确确立从视频结束到机器人开始执行之间的通用、可验证时长。2
5
这一点在工业环境中尤其重要。部署时需要考虑的不只是模型完成任务的成功率,还包括准备时间、推理延迟、安全检查,以及失败后的恢复能力。
Skild AI将其通用机器人模型的能力归因于一套广泛的数据管线。公司介绍过的训练来源包括大规模仿真、人类动作互联网视频、机器人数据、远程操控数据,以及真实部署过程中产生的信息。其C轮融资材料还描述了一个“数据飞轮”:模型部署得越多,就能获得越多经验,进而提升其在不同机器人和环境中的表现。37
在SMARTCLOUD SHOW活动上,Skild AI联合创始人Abhinav Gupta据报道表示,公司使用“各种类型”的机器人数据采集方式,并已积累了竞争对手100至1,000倍的数据量。这个倍数是公司方面的说法,并非经过公开审计的行业比较。6
从实际策略看,不同数据源承担的作用并不相同:人类视频提供物体与动作示例,仿真扩大机器人身体和环境的覆盖范围,真实机器人数据则帮助模型把这些抽象知识连接到现实世界的物理控制。
S1属于Skild AI打造“全形态”(omni-bodied)机器人脑的更大计划。这个词并不意味着双足机器人、四足机器人、轮式机器人和机械臂会用同一种方式移动。它们的关节、传感器、肢体、车轮以及可执行动作都各不相同。45
Skild AI所设想的架构,是先学习能够跨平台迁移的物理规律,再根据具体机器人的能力,把这些规律映射为相应动作。换言之,同一个模型可以在不同机器人形态之间共享知识,同时根据每台机器人的执行器和传感器调整输出。45
这种方法的目标,是减少为每一种机器人配置单独开发和维护模型的需要。Skild AI还介绍过在大量模拟机器人身体上训练模型,以帮助它学习更一般化的物理行为。42
45
Skild AI已宣布与ABB Robotics和Universal Robots合作,将其软件整合到工业机器人系统中。路透社还报道称,Skild AI与英伟达正在把机器人“大脑”部署到与英伟达Blackwell系统相关的装配线上。34
44
这些消息显示,S1及Skild Brain已经进入商业测试或整合阶段,但并没有构成完整的公开绩效记录。现有资料尚未提供经过独立审计的工厂产能、设备开机率、错误率、安全事故或投资回报数据。正在部署或整合,意味着技术正在接受实际验证,并不等于它已经在大规模生产中取代传统自动化系统。
投资者对Skild AI的兴趣十分强烈。彭博社报道,软银领投的一轮14亿美元C轮融资将公司估值推高至超过140亿美元,较约7个月前的估值增长超过两倍。17
其他报道将Skild AI累计融资额估算为18亿美元以上,但不同来源的数字存在差异,因此不宜将其视为经过审计的最终总额。18
21
22
这轮融资反映出市场相信:机器人软件可能成为横跨多种硬件的可扩展平台层。不过,“机器人的ChatGPT时刻”更适合作为一种类比,而不是已经尘埃落定的结论。S1指向的潜在变化是,机器人获得新技能的方式可能从逐项重新训练,转向通过示范进行学习。投资人Ravi Mhatre将其称为长流程人类劳动任务的“GPT-3时刻”,但这仍是投资者判断,而非独立科学验证。10
S1最重要的意义,并不只是让机器人模仿一段视频,而是尝试证明:一个机器人基础模型可以通过单次示范组合已有技能、适应变化后的场景,并在不更新任务专属权重的情况下完成长流程操作。
Skild AI报告的**66%对9%**内部基准结果,以及持续时间较长的操作演示,使这一主张具有技术上的重要性。1
4但另一面同样关键:目前公开证据仍主要来自公司材料、精选演示和早期部署公告。只有当外部研究者在标准化条件下复现这些结果,并且工业客户公开可靠性与安全数据后,市场才能判断S1究竟能否从“有潜力的实体人工智能方向”,走向真正可靠的通用机器人基础设施。
Studio Global AI
此页面包含一个有来源支持的答案,您可以在 Studio Global 内继续。
Skild AI称,S1只需观看一段示范视频,就能执行最长约10分钟、此前未见过的任务,无需针对任务微调或修改模型权重。
Skild AI称,S1只需观看一段示范视频,就能执行最长约10分钟、此前未见过的任务,无需针对任务微调或修改模型权重。 S1展示过手冲咖啡、移栽盆栽、组装套件和翻煎饼等操作,并据称能应对物体变化、重试部分失败动作。
Skild报告的内部测试显示,视频提示策略的平均逐步成功率为66%,语言提示VLA基线为9%;但这一结果尚未由独立机构复现。