ロボットに新しい仕事をさせるには、これまでタスクごとのデータ収集や遠隔操作、エンジニアによる調整、場合によっては再学習が必要でした。Skild AIの「S1」は、この前提を変えようとするロボット基盤モデルです。
人間が作業をしている動画を1本見せると、S1はその動画を新しいタスクの視覚的な指示として読み取り、事前学習で獲得したスキルを組み合わせてロボットの動作に変換します。Skild AIは、S1が事前学習では見ていない複数工程の作業を、最大10分間にわたって実行でき、タスクごとのファインチューニングや観察後の追加学習を必要としないと説明しています。
1
ただし、これは「動画をコマ送りで記憶して、そのまま再生する」という仕組みではありません。目標や手順を推測し、目の前の物体や配置に応じて、つかむ、運ぶ、置く、操作するといった能力を組み合わせることがS1の狙いです。
1本の動画をどう「指示」に変えるのか
S1の中核にあるのは、**視覚的なインコンテキスト学習(visual in-context learning)**です。
通常の機械学習では、新しい作業のデータを集め、モデルの重みを更新してからロボットを動かします。一方、S1では、人間による実演動画が推論時のプロンプトとして機能します。モデルは動画から作業の目的や順序を読み取り、学習済みのスキルを現在の環境に合わせて実行します。Skild AIの説明では、動画を見るたびにモデルの重みを更新するわけではありません。
1
これは、ロボットを「プログラムする」というより、「やり方を見せる」インターフェースに近い発想です。公開例としては、次のような作業が挙げられています。
1
35
- ハンドドリップコーヒーを淹れる
- 植物を鉢に植える
- キットを組み立てる
- パンケーキを裏返す
こうした作業は、単一の動作だけでなく、対象物の認識、つかみ方、手順の順序、持続的な制御を必要とします。
難所は「10分間の長い作業」を維持すること
ロボットに短い動作を1つさせるだけなら、個別にスクリプト化したり、短時間の学習で対応できたりする場合があります。しかし、10分間に及ぶ作業では、工程が何十個にも分かれ、物体の位置が変わり、途中で失敗する可能性も生じます。
S1が目指すのは、実演者の腕や手の動きをそのまま再現することではありません。作業全体の目的を維持しながら、現在のシーンに応じて動作を調整することです。たとえば、対象物の位置が少しずれていても、事前に学習した「つかむ」「移動する」「置く」といった能力を新しい順序に組み直せるかが問われます。
この点で、S1の価値は単発の動作精度だけでなく、長い作業の中で複数のスキルを組み合わせられるかにあります。
言葉で指示するVLAモデルと比べた結果
Skild AIは、動画で指示する方式と、言語で指示する視覚・言語・行動(VLA)モデルを、未知のタスクで比較しています。学習規模が10万時間とされた評価では、動画プロンプトを使う方式の**平均ステップ成功率が66%だったのに対し、比較対象の言語プロンプト方式は9%**でした。
32
この差は、動画のほうが言葉だけでは伝わりにくい物理的な情報を含むためだと考えられます。たとえば、次のような情報です。
- どの物体をつかむか
- 物体をどの向きに持つか
- どの作業から始めるか
- 環境の変化に対して、実演者がどう対応するか
もっとも、この数字は慎重に読む必要があります。66%という値はSkild AIが報告した評価結果であり、ここで紹介する資料から、独立した第三者による業界共通ベンチマークと確認できるものではありません。また、これは各ステップの平均成功率です。10分間の作業全体を最初から最後まで66%の確率で完遂する、という意味ではありません。
32
実演されたタスクは何か
S1の公開例には、コーヒーの準備、植木鉢への植え付け、キットの組み立て、パンケーキを焼いて裏返す作業などがあります。
1
33
35
これらは、単純な移動動作だけを試すものではありません。対象物を見つけ、適切に扱い、複数の工程を順番に進め、一定時間にわたって制御する必要があります。Skild AIは、これらの作業が事前学習中には見ていない「未知のタスク」だと説明しています。
1
33
一方、公開デモから、S1があらゆる家事を安定してこなせることや、監督なしで動作できることまで証明されたわけではありません。工場のような実環境では、照明、部品のばらつき、センサー、把持具、速度、安全要件などが結果を左右します。
観察後、何秒で動き始めるのか
S1の売りの1つは、動画を見た後にタスク専用の学習サイクルを挟まず、推論時に実行へ移れることです。Skild AIや関連報道は、これをリアルタイムのインコンテキスト実行として説明しています。
1
30
ただし、公開資料からは、「動画の終了から最初の動作まで何秒か」といった正確で信頼できる遅延の測定値は確認できません。
また、「ファインチューニング不要」という表現は、タスクごとにモデルの重みを更新する新たな学習工程がないことを指します。動画が瞬時に処理されること、あるいはロボット側のセットアップ、キャリブレーション、安全確認が一切不要であることを意味するわけではありません。
背景にある「Skild Brain」のデータ戦略
S1は、Skild AIが掲げるより大きな構想「Skild Brain」の一部です。特定のロボットと作業ごとに専用モデルを作るのではなく、さまざまなタスク、ロボットの身体形状、シミュレーション、さらに人間の視覚データを横断して、汎用的なモデルを訓練する考え方です。
3
10
同社は、10万種類のロボットを含むシミュレーション上の世界を作り、訓練データから除外したロボットの形状にもゼロショットで対応できるかを試したと説明しています。
6
訓練対象を広げることで、特定の機体だけに依存しない制御原理を学ばせることが狙いです。Skild AIの資料では、対象となる機体として、ヒューマノイド、四足歩行ロボット、卓上アーム、移動型マニピュレーターなどが挙げられています。
3
10
一方、「競合他社より100~1,000倍多いデータを持つ」という主張は、慎重に扱うべきです。提供された資料には、各社のデータ量や品質、実際に役立つロボット経験を同じ基準で独立監査した比較はありません。より確実に言えるのは、Skild AIが、1台のハードウェア向けに個別デモを集めるだけでなく、複数の身体形状と大規模シミュレーションを組み合わせて規模を拡大しようとしていることです。
「オムニボディ」とは何か
Skild AIが使う「オムニボディ(omni-bodied)」という言葉は、異なる身体を持つロボットへ同じモデルを移植する構想を指します。
理想的には、モデルがタスクの目的や物体の扱い方を、特定の機体の関節配置や車輪の位置とは切り離して学習できれば、二足歩行、四足歩行、車輪型、固定式アームなど、異なるロボットにも適応しやすくなります。Skild AIは、訓練に含めていないロボット形状を使ったシミュレーションで、ゼロショット制御を試したと説明しています。
6
ただし、ハードウェアの違いがなくなるわけではありません。実際のロボットには、センサー、グリッパー、関節の可動域、アクチュエーター、制御インターフェース、遅延、積載量、安全制約の違いがあります。
つまり、オムニボディの狙いは、ロボットごとの適応作業を減らすことです。どの機体でも追加検証なしに同じ性能を発揮する、という意味ではありません。
どこで導入されているのか
報道によると、Skild AIのソフトウェアは工場、データセンター、物流拠点にある数百台のロボットで稼働しているとされています。例として、NVIDIAのヒューストン工場、配線・建設関連企業、ニューヨークのラガーディア空港での試験が報じられています。また、ABB Robotics、Universal Robots、NVIDIAとの関係も発表されています。
4
17
さらに、Foxconnと連携し、米テキサス州ヒューストンでNVIDIAのBlackwell GPUサーバーシステムに関連する組立ラインへAIモデルを導入する計画も報じられています。
43
これらは、商用関心や実環境での試験が進んでいることを示します。しかし、公開情報だけでは、量産時の完遂率、稼働率、コスト削減額、投資対効果(ROI)を独立検証することはできません。研究室や管理された環境での評価結果を、そのまま工場の生産指標とみなすこともできません。
約14億ドルの調達と「フィジカルAIのChatGPT」
Skild AIは、ロボット向け基盤モデルへの期待を背景に、大型の資金調達でも注目されています。Bloombergによると、同社は2026年1月、SoftBank主導のシリーズCで約14億ドルを調達し、評価額は140億ドルを超えました。
13
同社が2024年7月に発表したシリーズAは3億ドルで、評価額は15億ドルでした。
9
「ロボットにとってのChatGPTの瞬間」という表現が示すのは、ユーザー体験の大きな変化です。現在は、作業ごとにロボットをプログラムしたり再学習させたりする必要があります。これが、作業の実演を1回見せるだけで済むなら、ロボットへの指示方法は大きく変わります。S1は、そのインターフェースに近づくための注目すべき一歩です。
ただし、汎用ロボットがすでに完成したことを示す証拠ではありません。現在確認できる主な成果は企業側の報告に基づき、公開されたタスクの種類も限られています。量産現場での独立検証済みの指標も、提供された資料には十分ありません。
現時点でのより慎重な見方は、S1が「ロボットのタスク専用トレーニングを減らす方法」を示した、というものです。動画を指示として使い、広範な事前学習から再利用可能なスキルを取り出し、それらを未知の長時間タスクに組み合わせられるかを試す――。その成否が、フィジカルAIが本当に現場へ広がるかを左右しそうです。