Skild AI cho biết S1 có thể thực hiện các nhiệm vụ nhiều bước, chưa từng xuất hiện trong quá trình tiền huấn luyện, kéo dài tới 10 phút sau khi xem một video con người thao tác và không cần fine tuning. S1 xem video như một chỉ dẫn tại thời điểm suy luận, sau đó kết hợp các kỹ năng đã học để tạo ra chuỗi hành động p...
Đăng bởiBiên tập bằng GPT-5.6 LunaHình ảnh được tạo bằng GPT Image 1.5
Câu trả lời nghiên cứu

Create a landscape editorial hero image for this Studio Global article: What is Skild AI’s S1 robotics foundation model, how does it enable robots to learn and perform previously unseen long-horizon manipulation. Article summary: Skild AI’s S1 is a robotics foundation model designed for visual in-context learning: rather than retraining a policy for each new job, a robot conditions on one video demonstration and then attempts the task in real tim. Topic tags: general, general web, news, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts wi
Skild AI muốn việc lập trình robot trở nên giống dạy bằng cách làm mẫu hơn là viết lại chương trình cho từng công việc. Với mô hình S1, một người chỉ cần thực hiện nhiệm vụ trước camera. Robot sau đó quan sát video, suy ra mục tiêu và trình tự thao tác, rồi thử hoàn thành một nhiệm vụ mới — kể cả nhiệm vụ chưa xuất hiện trong dữ liệu tiền huấn luyện — trong thời lượng lên tới 10 phút. Skild cho biết quy trình này không cần fine-tuning hay một vòng huấn luyện sau khi quan sát. 1
Đây là điểm đáng chú ý bởi robot truyền thống thường cần dữ liệu riêng cho từng nhiệm vụ, kỹ sư tích hợp, điều khiển từ xa hoặc huấn luyện lại trước khi có thể đảm nhiệm một công việc mới. S1 không đơn giản phát lại video từng khung hình. Mục tiêu của mô hình là hiểu việc cần làm, gọi lại những kỹ năng đã học và ghép chúng thành một chuỗi hành động trong bối cảnh hiện tại.
S1 sử dụng học trong ngữ cảnh bằng thị giác (visual in-context learning). Video con người làm mẫu đóng vai trò như một lời nhắc nhiệm vụ ngay tại thời điểm suy luận. Mô hình quan sát các bước, nhận diện mục tiêu, rồi chuyển thông tin đó thành hành động cho robot. Theo mô tả của Skild, trọng số mô hình không bị thay đổi sau mỗi video mới. 1
Cách tiếp cận này gần với việc “cho AI xem phải làm gì” hơn là huấn luyện robot theo phương pháp truyền thống. S1 cần liên kết hình ảnh với những kỹ năng đã có — chẳng hạn cầm, di chuyển, đặt và thao tác với đồ vật — rồi sắp xếp chúng thành một quy trình dài hơn. Các ví dụ công khai của Skild gồm pha cà phê pour-over, trồng cây vào chậu, lắp ráp bộ linh kiện và lật bánh pancake. 1
35
Thách thức lớn nằm ở chuỗi nhiệm vụ dài. Một động tác ngắn có thể được lập trình hoặc học riêng lẻ tương đối dễ dàng, nhưng một công việc kéo dài 10 phút có thể bao gồm hàng chục quyết định, vị trí đồ vật thay đổi và nhiều cơ hội mắc lỗi. S1 được thiết kế để duy trì mục tiêu trong suốt chuỗi hành động, đồng thời điều chỉnh thao tác theo khung cảnh thay vì sao chép chính xác chuyển động của người làm mẫu.
Trong bài đánh giá các nhiệm vụ chưa từng thấy, Skild báo cáo rằng chính sách được nhắc bằng video đạt tỷ lệ thành công trung bình 66% trên từng bước, trong khi một chính sách thị giác-ngôn ngữ-hành động (vision-language-action, hay VLA) tương đương được nhắc bằng ngôn ngữ chỉ đạt 9% ở cùng quy mô huấn luyện được nêu là 100.000 giờ. 32
Kết quả này cho thấy một video có thể truyền đạt những chi tiết vật lý mà lời nói dễ bỏ sót: cần cầm vật nào, hướng đặt ra sao, thứ tự thao tác thế nào và người thực hiện phản ứng ra sao khi môi trường thay đổi.
Tuy nhiên, cần đọc con số 66% một cách thận trọng. Đây là kết quả do Skild báo cáo, chưa phải một chuẩn đánh giá ngành được kiểm chứng độc lập. Hơn nữa, “tỷ lệ thành công trên từng bước” không đồng nghĩa với việc robot chắc chắn hoàn thành toàn bộ nhiệm vụ kéo dài 10 phút với xác suất 66% từ đầu đến cuối.
Các màn trình diễn công khai bao gồm:
Những tác vụ này không chỉ kiểm tra một chuyển động đơn lẻ. Chúng đòi hỏi robot nhận diện đồ vật, thao tác với vật thể, tuân thủ thứ tự các bước và duy trì điều khiển trong thời gian dài. Skild mô tả đây là những nhiệm vụ chưa xuất hiện trong quá trình tiền huấn luyện, dù phần lớn bằng chứng hiện có vẫn đến từ công ty hoặc các bài viết tóm tắt tuyên bố của công ty. 1
33
Các video cho thấy giao diện mà Skild hướng tới: một người thực hiện nhiệm vụ một lần, robot cố gắng khái quát hóa quy trình đó. Chúng chưa chứng minh rằng S1 có thể đảm nhiệm mọi việc nhà, hoạt động hoàn toàn không cần giám sát hay xử lý được mọi biến thể vật lý trong môi trường sản xuất.
Ưu điểm được quảng bá của S1 là robot có thể bắt đầu thực hiện sau khi quan sát video, không cần một giai đoạn huấn luyện riêng cho nhiệm vụ mới. Skild và các bài viết về sản phẩm mô tả đây là khả năng thực thi theo thời gian thực trong ngữ cảnh. 1
30
Dù vậy, các nguồn hiện có chưa đưa ra phép đo độ trễ chính xác và đáng tin cậy — ví dụ số giây từ khi video kết thúc đến khi robot thực hiện động tác đầu tiên. “Không cần fine-tuning” có nghĩa mô hình không trải qua một chu kỳ cập nhật trọng số cho nhiệm vụ mới; điều đó không nhất thiết có nghĩa mọi video đều được xử lý tức thì hoặc robot không cần thiết lập, hiệu chuẩn và kiểm tra an toàn.
S1 là một phần trong chiến lược Skild Brain rộng hơn: xây dựng một mô hình nền tảng dùng chung cho nhiều nhiệm vụ, nhiều loại robot, mô phỏng và dữ liệu hình ảnh từ con người, thay vì phát triển một chính sách riêng cho từng robot và từng công việc.
Skild cho biết họ đã tạo một vũ trụ mô phỏng gồm 100.000 biến thể robot và kiểm tra khả năng khái quát hóa trên những hình dạng bị loại khỏi dữ liệu huấn luyện. 6 Ý tưởng là cho mô hình tiếp xúc với các nguyên tắc điều khiển chung, để chúng có thể chuyển sang những thân robot chưa từng gặp.
Tài liệu của công ty mô tả hệ thống có thể hoạt động trên robot hình người, robot bốn chân, cánh tay robot để bàn và robot thao tác di động. 3
10
Tuyên bố rằng Skild có lượng dữ liệu lớn hơn đối thủ từ 100 đến 1.000 lần cần được xem xét thận trọng. Các nguồn được cung cấp chưa đưa ra một phép so sánh độc lập, chuẩn hóa và có thể kiểm toán giữa quy mô, chất lượng dữ liệu hay lượng kinh nghiệm robot hữu ích của các công ty. Điểm có thể khẳng định chắc chắn hơn là Skild đang theo đuổi quy mô bằng cách huấn luyện xuyên nhiều loại thân robot và dùng mô phỏng, thay vì chỉ dựa vào các bản trình diễn riêng cho một nền tảng phần cứng.
“Omni-bodied” là thuật ngữ Skild dùng cho một mô hình có thể chuyển giao giữa nhiều thân robot. Về nguyên tắc, mô hình dùng chung có thể học khái niệm cấp nhiệm vụ tách khỏi hình học cụ thể của một cỗ máy, rồi thích nghi với các loại chân, bánh xe, tay máy và cơ cấu truyền động khác nhau. Skild cho biết các thử nghiệm mô phỏng đã điều khiển được những hình dạng robot bị giữ lại để kiểm tra theo kiểu zero-shot — tức mô hình chưa được huấn luyện trực tiếp trên các hình dạng đó. 6
Điều này không khiến phần cứng trở nên không quan trọng. Robot vẫn khác nhau về cảm biến, kẹp gắp, giới hạn khớp, giao diện điều khiển, độ trễ, tải trọng và yêu cầu an toàn. Một mô hình khái quát hóa tốt giữa các thân robot có thể giảm công sức thích nghi, nhưng triển khai thực tế vẫn cần phần cứng tương thích, tích hợp hệ thống và kiểm định trong môi trường mục tiêu.
Các báo cáo công khai cho biết phần mềm của Skild đang hoạt động trên hàng trăm robot tại nhà máy, trung tâm dữ liệu và môi trường logistics. Những ví dụ được nhắc đến gồm nhà máy của NVIDIA ở Houston, một thử nghiệm tại sân bay LaGuardia và các hoạt động với những công ty trong lĩnh vực dây dẫn và xây dựng. Công ty cũng đã công bố quan hệ hợp tác liên quan đến ABB Robotics, Universal Robots và NVIDIA. 17
4
Những thông tin này cho thấy sự quan tâm thương mại và hoạt động thử nghiệm ngoài phòng lab, nhưng chưa đủ dữ liệu công khai để tính tỷ lệ hoàn thành trong sản xuất, thời gian hoạt động, mức tiết kiệm chi phí hay lợi tức đầu tư. Không nên lấy kết quả trong bài đánh giá có kiểm soát — chẳng hạn tỷ lệ 66% trên từng bước — làm thước đo cho hiệu suất tại nhà máy.
Một báo cáo khác cho biết Skild dự kiến phối hợp với Foxconn để triển khai hệ thống trên các dây chuyền lắp ráp liên quan đến máy chủ GPU Blackwell của NVIDIA. Đây là bằng chứng về một nỗ lực thử nghiệm hoặc triển khai cụ thể, chứ chưa phải bằng chứng cho thấy robot tự hành quy mô lớn đã vận hành rộng rãi trong nhà máy. 43
Nguồn vốn của Skild đã giúp cách tiếp cận này trở thành một trong những dự án được theo dõi sát trong lĩnh vực AI vật lý. Bloomberg đưa tin công ty huy động khoảng 1,4 tỷ USD trong vòng Series C do SoftBank dẫn dắt vào tháng 1/2026, với mức định giá trên 14 tỷ USD. 13 Vòng Series A trước đó, được công bố vào tháng 7/2024, trị giá 300 triệu USD và đưa mức định giá của công ty lên 1,5 tỷ USD.
9
Cụm từ “khoảnh khắc ChatGPT” cho robot mô tả một thay đổi được kỳ vọng trong trải nghiệm sử dụng: thay vì lập trình hoặc huấn luyện lại robot cho từng việc, người lao động có thể trình diễn hành vi mong muốn và để mô hình tổng quát chuyển nó thành hành động. S1 là một bước đáng chú ý hướng tới giao diện đó.
Nhưng S1 chưa phải bằng chứng rằng robot đa năng đã sẵn sàng. Các kết quả công khai quan trọng nhất vẫn do công ty báo cáo, nhóm nhiệm vụ còn giới hạn và chưa có những chỉ số triển khai công nghiệp được kiểm chứng độc lập trong các nguồn hiện có.
Kết luận thận trọng hơn là S1 cho thấy một hướng đi giàu tiềm năng để giảm chi phí huấn luyện robot theo từng nhiệm vụ: dùng video làm chỉ dẫn, tận dụng các kỹ năng tái sử dụng được từ quá trình tiền huấn luyện và kiểm tra khả năng ghép chúng thành một quy trình mới, dài và nhiều bước.
Studio Global AI
Trang này bao gồm câu trả lời dựa trên nguồn mà bạn có thể tiếp tục bên trong Studio Global.
Skild AI cho biết S1 có thể thực hiện các nhiệm vụ nhiều bước, chưa từng xuất hiện trong quá trình tiền huấn luyện, kéo dài tới 10 phút sau khi xem một video con người thao tác và không cần fine tuning.
Skild AI cho biết S1 có thể thực hiện các nhiệm vụ nhiều bước, chưa từng xuất hiện trong quá trình tiền huấn luyện, kéo dài tới 10 phút sau khi xem một video con người thao tác và không cần fine tuning. S1 xem video như một chỉ dẫn tại thời điểm suy luận, sau đó kết hợp các kỹ năng đã học để tạo ra chuỗi hành động phù hợp với môi trường hiện tại của robot.
Chiến lược Skild Brain hướng tới một mô hình có thể hoạt động trên nhiều loại thân robot và tận dụng dữ liệu mô phỏng quy mô lớn.
Skild AI cho biết S1 có thể thực hiện các nhiệm vụ nhiều bước, chưa từng xuất hiện trong quá trình tiền huấn luyện, kéo dài tới 10 phút sau khi xem một video con người thao tác và không cần fine tuning. S1 xem video như một chỉ dẫn tại thời điểm suy luận, sau đó kết hợp các kỹ năng đã học để tạo ra chuỗi hành động p...
Đăng bởiBiên tập bằng GPT-5.6 LunaHình ảnh được tạo bằng GPT Image 1.5
Câu trả lời nghiên cứu

Create a landscape editorial hero image for this Studio Global article: What is Skild AI’s S1 robotics foundation model, how does it enable robots to learn and perform previously unseen long-horizon manipulation. Article summary: Skild AI’s S1 is a robotics foundation model designed for visual in-context learning: rather than retraining a policy for each new job, a robot conditions on one video demonstration and then attempts the task in real tim. Topic tags: general, general web, news, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts wi
Skild AI muốn việc lập trình robot trở nên giống dạy bằng cách làm mẫu hơn là viết lại chương trình cho từng công việc. Với mô hình S1, một người chỉ cần thực hiện nhiệm vụ trước camera. Robot sau đó quan sát video, suy ra mục tiêu và trình tự thao tác, rồi thử hoàn thành một nhiệm vụ mới — kể cả nhiệm vụ chưa xuất hiện trong dữ liệu tiền huấn luyện — trong thời lượng lên tới 10 phút. Skild cho biết quy trình này không cần fine-tuning hay một vòng huấn luyện sau khi quan sát. 1
Đây là điểm đáng chú ý bởi robot truyền thống thường cần dữ liệu riêng cho từng nhiệm vụ, kỹ sư tích hợp, điều khiển từ xa hoặc huấn luyện lại trước khi có thể đảm nhiệm một công việc mới. S1 không đơn giản phát lại video từng khung hình. Mục tiêu của mô hình là hiểu việc cần làm, gọi lại những kỹ năng đã học và ghép chúng thành một chuỗi hành động trong bối cảnh hiện tại.
S1 sử dụng học trong ngữ cảnh bằng thị giác (visual in-context learning). Video con người làm mẫu đóng vai trò như một lời nhắc nhiệm vụ ngay tại thời điểm suy luận. Mô hình quan sát các bước, nhận diện mục tiêu, rồi chuyển thông tin đó thành hành động cho robot. Theo mô tả của Skild, trọng số mô hình không bị thay đổi sau mỗi video mới. 1
Cách tiếp cận này gần với việc “cho AI xem phải làm gì” hơn là huấn luyện robot theo phương pháp truyền thống. S1 cần liên kết hình ảnh với những kỹ năng đã có — chẳng hạn cầm, di chuyển, đặt và thao tác với đồ vật — rồi sắp xếp chúng thành một quy trình dài hơn. Các ví dụ công khai của Skild gồm pha cà phê pour-over, trồng cây vào chậu, lắp ráp bộ linh kiện và lật bánh pancake. 1
35
Thách thức lớn nằm ở chuỗi nhiệm vụ dài. Một động tác ngắn có thể được lập trình hoặc học riêng lẻ tương đối dễ dàng, nhưng một công việc kéo dài 10 phút có thể bao gồm hàng chục quyết định, vị trí đồ vật thay đổi và nhiều cơ hội mắc lỗi. S1 được thiết kế để duy trì mục tiêu trong suốt chuỗi hành động, đồng thời điều chỉnh thao tác theo khung cảnh thay vì sao chép chính xác chuyển động của người làm mẫu.
Trong bài đánh giá các nhiệm vụ chưa từng thấy, Skild báo cáo rằng chính sách được nhắc bằng video đạt tỷ lệ thành công trung bình 66% trên từng bước, trong khi một chính sách thị giác-ngôn ngữ-hành động (vision-language-action, hay VLA) tương đương được nhắc bằng ngôn ngữ chỉ đạt 9% ở cùng quy mô huấn luyện được nêu là 100.000 giờ. 32
Kết quả này cho thấy một video có thể truyền đạt những chi tiết vật lý mà lời nói dễ bỏ sót: cần cầm vật nào, hướng đặt ra sao, thứ tự thao tác thế nào và người thực hiện phản ứng ra sao khi môi trường thay đổi.
Tuy nhiên, cần đọc con số 66% một cách thận trọng. Đây là kết quả do Skild báo cáo, chưa phải một chuẩn đánh giá ngành được kiểm chứng độc lập. Hơn nữa, “tỷ lệ thành công trên từng bước” không đồng nghĩa với việc robot chắc chắn hoàn thành toàn bộ nhiệm vụ kéo dài 10 phút với xác suất 66% từ đầu đến cuối.
Các màn trình diễn công khai bao gồm:
Những tác vụ này không chỉ kiểm tra một chuyển động đơn lẻ. Chúng đòi hỏi robot nhận diện đồ vật, thao tác với vật thể, tuân thủ thứ tự các bước và duy trì điều khiển trong thời gian dài. Skild mô tả đây là những nhiệm vụ chưa xuất hiện trong quá trình tiền huấn luyện, dù phần lớn bằng chứng hiện có vẫn đến từ công ty hoặc các bài viết tóm tắt tuyên bố của công ty. 1
33
Các video cho thấy giao diện mà Skild hướng tới: một người thực hiện nhiệm vụ một lần, robot cố gắng khái quát hóa quy trình đó. Chúng chưa chứng minh rằng S1 có thể đảm nhiệm mọi việc nhà, hoạt động hoàn toàn không cần giám sát hay xử lý được mọi biến thể vật lý trong môi trường sản xuất.
Ưu điểm được quảng bá của S1 là robot có thể bắt đầu thực hiện sau khi quan sát video, không cần một giai đoạn huấn luyện riêng cho nhiệm vụ mới. Skild và các bài viết về sản phẩm mô tả đây là khả năng thực thi theo thời gian thực trong ngữ cảnh. 1
30
Dù vậy, các nguồn hiện có chưa đưa ra phép đo độ trễ chính xác và đáng tin cậy — ví dụ số giây từ khi video kết thúc đến khi robot thực hiện động tác đầu tiên. “Không cần fine-tuning” có nghĩa mô hình không trải qua một chu kỳ cập nhật trọng số cho nhiệm vụ mới; điều đó không nhất thiết có nghĩa mọi video đều được xử lý tức thì hoặc robot không cần thiết lập, hiệu chuẩn và kiểm tra an toàn.
S1 là một phần trong chiến lược Skild Brain rộng hơn: xây dựng một mô hình nền tảng dùng chung cho nhiều nhiệm vụ, nhiều loại robot, mô phỏng và dữ liệu hình ảnh từ con người, thay vì phát triển một chính sách riêng cho từng robot và từng công việc.
Skild cho biết họ đã tạo một vũ trụ mô phỏng gồm 100.000 biến thể robot và kiểm tra khả năng khái quát hóa trên những hình dạng bị loại khỏi dữ liệu huấn luyện. 6 Ý tưởng là cho mô hình tiếp xúc với các nguyên tắc điều khiển chung, để chúng có thể chuyển sang những thân robot chưa từng gặp.
Tài liệu của công ty mô tả hệ thống có thể hoạt động trên robot hình người, robot bốn chân, cánh tay robot để bàn và robot thao tác di động. 3
10
Tuyên bố rằng Skild có lượng dữ liệu lớn hơn đối thủ từ 100 đến 1.000 lần cần được xem xét thận trọng. Các nguồn được cung cấp chưa đưa ra một phép so sánh độc lập, chuẩn hóa và có thể kiểm toán giữa quy mô, chất lượng dữ liệu hay lượng kinh nghiệm robot hữu ích của các công ty. Điểm có thể khẳng định chắc chắn hơn là Skild đang theo đuổi quy mô bằng cách huấn luyện xuyên nhiều loại thân robot và dùng mô phỏng, thay vì chỉ dựa vào các bản trình diễn riêng cho một nền tảng phần cứng.
“Omni-bodied” là thuật ngữ Skild dùng cho một mô hình có thể chuyển giao giữa nhiều thân robot. Về nguyên tắc, mô hình dùng chung có thể học khái niệm cấp nhiệm vụ tách khỏi hình học cụ thể của một cỗ máy, rồi thích nghi với các loại chân, bánh xe, tay máy và cơ cấu truyền động khác nhau. Skild cho biết các thử nghiệm mô phỏng đã điều khiển được những hình dạng robot bị giữ lại để kiểm tra theo kiểu zero-shot — tức mô hình chưa được huấn luyện trực tiếp trên các hình dạng đó. 6
Điều này không khiến phần cứng trở nên không quan trọng. Robot vẫn khác nhau về cảm biến, kẹp gắp, giới hạn khớp, giao diện điều khiển, độ trễ, tải trọng và yêu cầu an toàn. Một mô hình khái quát hóa tốt giữa các thân robot có thể giảm công sức thích nghi, nhưng triển khai thực tế vẫn cần phần cứng tương thích, tích hợp hệ thống và kiểm định trong môi trường mục tiêu.
Các báo cáo công khai cho biết phần mềm của Skild đang hoạt động trên hàng trăm robot tại nhà máy, trung tâm dữ liệu và môi trường logistics. Những ví dụ được nhắc đến gồm nhà máy của NVIDIA ở Houston, một thử nghiệm tại sân bay LaGuardia và các hoạt động với những công ty trong lĩnh vực dây dẫn và xây dựng. Công ty cũng đã công bố quan hệ hợp tác liên quan đến ABB Robotics, Universal Robots và NVIDIA. 17
4
Những thông tin này cho thấy sự quan tâm thương mại và hoạt động thử nghiệm ngoài phòng lab, nhưng chưa đủ dữ liệu công khai để tính tỷ lệ hoàn thành trong sản xuất, thời gian hoạt động, mức tiết kiệm chi phí hay lợi tức đầu tư. Không nên lấy kết quả trong bài đánh giá có kiểm soát — chẳng hạn tỷ lệ 66% trên từng bước — làm thước đo cho hiệu suất tại nhà máy.
Một báo cáo khác cho biết Skild dự kiến phối hợp với Foxconn để triển khai hệ thống trên các dây chuyền lắp ráp liên quan đến máy chủ GPU Blackwell của NVIDIA. Đây là bằng chứng về một nỗ lực thử nghiệm hoặc triển khai cụ thể, chứ chưa phải bằng chứng cho thấy robot tự hành quy mô lớn đã vận hành rộng rãi trong nhà máy. 43
Nguồn vốn của Skild đã giúp cách tiếp cận này trở thành một trong những dự án được theo dõi sát trong lĩnh vực AI vật lý. Bloomberg đưa tin công ty huy động khoảng 1,4 tỷ USD trong vòng Series C do SoftBank dẫn dắt vào tháng 1/2026, với mức định giá trên 14 tỷ USD. 13 Vòng Series A trước đó, được công bố vào tháng 7/2024, trị giá 300 triệu USD và đưa mức định giá của công ty lên 1,5 tỷ USD.
9
Cụm từ “khoảnh khắc ChatGPT” cho robot mô tả một thay đổi được kỳ vọng trong trải nghiệm sử dụng: thay vì lập trình hoặc huấn luyện lại robot cho từng việc, người lao động có thể trình diễn hành vi mong muốn và để mô hình tổng quát chuyển nó thành hành động. S1 là một bước đáng chú ý hướng tới giao diện đó.
Nhưng S1 chưa phải bằng chứng rằng robot đa năng đã sẵn sàng. Các kết quả công khai quan trọng nhất vẫn do công ty báo cáo, nhóm nhiệm vụ còn giới hạn và chưa có những chỉ số triển khai công nghiệp được kiểm chứng độc lập trong các nguồn hiện có.
Kết luận thận trọng hơn là S1 cho thấy một hướng đi giàu tiềm năng để giảm chi phí huấn luyện robot theo từng nhiệm vụ: dùng video làm chỉ dẫn, tận dụng các kỹ năng tái sử dụng được từ quá trình tiền huấn luyện và kiểm tra khả năng ghép chúng thành một quy trình mới, dài và nhiều bước.
Studio Global AI
Trang này bao gồm câu trả lời dựa trên nguồn mà bạn có thể tiếp tục bên trong Studio Global.
Skild AI cho biết S1 có thể thực hiện các nhiệm vụ nhiều bước, chưa từng xuất hiện trong quá trình tiền huấn luyện, kéo dài tới 10 phút sau khi xem một video con người thao tác và không cần fine tuning.
Skild AI cho biết S1 có thể thực hiện các nhiệm vụ nhiều bước, chưa từng xuất hiện trong quá trình tiền huấn luyện, kéo dài tới 10 phút sau khi xem một video con người thao tác và không cần fine tuning. S1 xem video như một chỉ dẫn tại thời điểm suy luận, sau đó kết hợp các kỹ năng đã học để tạo ra chuỗi hành động phù hợp với môi trường hiện tại của robot.
Chiến lược Skild Brain hướng tới một mô hình có thể hoạt động trên nhiều loại thân robot và tận dụng dữ liệu mô phỏng quy mô lớn.