HOST, do các nhà nghiên cứu từ Đại học Công nghệ Bắc Kinh, X SQUARE ROBOT và Đại học Thanh Hoa phát triển, đạt tỷ lệ thành công trung bình 62% trên 50 nhiệm vụ thao tác mới sau một video dài khoảng 29 giây. GEN 1.5 của Generalist AI tiếp nhận một video trình diễn dài khoảng 3–12 giây như một “physical prompt”, không...
Câu trả lời nghiên cứu

Create a landscape editorial hero image for this Studio Global article: How do the two research efforts, HOST from Beijing Institute of Technology, X Square Robot, and Tsinghua University and GEN 1.5 from General. Article summary: Both efforts move robot learning from task specific retraining toward inference time imitation: a pretrained system treats a brief demonstration as context and immediately controls the robot accordingly.. Topic tags: general web, ai safety, prompt engineering, ai, workflow. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with
Hai hướng nghiên cứu cùng theo đuổi một thay đổi quan trọng trong robot học: robot không nhất thiết phải được huấn luyện lại cho từng nhiệm vụ mới. Thay vào đó, một mô hình đã được tiền huấn luyện có thể xem video ngắn như ngữ cảnh, suy ra mục tiêu và điều khiển robot thực hiện ngay trong giai đoạn suy luận.
Nói cách khác, cách dạy robot đang dịch chuyển từ “lập trình và huấn luyện lại” sang “làm mẫu cho robot xem”. Tuy nhiên, HOST hiện có nền tảng đánh giá học thuật rõ ràng hơn; GEN-1.5 vẫn chủ yếu dựa trên kết quả do Generalist AI công bố.
HOST là minh chứng học thuật cụ thể hơn cho hình thức học quan sát từ người sang robot. Video không được dùng đơn giản như một chuỗi lệnh để robot phát lại từng chuyển động của con người.
Thay vào đó, hệ thống cố gắng xác định robot đang ở giai đoạn nào của nhiệm vụ, tìm phần tương ứng trong video và dự đoán trạng thái tiếp theo từ góc nhìn của chính robot. Từ trạng thái dự kiến đó, HOST suy ra hành động cần thực hiện. Cách tiếp cận này giúp giảm phụ thuộc vào việc người và robot có hình dáng, góc nhìn hay quỹ đạo chuyển động giống nhau hay không.
Trong thử nghiệm trên 50 nhiệm vụ mới, mỗi nhiệm vụ được thực hiện 20 lần, HOST đạt tỷ lệ thành công trung bình 62%. Kết quả này cho thấy phương pháp có thể chuyển giao sang nhiều vật thể, công cụ và động tác chưa từng xuất hiện trong giai đoạn huấn luyện. Tuy vậy, tỷ lệ 62% cũng đồng nghĩa robot vẫn thất bại trong một số lượng đáng kể lần thử và chưa thể được xem là đáng tin cậy cho mọi tình huống thực tế.
Nhóm nghiên cứu cũng báo cáo rằng hiệu suất của HOST suy giảm lần lượt khoảng 1%, 4%, 6% và 9% khi thay đổi ánh sáng, vật thể, bối cảnh và có tác động gây nhiễu từ con người. Đây là tín hiệu tích cực về độ bền vững, nhưng vẫn nằm trong phạm vi thử nghiệm có kiểm soát.
GEN-1.5 diễn giải cùng một ý tưởng theo hướng “mô hình nền tảng hiện thân”. Một video trình diễn ngắn được đặt vào cửa sổ ngữ cảnh như một lời nhắc vật lý, sau đó mô hình dùng kiến thức vận động đã tích lũy từ tiền huấn luyện để thực hiện nhiệm vụ mà không cần cập nhật trọng số.
Các trình diễn do Generalist AI giới thiệu cho thấy mô hình có thể bắt chước một số thao tác do con người thực hiện, kết hợp các hành vi đã được gợi ý, sử dụng công cụ theo cách mới và trong một số trường hợp chuyển từ video mô phỏng sang thực hiện trên robot thật.
Tuy nhiên, “không cần huấn luyện” ở đây chỉ đúng với chế độ one-shot. Với nhiệm vụ khó hơn, GEN-1.5 vẫn có một con đường thích nghi few-shot bằng 1–10 bước gradient trên vài phút dữ liệu. Vì vậy, hệ thống không loại bỏ hoàn toàn mọi hình thức thích nghi; nó chỉ khiến quá trình này ngắn hơn đáng kể so với việc xây dựng một chính sách riêng từ đầu.
Điểm cần hiểu rõ là những robot này không học mà không cần dữ liệu trước đó. Chi phí lớn đã được chuyển sang giai đoạn tiền huấn luyện.
Một mô hình hoặc chính sách được huấn luyện trên quy mô lớn đã có sẵn kiến thức về vật lý, tương tác, chuyển động và cách sử dụng công cụ. Video ngắn của người dùng chỉ cung cấp mục tiêu, trình tự thao tác và những tương tác liên quan cho nhiệm vụ mới.
Đây là cách “phân bổ trước” chi phí huấn luyện: nhà phát triển đầu tư nhiều dữ liệu và năng lực tính toán một lần, còn người dùng cuối có thể dạy robot một việc mới bằng một lần trình diễn ngắn. Với HOST, nhóm nghiên cứu định lượng lợi ích này bằng thời gian tiếp nhận trung bình 29 giây và mức nhanh hơn được tuyên bố là 507 lần so với fine-tuning bằng 50 video robot cho mỗi nhiệm vụ.
Robot truyền thống thường cần được lập trình chi tiết, thiết kế hàm thưởng, thu thập dữ liệu điều khiển từ xa hoặc fine-tuning bằng nhiều mẫu robot. Quy trình đó tốn thời gian, đòi hỏi chuyên môn và có thể khiến robot quên các kỹ năng cũ sau khi học nhiệm vụ mới.
HOST và GEN-1.5 hướng tới một giao diện tự nhiên hơn: con người làm mẫu, robot quan sát và thử thực hiện. Nếu tiếp tục được cải thiện, cách dạy này có thể giúp việc triển khai robot linh hoạt hơn trong các môi trường thay đổi thường xuyên.
Việc không cập nhật tham số trong chế độ one-shot cũng có một lợi ích quan trọng: kỹ năng mới được xử lý như ngữ cảnh tạm thời, thay vì ghi đè lên mô hình đã học. Điều này có thể giảm nguy cơ “học mới, quên cũ”, dù khả năng duy trì ổn định trong các môi trường dài hạn vẫn cần được kiểm chứng thêm.
HOST vẫn là kết quả trong phòng thí nghiệm. Nghiên cứu đánh giá 50 nhiệm vụ được lựa chọn trong một thiết lập kiểm soát, với tỷ lệ thành công trung bình 62%. Hiệu suất trong nhà ở, nhà máy, nhiệm vụ dài nhiều bước, tình huống quan trọng về an toàn và các thử nghiệm độc lập vẫn chưa được chứng minh.
Bằng chứng về GEN-1.5 khó đánh giá độc lập hơn. Thông tin về mô hình, thời gian huấn luyện, tuyên bố không dùng dữ liệu mô phỏng, thời lượng trình diễn và khả năng thích nghi chủ yếu đến từ Generalist AI hoặc các kênh do công ty liên quan công bố.
Chưa có benchmark công khai tương đương cho GEN-1.5. Hiện thiếu một bộ dữ liệu độc lập với số lượng nhiệm vụ, quy trình thử, tỷ lệ thành công one-shot tổng hợp, baseline, mô hình hoặc dữ liệu được phát hành và kết quả tái lập từ bên thứ ba. Vì vậy, các video trình diễn cho thấy tiềm năng, nhưng chưa đủ để xác lập một mốc hiệu suất đã được kiểm chứng.
Nhiệm vụ được công bố vẫn tương đối ngắn và đơn giản. Nguồn giới thiệu GEN-1.5 cũng lưu ý rằng các kỹ năng one-shot hiện là những nhiệm vụ ngắn, ít bước. Khả năng xử lý kế hoạch dài, vật thể bất thường, sai sót nghiêm trọng hoặc yêu cầu an toàn cao vẫn là câu hỏi mở.
HOST cung cấp bằng chứng rằng robot có thể tiếp nhận kỹ năng thao tác mới từ một video người duy nhất, trong thời gian trung bình khoảng 29 giây và không cập nhật tham số, trên một bộ kiểm thử được xác định rõ. GEN-1.5 cho thấy tiền huấn luyện hiện thân quy mô lớn có thể tạo ra khả năng học trong ngữ cảnh tương tự ở một mô hình tổng quát hơn, với video trình diễn dài vài giây.
Hướng đi này là có thật và đáng chú ý, nhưng chưa phải sự thay thế hoàn chỉnh cho kiểm định nhiệm vụ, kỹ thuật an toàn và thích nghi chuyên biệt. Robot đang tiến gần hơn tới cách học của con người—nhìn, hiểu và thử làm—nhưng để hoạt động đáng tin cậy trong thế giới mở, chúng vẫn còn một chặng đường dài.
Studio Global AI
Trang này bao gồm câu trả lời dựa trên nguồn mà bạn có thể tiếp tục bên trong Studio Global.
HOST, do các nhà nghiên cứu từ Đại học Công nghệ Bắc Kinh, X SQUARE ROBOT và Đại học Thanh Hoa phát triển, đạt tỷ lệ thành công trung bình 62% trên 50 nhiệm vụ thao tác mới sau một video dài khoảng 29 giây.
HOST, do các nhà nghiên cứu từ Đại học Công nghệ Bắc Kinh, X SQUARE ROBOT và Đại học Thanh Hoa phát triển, đạt tỷ lệ thành công trung bình 62% trên 50 nhiệm vụ thao tác mới sau một video dài khoảng 29 giây. GEN 1.5 của Generalist AI tiếp nhận một video trình diễn dài khoảng 3–12 giây như một “physical prompt”, không cập nhật trọng số mô hình trong chế độ one shot; công ty báo cáo tỷ lệ thành công trung bình 59% trên 10 n...
Điểm đột phá nằm ở việc chuyển phần lớn chi phí học tập vào giai đoạn tiền huấn luyện quy mô lớn, thay vì bắt người dùng thu thập hàng trăm mẫu robot và tinh chỉnh lại cho mỗi nhiệm vụ.