Một robot đang làm nhiệm vụ nhiều bước không thể chỉ nhìn hình ảnh trước mắt: nó còn cần biết mình đã làm đến đâu, điều gì vừa thay đổi và phải xử lý thế nào nếu một động tác không như dự tính. Đó là bài toán HERON-CRA của Scalabot, thương hiệu thuộc Songyan Dynamics, muốn giải quyết. Đây là mô hình thứ hai trong hệ HERON, sau HERON-World Model. Thiết kế kết nối trí nhớ nhiệm vụ, học cách sửa động tác và khả năng dùng lại kỹ năng trên những robot khác nhau; hiệu quả thực tế vẫn cần được kiểm chứng riêng.
6
14
15
Robot “nhớ” và sửa sai ra sao?
Context Expert lưu diễn biến của nhiệm vụ. Thay vì chỉ dựa vào khung hình mới nhất, thành phần này mã hóa thông tin không gian và ý nghĩa của những gì đã xảy ra thành các đơn vị dữ liệu có cấu trúc theo thời gian. Cách gọi “4D” ở đây là không gian ba chiều cộng thêm chiều thời gian. Nhờ vậy, việc chọn động tác tiếp theo có thể xét đến các bước trước và những thay đổi trong cảnh.
6
9
RL Engine học phần điều chỉnh. Theo mô tả được công bố, đây là thành phần học tăng cường dạng actor–critic bổ sung: nó học cách chỉnh một chính sách hành động nền, thay vì thay thế toàn bộ chính sách đó. Một mô hình đánh giá được dùng để theo dõi tiến độ nhiệm vụ. Mục tiêu là thao tác chính xác hơn và khắc phục khi hành động lệch hướng, nhưng thông tin hiện có chưa tách được mức cải thiện do riêng RL Engine tạo ra.
5
9
Tiền huấn luyện và mô phỏng mở rộng việc học. Tiền huấn luyện trên dữ liệu từ các robot có cấu tạo khác nhau nhằm giúp chuyển kỹ năng giữa các loại robot. Song song, những trạng thái ghi nhận từ lần làm thành công hoặc thất bại ngoài đời thực có thể làm điểm xuất phát để HERON-World Model tạo các chuỗi diễn biến giả định cho việc học tiếp. Đó là vòng học mà Scalabot đề xuất, không phải bằng chứng rằng các tình huống được mô phỏng luôn dự báo đúng kết quả trên robot thật.
7
14
15
Con số 97,8% nói lên điều gì?
Scalabot báo cáo tỷ lệ gấp tất thành công trong bài thử của mình tăng từ 38,5% lên 97,8%. Đây là mức tăng được báo cáo cho một tác vụ cụ thể, không phải tỷ lệ thành công chung của robot. Tài liệu được cung cấp chưa xác lập số lần thử, điều kiện và mốc so sánh đã được kiểm tra độc lập.
12
Màn trình diễn pha cà phê cho thấy mục tiêu duy trì ngữ cảnh qua nhiều bước; các trình diễn chuyển kỹ năng sang robot khác và ứng phó với tác động làm xáo trộn tình huống cho thấy hệ thống được kỳ vọng thích nghi ra sao. Tuy nhiên, từng màn trình diễn riêng lẻ không cho biết robot sẽ thành công thường xuyên đến mức nào trong môi trường lạ, với các loại robot khác hay trước nhiều kiểu gián đoạn.
4
6
15
Điểm cần phân biệt là một thiết kế có logic với hiệu quả đã được xác nhận. Để đánh giá HERON-CRA có đáng tin cậy trong nhiệm vụ dài hay không, cần các thử nghiệm độc lập, có thể so sánh và tách riêng đóng góp của trí nhớ, học tăng cường, tiền huấn luyện và các chuỗi mô phỏng.
4
14
15