Tập dữ liệu huấn luyện bao gồm hơn 1.000.000 giờ video từ góc nhìn thứ nhất (egocentric) của con người – tương đương khoảng 170 năm kinh nghiệm sống liên tục . Các video này ghi lại các thao tác hàng ngày như nấu ăn, gấp quần áo, lắp ráp và lau dọn . Điểm mấu chốt là: Không có bất kỳ dữ liệu hành động robot nào được sử dụng trong quá trình tiền huấn luyện. Dữ liệu robot chỉ được đưa vào trong một giai đoạn 'hậu huấn luyện' hoặc tinh chỉnh rất nhỏ, thường là 10 giờ hoặc ít hơn cho mỗi nhiệm vụ .
Trong quá trình tiền huấn luyện, DYNA-2 sử dụng mục tiêu dự đoán video – học cách dự đoán các khung hình video tương lai từ các quan sát trong quá khứ – kết hợp với một thuật toán đồng huấn luyện video (video co-training algorithm) giúp học đồng thời các biểu diễn thị giác và dự đoán hành động . Cách tiếp cận này trái ngược với kiến trúc VLA của DYNA-1, vốn ánh xạ trực tiếp cảm nhận thành hành động robot mà không cần bước dự đoán video trung gian .
Công ty đã chứng minh khả năng mở rộng quy mô qua bốn bậc độ lớn, từ 1.000 giờ lên đến 1.000.000 giờ dữ liệu tiền huấn luyện .
Công ty đã thực hiện các so sánh trực tiếp giữa DYNA-2 và DYNA-1 trong các điều kiện huấn luyện và triển khai thực tế tương đồng.
Hiệu suất chuẩn hóa trung bình tăng đều đặn theo quy mô tiền huấn luyện: 20% → 28% → 45% → 53% so với mức tối đa có thể đạt được khi dữ liệu tăng từ 1k → 10k → 100k → 1M giờ . Ở quy mô 1 triệu giờ, DYNA-2 đạt hiệu suất thực tế tốt nhất trên 9 trong số 14 nhiệm vụ . Một số cải thiện đáng chú ý bao gồm:
Dyna Robotics báo cáo cái mà họ gọi là "định luật mở rộng quy mô thực sự đầu tiên trong ngành robot được cung cấp hoàn toàn bằng dữ liệu con người" . Các đặc điểm chính:
Công ty tuyên bố rõ ràng rằng đây là một minh chứng "lần đầu tiên" cho thấy việc mở rộng dữ liệu quan sát của con người, chứ không phải dữ liệu hành động của robot, có thể là một trục đáng tin cậy để cải thiện trí thông minh vật lý của robot .
Nếu những tuyên bố này được xác minh độc lập, Dyna Robotics đã chỉ ra một con đường thực tế để nhân rộng trí thông minh robot mà không gặp phải nút thắt về chi phí thu thập dữ liệu hành động robot đắt đỏ. Video về con người tồn tại với quy mô gần như vô hạn. Công ty cho biết họ đang hướng tới 10 triệu giờ dữ liệu huấn luyện, điều này sẽ cho phép robot làm chủ các nhiệm vụ vật lý mới chỉ với vài giờ tinh chỉnh cục bộ .