
Create a landscape editorial hero image for this Studio Global article: What is Dyna Robotics' DYNA-2 robot foundation model, how was it trained on over one million hours of first-person human video, what "world. Article summary: Dyna Robotics' **DYNA-2** is a robot foundation model that the company calls a **World-Action Model (WAM)** — a video-prediction architecture trained on over **one million hours of egocentric (first-person) human video**. Topic tags: general, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fak
DYNA-2 của Dyna Robotics đánh dấu một sự thay đổi căn bản trong cách robot học các kỹ năng vật lý. Thay vì dựa vào dữ liệu vận hành từ xa robot tốn kém — tiêu chuẩn của ngành — DYNA-2 đã được huấn luyện trước trên hơn một triệu giờ video góc nhìn thứ nhất (egocentric) của con người, tương đương khoảng 170 năm kinh nghiệm liên tục . Được công bố vào ngày 10 tháng 8 năm 2026, mô hình này giới thiệu một kiến trúc mới gọi là World-Action Model (WAM), học cách dự đoán hành động thay đổi thế giới vật lý như thế nào trước khi robot thực sự di chuyển
.
Kiến trúc của DYNA-2 được xây dựng trên video generation thay vì các bộ chuyển đổi Vision-Language-Action (VLA) vốn thống trị lĩnh vực robot . Trong quá trình huấn luyện trước, mô hình chạy một mục tiêu kép (dual objective): nó dự đoán cả khung hình video tiếp theo và hành động tiếp theo từ kho dữ liệu video của con người
. Cách tiếp cận này cho phép mô hình xây dựng một mô hình nội bộ về vật lý tiếp xúc và lý luận không gian — học các mối quan hệ nhân quả giữa hành động và hậu quả vật lý của chúng — và có thể chuyển giao qua các hình thái robot khác nhau mà không cần nhìn thấy robot nào trong quá trình huấn luyện trước
.
Kho dữ liệu huấn luyện trước: Công ty đã xây dựng bốn tập con lồng nhau của video người góc nhìn thứ nhất — 1.000, 10.000, 100.000 và 1.000.000 giờ — với không có dữ liệu hành động robot nào được sử dụng trong quá trình huấn luyện trước . Sau khi huấn luyện trước, mô hình được tinh chỉnh (fine-tuned) trên một lượng nhỏ dữ liệu robot thực tế (hàng giờ hoặc thậm chí vài phút) để chuyển giao trực giác vật lý đã học sang phần cứng cụ thể
.
Dyna Robotics đã báo cáo cái được gọi là định luật scaling chuyển giao giữa các hình thái (cross-embodiment transfer scaling law) đầu tiên trong thao tác robot . Phát hiện này có ý nghĩa quan trọng vì nó chứng minh rằng việc mở rộng quy mô dữ liệu video của con người tạo ra những cải thiện có thể dự đoán trước và đơn điệu trong hiệu suất robot — tương tự như các định luật scaling đã biến đổi các mô hình ngôn ngữ lớn (large language models).
Định luật scaling trên dữ liệu người: Trên tất cả bốn bậc độ lớn (1K → 10K → 100K → 1M giờ), tất cả các chỉ số về chất lượng dự đoán video đều cải thiện một cách đơn điệu, được mô tả tốt bằng một power law với không có dấu hiệu bão hòa (plateau) .
Định luật chuyển giao sang dữ liệu robot chưa từng thấy: Các checkpoint tương tự được đánh giá zero-shot trên 39 nhiệm vụ robot riêng biệt trên hai nền tảng hai tay cố định. Hiệu suất cải thiện một cách đơn điệu khi kho dữ liệu video người huấn luyện trước tăng lên, trước bất kỳ quá trình tinh chỉnh dành riêng cho robot nào . Một phân tích cho thấy khi giữ dữ liệu có gắn nhãn hành động cố định ở mức 50.000 giờ và thêm các giờ chỉ có video, sai số MSE dự đoán hành động robot zero-shot giảm từ 0.340 xuống 0.120
.
Những cải thiện về hiệu suất của DYNA-2 rõ ràng nhất ở ba lĩnh vực chính:
Sản xuất chính xác cao: DYNA-2 đã nâng tỷ lệ thành công nhiệm vụ từ khoảng 20% lên 80–90% chỉ nhờ tăng quy mô huấn luyện trước, mà không cần thay đổi dữ liệu sau huấn luyện . Đây là mức cải thiện gấp 4 đến 4,5 lần chỉ từ việc xem thêm video của con người.
Triển khai zero-shot cho khách hàng thực tế: Tại các địa điểm khách hàng thực tế, DYNA-2 đạt được tỷ lệ đạt chất lượng 87%, so với 46% của người tiền nhiệm dựa trên VLA là DYNA-1 — một cải thiện 41 điểm phần trăm với cùng ngân sách sau huấn luyện . Trong các đánh giá vật lý trực tiếp với cùng điều kiện huấn luyện, DYNA-2 hoàn thành nhiệm vụ so với DYNA-1 và giành chiến thắng trong .
Kết quả của DYNA-2 thách thức giả định phổ biến rằng robot đòi hỏi một lượng lớn dữ liệu robot dành riêng cho từng nhiệm vụ. Bằng cách chứng minh một định luật scaling chuyển giao từ video người sang phần cứng robot, Dyna Robotics mở ra một con đường thực tế hướng tới 10 triệu giờ dữ liệu huấn luyện — với tiềm năng cho phép robot làm chủ các nhiệm vụ vật lý mới chỉ với vài giờ tinh chỉnh tại chỗ . Mô hình hiện đang hoạt động như một hệ thống do nhà cung cấp vận hành; Dyna Robotics chưa công bố checkpoint công khai, API hoặc giấy phép nào cho DYNA-2
. Việc tái tạo độc lập bởi cộng đồng nghiên cứu robot sẽ là bước tiếp theo để xác thực những kết quả này
.
Studio Global AI
Trang này bao gồm câu trả lời dựa trên nguồn mà bạn có thể tiếp tục bên trong Studio Global.
DYNA 2 của Dyna Robotics, một World Action Model (WAM), được huấn luyện trước trên hơn 1 triệu giờ video góc nhìn thứ nhất của con người — tương đương 170 năm kinh nghiệm — và đã chứng minh định luật scaling chuyển gi...
DYNA 2 của Dyna Robotics, một World Action Model (WAM), được huấn luyện trước trên hơn 1 triệu giờ video góc nhìn thứ nhất của con người — tương đương 170 năm kinh nghiệm — và đã chứng minh định luật scaling chuyển gi... Trong các bài kiểm tra thực tế, DYNA 2 đã nâng tỷ lệ thành công trong sản xuất chính xác cao từ 20% lên 80–90% chỉ nhờ quy mô huấn luyện trước, và tại một khách hàng đạt tỷ lệ chất lượng 87% so với 46% của phiên bản t...
Mô hình có thể thích ứng với nhiệm vụ vặn nắp chai chỉ với 13 phút dữ liệu robot chuyên biệt, với hiệu suất tăng từ 10% lên 40–50% khi quy mô huấn luyện trước tăng từ 1.000 lên 1.000.000 giờ.
Scaling hiệu suất sau huấn luyện: Sau khi huấn luyện, điểm số chuẩn hóa trung bình trên 14 nhiệm vụ robot tăng từ 20% → 28% → 45% → 53% so với mức tối đa có thể đạt được khi quy mô huấn luyện trước tăng từ 1K lên 1M giờ .
Vặn nắp chai (13 phút dữ liệu): Chỉ với 13 phút dữ liệu trình diễn dành riêng cho robot, DYNA-2 có thể điều khiển một cặp tay robot năm ngón linh hoạt để vặn mở nắp chai . Báo cáo kỹ thuật của công ty làm rõ con số này là khoảng 10 phút dữ liệu robot, với quy mô huấn luyện trước nâng tỷ lệ thành công từ 10% ở quy mô nhỏ hơn lên 40–50% ở quy mô đầy đủ 1 triệu giờ
.