PhysBrain 1.5 dùng một kiến trúc tự hồi quy để tạo câu trả lời về không gian, chuyển động robot và dự đoán trạng thái hình ảnh tiếp theo. DeepCybo đã công bố trọng số bản 2B và 8B cùng tài liệu đánh giá; các nhóm cần tái lập kết quả và thử nghiệm robot vận hành theo vòng phản hồi trước khi triển khai.
Đăng bởiBiên tập bằng GPT-6 SolHình ảnh được tạo bằng GPT Image 2
Câu trả lời nghiên cứu

Create a landscape editorial hero image for this Studio Global article: What is DeepCybo’s open-source PhysBrain 1.5 physical foundation model, how do its 2B and 8B versions unify embodied understanding, action g. Article summary: PhysBrain 1.5 is DeepCybo’s open-weight attempt to put scene understanding, robot-action generation, and prediction of what happens next into one vision-language model. Its published 28-benchmark result is strong evidenc. Topic tags: general, academic, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, char
Một mô hình có thể nhìn một cảnh, đề xuất cách robot di chuyển rồi dự đoán cảnh sẽ thay đổi ra sao nghe như đã khép kín bài toán điều khiển robot. Với PhysBrain 1.5 của DeepCybo, cần tách hai điều: mô hình làm tốt các bài đánh giá về hiểu môi trường vật lý và robot thực hiện nhiệm vụ đáng tin cậy ngoài đời. Kết quả được công bố hiện chủ yếu chứng minh điều thứ nhất. 1
9
10
Hai phiên bản PhysBrain 1.5-2B và 1.5-8B được phát triển từ các mô hình thị giác–ngôn ngữ Qwen3-VL tương ứng. Thay vì dùng những bộ phận đầu ra riêng cho từng tác vụ, hệ thống biểu diễn câu trả lời bằng ngôn ngữ hoặc thông tin không gian, chuyển động của bộ phận thao tác cuối của robot, và trạng thái hình ảnh dự đoán thành các chuỗi token rời rạc. Trạng thái dự đoán bao gồm ảnh màu RGB, thông tin độ sâu và vùng không gian robot chiếm dụng. Mô hình học các chuỗi này bằng cách dự đoán token tiếp theo trong cùng một kiến trúc tự hồi quy. 1
8
10
Nói đơn giản, mô tả cảnh, đề xuất chuyển động và hình dung kết quả có thể được học trong một khuôn khổ chung. Nhưng một quỹ đạo do mô hình tạo ra không đồng nghĩa robot đã thực hiện thành công quỹ đạo đó. 1
8
DeepCybo mô tả quá trình huấn luyện gồm hai giai đoạn. Ở giai đoạn tiền huấn luyện, mô hình học từ video con người tương tác theo từng nhiệm vụ; bối cảnh cảnh quay và nhiệm vụ được ghép với chuyển động tái dựng cùng những quan sát sau đó. Tiếp theo, giai đoạn tinh chỉnh có giám sát sử dụng hỗn hợp dữ liệu gồm thao tác mẫu của con người, quỹ đạo robot và trải nghiệm mô phỏng. Vì vậy, nói toàn bộ mô hình chỉ được huấn luyện bằng video con người là không chính xác. 1
12
Theo DeepCybo, bản 8B đạt điểm trung bình 72,5 trên 28 bài đánh giá năng lực hiểu môi trường của AI hiện thân — tức AI gắn với tác nhân có thể nhận biết và tác động lên môi trường. Trong nhóm mô hình mở được đưa vào phép so sánh, bản 8B đứng đầu về điểm trung bình và dẫn đầu ở 14 bài riêng lẻ. Bản 2B đạt 66,6 điểm trung bình. Các bài đánh giá trải từ nhận biết hình ảnh và không gian, hiểu không gian 3D và nhiều góc nhìn, đến suy luận, lập kế hoạch, xác định đối tượng có thể tương tác và suy luận về quỹ đạo qua hình ảnh. 1
9
10
11
Trong bảng kết quả DeepCybo công bố, điểm của bản 8B ở gần GPT-6-Astra (73,3) và Gemini 3.6 Flash (73,0), hai mô hình không mở. Đây là so sánh theo điều kiện đánh giá của dự án, không phải bảng xếp hạng độc lập của mọi mô hình hiện có, càng không phải phép đo tỷ lệ robot hoàn thành nhiệm vụ. 1
18
DeepCybo đã phát hành trọng số mô hình 2B và 8B, báo cáo kỹ thuật và tài nguyên đánh giá để các nhóm có thể kiểm tra, thử tái lập kết quả. 1
9
10
11 Trước khi dựa vào điểm trung bình, cần xem kết quả từng bài, thiết lập đánh giá, khả năng dữ liệu huấn luyện trùng với dữ liệu kiểm tra và liệu các mô hình đối chiếu có được thử trong điều kiện tương đương hay không.
Quan trọng hơn, việc triển khai đòi hỏi thử nghiệm vòng kín trên đúng robot, đồ vật và điều kiện dự kiến sử dụng: robot quan sát kết quả hành động rồi điều chỉnh bước tiếp theo. Tỷ lệ hoàn thành nhiệm vụ, khả năng phục hồi sau lỗi, độ trễ và an toàn trong quá trình đó mới cho biết mô hình có hữu dụng trong vận hành hay không. Điểm hiểu môi trường được công bố không thể thay thế những phép thử ấy. 1
9
10
Studio Global AI
Trang này bao gồm câu trả lời dựa trên nguồn mà bạn có thể tiếp tục bên trong Studio Global.
PhysBrain 1.5 dùng một kiến trúc tự hồi quy để tạo câu trả lời về không gian, chuyển động robot và dự đoán trạng thái hình ảnh tiếp theo.
PhysBrain 1.5 dùng một kiến trúc tự hồi quy để tạo câu trả lời về không gian, chuyển động robot và dự đoán trạng thái hình ảnh tiếp theo. DeepCybo đã công bố trọng số bản 2B và 8B cùng tài liệu đánh giá; các nhóm cần tái lập kết quả và thử nghiệm robot vận hành theo vòng phản hồi trước khi triển khai.