PhysBrain 1.5 ใช้สถาปัตยกรรมเดียวสร้างคำตอบเกี่ยวกับฉาก การเคลื่อนไหวของหุ่นยนต์ และการคาดการณ์สภาพภาพในอนาคต [1][8] DeepCybo เปิดให้เข้าถึงน้ำหนักโมเดลรุ่น 2B และ 8B พร้อมเอกสารและทรัพยากรประเมินผล แต่ทีมที่นำไปใช้ยังต้องทดสอบการทำงานแบบวงจรปิดบนหุ่นยนต์ของตนเอง [1][9][10][11]
เผยแพร่โดยแก้ไขด้วย GPT-6 Solรูปภาพสร้างด้วย GPT Image 2
คำตอบการวิจัย

Create a landscape editorial hero image for this Studio Global article: What is DeepCybo’s open-source PhysBrain 1.5 physical foundation model, how do its 2B and 8B versions unify embodied understanding, action g. Article summary: PhysBrain 1.5 is DeepCybo’s open-weight attempt to put scene understanding, robot-action generation, and prediction of what happens next into one vision-language model. Its published 28-benchmark result is strong evidenc. Topic tags: general, academic, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, char
หากโจทย์คือให้หุ่นยนต์มองเห็นสิ่งของ คิดว่าจะขยับอย่างไร แล้วประเมินว่าจะเกิดอะไรขึ้นหลังขยับ PhysBrain 1.5 ของ DeepCybo พยายามรวมทั้งสามขั้นไว้ในโมเดลเดียว จุดที่ต้องแยกให้ออกคือ ผลทดสอบความเข้าใจสภาพแวดล้อมของหุ่นยนต์ กับหลักฐานว่าหุ่นยนต์ลงมือทำงานได้สำเร็จและเชื่อถือได้จริง ซึ่งไม่ใช่สิ่งเดียวกัน 1
9
10
PhysBrain 1.5 มีรุ่น 2B และ 8B ซึ่งต่อยอดจากโมเดลภาพและภาษา Qwen3-VL ในขนาดที่สอดคล้องกัน แทนที่จะแยกระบบสำหรับตอบคำถาม สร้างการเคลื่อนไหว และทำนายผลลัพธ์ โมเดลนี้แปลงผลลัพธ์เหล่านั้นเป็นลำดับโทเคนแบบไม่ต่อเนื่อง แล้วฝึกให้ทำนายโทเคนถัดไปด้วยสถาปัตยกรรมแบบออโตรีเกรสซีฟเดียว 1
8
10
ลำดับโทเคนดังกล่าวใช้แทนได้ทั้งคำตอบเป็นภาษาและข้อมูลเชิงพื้นที่ เส้นทางการเคลื่อนที่ของปลายแขนกล ตลอดจนสภาพภาพที่คาดว่าจะเกิดขึ้น ซึ่งรวมข้อมูลสี RGB ความลึก และบริเวณที่หุ่นยนต์ครอบครองในภาพ กล่าวอย่างง่าย โมเดลเรียนรู้ทั้งการอธิบายสิ่งที่เห็น การเสนอการเคลื่อนไหว และการคาดภาพหลังเคลื่อนไหวในรูปแบบข้อมูลร่วมกัน แต่เส้นทางที่โมเดลสร้างขึ้นไม่ใช่หลักฐานว่าหุ่นยนต์ทำตามได้สำเร็จ 1
8
DeepCybo อธิบายการฝึกเป็นสองช่วง ช่วงแรกใช้วิดีโอปฏิสัมพันธ์ของมนุษย์ที่จัดตามงาน โดยจับคู่บริบทของฉากและงานกับการเคลื่อนไหวที่สร้างคืนจากวิดีโอและสิ่งที่สังเกตเห็นหลังจากนั้น ช่วงปรับแต่งแบบมีผู้สอนจึงใช้ข้อมูลผสม ทั้งการสาธิตของมนุษย์ เส้นทางการเคลื่อนไหวของหุ่นยนต์ และประสบการณ์จากการจำลอง ดังนั้นการบอกว่าโมเดลนี้ “ฝึกจากวิดีโอมนุษย์เท่านั้น” จะถูกต้องเฉพาะช่วงก่อนฝึก ไม่ใช่ทั้งกระบวนการ 1
12
DeepCybo รายงานว่า PhysBrain 1.5-8B ได้คะแนนเฉลี่ย 72.5 จากเกณฑ์ทดสอบความเข้าใจสำหรับระบบที่ทำงานในสภาพแวดล้อมจริง 28 รายการ สูงสุดในกลุ่มโมเดลแบบเปิดที่นำมาเปรียบเทียบ และได้ผลดีที่สุดในกลุ่มนั้น 14 รายการ ส่วนรุ่น 2B มีคะแนนเฉลี่ยที่รายงานไว้ 66.6 ชุดทดสอบครอบคลุมการรับรู้ภาพและตำแหน่ง การเข้าใจสามมิติและหลายมุมมอง การใช้เหตุผลและวางแผน การระบุตำแหน่งกับสิ่งที่วัตถุเอื้อให้ทำได้ รวมถึงการให้เหตุผลจากเส้นทางการเคลื่อนไหวในภาพ 1
9
10
11
ในตารางเปรียบเทียบที่ DeepCybo เผยแพร่ คะแนนของรุ่น 8B อยู่ใกล้โมเดลแบบปิด GPT-6-Astra (73.3) และ Gemini 3.6 Flash (73.0) แต่ตัวเลขนี้เป็นผลภายใต้การประเมินที่โครงการรายงาน ไม่ใช่อันดับอิสระของทุกโมเดลที่มีอยู่ และไม่ใช่คะแนนความสำเร็จของการหยิบจับวัตถุด้วยหุ่นยนต์จริง 1
18
DeepCybo เปิดให้เข้าถึงน้ำหนักโมเดลรุ่น 2B และ 8B พร้อมรายงานทางเทคนิคและทรัพยากรสำหรับประเมินผล ทีมพัฒนาจึงมีจุดเริ่มต้นสำหรับตรวจสอบโมเดลและลองทำผลทดสอบซ้ำ 1
9
10
11
ก่อนยึดคะแนนเฉลี่ยเป็นข้อสรุป ควรดูผลแยกรายการ ตรวจเงื่อนไขการประเมิน ความเป็นไปได้ที่ข้อมูลฝึกและข้อมูลทดสอบจะทับซ้อนกัน และความเท่าเทียมของเงื่อนไขที่ใช้กับโมเดลเปรียบเทียบ ส่วนการตัดสินใจใช้งานจริงต้องทดสอบแบบ วงจรปิด บนหุ่นยนต์เป้าหมาย ให้หุ่นยนต์รับข้อมูล ลงมือทำ และปรับการกระทำจากผลที่เกิดขึ้น พร้อมวัดอัตราสำเร็จ การกู้คืนเมื่อผิดพลาด ความหน่วง และความปลอดภัยกับวัตถุและสภาพแวดล้อมที่จะพบจริง คะแนนด้านความเข้าใจเพียงอย่างเดียวใช้แทนการทดสอบเหล่านี้ไม่ได้ 1
9
10
Studio Global AI
หน้านี้รวมคำตอบที่ได้รับการสนับสนุนจากแหล่งที่มาซึ่งคุณสามารถดำเนินการต่อภายใน Studio Global
PhysBrain 1.5 ใช้สถาปัตยกรรมเดียวสร้างคำตอบเกี่ยวกับฉาก การเคลื่อนไหวของหุ่นยนต์ และการคาดการณ์สภาพภาพในอนาคต [1][8]
PhysBrain 1.5 ใช้สถาปัตยกรรมเดียวสร้างคำตอบเกี่ยวกับฉาก การเคลื่อนไหวของหุ่นยนต์ และการคาดการณ์สภาพภาพในอนาคต [1][8] DeepCybo เปิดให้เข้าถึงน้ำหนักโมเดลรุ่น 2B และ 8B พร้อมเอกสารและทรัพยากรประเมินผล แต่ทีมที่นำไปใช้ยังต้องทดสอบการทำงานแบบวงจรปิดบนหุ่นยนต์ของตนเอง [1][9][10][11]