ชุดข้อมูลที่ใช้เทรนประกอบด้วย วิดีโอแบบมุมมองบุคคลที่หนึ่ง (Egocentric Video) ของมนุษย์มากกว่า 1,000,000 ชั่วโมง ซึ่งเทียบเท่ากับประสบการณ์การตื่นอยู่ต่อเนื่องประมาณ 170 ปี วิดีโอเหล่านี้บันทึกกิจวัตรประจำวัน เช่น การทำอาหาร การพับผ้า การประกอบสิ่งของ และการทำความสะอาด ไม่มีข้อมูลการเคลื่อนไหวของหุ่นยนต์ (Robot Action Data) ถูกใช้ในช่วง Pre-training เลย ข้อมูลหุ่นยนต์จะถูกนำเข้ามาใช้เฉพาะในช่วง Post-training หรือ Fine-tuning ขนาดเล็กเท่านั้น ซึ่งปกติแล้วใช้เวลาไม่เกิน 10 ชั่วโมงต่อหนึ่งงาน
ในช่วง Pre-training DYNA-2 ใช้ วัตถุประสงค์การทำนายวิดีโอ (Video Prediction Objective) คือการเรียนรู้ที่จะทำนายเฟรมวิดีโอในอนาคตจากเฟรมในอดีต ผสานกับ อัลกอริทึม Video Co-training ที่เรียนรู้ทั้งการแสดงผลทางภาพและการทำนายการกระทำไปพร้อมกัน วิธีการนี้แตกต่างจากสถาปัตยกรรม VLA ของ DYNA-1 โดยสิ้นเชิง
บริษัทแสดงให้เห็นถึงการขยายผล (Scaling) ในช่วง 4 ลำดับความสำคัญ (Four Orders of Magnitude) ตั้งแต่ 1,000 ชั่วโมง ไปจนถึง 1,000,000 ชั่วโมงของข้อมูล Pre-training
บริษัทได้ทำการเปรียบเทียบแบบตัวต่อตัวระหว่าง DYNA-2 และ DYNA-1 ภายใต้เงื่อนไขการเทรนที่เหมือนกันและการใช้งานจริง
ประสิทธิภาพโดยเฉลี่ยที่ถูกปรับให้เป็นมาตรฐาน (Normalized Performance) เพิ่มขึ้นอย่างต่อเนื่องตามขนาดของ Pre-training: 20% → 28% → 45% → 53% ของค่าสูงสุดที่เป็นไปได้ เมื่อข้อมูลเพิ่มขึ้นจาก 1k → 10k → 100k → 1M ชั่วโมง ที่ขนาด 1M ชั่วโมง DYNA-2 ทำผลงานในโลกจริงได้ดีที่สุดใน 9 จาก 14 งาน การปรับปรุงในแต่ละงานที่สำคัญได้แก่:
Dyna Robotics รายงานถึงสิ่งที่เรียกว่า "Scaling Law ที่แท้จริงครั้งแรกในวงการหุ่นยนต์ที่ขับเคลื่อนด้วยข้อมูลของมนุษย์ทั้งหมด" โดยมีลักษณะสำคัญดังนี้:
บริษัทระบุอย่างชัดเจนว่านี่คือการสาธิต "เป็นครั้งแรก" ที่การขยายขนาดข้อมูลการสังเกตของมนุษย์ ไม่ใช่ข้อมูลการกระทำของหุ่นยนต์ สามารถเป็นแกนหลักที่เชื่อถือได้ในการพัฒนาความฉลาดทางกายภาพของหุ่นยนต์
หากการอ้างสิทธิ์เหล่านี้ผ่านการตรวจสอบโดยอิสระ Dyna Robotics ได้แสดงให้เห็นถึงหนทางปฏิบัติจริงในการขยายขนาดความฉลาดของหุ่นยนต์ โดยไม่ต้องเจอปัญหาคอขวดจากการเก็บข้อมูลการกระทำของหุ่นยนต์ที่มีราคาแพงและหายาก วิดีโอของมนุษย์นั้นมีอยู่ในปริมาณที่ไร้ขีดจำกัดในทางปฏิบัติ บริษัทกล่าวว่ากำลังทำงานเพื่อไปสู่ข้อมูลเทรน 10 ล้านชั่วโมง ซึ่งจะทำให้หุ่นยนต์สามารถเรียนรู้งานทางกายภาพใหม่ๆ ได้ด้วยการ Fine-tuning ในพื้นที่เพียงไม่กี่ชั่วโมง