Korpus wstępnego treningu: Firma zbudowała cztery zagnieżdżone podzbiory ludzkich nagrań wideo – 1000, 10 000, 100 000 i 1 000 000 godzin – bez użycia danych o działaniach robota w fazie wstępnej . Po wstępnym treningu model jest dostrajany na stosunkowo niewielkiej ilości rzeczywistych danych robota (godziny, a nawet minuty), aby przenieść wyuczoną fizyczną intuicję na konkretny sprzęt
.
Dyna Robotics ogłosiło odkrycie pierwszego prawa skalowania transferu między różnymi konstrukcjami w manipulacji . Znaczenie tego odkrycia polega na tym, że pokazuje ono, iż skalowanie danych z ludzkich nagrań wideo prowadzi do przewidywalnej, monotonicznej poprawy wydajności robota – odzwierciedlając prawa skalowania, które zrewolucjonizowały duże modele językowe.
Prawo skalowania na danych ludzkich: We wszystkich czterech rzędach wielkości (1K → 10K → 100K → 1M godzin) wszystkie wskaźniki jakości predykcji wideo poprawiały się monotonicznie, zgodnie z prawem potęgowym, bez obserwowanego plateau .
Prawo przenosi się na nieznane dane robota: Te same punkty kontrolne oceniano zero-shot na 39 różnych zadaniach robotów na dwóch stacjonarnych platformach dwuramiennych. Wydajność poprawiała się monotonicznie wraz ze wzrostem puli ludzkich nagrań wideo, jeszcze przed jakimkolwiek dostrojeniem specyficznym dla robota . Jedna z analiz wykazała, że utrzymanie danych z oznaczonymi działaniami na stałym poziomie 50 000 godzin i dodanie godzin tylko z wideo zmniejszyło błąd średniokwadratowy (MSE) przewidywania działań robota zero-shot z 0,340 do 0,120
.
Skalowanie wydajności po treningu: Po treningu końcowym średni znormalizowany wynik w 14 zadaniach robotów wzrósł z 20% → 28% → 45% → 53% osiągalnego maksimum wraz ze wzrostem skali wstępnego treningu z 1K do 1M godzin .
Największe zyski wydajności DYNA-2 są widoczne w trzech kluczowych obszarach:
Precyzyjna produkcja: DYNA-2 zwiększył wskaźniki powodzenia zadań z około 20% do 80–90% wyłącznie poprzez zwiększenie skali wstępnego treningu, bez żadnych zmian w danych po treningu . To 4–4,5-krotna poprawa wynikająca wyłącznie z obejrzenia większej ilości ludzkich nagrań.
Wdrożenia zero-shot u klientów: W rzeczywistych lokalizacjach klientów DYNA-2 osiągnął 87% wskaźnik jakości, w porównaniu do 46% dla swojego poprzednika opartego na VLA, DYNA-1 – poprawa o 41 punktów procentowych przy porównywalnych budżetach na trening końcowy . W bezpośrednich porównaniach fizycznych z identycznymi warunkami treningowymi DYNA-2 wykonywał zadania 1,55 razy częściej niż DYNA-1 i wygrywał 65% bezpośrednich porównań
.
Odkręcanie nakrętki butelki (13 minut danych): Mając zaledwie 13 minut danych demonstracyjnych specyficznych dla robota, DYNA-2 dostosowano do sterowania parą pięciopalczastych dłoni w celu odkręcenia nakrętki butelki . Raport techniczny firmy wyjaśnia, że było to około 10 minut danych robota, a skala wstępnego treningu podniosła skuteczność z 10% przy mniejszych budżetach do 40–50% przy pełnym budżecie 1M godzin
.
Wyniki DYNA-2 podważają panujące założenie, że roboty wymagają ogromnych ilości danych specyficznych dla danego zadania. Demonstrując prawo skalowania, które przenosi wiedzę z ludzkiego wideo na sprzęt robotyczny, Dyna Robotics otwiera praktyczną ścieżkę do 10 milionów godzin danych treningowych – z potencjałem umożliwienia robotom opanowania nowych fizycznych zadań w zaledwie kilka godzin lokalnego dostrajania . Model działa obecnie jako system zarządzany przez dostawcę; Dyna Robotics nie ogłosiło publicznego punktu kontrolnego, API ani licencji na DYNA-2
. Niezależna replikacja przez społeczność badawczą robotyki będzie kolejnym krokiem w walidacji tych wyników
.