Träningsdatasetet bestod av över 1 000 000 timmar egocentrisk (första persons) mänsklig video – motsvarande cirka 170 års kontinuerlig vaken erfarenhet . Videorna fångade vardagliga manipulationsuppgifter som matlagning, vikning, montering och rengöring . Ingen robotaktionsdata användes under förträningen; robotdata introducerades först under en liten eftertränings- eller finjusteringsfas, vanligtvis 10 timmar eller mindre per uppgift .
Under förträningen använde DYNA-2 ett videoprediktionsmål – att lära sig förutsäga framtida videoramar från tidigare observationer – kombinerat med en video-samträningsalgoritm som gemensamt lär sig visuella representationer och aktionsprediktion . Detta tillvägagångssätt står i kontrast till VLA-arkitekturen i DYNA-1, som direkt mappar perception till robotaktioner utan mellanliggande videoprediktion .
Företaget demonstrerade skalning över fyra storleksordningar, från 1 000 timmar upp till 1 000 000 timmar förträningsdata .
Företaget genomförde direkta jämförelser mellan DYNA-2 och DYNA-1 under matchade träningsförhållanden och verkliga driftsättningar.
Genomsnittlig normaliserad prestanda ökade monotont med förträningsskalan: 20 % → 28 % → 45 % → 53 % av det uppnåbara maximumet när data skalades från 1k → 10k → 100k → 1M timmar . Vid 1M-timmarsskalan uppnådde DYNA-2 den starkaste verkliga prestandan på 9 av 14 uppgifter . Viktiga förbättringar på uppgiftsnivå inkluderade:
Dyna Robotics rapporterade vad de kallar ”den första sanna skalningslagen inom robotik som drivs helt av mänsklig data” . Viktiga egenskaper:
Företaget anger uttryckligen att detta är en ”först-i-sitt-slag” demonstration av att skalning av mänsklig observationsdata, inte robotaktionsdata, kan fungera som en pålitlig axel för att förbättra fysisk robotintelligens .
Om påståendena håller för oberoende verifiering har Dyna Robotics visat en praktisk väg för att skala robotintelligens utan flaskhalsen av att samla in dyr robotaktionsdata. Mänsklig video finns i praktiskt taget obegränsad skala. Företaget säger att de redan arbetar mot 10 miljoner timmar träningsdata, vilket skulle göra det möjligt för robotar att bemästra nya fysiska uppgifter med bara timmar av lokal finjustering .