Corpus di pre-addestramento: L'azienda ha costruito quattro sottoinsiemi annidati di video umani egocentrici: 1.000, 10.000, 100.000 e 1.000.000 di ore, senza utilizzare dati di azione robotica durante il pre-addestramento . Dopo questa fase, il modello viene messo a punto con una quantità relativamente piccola di dati reali del robot (ore o addirittura minuti) per trasferire l'intuizione fisica appresa all'hardware specifico
.
Dyna Robotics ha riportato quella che definisce la prima legge di scala di trasferimento cross-embodiment nella manipolazione . La scoperta è significativa perché dimostra che l'aumento dei dati video umani produce miglioramenti prevedibili e monotoni nelle prestazioni del robot, rispecchiando le leggi di scala che hanno trasformato i grandi modelli linguistici.
Legge di scala sui dati umani: Attraverso tutti e quattro gli ordini di grandezza (1K → 10K → 100K → 1M ore), tutte le metriche di qualità della previsione video sono migliorate in modo monotono, ben descritte da una legge di potenza con nessun plateau osservato .
La legge si trasferisce a dati robotici mai visti: Gli stessi checkpoint sono stati testati zero-shot su 39 diversi compiti robotici su due piattaforme bimanuali stazionarie. Le prestazioni sono migliorate in modo monotono all'aumentare del pool di video umani di pre-addestramento, prima di qualsiasi messa a punto specifica per il robot . Un'analisi ha mostrato che, mantenendo fissi a 50.000 ore i dati con azioni etichettate e aggiungendo ore di solo video, l'MSE (errore quadratico medio) dell'azione robotica zero-shot è sceso da 0,340 a 0,120
.
Ridimensionamento delle prestazioni post-addestramento: Dopo il post-addestramento, il punteggio normalizzato medio su 14 compiti robotici è passato dal 20% → 28% → 45% → 53% del massimo ottenibile, con l'aumento della scala di pre-addestramento da 1K a 1M ore .
I miglioramenti delle prestazioni di DYNA-2 sono più visibili in tre aree chiave:
Produzione di alta precisione: DYNA-2 ha aumentato i tassi di successo dei compiti da circa il 20% all'80-90% solo attraverso una maggiore scala di pre-addestramento, senza alcuna modifica ai dati di post-addestramento . Si tratta di un miglioramento da 4x a 4,5x ottenuto semplicemente guardando più video umani.
Implementazioni zero-shot presso i clienti: In siti di clienti reali, DYNA-2 ha raggiunto un tasso di qualità dell'87%, rispetto al 46% del suo predecessore DYNA-1 basato su VLA, un miglioramento di 41 punti percentuali a parità di budget di post-addestramento . In valutazioni fisiche testa a testa con condizioni di addestramento identiche, DYNA-2 ha completato i compiti 1,55 volte più spesso di DYNA-1 e ha vinto il 65% dei confronti testa a testa
.
Svitare un tappo di bottiglia (13 minuti di dati): Con solo 13 minuti di dati dimostrativi specifici per il robot, DYNA-2 è stato adattato per comandare un paio di mani destre a cinque dita per svitare un tappo di bottiglia . Il rapporto tecnico dell'azienda chiarisce che la cifra era di circa 10 minuti di dati robotici, con la scala di pre-addestramento che ha fatto salire il successo dal 10% con budget più piccoli al 40-50% con il budget completo di 1 milione di ore
.
I risultati di DYNA-2 sfidano l'ipotesi prevalente che i robot richiedano grandi quantità di dati robotici specifici per il compito. Dimostrando una legge di scala che si trasferisce dal video umano all'hardware robotico, Dyna Robotics apre una strada pratica verso 10 milioni di ore di dati di addestramento, con il potenziale di consentire ai robot di padroneggiare nuovi compiti fisici con solo poche ore di messa a punto locale . Attualmente, il modello opera come un sistema gestito dal fornitore; Dyna Robotics non ha annunciato checkpoint pubblici, API o licenze per DYNA-2
. La replica indipendente da parte della comunità di ricerca sulla robotica sarà il passo successivo per validare questi risultati
.