Le versioni 2B e 8B usano un’unica architettura autoregressiva per produrre risposte spaziali, movimenti robotici e previsioni degli stati futuri. DeepCybo dichiara 72,5 punti per la versione 8B su 28 benchmark, il miglior risultato tra i modelli aperti inclusi nel suo confronto; il dato non misura il successo dei c...
Pubblicato daModificato con GPT-6 SolImmagini generate con GPT Image 2
Research answer

Create a landscape editorial hero image for this Studio Global article: What is DeepCybo’s open-source PhysBrain 1.5 physical foundation model, how do its 2B and 8B versions unify embodied understanding, action g. Article summary: PhysBrain 1.5 is DeepCybo’s open-weight attempt to put scene understanding, robot-action generation, and prediction of what happens next into one vision-language model. Its published 28-benchmark result is strong evidenc. Topic tags: general, academic, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, char
PhysBrain 1.5 è il modello a pesi disponibili sviluppato da DeepCybo per collegare tre capacità: interpretare una scena, generare il movimento di un robot e prevedere come potrebbe cambiare l’ambiente. Per chi valuta di usarlo, la distinzione decisiva è questa: i risultati pubblicati riguardano soprattutto la comprensione dell’ambiente fisico, non l’affidabilità di un robot mentre manipola oggetti nel mondo reale. 1
9
10
Le versioni 2B e 8B partono dai rispettivi modelli visione-linguaggio Qwen3-VL. PhysBrain 1.5 rappresenta come sequenze di token discreti sia le risposte linguistiche e spaziali sia i movimenti dell’organo terminale del robot — per esempio, la pinza — e gli stati visivi futuri. Questi ultimi comprendono immagini RGB, informazioni di profondità e dati sulla porzione di spazio occupata dal robot. Un’unica architettura autoregressiva viene addestrata a prevedere il token successivo, senza moduli di uscita separati per ciascun compito. 1
8
10
Il vantaggio progettuale è poter trattare nello stesso formato ciò che il modello riconosce, il movimento che propone e l’esito visivo che prevede. Una traiettoria generata, però, non equivale a un movimento eseguito con successo da un robot. 1
8
DeepCybo descrive due fasi. Nel preaddestramento usa video di interazioni umane organizzati intorno a un compito, associando il contesto della scena e dell’obiettivo a movimenti ricostruiti e osservazioni successive. Segue un affinamento supervisionato su una combinazione di dimostrazioni umane, traiettorie robotiche ed esperienze simulate. Dire che il modello è addestrato soltanto su video umani descriverebbe quindi in modo incompleto il processo. 1
12
Secondo DeepCybo, PhysBrain 1.5-8B ottiene una media di 72,5 su 28 benchmark di comprensione dell’ambiente fisico: è primo tra i modelli aperti inclusi nel confronto e registra il miglior risultato di quel gruppo in 14 prove. Per la versione 2B, la media dichiarata è 66,6. I test coprono percezione visuo-spaziale, comprensione 3D e da più punti di vista, ragionamento e pianificazione, individuazione di elementi nello spazio e delle loro possibilità d’uso, oltre al ragionamento sulle traiettorie visive. 1
9
10
11
Nella tabella pubblicata da DeepCybo, il punteggio dell’8B è vicino a quelli attribuiti ai modelli proprietari GPT-6-Astra (73,3) e Gemini 3.6 Flash (73,0). Si tratta di un confronto nelle condizioni di valutazione riportate dal progetto, non di una classifica indipendente di tutti i modelli disponibili né di una misura dei compiti completati da robot fisici. 1
18
DeepCybo ha reso disponibili i checkpoint 2B e 8B, il rapporto tecnico e risorse per la valutazione: materiale da cui partire per esaminare i modelli e tentare di riprodurre i risultati. 1
9
10
11
Prima di prendere la media come riferimento operativo, un team dovrebbe controllare i risultati delle singole prove, le impostazioni di valutazione, l’eventuale sovrapposizione tra dati di addestramento e test e la comparabilità delle condizioni applicate agli altri modelli. Per un impiego concreto conta soprattutto una prova a ciclo chiuso sul robot previsto: percentuale di compiti riusciti, recupero dagli errori, tempi di risposta e sicurezza con gli oggetti e nelle condizioni che incontrerà davvero. Il punteggio pubblicato sulla comprensione non sostituisce queste misure. 1
9
10
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Le versioni 2B e 8B usano un’unica architettura autoregressiva per produrre risposte spaziali, movimenti robotici e previsioni degli stati futuri.
Le versioni 2B e 8B usano un’unica architettura autoregressiva per produrre risposte spaziali, movimenti robotici e previsioni degli stati futuri. DeepCybo dichiara 72,5 punti per la versione 8B su 28 benchmark, il miglior risultato tra i modelli aperti inclusi nel suo confronto; il dato non misura il successo dei compiti eseguiti da un robot reale.