PhysBrain 1.5 bruker én autoregressiv modell til å gi romlige svar, foreslå robotbevegelser og forutsi fremtidige visuelle tilstander. DeepCybo rapporterer 72,5 i snitt for 8B versjonen på 28 tester av robotrelatert forståelse, best blant de åpne modellene selskapet sammenlignet.
Publisert avRedigert med GPT-6 SolBilder generert med GPT Image 2
Research answer

Create a landscape editorial hero image for this Studio Global article: What is DeepCybo’s open-source PhysBrain 1.5 physical foundation model, how do its 2B and 8B versions unify embodied understanding, action g. Article summary: PhysBrain 1.5 is DeepCybo’s open-weight attempt to put scene understanding, robot-action generation, and prediction of what happens next into one vision-language model. Its published 28-benchmark result is strong evidenc. Topic tags: general, academic, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, char
Det avgjørende spørsmålet om PhysBrain 1.5 er ikke bare om modellen kan beskrive en scene og foreslå en bevegelse. Det er om en robot faktisk kan gjennomføre bevegelsen, oppdage feil og fullføre oppgaven. DeepCybos publiserte resultater gjelder først og fremst robotrelatert forståelse i standardiserte tester – ikke pålitelig oppgaveutførelse i den fysiske verden. 1
9
10
PhysBrain 1.5 finnes i 2B- og 8B-versjoner, bygget på tilsvarende Qwen3-VL-modeller for syn og språk. I stedet for å ha separate, oppgavespesifikke deler for forståelse, handling og prediksjon, uttrykker modellen svarene som sekvenser av diskrete enheter, ofte kalt tokens. Den trenes til å forutsi neste enhet i sekvensen – en autoregressiv metode. 1
8
10
Sekvensene kan representere språk og romlig informasjon, bevegelsen til robotens arbeidsende, og visuelle anslag over hva som skjer videre. De visuelle anslagene omfatter fargebilder (RGB), dybdeinformasjon og informasjon om hvor roboten befinner seg i bildet. Tanken er at sceneforståelse, foreslått bevegelse og forventet utfall skal kunne læres innenfor samme arkitektur. En beregnet bevegelsesbane er likevel ikke det samme som en bevegelse en robot har utført med hell. 1
8
10
DeepCybo beskriver to trinn. I den innledende treningen brukes videoer av mennesker som utfører oppgaver. Oppgave og omgivelser kobles til rekonstruert bevegelse og observasjoner av det som skjer etterpå. Deretter finjusteres modellen med en blanding av menneskelige demonstrasjoner, roboters bevegelsesdata og erfaring fra simulering. Å si at hele modellen er trent bare på menneskevideoer, ville derfor være misvisende. 1
12
DeepCybo oppgir en gjennomsnittsscore på 72,5 for PhysBrain 1.5-8B på 28 tester av robotrelatert forståelse. Det er høyest blant de åpne modellene i selskapets sammenligning; 8B-versjonen får også best resultat blant disse modellene på 14 enkeltstående tester. Den oppgitte gjennomsnittsscoren for 2B-versjonen er 66,6. Testene dekker blant annet visuell og romlig oppfatning, 3D- og flervinkelforståelse, resonnering og planlegging, evnen til å knytte objekter til mulige handlinger, samt forståelse av visuelle bevegelsesbaner. 1
9
10
11
I DeepCybos publiserte sammenligning ligger 8B-modellen nær de oppførte resultatene for de proprietære modellene GPT-6-Astra (73,3) og Gemini 3.6 Flash (73,0). Dette er en sammenligning under prosjektets rapporterte testoppsett, ikke en uavhengig rangering av alle tilgjengelige modeller – og heller ikke en måling av hvor ofte en fysisk robot lykkes med en oppgave. 1
18
DeepCybo har gjort modellvekter for både 2B og 8B tilgjengelige, sammen med en teknisk rapport og evalueringsressurser. Det gir andre team mulighet til å undersøke modellene og forsøke å gjenskape resultatene. 1
9
10
11
Før gjennomsnittsscoren brukes som beslutningsgrunnlag, bør team se på resultatene for hver enkelt test, kontrollere testinnstillingene og undersøke mulig overlapp mellom trenings- og testdata. De bør også sjekke om modellene i sammenligningen ble vurdert under likeverdige forhold. For praktisk bruk er den viktigste prøven å la den aktuelle roboten utføre oppgaver i en lukket sløyfe, der den registrerer hva som faktisk skjer og justerer handlingene sine. Da må oppgavesuksess, feilretting, tidsbruk og sikkerhet måles med gjenstandene og forholdene roboten faktisk skal møte. Den publiserte forståelsesscoren kan ikke erstatte slike målinger. 1
9
10
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
PhysBrain 1.5 bruker én autoregressiv modell til å gi romlige svar, foreslå robotbevegelser og forutsi fremtidige visuelle tilstander.
PhysBrain 1.5 bruker én autoregressiv modell til å gi romlige svar, foreslå robotbevegelser og forutsi fremtidige visuelle tilstander. DeepCybo rapporterer 72,5 i snitt for 8B versjonen på 28 tester av robotrelatert forståelse, best blant de åpne modellene selskapet sammenlignet.
Modellvekter for 2B og 8B er tilgjengelige, men team må gjenskape testresultatene og prøve lukket sløyfe styring på egne roboter før de trekker konklusjoner om praktisk ytelse.