PhysBrain 1.5 utilise un modèle autorégressif commun pour produire des réponses spatiales, des mouvements robotiques et des prédictions visuelles. DeepCybo publie des poids pour les versions 2B et 8B ; le score annoncé sur les tests d’IA incarnée ne remplace pas des essais en boucle fermée sur un robot.
Publié parModifié avec GPT-6 SolImages générées avec GPT Image 2
Réponse de recherche

Create a landscape editorial hero image for this Studio Global article: What is DeepCybo’s open-source PhysBrain 1.5 physical foundation model, how do its 2B and 8B versions unify embodied understanding, action g. Article summary: PhysBrain 1.5 is DeepCybo’s open-weight attempt to put scene understanding, robot-action generation, and prediction of what happens next into one vision-language model. Its published 28-benchmark result is strong evidenc. Topic tags: general, academic, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, char
PhysBrain 1.5, développé par DeepCybo, cherche à traiter dans un même modèle trois questions liées : que montre une scène, quel mouvement proposer au robot et à quoi pourrait ressembler la suite ? Ses poids sont accessibles, mais il faut distinguer ses résultats aux tests de compréhension incarnée d’une démonstration de manipulation fiable dans le monde réel. 1
9
10
Les versions 2B et 8B s’appuient sur les modèles vision-langage Qwen3-VL correspondants. Au lieu de confier chaque tâche à un module de sortie spécialisé, PhysBrain 1.5 représente sous forme de séquences discrètes les réponses en langage naturel ou spatiales, les mouvements de l’effecteur du robot — la partie qui agit sur son environnement — et les états visuels futurs. Ces derniers comprennent des images couleur (RGB), des données de profondeur et des informations sur l’espace occupé par le robot. Le modèle apprend à prédire l’élément suivant de ces séquences au sein d’une architecture autorégressive commune. 1
8
10
Cette conception rapproche description de la scène, action envisagée et résultat prédit. Prédire une trajectoire ne prouve toutefois pas qu’un robot puisse l’exécuter avec succès. 1
8
Selon DeepCybo, le préentraînement exploite des vidéos d’interactions humaines centrées sur des tâches : le contexte de la scène est associé à des mouvements reconstruits et aux observations qui suivent. Vient ensuite un ajustement supervisé mêlant démonstrations humaines, trajectoires de robots et expériences simulées. Dire que PhysBrain 1.5 a été entraîné uniquement sur des vidéos humaines occulterait donc cette seconde étape. 1
12
DeepCybo annonce pour PhysBrain 1.5-8B un score moyen de 72,5 sur 28 tests de compréhension incarnée. Dans sa comparaison, il arrive en tête des modèles ouverts évalués et obtient le meilleur résultat parmi eux sur 14 tests. La version 2B atteint 66,6 en moyenne. Les épreuves portent notamment sur la perception visuelle et spatiale, la compréhension 3D et multivue, le raisonnement, la planification, l’identification des possibilités d’action et l’analyse de trajectoires visuelles. 1
9
10
11
Dans le tableau publié par DeepCybo, le résultat du modèle 8B est proche de ceux attribués aux modèles propriétaires GPT-6-Astra (73,3) et Gemini 3.6 Flash (73,0). Il s’agit d’une comparaison selon son protocole, pas d’un classement indépendant de tous les modèles disponibles ni d’un taux de réussite sur des tâches robotiques réelles. 1
18
Les poids des versions 2B et 8B, le rapport technique et des ressources d’évaluation donnent aux équipes de quoi examiner les modèles et tenter de reproduire les résultats. 1
9
10
11
Avant de se fier à la moyenne, il faut regarder les résultats test par test, les paramètres d’évaluation, un éventuel recoupement entre données d’entraînement et de test, ainsi que l’équivalence des conditions imposées aux modèles comparés. Pour un usage robotique, l’épreuve décisive reste l’exécution en boucle fermée sur le matériel visé : réussite des tâches, reprise après erreur, latence et sécurité avec les objets et dans les conditions réellement rencontrés. Le score publié ne mesure pas ces performances à lui seul. 1
9
10
Studio Global AI
Cette page comprend une réponse basée sur la source que vous pouvez continuer dans Studio Global.
PhysBrain 1.5 utilise un modèle autorégressif commun pour produire des réponses spatiales, des mouvements robotiques et des prédictions visuelles.
PhysBrain 1.5 utilise un modèle autorégressif commun pour produire des réponses spatiales, des mouvements robotiques et des prédictions visuelles. DeepCybo publie des poids pour les versions 2B et 8B ; le score annoncé sur les tests d’IA incarnée ne remplace pas des essais en boucle fermée sur un robot.