PhysBrain 1.5 utiliza una arquitectura autorregresiva para producir respuestas espaciales, movimientos del robot y predicciones del estado visual futuro. DeepCybo informa de 72,5 puntos para la versión 8B en 28 pruebas; es un resultado de comprensión corporizada, no una tasa de éxito en tareas físicas.
Publicado porEditado con GPT-6 SolImágenes generadas con GPT Image 2
Respuesta de investigación

Create a landscape editorial hero image for this Studio Global article: What is DeepCybo’s open-source PhysBrain 1.5 physical foundation model, how do its 2B and 8B versions unify embodied understanding, action g. Article summary: PhysBrain 1.5 is DeepCybo’s open-weight attempt to put scene understanding, robot-action generation, and prediction of what happens next into one vision-language model. Its published 28-benchmark result is strong evidenc. Topic tags: general, academic, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, char
Un modelo puede describir dónde está un objeto, proponer cómo mover una pinza y anticipar qué se verá después. Eso no significa que la pinza haya completado la tarea. Esa distinción es clave para interpretar PhysBrain 1.5, el modelo de DeepCybo que reúne comprensión del entorno, generación de acciones y predicción de estados futuros. 1
9
10
Las versiones 2B y 8B parten de los correspondientes modelos de visión y lenguaje Qwen3-VL. En lugar de emplear módulos de salida distintos para cada tarea, PhysBrain 1.5 representa las respuestas lingüísticas o espaciales, el movimiento del extremo operativo del robot y los estados visuales futuros como secuencias de unidades discretas (tokens). Una misma arquitectura autorregresiva aprende a predecir la siguiente unidad. Las predicciones visuales abarcan imágenes RGB, profundidad e información sobre el espacio ocupado por el robot. 1
8
10
El formato común permite tratar una descripción de la escena, una trayectoria propuesta y una predicción de su resultado dentro del mismo modelo. Generar una trayectoria, sin embargo, no demuestra que un robot pueda ejecutarla con éxito. 1
8
DeepCybo describe dos etapas. Primero, preentrena el modelo con vídeos de interacciones humanas centrados en tareas, relacionando el contexto de cada escena con movimientos reconstruidos y observaciones posteriores. Después lo ajusta de forma supervisada con una mezcla de demostraciones humanas, trayectorias de robots y experiencias simuladas. Por tanto, decir que se entrenó solo con vídeos humanos deja fuera la segunda etapa. 1
12
Según DeepCybo, PhysBrain 1.5-8B obtuvo una media de 72,5 en 28 pruebas de comprensión corporizada: quedó primero entre los modelos abiertos incluidos en su comparación y logró el mejor resultado abierto en 14 pruebas individuales. La media comunicada para la versión 2B es 66,6. Las pruebas cubren percepción visual y espacial, comprensión 3D y desde varias perspectivas, razonamiento y planificación, identificación de objetos y posibilidades de interacción con ellos, y razonamiento sobre trayectorias visuales. 1
9
10
11
En la tabla publicada por DeepCybo, el 8B se acerca a los resultados atribuidos a los modelos propietarios GPT-6-Astra (73,3) y Gemini 3.6 Flash (73,0). Se trata de una comparación bajo la evaluación presentada por el proyecto: no es una clasificación independiente de todos los modelos disponibles ni una medida de tareas robóticas completadas. 1
18
DeepCybo ha publicado los pesos de las versiones 2B y 8B, junto con el informe técnico y recursos de evaluación. Esto permite a otros equipos inspeccionar los modelos e intentar reproducir los resultados. 1
9
10
11
Antes de tomar la media como referencia, conviene revisar los resultados de cada prueba, las condiciones de evaluación, el posible solapamiento entre datos de entrenamiento y pruebas, y si los modelos comparados se evaluaron en condiciones equivalentes. Para un despliegue, la comprobación decisiva es otra: ejecutar tareas en bucle cerrado —observando y ajustando las acciones durante la tarea— con el robot, los objetos y las condiciones previstos, y medir éxito, recuperación ante errores, latencia y seguridad. La puntuación publicada de comprensión no sustituye esas mediciones. 1
9
10
Studio Global AI
Esta página incluye una respuesta respaldada por fuentes que puede continuar dentro de Studio Global.
PhysBrain 1.5 utiliza una arquitectura autorregresiva para producir respuestas espaciales, movimientos del robot y predicciones del estado visual futuro.
PhysBrain 1.5 utiliza una arquitectura autorregresiva para producir respuestas espaciales, movimientos del robot y predicciones del estado visual futuro. DeepCybo informa de 72,5 puntos para la versión 8B en 28 pruebas; es un resultado de comprensión corporizada, no una tasa de éxito en tareas físicas.
Los pesos de las versiones 2B y 8B están disponibles. Antes de desplegarlas, conviene reproducir la evaluación y probarlas en el robot y el entorno previstos.