HOST y GEN-1.5: robots que aprenden nuevas habilidades viendo un solo vídeo
HOST, desarrollado por investigadores de Beijing Institute of Technology, X Square Robot y Tsinghua University, adquiere habilidades en unos 29 segundos y alcanzó un 62 % de éxito medio en 50 tareas nuevas. GEN 1.5, de Generalist AI, utiliza una demostración de entre 3 y 12 segundos como una «instrucción física» den...
HOST, desarrollado por investigadores de Beijing Institute of Technology, X Square Robot y Tsinghua University, adquiere habilidades en unos 29 segundos y alcanzó un 62 % de éxito medio en 50 tareas nuevas.
GEN 1.5, de Generalist AI, utiliza una demostración de entre 3 y 12 segundos como una «instrucción física» dentro del contexto del modelo, sin gradientes ni ajuste fino en su modalidad de un solo ejemplo.
Los resultados respaldan el aprendizaje por observación, pero no equivalen a aprender desde cero: ambos sistemas dependen de un preentrenamiento amplio, y las pruebas de GEN 1.5 aún cuentan con una validación independ...
How do the two research efforts, HOST from Beijing Institute of Technology, X Square Robot, and Tsinghua University and GEN 1.5 from GeneralAI-generated editorial hero image for How do the two research efforts, HOST from Beijing Institute of Technology, X Square Robot, and Tsinghua University and GEN 1.5 from General.
Prompt de IA
Create a landscape editorial hero image for this Studio Global article: How do the two research efforts, HOST from Beijing Institute of Technology, X Square Robot, and Tsinghua University and GEN 1.5 from General. Article summary: Both efforts move robot learning from task specific retraining toward inference time imitation: a pretrained system treats a brief demonstration as context and immediately controls the robot accordingly.. Topic tags: general web, ai safety, prompt engineering, ai, workflow. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with
openai.com
La robótica lleva décadas funcionando con una lógica costosa: definir una tarea concreta, recopilar demostraciones del robot y ajustar el modelo hasta que aprenda a repetirla. HOST y GEN-1.5 proponen otra vía: un sistema previamente entrenado recibe un vídeo breve como contexto y utiliza esa información para ejecutar una habilidad nueva en el momento, sin un reentrenamiento convencional.
La diferencia es importante. Estos robots no aprenden sin experiencia previa; reutilizan conocimientos físicos adquiridos durante un preentrenamiento a gran escala. El vídeo humano aporta el objetivo y la secuencia concreta que deben intentar reproducir.
Comparación rápida
Característica
HOST
GEN-1.5
Mecanismo principal
Política de imitación visual de un solo ejemplo. Vincula la ejecución del robot con el progreso observado en el vídeo y utiliza predicciones desde la perspectiva del propio robot para decidir las acciones.
Modelo fundacional multimodal para robótica. Trata la demostración sensoriomotora como una «instrucción física» dentro del contexto y genera acciones para el robot.
Entradas y salidas
Vídeo humano, instrucción lingüística, observaciones recientes del robot y datos propioceptivos —información sobre la posición y el estado de sus articulaciones—. Produce acciones sin actualizar los parámetros del modelo.
Hasta 30 segundos de memoria de vídeo, además de datos de sensores, lenguaje y propiocepción. Genera trayectorias de acción a 100 Hz.
Base de entrenamiento
Dos etapas: preentrenamiento con 193.462 trayectorias robóticas en 229 tareas y adaptación con 5.847 pares recopilados por el propio sistema de vídeo humano y trayectoria robótica.
Studio Global AI
Continúe su investigación
Esta página incluye una respuesta respaldada por fuentes que puede continuar dentro de Studio Global.
¿Cuál es la respuesta corta a "HOST y GEN-1.5: robots que aprenden nuevas habilidades viendo un solo vídeo"?
HOST, desarrollado por investigadores de Beijing Institute of Technology, X Square Robot y Tsinghua University, adquiere habilidades en unos 29 segundos y alcanzó un 62 % de éxito medio en 50 tareas nuevas.
¿Cuáles son los puntos clave a validar primero?
HOST, desarrollado por investigadores de Beijing Institute of Technology, X Square Robot y Tsinghua University, adquiere habilidades en unos 29 segundos y alcanzó un 62 % de éxito medio en 50 tareas nuevas. GEN 1.5, de Generalist AI, utiliza una demostración de entre 3 y 12 segundos como una «instrucción física» dentro del contexto del modelo, sin gradientes ni ajuste fino en su modalidad de un solo ejemplo.
¿Qué debo hacer a continuación en la práctica?
Los resultados respaldan el aprendizaje por observación, pero no equivalen a aprender desde cero: ambos sistemas dependen de un preentrenamiento amplio, y las pruebas de GEN 1.5 aún cuentan con una validación independ...
Generalist AI afirma que lo entrenó durante más de ocho meses con datos de interacción física real y sin datos de simulación en el preentrenamiento.
Duración de la demostración
Unos 29 segundos de media para adquirir una habilidad.
Entre 3 y 12 segundos, según la empresa.
¿Hay reentrenamiento convencional?
No durante la adquisición: no se realiza una actualización específica de los parámetros para la tarea.
No en el modo de un solo ejemplo: la empresa afirma que no requiere gradientes ni ajuste fino.
Cobertura de tareas
50 tareas nuevas de manipulación, con distintos objetos, herramientas y movimientos básicos; se realizaron 20 pruebas por tarea.
Las demostraciones públicas incluyen abrir un tarro, abrir una bolsa con cremallera, barrer un objeto hasta un cuenco, introducir un rotulador en un vaso, verter tornillos y usar herramientas. No existe un conjunto de pruebas público con el mismo nivel de detalle.
Éxito
62 % de media en las tareas nuevas.
La empresa ha comunicado un 59 % de éxito medio en 10 tareas diversas con aprendizaje a partir de un solo ejemplo, pero no hay una validación independiente comparable.
Comparación o adaptación adicional
Según los autores, supera en un 45 % a la línea base de imitación sin ejemplos específicos y también aventaja al ajuste supervisado con 50 demostraciones robóticas por tarea.
Cuando la instrucción de un solo ejemplo no basta, Generalist AI afirma que puede adaptar el modelo con entre 1 y 10 pasos de gradiente usando entre 1 y 5 minutos de datos, aproximadamente entre 10 y 50 demostraciones.
Ganancia de eficiencia
La adquisición sería unas 507 veces más rápida que el ajuste supervisado con 50 demostraciones robóticas por tarea.
La empresa contrapone sus 3–12 segundos de indicación a entrenamientos convencionales de decenas de miles de pasos. Esta comparación todavía no ha sido verificada mediante una evaluación independiente equivalente.
Cómo funciona HOST
HOST —siglas en inglés de Human-to-robot One-Shot Skill AcquisiTion— no intenta convertir directamente cada movimiento de la mano humana en una trayectoria idéntica para el robot. En su lugar, emplea el vídeo como una referencia condicionada por el progreso de la tarea.
El sistema estima en qué fase de la demostración se encuentra, observa el estado actual del robot y predice cómo debería verse el resultado desde la perspectiva del robot. A partir de esa predicción, calcula las acciones necesarias para avanzar. Esto permite que el robot no dependa de que su cuerpo, cámara o entorno sean idénticos a los de la persona que aparece en el vídeo.
El resultado ofrece la evidencia académica más concreta de los dos enfoques. En 50 tareas de manipulación no vistas durante el entrenamiento, HOST obtuvo un 62 % de éxito medio, con 20 intentos por tarea. Las pruebas incluían diferentes objetos, herramientas y tipos de movimiento.
El sistema también conservó buena parte de ese rendimiento ante variaciones de iluminación, objetos, escena e interferencias humanas. Las pérdidas comunicadas fueron del 1 %, 4 %, 6 % y 9 %, respectivamente, frente a su referencia del 62 %.
Aun así, un 62 % deja claro que la técnica está lejos de ser infalible. Puede adquirir una habilidad con rapidez, pero todavía no garantiza una ejecución fiable en cualquier entorno o ante cualquier tarea.
Qué aporta GEN-1.5
GEN-1.5 aborda el problema desde la perspectiva de un modelo fundacional físico: un sistema multimodal entrenado con una gran cantidad de experiencia de interacción. La demostración se introduce en una ventana de contexto, como una instrucción temporal, en vez de transformarse en una nueva política entrenada específicamente para esa tarea.
Según Generalist AI, una demostración de entre 3 y 12 segundos puede bastar para que el modelo intente abrir un tarro, abrir una bolsa, barrer un objeto hasta un recipiente o ejecutar otras manipulaciones breves. La compañía también afirma capacidades de imitación de humano a robot, combinación de comportamientos indicados por separado, transferencia de vídeos de simulación al mundo físico y uso improvisado de herramientas.
El modelo ofrece además una segunda vía. Si la indicación de un solo ejemplo no funciona, puede realizar una adaptación de pocos ejemplos mediante entre 1 y 10 pasos de gradiente con unos minutos de datos. Por tanto, «sin entrenamiento» describe el modo de una sola demostración, no todos los escenarios de uso de GEN-1.5.
La empresa informa de un 59 % de éxito medio en 10 tareas diversas con un solo ejemplo, pero las tareas son breves y sencillas, y los detalles públicos no permiten compararlas directamente con la evaluación de HOST.
El cambio de paradigma: enseñar mostrando
La importancia de estos trabajos va más allá de sus porcentajes. Ambos apuntan a una interfaz de enseñanza más cercana a la humana: mostrar una acción en lugar de programar cada paso, diseñar una función de recompensa o recopilar cientos de demostraciones del propio robot.
La demostración cumple varias funciones a la vez. Indica qué objeto manipular, cuál es el objetivo, qué procedimiento seguir y qué interacciones son relevantes. El modelo preentrenado aporta el conocimiento físico general; el vídeo especifica la nueva situación.
Por eso, la eficiencia anunciada no significa que el robot aprenda desde cero en unos segundos. El coste se desplaza hacia el preentrenamiento, que se realiza antes y se amortiza entre muchas tareas. Para el usuario final, la promesa es sustituir una larga fase de optimización específica por una breve observación. HOST expresa esa ventaja con sus 29 segundos de adquisición y su aumento de velocidad declarado de 507 veces.
Límites que conviene tener presentes
HOST procede de una evaluación controlada. Es un trabajo académico en formato de prepublicación, probado en 50 tareas seleccionadas y con un 62 % de éxito medio. Todavía no demuestra fiabilidad general en hogares, fábricas, tareas largas, situaciones críticas o entornos no controlados.
La evidencia de GEN-1.5 es más difícil de auditar. Las afirmaciones sobre el modelo, los ocho meses de entrenamiento, la ausencia de datos de simulación, la duración de las demostraciones y la adaptación proceden principalmente de Generalist AI o de anuncios relacionados con la empresa.
No hay un punto de comparación público equivalente. Para GEN-1.5 no se dispone de un protocolo independiente estandarizado con el mismo número de tareas, número de intentos, líneas base, publicación de modelo y datos, o reproducción por terceros. Sus demostraciones son indicios de capacidad, pero todavía no establecen una frontera de rendimiento verificada.
En conjunto, HOST aporta evidencia de que un robot puede adquirir, durante la inferencia y sin cambiar sus parámetros, habilidades nuevas a partir de un único vídeo humano dentro de un conjunto definido de tareas. GEN-1.5 sugiere que un preentrenamiento físico suficientemente amplio puede convertir ese comportamiento en una capacidad emergente de un modelo generalista.
La dirección es prometedora, pero la conclusión debe ser prudente: el aprendizaje robótico por observación está avanzando, aunque todavía no sustituye la validación específica de cada tarea, la ingeniería de seguridad ni la adaptación necesaria en entornos abiertos.