Zeva es un marco de adaptación en despliegue: mantiene congelados los pesos de la política basada en Cosmos3 y usa una memoria de las relaciones entre acciones y efectos físicos para modificar las decisiones posteriores. Su codificador causal, las memorias BIT y PIM y la inyección de contexto permiten aprovechar int...
Publicado porEditado con GPT-5.6 TerraImágenes generadas con GPT Image 2
Respuesta de investigación

Create a landscape editorial hero image for this Studio Global article: What is Zeva, the frozen weight in context causal memory method introduced by Tsinghua AIR and Domain Transform for Cosmos3 backed embodied. Article summary: Zeva is a deployment time adaptation framework for embodied manipulation: it keeps the Cosmos3 based policy weights frozen, but lets the robot improve through an online memory of what its actions physically caused.. Topic tags: general web, llm, prompt engineering, ai, code. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with
Zeva es un marco de adaptación para robots manipuladores durante el despliegue. Su idea central es sencilla: la política basada en Cosmos3 mantiene sus pesos congelados, pero el robot puede cambiar su conducta porque recuerda qué efecto físico tuvieron sus acciones anteriores. En vez de repetir el ciclo habitual de recopilar datos, etiquetarlos y reentrenar el modelo, recupera ese contexto causal en el momento de inferencia. 1
5
Zeva denomina a este enfoque In-Context Causal Learning (ICCL), o aprendizaje causal en contexto. No es aprendizaje permanente en los pesos de la red: es una adaptación basada en memoria que opera mientras el robot ejecuta la tarea.
El sistema se apoya en tres piezas:
Causal Transition Encoder (CTE), o codificador de transiciones causales. Tras cada acción, combina el estado visual, la acción ejecutada y el cambio observado en el entorno. A partir de ello genera una representación de interacción causal: por un lado, un indicador de la fase de la tarea; por otro, una señal sobre la dinámica provocada por la acción. El objetivo es centrarse en relaciones como «cerrar la pinza y levantar el objeto» y no en correlaciones accidentales, como la iluminación o el fondo. 1
4
Memoria causal de dos escalas temporales. La Brief Interaction Trace (BIT) conserva la evidencia reciente del intento actual. Sirve, por ejemplo, para que el robot reaccione a un error que acaba de producirse. La Persistent Interaction Memory (PIM) conserva y consolida evidencia relevante entre intentos repetidos dentro del mismo episodio, de modo que los aciertos y fallos anteriores influyan en el siguiente reintento. 1
Inyección de la política en contexto. Zeva busca en esas memorias evidencias causales que coincidan con la fase actual de la tarea y las convierte en un prompt causal que se inserta en la ruta de generación de acciones de la política congelada. Así, la política puede variar su respuesta sin aplicar gradientes ni modificar parámetros. 1
5
En términos operativos, esto puede acortar la adaptación ante un objeto, una configuración o un comportamiento físico no previsto: no exige nuevas etiquetas, una ejecución de entrenamiento, una nueva versión del modelo ni una parada para reentrenar. Aun así, conviene distinguirlo del aprendizaje de pesos: Zeva se adapta mediante memoria y contexto, no mediante una actualización duradera de sus parámetros. 1
6
En la simulación RoboCasa365-Atomic5, un subconjunto de cinco tareas, Zeva informó de un 76,8% de éxito medio, frente al 72,4% de Fast-WAM y al 64,8% de Cosmos3-Nano. 1
El proyecto también muestra un aumento de éxito acumulado de aproximadamente 26% en el primer intento de evolución a 73% en el cuarto. Sin embargo, el material primario disponible identifica esa gráfica como correspondiente a RoboCasa365, no a ChemLab-Evo. Por tanto, no queda respaldado atribuir específicamente la curva del 26% al 73% a ChemLab-Evo. 1
En ChemLab-Evo, con un robot ARX real y tareas de nivel 1, los resultados reportados a través de intentos repetidos fueron:
La tabla final de ChemLab-Evo nivel 1 sitúa a Zeva en 100% / 70% / 80% en esas tres tareas, con un 83,3% de media. Cosmos3-Nano obtuvo 80% / 70% / 60%, y Fast-WAM, 85% / 70% / 75%. 1
Una única secuencia guiada físicamente por una persona puede registrarse en la misma memoria de interacción como punto de partida. La política sigue congelada, pero después utiliza ese contexto causal para reproducir la secuencia. 6
La evidencia aportada confirma este mecanismo de calentamiento o warm-up con una demostración, pero no aporta cifras verificadas de mejora antes y después específicamente para colocar el vaso de precipitados o verter agua. La conclusión prudente es que la demostración puede impulsar o inicializar esas tareas, no cuantificar una ganancia concreta. 6
La explicación más razonable es el margen de mejora. Una política preentrenada menos capaz cometerá más errores sistemáticos al enfrentarse a una configuración física distinta; por ello, la evidencia correctiva guardada en la memoria puede tener más errores que corregir. Una base más fuerte ya parte de una mayor tasa de acierto y deja menos margen recuperable.
No obstante, esto debe tratarse como una interpretación plausible, no como una ley general demostrada: la evidencia principal compara resultados en tareas concretas y muestra mejora durante el despliegue, pero no prueba que los modelos más débiles siempre se beneficien más. 1
ChemLab-Evo plantea variaciones físicas estructuradas y relevantes para la manipulación: geometrías de agarre, recipientes pequeños, precisión al colocar objetos, inclinación y vertido, procedimientos de varios pasos y fallos que pueden interpretarse por sus efectos físicos. El banco incluye siete tareas con un manipulador ARX, desde acciones elementales —recoger un tubo, colocar un vaso de precipitados y verter— hasta secuencias y procedimientos más largos, como una titulación, preparar una solución salina, pesar en una balanza y realizar una extracción. 1
Por ello, es un entorno útil para comprobar si el robot transfiere relaciones entre acción y efecto, y no solo imita patrones visuales entre intentos o habilidades relacionadas.
Más contexto implica más coste de inferencia. Recuperar memoria e inyectar el prompt causal añade cómputo y procesamiento de contexto. Los historiales extensos podrían ayudar solo hasta que la calidad de recuperación, la latencia o la capacidad de contexto se conviertan en un límite. Los resultados disponibles no establecen cómo escala el método en despliegues muy prolongados. 1
La memoria puede incorporar evidencia engañosa. Una codificación causal incorrecta, una coincidencia deficiente de fase o un intento fallido mal interpretado podrían recuperar información perjudicial. Separar BIT y PIM reduce ese riesgo, pero no garantiza una consolidación segura de la memoria. 1
Alcance físico aún limitado. Las pruebas reales se concentran sobre todo en objetos rígidos de laboratorio y transferencia de líquidos. Falta demostrar la generalización a materiales muy deformables —telas, cables, alimentos o envases blandos— y a tareas de contacto intenso que requieran fuerza o tacto. 1
Protocolo controlado, no operación indefinida. La evaluación reinicia el entorno entre intentos y mantiene la PIM dentro de un episodio. Eso no demuestra funcionamiento sostenido en una instalación cambiante, con variaciones de calibración de cámara, desgaste, personas, desorden o reglas de gestión de memoria a largo plazo. 1
Transferencia entre robots y hardware. La evaluación real utiliza un manipulador ARX en un espacio de trabajo específico de 80 × 60 cm. Queda por comprobar si el codificador y la inyección de contexto se trasladan limpiamente a otros brazos, pinzas, robots móviles, sistemas bimanuales, sensores, frecuencias de control y requisitos de seguridad. 1
Transferencia entre familias de tareas. El método se evaluó en un conjunto seleccionado de tareas de cocina y química. La transferencia entre efectos funcionalmente similares —cerrar una pinza, elevar un objeto o inclinar un recipiente— es prometedora, pero la transferencia amplia a clases de tareas no relacionadas e instrucciones semánticas sigue siendo una cuestión empírica abierta. 1
Madurez de la evidencia. Son resultados comunicados por el artículo y el proyecto, no una réplica independiente. La descripción del método está respaldada por la investigación disponible, pero su robustez en horizontes largos, con más hardware, materiales deformables y entornos de producción poco controlados necesita más validación. 1
Studio Global AI
Esta página incluye una respuesta respaldada por fuentes que puede continuar dentro de Studio Global.
Zeva es un marco de adaptación en despliegue: mantiene congelados los pesos de la política basada en Cosmos3 y usa una memoria de las relaciones entre acciones y efectos físicos para modificar las decisiones posteriores.
Zeva es un marco de adaptación en despliegue: mantiene congelados los pesos de la política basada en Cosmos3 y usa una memoria de las relaciones entre acciones y efectos físicos para modificar las decisiones posteriores. Su codificador causal, las memorias BIT y PIM y la inyección de contexto permiten aprovechar intentos fallidos o exitosos sin recopilar etiquetas ni ejecutar un ciclo de ajuste fino.
En RoboCasa365 Atomic5 informó un 76,8% de éxito medio; en tareas reales de ChemLab Evo, la recogida de tubos, la colocación de vasos de precipitados y el vertido de agua mejoraron a lo largo de varios intentos.