Zeva holder Cosmos3 baserede politikvægte frosne, men tilpasser robotten under drift ved at hente erfaringer om, hvad dens handlinger fysisk forårsagede. Systemet kombinerer en Causal Transition Encoder med en korttidshukommelse (BIT) og en vedvarende hukommelse på tværs af forsøg (PIM).
Udgivet afRedigeret med GPT-5.6 TerraBilleder genereret med GPT Image 2
Research answer

Create a landscape editorial hero image for this Studio Global article: What is Zeva, the frozen weight in context causal memory method introduced by Tsinghua AIR and Domain Transform for Cosmos3 backed embodied. Article summary: Zeva is a deployment time adaptation framework for embodied manipulation: it keeps the Cosmos3 based policy weights frozen, but lets the robot improve through an online memory of what its actions physically caused.. Topic tags: general web, llm, prompt engineering, ai, code. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with
Zeva er et rammeværk til robotmanipulation, der skal gøre en robot bedre under drift uden at opdatere dens modelvægte. I stedet for den gængse arbejdsgang med at indsamle data, mærke dem og finjustere modellen, gemmer systemet viden om sammenhængen mellem robotens handlinger og de observerede fysiske effekter. Den viden hentes frem som kontekst, når robotten skal vælge sin næste handling. 1
5
Det centrale forbehold er vigtigt: Zeva lærer i praktisk forstand af erfaring, men det er hukommelsesbaseret tilpasning i kontekst – ikke varig læring i selve modelparametrene.
Efter en handling kombinerer Zevas Causal Transition Encoder (CTE) visuelle observationer, handlingsdata og den observerede ændring i omgivelserne i en latent repræsentation af den kausale interaktion. Den opdeles blandt andet i et token for opgavens fase og et interaktionssignal. Målet er at fokusere på handlingsudløst fysisk dynamik frem for tilfældige visuelle sammenhænge som baggrund eller belysning. 1
4
Det er forskellen på blot at registrere, at en griber flyttede sig, og at repræsentere, om bevægelsen faktisk løftede et reagensglas, flyttede et bægerglas forkert eller begyndte en hældning.
Zeva deler erfaringerne op efter tidshorisont:
Opdelingen skal undgå, at øjeblikkelige signaler og mere genbrugelige erfaringer blandes ukritisk sammen.
Når robotten skal udføre næste trin, henter Zeva beviser fra hukommelsen, som matcher den aktuelle opgavefase. De omdannes til en kausal prompt og føres ind i handlingsgenereringen i den frosne basismodel. Politikken kan dermed ændre adfærd gennem den kontekst, den får præsenteret, uden gradientopdateringer eller ændringer af parametrene. 1
5
I princippet kan det spare den operationelle proces med nye labels, en træningskørsel, en ny modelversion og eventuel nedetid, når robotten møder en ukendt objektplacering eller fysisk egenskab. 1
6
På simulationsundersættet RoboCasa365-Atomic5, som rummer fem opgaver, rapporterer Zeva en gennemsnitlig succesrate på 76,8 %. Til sammenligning angives 72,4 % for Fast-WAM og 64,8 % for Cosmos3-Nano. 1
På fysiske ChemLab-Evo Level-1-opgaver med en ARX-robot rapporteres følgende udvikling over gentagne forsøg:
Den endelige Level-1-tabel angiver Zeva til 100 % / 70 % / 80 % på de tre opgaver, med et gennemsnit på 83,3 %. Cosmos3-Nano angives til 80 % / 70 % / 60 %, mens Fast-WAM angives til 85 % / 70 % / 75 %. 1
Et tal, der er blevet fremhævet i omtalen, er en kumulativ successtigning fra omtrent 26 % ved første udviklingsforsøg til 73 % ved det fjerde. Den primære dokumentation, der er stillet til rådighed, mærker dog kurven som RoboCasa365 – ikke ChemLab-Evo. Det er derfor ikke solidt belagt at tilskrive netop 26-til-73 %-kurven til ChemLab-Evo. 1
En enkelt fysisk guidet demonstration fra et menneske kan indlæses i den samme interaktionshukommelse som en slags opvarmning. Politikmodellen forbliver frossen, men kan siden bruge den kausale interaktionskontekst til at genskabe forløbet. 6
Det tilgængelige materiale bekræfter mekanismen kvalitativt, men giver ikke verificerede før-og-efter-tal specifikt for placering af bægerglas eller vandhældning. Den nøgterne konklusion er derfor, at en enkelt demonstration efter sigende kan forbedre eller varme op til opgaverne – ikke hvor stor den præcise gevinst er. 6
En nærliggende forklaring er, at en svagere fortrænet politik har mere plads til forbedring. Hvis den oftere fejler systematisk, når de fysiske forhold ændrer sig, kan de ekstra erfaringer om årsag og virkning rette flere fejl. En stærkere model klarer allerede flere situationer og har derfor færre fejl, som hukommelsesprompten kan eliminere.
Det er dog en fortolkning, ikke en universel lov. Det fremlagte arbejde dokumenterer sammenlignende resultater og forbedring under drift, men ikke, at svagere modeller altid vil få relativt større udbytte. 1
ChemLab-Evo er valgt, fordi laboratoriearbejde samler flere typer fysisk variation med betydning for resultatet: små beholdere, præcise placeringer, gribegeometri, hældning, væskeoverførsel og opgaver i flere trin. Benchmarken omfatter syv opgaver med ARX-manipulatoren – fra grundhandlinger som at tage et reagensglas, placere et bægerglas og hælde væske til procedurer som titrering, fremstilling af saltopløsning, vejning og ekstraktion. 1
Det gør miljøet egnet til at undersøge, om robotten kan overføre huskede relationer mellem handling og effekt, frem for alene at efterligne det visuelle indtryk af en tidligere demonstration.
Zeva er dermed mest interessant som et forsøg på at flytte en del af robotters tilpasning fra træningspipeline til selve driftstidspunktet. Men de nuværende resultater er rapporteret af projektet og forskningsartiklen selv; der foreligger ikke her en uafhængig replikation på tværs af længere tidshorisonter, flere robotplatforme og ukontrollerede driftsmiljøer. 1
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Zeva holder Cosmos3 baserede politikvægte frosne, men tilpasser robotten under drift ved at hente erfaringer om, hvad dens handlinger fysisk forårsagede.
Zeva holder Cosmos3 baserede politikvægte frosne, men tilpasser robotten under drift ved at hente erfaringer om, hvad dens handlinger fysisk forårsagede. Systemet kombinerer en Causal Transition Encoder med en korttidshukommelse (BIT) og en vedvarende hukommelse på tværs af forsøg (PIM).
Forskerne rapporterer 76,8 % gennemsnitlig succes i RoboCasa365 Atomic5 og forbedringer på tre fysiske ChemLab Evo opgaver, men resultaterne er endnu ikke uafhængigt replikeret.