Zeva upravuje chování robota během nasazení pomocí paměti následků akcí, nikoli dalším trénováním či změnou vah politiky Cosmos3. Kauzální přechodový enkodér, krátkodobá stopa BIT a trvalejší paměť PIM dodávají zmrazené politice relevantní kontext pro další krok.
PublikovalUpraveno pomocí GPT-5.6 TerraObrázky vytvořeny pomocí GPT Image 2
Research answer

Create a landscape editorial hero image for this Studio Global article: What is Zeva, the frozen weight in context causal memory method introduced by Tsinghua AIR and Domain Transform for Cosmos3 backed embodied. Article summary: Zeva is a deployment time adaptation framework for embodied manipulation: it keeps the Cosmos3 based policy weights frozen, but lets the robot improve through an online memory of what its actions physically caused.. Topic tags: general web, llm, prompt engineering, ai, code. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with
Zeva je rámec pro adaptaci robotické manipulace přímo při nasazení. Politika založená na Cosmos3 si nemění váhy, přesto může po interakci upravit další postup: robot si ukládá, co jeho akce ve fyzickém světě způsobila, a tuto zkušenost při dalším rozhodování vloží do kontextu modelu. Místo cyklu „nasbírat data – opatřit je štítky – dotrénovat“ tedy používá paměťovou adaptaci během inference. 1
5
Systém stojí na třech navazujících částech:
Causal Transition Encoder (CTE), tedy enkodér kauzálních přechodů: Po každé akci spojí vizuální stav, provedenou akci a pozorovanou změnu stavu do latentní reprezentace interakce. Rozděluje ji na token fáze úkolu a signál interakce, který má zachytit dynamiku vyvolanou akcí, nikoli jen náhodné vizuální souvislosti typu pozadí či osvětlení. 1
4
Paměť na dvou časových škálách:
Vložení kontextu do politiky: Zeva z obou pamětí vyhledá důkazy odpovídající aktuální fázi úkolu, vytvoří z nich kauzální prompt a vloží jej do cesty, která generuje akci zmrazené základní politiky. Chování se proto může změnit bez gradientového kroku a bez aktualizace parametrů. 1
5
Prakticky to může zkrátit reakci na neznámou konfiguraci objektů či odlišné fyzikální chování: není nutné vytvářet nové popisky, spouštět přetrénování, vydávat novou verzi modelu ani zařízení odstavovat. Nejde však o trvalé učení do vah modelu, nýbrž o kontextovou adaptaci založenou na paměti. 1
6
Na pětici simulačních úloh RoboCasa365-Atomic5 dosáhla Zeva podle autorů průměrné úspěšnosti 76,8 %. Fast-WAM dosáhl 72,4 % a Cosmos3-Nano 64,8 %. 1
V reálných úlohách ChemLab-Evo Level 1 s manipulátorem ARX autoři uvádějí postupné zlepšování při opakovaných pokusech:
Závěrečná tabulka pro tyto tři úlohy uvádí pro Zevu hodnoty 100 % / 70 % / 80 %, tedy průměr 83,3 %. Cosmos3-Nano dosáhl 80 % / 70 % / 60 % a Fast-WAM 85 % / 70 % / 75 %. 1
Často citovaný růst souhrnné úspěšnosti zhruba z 26 % při prvním evolučním pokusu na 73 % při čtvrtém je v dostupném primárním materiálu označen jako graf pro RoboCasa365, nikoli pro ChemLab-Evo. Připsat tuto konkrétní křivku přímo ChemLab-Evo proto dostupné primární podklady nepotvrzují. 1
Jednu fyzicky vedenou lidskou demonstraci lze uložit do stejného mechanismu interakční paměti jako počáteční zkušenost. Politika zůstává zmrazená a později může využít tento kauzální kontext k opakování dané sekvence. 6
Dodané podklady potvrzují kvalitativní mechanismus „one-shot“ zahřátí, nikoli ověřené číselné výsledky před a po demonstraci konkrétně pro pokládání kádinky a nalévání. Je tedy namístě říci, že demonstrace měla tyto úlohy nastartovat či zlepšit, ne však uvádět přesný, nepodložený nárůst. 6
Nejpravděpodobnějším vysvětlením je větší prostor pro zlepšení. Slabší předtrénovaná politika častěji dělá systematické chyby při změně fyzické situace, takže z explicitní zpětné vazby „akce → následek“ může vytěžit více. Silnější model už naproti tomu více situací zvládne napoprvé, a zbývá mu proto méně chyb, které lze takovým kontextem odstranit.
Jde ale o rozumnou interpretaci, ne o obecně prokázaný zákon. Primární materiál ukazuje srovnávací výsledky a zlepšení při nasazení, nikoli univerzální pravidlo, že slabší politiky vždy získají více. 1
Prostředí ChemLab-Evo je vhodné proto, že laboratorní manipulace kombinuje řadu důležitých fyzických proměnných: geometrii úchopu, malé nádoby, přesné pokládání, naklánění a přelévání, vícekrokové postupy i chyby, které lze číst z jejich fyzických následků. Benchmark zahrnuje sedm úloh pro manipulátor ARX — od základních dovedností, jako je zvednutí zkumavky, položení kádinky a nalévání, po kratší sekvence a delší procedury včetně titrace, přípravy solného roztoku, vážení na laboratorních vahách a extrakce. 1
Je to proto užitečný test, zda se mezi pokusy a příbuznými dovednostmi přenáší zapamatovaný vztah mezi akcí a efektem, a ne pouze vizuální napodobení.
Náklady na kontext a inferenci: Vyhledávání v paměti a vkládání kauzálního promptu přidává výpočetní nároky i práci s kontextem. Delší historie nemusí pomáhat neomezeně — limitem se může stát kvalita vyhledání, odezva nebo velikost kontextu. Dodané výsledky neprokazují škálování na velmi dlouhé nasazení. 1
Kvalita a možné znečištění paměti: Chybné zakódování kauzálního vztahu, špatné přiřazení fáze úkolu či zavádějící neúspěšný pokus mohou vést k vyzvednutí škodlivé zkušenosti. Oddělení BIT a PIM toto riziko omezuje, ale nezaručuje bezpečnou konsolidaci paměti. 1
Omezený rozsah ověřené fyziky: Reálné testy se soustředí hlavně na tuhé laboratorní objekty a přelévání kapaliny. Přenos na vysoce deformovatelné materiály — látku, kabely, potraviny nebo měkké obaly — či na úlohy s intenzivním kontaktem a potřebou silové nebo hmatové zpětné vazby zatím prokázán není. 1
Stabilita pracoviště: Evaluace mezi pokusy resetuje prostředí a PIM zachovává v rámci jedné epizody. To je kontrolovaný protokol, nikoli demonstrace dlouhodobého provozu v nepřetržitě se měnícím provozu s odchylkami kamerové kalibrace, opotřebením, lidmi, nepořádkem a pravidly pro správu dlouhodobé paměti. 1
Přenos mezi roboty a hardwarem: Reálné hodnocení používá manipulátor ARX ve specifickém pracovním prostoru 80 × 60 cm. Otevřená zůstává otázka, zda se enkodér a způsob vkládání promptu přenesou bez problémů na jiná ramena, chapadla, mobilní manipulátory, bimanualní systémy, odlišné senzory, řídicí frekvence a bezpečnostní omezení. 1
Šířka typů úloh: Metoda byla testována na vybraných kuchyňských a chemických úlohách. Přenos mezi funkčně podobnými efekty — například sevřením úchopu, zvednutím a nakláněním nádoby — je slibný. Široký přenos mezi nesouvisejícími třídami úkolů a instrukcemi v přirozeném jazyce však zůstává otevřenou empirickou otázkou. 1
Zralost důkazů: Jde o výsledky uváděné v článku a projektem, nikoli o nezávislou replikaci. Popis mechanismu je podložený, odolnost při dlouhém provozu, na širším spektru hardwaru, deformovatelných objektech a nekontrolovaných pracovištích ale vyžaduje další ověření. 1
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Zeva upravuje chování robota během nasazení pomocí paměti následků akcí, nikoli dalším trénováním či změnou vah politiky Cosmos3.
Zeva upravuje chování robota během nasazení pomocí paměti následků akcí, nikoli dalším trénováním či změnou vah politiky Cosmos3. Kauzální přechodový enkodér, krátkodobá stopa BIT a trvalejší paměť PIM dodávají zmrazené politice relevantní kontext pro další krok.
Autoři uvádějí 76,8% průměrnou úspěšnost v RoboCasa365 Atomic5 a zlepšení tří reálných laboratorních úloh v ChemLab Evo; širší provozní generalizace však zatím prokázána není.