Zeva адаптує робота під час виконання завдань без оновлення ваг моделі: замість донавчання вона додає до рішення контекст із пам’яті про наслідки попередніх дій. Архітектура поєднує причинний кодер переходів CTE, короткочасну пам’ять BIT для поточної спроби та постійну пам’ять PIM для досвіду між спробами в межах еп...
ОпублікувавВідредаговано за допомогою GPT-5.6 TerraЗображення створено за допомогою GPT Image 2
Research answer

Create a landscape editorial hero image for this Studio Global article: What is Zeva, the frozen weight in context causal memory method introduced by Tsinghua AIR and Domain Transform for Cosmos3 backed embodied. Article summary: Zeva is a deployment time adaptation framework for embodied manipulation: it keeps the Cosmos3 based policy weights frozen, but lets the robot improve through an online memory of what its actions physically caused.. Topic tags: general web, llm, prompt engineering, ai, code. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with
Zeva — це підхід до адаптації роботів-маніпуляторів під час розгортання, створений Tsinghua AIR спільно з Domain Transform. Його головна ідея проста: базова політика на основі Cosmos3 не змінює свої ваги, але робот може поліпшувати наступні дії, зберігаючи й витягуючи інформацію про те, до яких фізичних наслідків призвели його попередні рухи. 1
5
Тобто замість звичного циклу «зібрати дані → розмітити → донавчити модель → розгорнути нову версію» Zeva пристосовується на етапі інференсу — через контекст, що подається моделі перед генерацією чергової дії.
Після дії робот враховує візуальний стан, виконану дію та спостережувану зміну стану. Causal Transition Encoder (CTE) перетворює це на приховане подання причинної взаємодії: не просто «маніпулятор перемістився», а радше «на певному етапі завдання саме ця дія спричинила таку зміну об’єкта». 1
4
Подання розділяється на:
Zeva не зберігає весь досвід як один потік. Вона використовує два різні типи пам’яті:
Таке розділення потрібне, щоб не втратити оперативні сигнали поточної дії, але й не дозволити одиничному шумному епізоду безконтрольно визначати довший досвід.
Коли треба вибрати наступну дію, Zeva дістає з пам’яті причинні свідчення, що відповідають поточній фазі завдання. Із них формується causal prompt — контекст, який подається в шлях генерації дії замороженої базової політики. 1
5
Отже, поведінка робота змінюється не через градієнтне оновлення параметрів, а через новий контекст. Це справді форма навчання в практичному сенсі, однак ідеться про контекстну адаптацію на основі пам’яті, а не про стійке навчання ваг моделі.
Якщо робот зіткнувся з незвичним розташуванням предметів або іншими фізичними властивостями об’єкта, Zeva потенційно дозволяє пристосуватися без нової розмітки, запуску перенавчання, випуску іншої версії моделі та простою системи. 1
6
Але це не означає, що робот набуває необмеженого постійного досвіду: у поданому протоколі PIM зберігається в межах епізоду, а середовище між спробами скидається. 1
У п’ятизавданнєвому симуляційному наборі RoboCasa365-Atomic5 Zeva показала 76,8% середнього успіху. Для порівняння, Fast-WAM мав 72,4%, а Cosmos3-Nano — 64,8%. 1
Автори також наводять графік сукупного успіху, який зріс приблизно з 26% у першій спробі еволюції до 73% у четвертій. Водночас у доступному первинному матеріалі цей графік позначено як RoboCasa365, а не ChemLab-Evo. Тому відносити саме цю динаміку 26% → 73% до ChemLab-Evo на підставі наданих даних не варто. 1
На реальних завданнях рівня 1 у хімічному середовищі ChemLab-Evo, виконуваних маніпулятором ARX, результати за повторними спробами були такими:
У підсумковій таблиці Level-1 Zeva має 100% / 70% / 80% на цих трьох завданнях і 83,3% у середньому. Cosmos3-Nano показала 80% / 70% / 60%, а Fast-WAM — 85% / 70% / 75%. 1
Одну фізично керовану демонстрацію людини можна записати в той самий механізм пам’яті як стартовий приклад. Після цього заморожена політика використовує причинний контекст цієї взаємодії, щоб відтворювати послідовність дій. 6
Надані матеріали підтверджують сам механізм одноразового «розігріву» через демонстрацію, але не містять перевірених числових результатів «до/після» саме для встановлення склянки або наливання води. Коректніше сказати, що демонстрація, за повідомленням проєкту, допомагає ініціалізувати чи поліпшити виконання, але не заявляти конкретний розмір приросту. 6
Імовірне пояснення — запас для покращення. Слабша попередньо навчена політика частіше систематично помиляється, коли фізична конфігурація змінилася. Тому для неї більше можливостей виправити поведінку завдяки явним сигналам «дія → наслідок».
Сильніша базова модель від початку частіше виконує завдання правильно, отже, має менше помилок, які можна усунути контекстним причинним підказуванням. Це правдоподібна інтерпретація, але не доведений загальний закон: матеріали встановлюють порівняльні результати та покращення під час розгортання, а не універсальне правило для всіх моделей і роботів. 1
ChemLab-Evo обрано як середовище, де фізична варіативність має чіткі наслідки: геометрія захвату, дрібні ємності, точне встановлення, нахиляння під час наливання, багатокрокові процедури й помилки, які можна пов’язати з конкретною фізичною дією. 1
Бенчмарк охоплює сім завдань для маніпулятора ARX: від базових операцій із пробіркою, склянкою та водою до коротких послідовностей і довших процедур — титрування, приготування сольового розчину, зважування на вагах та екстракції. 1
Саме тому це зручний тест: він перевіряє, чи переносить робот між спробами й спорідненими навичками запам’ятовані зв’язки між дією та її ефектом, а не лише повторює візуальний шаблон.
Вартість контексту й інференсу. Пошук у пам’яті та додавання причинної підказки збільшують обчислювальні витрати. Довша історія може бути корисною лише до моменту, коли почнуть заважати затримка, якість добору контексту чи місткість контекстного вікна. Масштабування на дуже тривалі розгортання поки не показано. 1
Якість і «забруднення» пам’яті. Помилка в причинному кодуванні, невідповідність фази або оманливий результат невдалої спроби можуть призвести до вилучення шкідливого контексту. BIT і PIM зменшують цей ризик, але не гарантують безпечної консолідації пам’яті. 1
Обмежена фізична різноманітність. Реальні експерименти здебільшого стосуються жорстких лабораторних предметів і переливання рідини. Узагальнення на тканину, кабелі, їжу, м’яке паковання чи завдання з інтенсивним контактом, де потрібен тактильний або силовий зворотний зв’язок, лишається недоведеним. 1
Стабільність майданчика. У тестах середовище скидається між спробами. Це контрольований протокол, а не доказ нескінченної роботи в реальному об’єкті, де змінюються калібрування камер, зношення обладнання, освітлення, присутність людей і рівень безладу. 1
Перенесення між платформами. Реальне оцінювання проводили на конкретному маніпуляторі ARX у робочій зоні 80 × 60 см. Відкритим залишається питання, наскільки чисто кодер і механізм контекстного введення переноситимуться на інші руки, захвати, мобільних або дворуких роботів, інші сенсори, частоти керування та обмеження безпеки. 1
Широта класів завдань. Метод перевіряли на вибраних кухонних і хімічних операціях. Перенесення між функціонально подібними ефектами — наприклад, стисканням захвату, підніманням і нахилом ємності — виглядає перспективно. Проте перенесення на зовсім інші класи завдань і складні мовні інструкції ще потребує окремої перевірки. 1
Зрілість доказів. Це результати, заявлені в роботі та матеріалах проєкту, а не незалежна реплікація. Опис механізму переконливий, але надійність на довгих горизонтах, на різному обладнанні, із деформівними об’єктами та в неконтрольованих робочих середовищах ще належить підтвердити. 1
Zeva цікава не тим, що «вчить робота без навчання», а тим, що переносить адаптацію з ваг моделі до організованої пам’яті про фізичні наслідки дій. Це може зменшити тертя під час розгортання, але не скасовує потреби перевіряти безпеку, якість пам’яті та межі узагальнення в реальному середовищі.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Zeva адаптує робота під час виконання завдань без оновлення ваг моделі: замість донавчання вона додає до рішення контекст із пам’яті про наслідки попередніх дій.
Zeva адаптує робота під час виконання завдань без оновлення ваг моделі: замість донавчання вона додає до рішення контекст із пам’яті про наслідки попередніх дій. Архітектура поєднує причинний кодер переходів CTE, короткочасну пам’ять BIT для поточної спроби та постійну пам’ять PIM для досвіду між спробами в межах епізоду.
У симуляції RoboCasa365 Atomic5 Zeva повідомила про 76,8% середнього успіху; на реальному ChemLab Evo результати зростали для взяття пробірки, встановлення склянки та наливання води.