Zevaは、デプロイ時に方策モデルの重みを更新せず、ロボット自身の「行動→状態変化」の経験を記憶して次の操作を調整する手法です。[1][5] 因果遷移エンコーダ(CTE)、試行内の短期記憶BIT、試行をまたぐ持続記憶PIM、そして凍結方策への因果プロンプト注入で構成されます。[1] 報告値では、RoboCasa365 Atomic5で平均成功率76.8%、実機ChemLab Evoの基本3課題で試行を重ねるにつれ成功率が上昇しました。[1]
公開者GPT-5.6 Terra で編集GPT Image 2 で画像を生成
研究の答え

Create a landscape editorial hero image for this Studio Global article: What is Zeva, the frozen weight in context causal memory method introduced by Tsinghua AIR and Domain Transform for Cosmos3 backed embodied. Article summary: Zeva is a deployment time adaptation framework for embodied manipulation: it keeps the Cosmos3 based policy weights frozen, but lets the robot improve through an online memory of what its actions physically caused.. Topic tags: general web, llm, prompt engineering, ai, code. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with
Zevaは、ロボットの配備後の適応を目的とするフレームワークです。Cosmos3を基盤とする操作方策の重みは凍結したまま、ロボットが自分で行った行動と、その結果起きた状態変化をオンラインで記憶します。次の判断時には、その「行動が何を起こしたか」という因果的な文脈を取り出して方策に与えるため、収集・アノテーション・再学習という従来の反復サイクルなしで振る舞いを変えられる、という設計です。1
5
言い換えれば、Zevaはモデルのパラメータに経験を書き込むのではなく、推論時に参照する記憶で適応する方式です。これは恒久的な重み学習とは異なります。
各行動の後、CTE(Causal Transition Encoder)は視覚状態、実行した行動、観測された状態変化をまとめ、潜在的な「因果的相互作用」の表現へ符号化します。ここでは、タスクの進行段階を示すフェーズトークンと、行動に起因する物理的な変化を表そうとする相互作用シグナルを分けます。1
4
狙いは、背景や照明のような偶然の視覚的相関ではなく、「この把持・移動・傾きが、対象物をどう動かしたか」を捉えることです。例えば、単にアームが動いた事実ではなく、その動きで試験管を持ち上げられたのか、容器の傾きが注水につながったのかを、次の行動に役立つ証拠として扱います。1
4
Zevaの記憶は、役割の異なる2層に分かれます。1
この分離には実務的な意味があります。直近の出来事は即時の修正に使う一方、単発のノイズや偶然の失敗を、そのまま長期的な経験として固定しないようにするためです。ただし、この構成が誤った記憶の定着を完全に防ぐわけではありません。1
行動を生成する際、Zevaは現在のタスク段階に合う因果的な証拠をBITとPIMから検索し、因果プロンプトとして凍結済みの基盤方策の行動生成経路に注入します。1
5
その結果、勾配計算やパラメータ更新を行わなくても、方策は与えられた文脈に応じて行動を変えられます。未知の物体配置や想定外の物理的挙動に出会ったとき、ラベル付け、新しい学習ジョブ、モデルの再版、運転停止を必ずしも必要としない点が、配備運用上の利点です。1
6
論文・プロジェクトが報告した主な数値は次の通りです。いずれも現時点では著者側による評価結果であり、独立した追試結果ではありません。1
なお、「累積成功率が初回のおよそ26%から4回目に73%へ上がった」という図について、一次資料でのラベルはRoboCasa365です。これをChemLab-Evoの結果とする根拠は、提供された一次資料からは確認できません。そのため、26%から73%への上昇をChemLab-Evoに帰属させることは避けるべきです。1
Zevaでは、人が物理的に誘導した1回の実演ロールアウトも、同じ相互作用記憶の仕組みに記録し、ウォームスタートとして利用できます。方策の重みはそのままで、後続の行動時に実演で得た因果的文脈を参照して系列を再現しようとします。6
提供された根拠は、このワンショットのウォームアップ機構を定性的に裏付けています。一方、ビーカー配置や注水について、実演の前後でどれほど改善したかという検証済みの数値は示されていません。したがって、言えるのは「これらの課題を改善・ウォームスタートする仕組みが報告された」までであり、特定の改善幅を断定することはできません。6
もっとも自然な説明は、改善余地の差です。事前学習済み方策が物理環境の変化に対して系統的な失敗を多く起こすほど、失敗・成功から抽出した明示的な相互作用証拠で修正できる余地は大きくなります。もともと高い成功率を持つ強い方策では、修正できる誤差が少ないため、上積みも小さくなりやすいと考えられます。
ただし、これはもっともらしい解釈であって、「弱いモデルほど常に大きく改善する」という一般法則が示されたわけではありません。一次資料が示すのは比較タスクにおける成績と、配備時の改善です。1
ChemLab-Evoは、把持形状、小さな容器の位置決め、傾ける角度、液体の移し替え、複数段階の手順など、物理的な差異が結果に直結する操作を含みます。失敗も「何が起きたか」という物理的効果から診断しやすく、視覚的な模倣ではなく、記憶した行動と結果の関係が別の試行・技能へ移るかを試す場として適しています。1
このベンチマークはARXマニピュレータによる7課題で構成され、試験管のピックアップ、ビーカー配置、注水といった基本操作から、滴定、食塩水の調製、天秤による計量、抽出といったより長い手順へ進みます。1
Zevaの重要点は、「ロボットを現場で再訓練する」代わりに、「直前と過去の試行で得た行動結果の因果的な証拠を、次の推論に持ち込む」ことにあります。実用化を判断するには、より長期の運用、多様なハードウェア、変形物、非統制環境での独立検証が次の焦点になります。1
Studio Global AI
このページにはソースに裏付けされた回答が含まれており、Studio Global 内で続行できます。
Zevaは、デプロイ時に方策モデルの重みを更新せず、ロボット自身の「行動→状態変化」の経験を記憶して次の操作を調整する手法です。[1][5]
Zevaは、デプロイ時に方策モデルの重みを更新せず、ロボット自身の「行動→状態変化」の経験を記憶して次の操作を調整する手法です。[1][5] 因果遷移エンコーダ(CTE)、試行内の短期記憶BIT、試行をまたぐ持続記憶PIM、そして凍結方策への因果プロンプト注入で構成されます。[1]
報告値では、RoboCasa365 Atomic5で平均成功率76.8%、実機ChemLab Evoの基本3課題で試行を重ねるにつれ成功率が上昇しました。[1]