Zeva는 배포 중 정책 가중치를 업데이트하지 않고, 로봇의 행동과 그 결과 사이의 인과적 상호작용을 메모리로 축적해 추론 시점에 활용한다. 최근 시도용 BIT와 반복 시도 간 경험을 축적하는 PIM을 분리하고, 현재 작업 단계에 맞는 정보를 꺼내 동결된 정책에 주입한다.
게시자GPT-5.6 Terra로 편집GPT Image 2로 이미지 생성
연구 답변

Create a landscape editorial hero image for this Studio Global article: What is Zeva, the frozen weight in context causal memory method introduced by Tsinghua AIR and Domain Transform for Cosmos3 backed embodied. Article summary: Zeva is a deployment time adaptation framework for embodied manipulation: it keeps the Cosmos3 based policy weights frozen, but lets the robot improve through an online memory of what its actions physically caused.. Topic tags: general web, llm, prompt engineering, ai, code. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with
Zeva는 로봇 조작을 위한 배포 시점 적응 프레임워크다. Cosmos3 기반 정책 모델의 가중치를 배포 뒤에도 고정한 채, 로봇이 실행한 행동이 실제 환경에 일으킨 변화를 온라인 메모리에 기록하고 다음 행동을 만들 때 그 정보를 활용한다. 즉, 낯선 물체 배치나 물리적 특성에 부딪힐 때마다 데이터를 모으고 라벨링한 뒤 파인튜닝하는 대신, 추론 문맥을 바꾸는 방식으로 적응한다. 1
5
여기서 중요한 점은 이것이 영구적인 파라미터 학습은 아니라는 것이다. 로봇은 가중치에 새 지식을 새겨 넣지 않고, 현재 에피소드에서 쌓인 기억을 통해 행동을 조정한다.
각 행동 뒤 Zeva의 인과 전이 인코더(Causal Transition Encoder·CTE) 는 시각 상태, 실행한 행동, 관측된 상태 변화를 결합해 잠재적 인과 상호작용 표현으로 바꾼다. 이 표현은 작업이 어느 단계에 있는지를 나타내는 단계 토큰(phase token) 과, 행동이 유발한 물리적 변화를 담으려는 상호작용 신호로 나뉜다. 배경이나 조명처럼 행동과 직접 관련 없는 시각적 상관관계보다, ‘집게를 닫았더니 물체가 잡혔는가’ 같은 행동 유발 효과를 포착하려는 설계다. 1
4
Zeva는 기억을 한 저장소에 뒤섞지 않고 두 층으로 관리한다.
쉽게 말해 BIT는 ‘방금 무엇이 잘못됐는지’를 위한 작업 기억이고, PIM은 ‘이전 시도에서 무엇을 배웠는지’를 위한 누적 기억에 가깝다.
행동을 생성할 때 Zeva는 현재 작업 단계와 맞는 인과적 상호작용 증거를 두 메모리에서 검색한다. 이어 이를 인과 프롬프트 형태로 만들어, 동결된 기반 정책의 행동 생성 경로에 주입한다. 그래서 정책의 파라미터를 바꾸지 않아도, 주어진 문맥에 따라 다른 행동을 선택할 수 있다. 1
5
이 방식은 낯선 조건을 만난 뒤에도 별도 라벨, 재학습 실행, 모델 버전 교체, 그에 따른 운영 중단 없이 적응할 가능성을 제시한다. 다만 검색·문맥 처리라는 추론 비용은 추가된다. 1
6
논문과 프로젝트가 보고한 수치는 다음과 같다.
사람이 물리적으로 안내한 단 한 번의 롤아웃도 같은 상호작용 메모리에 기록해 초기 단서, 즉 웜스타트로 쓸 수 있다. 이후 정책은 여전히 동결된 상태로, 그 시연에서 얻은 인과적 상호작용 문맥을 이용해 동작 순서를 재현한다. 6
제공된 근거는 이러한 원샷 웜스타트 메커니즘 자체는 뒷받침한다. 그러나 비커 놓기나 물 붓기에서 시연 전후 성능이 정확히 얼마나 올랐는지를 보여 주는 검증된 수치는 제공하지 않는다. 따라서 해당 작업을 개선하거나 초기화하는 데 활용됐다고 보는 것은 가능하지만, 구체적인 상승 폭을 단정하기는 어렵다. 6
합리적인 해석은 개선 여지(headroom) 다. 사전학습 정책이 새 물리 조건에서 더 자주, 더 체계적으로 실패할수록 명시적인 ‘행동→결과’ 피드백이 바로잡을 수 있는 오류도 많아진다. 반대로 강한 기본 모델은 처음부터 성공하는 비율이 높으므로 메모리 기반 프롬프팅으로 회복할 실패가 상대적으로 적다.
하지만 이것을 보편 법칙으로 볼 수는 없다. 1차 자료가 보여 주는 것은 비교 과제에서의 성능과 배포 중 개선이지, 모든 약한 정책이 항상 더 큰 이득을 얻는다는 일반 정리는 아니다. 1
ChemLab-Evo는 작은 용기, 정밀한 배치, 기울이기와 액체 붓기, 다단계 절차처럼 물리적 변수가 결과를 크게 좌우하는 작업을 포함한다. 벤치마크는 ARX 매니퓰레이터의 7개 작업으로 구성되며, 시험관 집기·비커 놓기·물 붓기 같은 원자적 동작에서 시작해 짧은 시퀀스, 적정·염 용액 제조·저울 계량·추출 같은 긴 절차로 확장된다. 1
이 환경은 단순히 화면에서 본 동작을 모방하는지를 넘어, 기억한 행동 효과가 재시도와 유사 기술 사이에서 실제로 전이되는지를 살피기에 적합하다.
Zeva의 의미는 로봇이 현장에서 겪은 실패를 곧바로 모델 재학습으로 이어 붙이지 않고도, 다음 행동의 판단 근거로 전환하려 했다는 데 있다. 다만 이는 ‘가중치가 스스로 진화한다’는 주장보다는, 동결된 정책이 잘 설계된 인과 기억 문맥을 통해 일시적으로 적응한다는 기술로 이해하는 편이 정확하다.
Studio Global AI
이 페이지에는 Studio Global 내에서 계속할 수 있는 소스 기반 답변이 포함되어 있습니다.
Zeva는 배포 중 정책 가중치를 업데이트하지 않고, 로봇의 행동과 그 결과 사이의 인과적 상호작용을 메모리로 축적해 추론 시점에 활용한다.
Zeva는 배포 중 정책 가중치를 업데이트하지 않고, 로봇의 행동과 그 결과 사이의 인과적 상호작용을 메모리로 축적해 추론 시점에 활용한다. 최근 시도용 BIT와 반복 시도 간 경험을 축적하는 PIM을 분리하고, 현재 작업 단계에 맞는 정보를 꺼내 동결된 정책에 주입한다.
논문 보고 기준 RoboCasa365 Atomic5 평균 성공률은 76.8%였고, 실제 ChemLab Evo Level 1 원자 작업 평균은 83.3%였다.