PixVerse R2 è presentato come un modello audiovisivo in tempo reale: la scena continua a evolversi mentre l’utente la guida, anziché fermarsi in una clip già definita. Si può intervenire con testo, immagini di riferimento, audio e comandi d’azione; il modello mira a mantenere nel tempo personaggi, oggetti e stato de...
Pubblicato daModificato con GPT-6 LunaImmagini generate con GPT Image 2
Research answer

Create a landscape editorial hero image for this Studio Global article: What is AIsphere’s PixVerse R2, when was it released, and how does it let users create and explore continuous audiovisual worlds through tex. Article summary: AIsphere’s PixVerse R2 is a real-time audiovisual “world model”: instead of producing a finished video clip, it generates a scene that keeps running and responds to the user. AIsphere published an R2 technical overview i. Topic tags: general, general web. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake numbers, clic
PixVerse R2 punta a trasformare la generazione video da un comando seguito da una clip conclusa a una scena che continua a svolgersi. L’utente può intervenire mentre il mondo generato è in movimento e il modello prova a far sì che le nuove istruzioni influenzino ciò che accade dopo, non soltanto a far partire un video separato. AIsphere ha annunciato R2 il 22 settembre 2026; alcune notizie riportano il lancio ufficiale in Cina il giorno successivo. La società aveva pubblicato una panoramica tecnica in agosto. 1
5
9
PixVerse descrive un sistema che accetta testo, immagini di riferimento, audio e comandi d’azione. Tra gli esempi riportati ci sono controlli in stile WASD per muoversi e istruzioni testuali per cambiare personaggio, aggiungere un oggetto o modificare l’ambiente senza interrompere la generazione. L’idea è che ogni nuovo input aggiorni la scena già avviata, invece di produrre un filmato scollegato da quello precedente. 1
6
È questo il senso di “modello del mondo”: R2 dovrebbe usare la storia della sessione e i comandi più recenti per generare il segmento audiovisivo successivo, mantenendo le relazioni tra personaggi, oggetti e spazi. AIsphere afferma che gli eventi della sessione vengono portati avanti nel tempo; la continuità, però, è un obiettivo del sistema, non una garanzia di coerenza perfetta in ogni situazione. 1
3
6
In Zero Mark, un film-gioco interattivo creato da Xiaolongbao, la stessa scena può prendere direzioni diverse in base alla scelta dell’utente. Offrire a una creatura un drago invece di una foglia, per esempio, genera una risposta differente: una dimostrazione di come un input possa cambiare il seguito dell’incontro. 12
Un’altra demo presenta Eve, un personaggio digitale. Secondo una delle fonti, Eve risponde alle domande e agli sviluppi della storia usando voce, personalità, memoria e stato della relazione, con l’obiettivo di mantenere un’identità riconoscibile attraverso più scambi. Sono dimostrazioni del tipo di interazione che R2 intende offrire, non valutazioni indipendenti della sua affidabilità nelle sessioni più lunghe. 6
AIsphere descrive R2 come un sistema composto da due elementi principali. Omni Causal AR è la componente che costruisce il modello del mondo: elabora input diversi e fa avanzare la scena nel tempo, usando lo stato corrente come contesto per ciò che viene generato dopo. Real-Time Acceleration è lo strato pensato per portare queste capacità in un funzionamento interattivo. 1
9
13
Altri meccanismi dovrebbero aiutare a gestire tempi, continuità e costi di calcolo:
Nelle proprie valutazioni interne, AIsphere riferisce una riduzione del 35,8% della deriva visiva durante una sessione lunga. È un dato comunicato dall’azienda, non una misura verificata in modo indipendente per tutti gli scenari d’uso. 2
Le fonti disponibili non presentano un benchmark indipendente comparabile su latenza, frequenza dei fotogrammi o qualità. Perciò, anche se PixVerse descrive R2 come un sistema in tempo reale progettato per mantenere più a lungo la coerenza della scena, i dati qui disponibili non permettono di stabilire come si comporti con scene, controlli e sessioni prolungate differenti. Le demo chiariscono il progetto; da sole, non dimostrano quanto sia affidabile nell’uso più ampio. 1
3
PixVerse aveva presentato R1 nel gennaio 2026 come un primo passo verso video interattivi generati in modo continuo. R2 viene descritto come un’evoluzione orientata a supportare più tipi di input e a mantenere più a lungo lo stato della scena. Il PixVerse Game Engine collega la generazione video in tempo reale ad agenti AI e meccaniche di gioco: una direzione che punta a esperienze con ruoli, regole e mondi che cambiano. 14
18
Le fonti consentono di ricostruire questa direzione del prodotto, ma non offrono una citazione sufficientemente verificabile per attribuire a Wang Changhu, CEO di AIsphere, una visione più specifica dei mondi interattivi.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
PixVerse R2 è presentato come un modello audiovisivo in tempo reale: la scena continua a evolversi mentre l’utente la guida, anziché fermarsi in una clip già definita.
PixVerse R2 è presentato come un modello audiovisivo in tempo reale: la scena continua a evolversi mentre l’utente la guida, anziché fermarsi in una clip già definita. Si può intervenire con testo, immagini di riferimento, audio e comandi d’azione; il modello mira a mantenere nel tempo personaggi, oggetti e stato della scena.
AIsphere riferisce una riduzione del 35,8% della deriva visiva nelle proprie valutazioni interne, ma il dato non è una verifica indipendente.