PixVerse R2 ne vise pas seulement à créer un clip terminé : il génère une scène audiovisuelle qui continue pendant que l’utilisateur la dirige. Texte, images de référence, audio et actions peuvent modifier une même session, avec pour objectif de conserver les personnages, les objets et l’état du décor.
Publié parModifié avec GPT-6 LunaImages générées avec GPT Image 2
Réponse de recherche

Create a landscape editorial hero image for this Studio Global article: What is AIsphere’s PixVerse R2, when was it released, and how does it let users create and explore continuous audiovisual worlds through tex. Article summary: AIsphere’s PixVerse R2 is a real-time audiovisual “world model”: instead of producing a finished video clip, it generates a scene that keeps running and responds to the user. AIsphere published an R2 technical overview i. Topic tags: general, general web. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake numbers, clic
PixVerse R2 entend faire passer la vidéo générée d’un format fixe à un monde qui évolue au fil des interactions. Au lieu d’envoyer une consigne puis de recevoir un clip terminé, l’utilisateur peut intervenir pendant que la scène se poursuit. AIsphere a annoncé R2 le 22 septembre 2026 ; plusieurs articles situent son lancement officiel en Chine au 23 septembre. L’entreprise avait publié un aperçu technique en août. 1
5
9
PixVerse présente R2 comme un « modèle du monde » audiovisuel : il doit s’appuyer sur l’état actuel de la scène et sur ce qui s’y est déjà passé pour générer la suite. L’utilisateur peut intervenir par du texte, des images de référence, de l’audio ou des actions. Des exemples rapportés évoquent aussi des commandes de déplacement de type WASD, ainsi que des prompts pour changer de personnage, ajouter un objet ou modifier l’environnement sans interrompre la génération. 1
6
L’idée est que chaque nouvelle entrée influe à la fois sur la scène en cours et sur ce qui vient ensuite, plutôt que de déclencher un clip sans lien avec le précédent. AIsphere affirme que le modèle conserve les événements d’une session et cherche à maintenir les relations entre personnages, objets et espaces. 1
3
6
Dans Zero Mark, un film-jeu interactif créé par Xiaolongbao, un même face-à-face peut prendre des directions différentes selon le choix du joueur. Offrir un dragon à une créature plutôt qu’une feuille entraîne une autre réaction, générée en direct : la commande change donc la suite de la scène. 12
Une autre démo met en scène Eve, un personnage numérique. Selon un compte rendu, ses réponses s’appuient sur sa voix, sa personnalité, sa mémoire et l’état de sa relation avec le joueur, afin de préserver une identité cohérente au fil des échanges et des rebondissements. Ces démonstrations illustrent le type d’interaction recherché ; elles ne constituent pas une évaluation indépendante de sa fiabilité sur de longues sessions. 6
AIsphere décrit R2 comme un système articulé autour de deux composants. Omni Causal AR est la brique de modélisation du monde : elle traite différents types d’entrées et fait progresser la scène dans le temps, en utilisant son état courant comme contexte. Real-Time Acceleration vise à rendre ces capacités utilisables dans une interaction en temps réel. 1
9
13
D’autres mécanismes sont présentés comme des moyens de gérer la continuité, le rythme des commandes et le coût de calcul :
Dans ses évaluations internes, AIsphere rapporte une réduction de 35,8 % de la dérive visuelle au cours d’une longue session. Il s’agit d’un résultat communiqué par l’entreprise, et non d’une mesure vérifiée de manière indépendante pour tous les usages. 2
Les sources disponibles ne fournissent pas de comparaison indépendante et équivalente sur la latence, la fréquence d’images ou la qualité visuelle. PixVerse présente donc R2 comme un modèle temps réel conçu pour rester cohérent plus longtemps, mais les éléments cités ne permettent pas de savoir comment il se comportera selon les scènes, les commandes ou la durée des sessions. Les démos donnent à voir le principe ; elles ne suffisent pas à établir sa fiabilité dans toutes les situations. 1
3
PixVerse avait présenté R1 en janvier 2026 comme une première étape vers la vidéo générée en continu et interactive. R2 est présenté comme une évolution, avec davantage de types d’entrées et une volonté de mieux préserver l’état de la scène au fil du temps. Le PixVerse Game Engine relie la vidéo générée en temps réel à des agents d’IA et à des mécaniques de jeu, pour créer des expériences structurées autour de rôles, de règles et d’états qui évoluent. 14
18
Les sources étayent cette orientation produit, mais ne fournissent pas de citation assez solidement documentée pour attribuer une vision plus précise des mondes interactifs au PDG Wang Changhu.
Studio Global AI
Cette page comprend une réponse basée sur la source que vous pouvez continuer dans Studio Global.
PixVerse R2 ne vise pas seulement à créer un clip terminé : il génère une scène audiovisuelle qui continue pendant que l’utilisateur la dirige.
PixVerse R2 ne vise pas seulement à créer un clip terminé : il génère une scène audiovisuelle qui continue pendant que l’utilisateur la dirige. Texte, images de référence, audio et actions peuvent modifier une même session, avec pour objectif de conserver les personnages, les objets et l’état du décor.
AIsphere rapporte une baisse de 35,8 % de la dérive visuelle lors d’évaluations internes ; ce résultat n’est pas une mesure indépendante de ses performances.