PixVerse R2 busca generar un mundo audiovisual que siga en marcha, en lugar de entregar un video cerrado e inmutable. Durante una sesión, se puede intervenir con texto, imágenes de referencia, audio y acciones; el modelo intenta conservar los personajes, los objetos y el estado de la escena.
Publicado porEditado con GPT-6 LunaImágenes generadas con GPT Image 2
Respuesta de investigación

Create a landscape editorial hero image for this Studio Global article: What is AIsphere’s PixVerse R2, when was it released, and how does it let users create and explore continuous audiovisual worlds through tex. Article summary: AIsphere’s PixVerse R2 is a real-time audiovisual “world model”: instead of producing a finished video clip, it generates a scene that keeps running and responds to the user. AIsphere published an R2 technical overview i. Topic tags: general, general web. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake numbers, clic
PixVerse R2 es la apuesta de AIsphere por una generación de video con IA que se parezca menos a recibir un clip terminado y más a entrar en una escena que sigue desarrollándose. El usuario puede influir en lo que ocurre con texto, imágenes, audio y acciones, mientras el modelo continúa generando sonido e imagen sincronizados. AIsphere anunció R2 el 22 de septiembre de 2026; distintos reportes situaron su lanzamiento formal en China el 23 de septiembre. La empresa había publicado un resumen técnico en agosto. 1
5
9
En vez de escribir una instrucción y esperar un video fijo, el usuario puede seguir dando indicaciones durante la sesión. PixVerse describe compatibilidad con texto, imágenes de referencia, audio y controles de acción. Según los reportes, también se puede mover al personaje con controles tipo WASD o pedir, mediante instrucciones, que cambie un personaje, aparezca un objeto o se modifique el entorno. La idea es que cada nueva entrada afecte la escena en curso y lo que suceda después, no que dé comienzo a un clip desconectado. 1
6
Esa continuidad es parte central de la idea de «modelo de mundo»: R2 busca usar el historial de la sesión y los controles actuales para generar el siguiente tramo de audio y video sincronizados. AIsphere afirma que el modelo conserva los acontecimientos de la sesión y trata de mantener las relaciones entre personajes, objetos y espacios. 1
3
6
En Zero Mark, un juego cinematográfico interactivo creado por Xiaolongbao, un mismo encuentro puede tomar distintos rumbos según la elección del jugador. Ofrecerle un dragón a una criatura, en vez de una hoja, genera una respuesta distinta en tiempo real: una decisión modifica la continuación de la escena. 12
Otra demo presenta a Eve, un personaje digital. Un reporte describe cómo responde a preguntas del jugador y a cambios en la historia usando voz, personalidad, memoria y el estado de su relación con el usuario, con el objetivo de conservar una identidad coherente a través de varios intercambios. Son demostraciones del tipo de interacción que se busca, no pruebas independientes de su fiabilidad en sesiones prolongadas. 6
AIsphere describe R2 como un sistema con dos componentes principales. Omni Causal AR es la parte que modela el mundo: procesa distintos tipos de entrada y hace avanzar la escena en el tiempo, tomando su estado actual como contexto para lo que viene. Real-Time Acceleration busca llevar esas capacidades a una operación interactiva. 1
9
13
Otros mecanismos se ocupan del ritmo, la continuidad y el uso de cómputo:
AIsphere ha informado una reducción del 35,8 % en la deriva visual durante una sesión larga en sus evaluaciones internas. Es un dato comunicado por la empresa, no una medición verificada de manera independiente para todos los usos posibles. 2
Las fuentes disponibles no aportan una comparación independiente equivalente de latencia, frecuencia de fotogramas o calidad. Por eso, aunque PixVerse presenta R2 como un sistema en tiempo real diseñado para conservar la coherencia durante sesiones más largas, la información disponible no permite establecer cómo se comporta en distintas escenas, con diferentes controles o en interacciones prolongadas. Las demos ilustran el concepto, pero no resuelven por sí solas qué tan fiable será en un uso más amplio. 1
3
PixVerse presentó R1 en enero de 2026 como un primer paso hacia el video interactivo generado de forma continua. R2 se plantea como una evolución centrada en admitir más tipos de entrada y mantener el estado de la escena durante más tiempo. PixVerse Game Engine conecta el video generativo en tiempo real con agentes de IA y mecánicas de juego, con la mirada puesta en experiencias con roles, reglas y estados del mundo que cambian. 14
18
Las fuentes disponibles permiten describir esa orientación del producto, pero no ofrecen una cita suficientemente fundamentada para atribuir al director ejecutivo Wang Changhu una visión más específica sobre los mundos interactivos.
Studio Global AI
Esta página incluye una respuesta respaldada por fuentes que puede continuar dentro de Studio Global.
PixVerse R2 busca generar un mundo audiovisual que siga en marcha, en lugar de entregar un video cerrado e inmutable.
PixVerse R2 busca generar un mundo audiovisual que siga en marcha, en lugar de entregar un video cerrado e inmutable. Durante una sesión, se puede intervenir con texto, imágenes de referencia, audio y acciones; el modelo intenta conservar los personajes, los objetos y el estado de la escena.
AIsphere afirma que sus evaluaciones internas registraron una reducción del 35,8 % en la deriva visual durante sesiones largas; el resultado no es una evaluación independiente.