PixVerse R2 soll KI Video von einem fertigen Clip zu einer laufenden, interaktiven Szene weiterentwickeln. Nutzer können mit Text, Referenzbildern, Audio und Aktionen eingreifen; das Modell soll den bisherigen Szenenverlauf berücksichtigen.
Veröffentlicht vonBearbeitet mit GPT-6 LunaBilder erstellt mit GPT Image 2
Forschungsantwort

Create a landscape editorial hero image for this Studio Global article: What is AIsphere’s PixVerse R2, when was it released, and how does it let users create and explore continuous audiovisual worlds through tex. Article summary: AIsphere’s PixVerse R2 is a real-time audiovisual “world model”: instead of producing a finished video clip, it generates a scene that keeps running and responds to the user. AIsphere published an R2 technical overview i. Topic tags: general, general web. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake numbers, clic
PixVerse R2 soll sich weniger wie ein Werkzeug für fertige Videoclips anfühlen – und mehr wie eine Szene, die weiterläuft, während man sie beeinflusst. Nutzer können Text, Bilder, Audio und Aktionen eingeben; das Modell erzeugt daraufhin fortlaufend synchronisierte Bild- und Tonausgaben. AIsphere kündigte R2 am 22. September 2026 an. Berichte aus China datieren den offiziellen Start dort auf den 23. September. Einen technischen Überblick hatte das Unternehmen bereits im August veröffentlicht. 1
5
9
Bei einem herkömmlichen Videogenerator führt ein Prompt meist zu einem abgeschlossenen Clip. PixVerse R2 soll dagegen eine laufende Sitzung fortsetzen: Nutzer können fortwährend eingreifen, etwa mit Text, Referenzbildern, Audio oder Aktionen. Berichten zufolge sind auch WASD-Steuerung – die Tasten W, A, S und D zur Bewegung – sowie Prompts möglich, die Figuren austauschen, Gegenstände hinzufügen oder die Umgebung verändern. Die neue Eingabe soll die bestehende Szene und ihren weiteren Verlauf beeinflussen, statt einfach einen unabhängigen Clip zu starten. 1
6
Genau darin liegt die Idee eines „Weltmodells“: R2 soll den bisherigen Verlauf und die aktuelle Steuerung nutzen, um den nächsten Abschnitt mit Bild und Ton zu erzeugen. AIsphere zufolge soll das Modell Ereignisse innerhalb einer Sitzung fortschreiben und Beziehungen zwischen Figuren, Gegenständen und Räumen möglichst erhalten. 1
3
6
Im interaktiven Filmspiel Zero Mark von Xiaolongbao kann dieselbe Begegnung je nach Entscheidung anders verlaufen. Bietet man einer Kreatur einen Drachen statt eines Blatts an, reagiert sie live anders. Die Demo veranschaulicht damit, wie eine Eingabe den weiteren Verlauf einer Szene verändern soll. 12
Eine weitere Demo dreht sich um Eve, eine digitale Figur. Ein Bericht beschreibt, wie Eve auf Fragen und Entwicklungen in der Geschichte mit Stimme, Persönlichkeit, Erinnerung und Beziehungsstatus reagiert. Damit soll ihre Identität über mehrere Gesprächsrunden hinweg konsistent bleiben. Die Beispiele zeigen das angestrebte Interaktionsprinzip; sie sind keine unabhängige Prüfung, wie zuverlässig es über längere Sitzungen funktioniert. 6
AIsphere beschreibt R2 als Zusammenspiel zweier zentraler Komponenten. Omni Causal AR soll als Weltmodell die verschiedenen Eingabearten verarbeiten und die Szene über die Zeit weiterentwickeln. Real-Time Acceleration soll diese Fähigkeiten in einen interaktiven Betrieb überführen. 1
9
13
Weitere Verfahren sollen dabei helfen, Reaktionsgeschwindigkeit, Kontinuität und Rechenaufwand auszubalancieren:
AIsphere gibt an, in internen Tests bei längeren Sitzungen eine um 35,8 Prozent geringere visuelle Drift gemessen zu haben. Das ist ein vom Unternehmen berichtetes Ergebnis und keine unabhängig bestätigte Leistungsangabe für alle Einsatzbereiche. 2
Die vorliegenden Quellen enthalten keinen vergleichbaren unabhängigen Benchmark zu Latenz, Bildrate oder Qualität. PixVerse stellt R2 zwar als Echtzeitmodell vor, das auch über längere Sitzungen konsistent bleiben soll. Die verfügbaren Belege zeigen aber nicht, wie zuverlässig es mit verschiedenen Szenen und Steuerungsarten oder über lange Interaktionen hinweg arbeitet. Die Demos veranschaulichen das Konzept, beantworten diese Fragen jedoch nicht abschließend. 1
3
PixVerse stellte R1 im Januar 2026 als früheren Schritt hin zu fortlaufend erzeugtem, interaktivem Video vor. R2 soll diesen Ansatz mit mehr Eingabearten und einem längerfristig erhaltenen Szenenzustand ausbauen. Der PixVerse Game Engine verbindet Echtzeit-Videogenerierung mit KI-Agenten und Spielmechaniken – also mit Elementen wie Rollen, Regeln und veränderlichen Spielzuständen. 14
18
Die verfügbaren Quellen stützen diese Entwicklungslinie. Ein ausreichend belegtes Zitat, um CEO Wang Changhu eine konkretere Vision interaktiver Welten zuzuschreiben, liegt jedoch nicht vor.
Studio Global AI
Diese Seite enthält eine quellengestützte Antwort, die Sie in Studio Global fortsetzen können.
PixVerse R2 soll KI Video von einem fertigen Clip zu einer laufenden, interaktiven Szene weiterentwickeln.
PixVerse R2 soll KI Video von einem fertigen Clip zu einer laufenden, interaktiven Szene weiterentwickeln. Nutzer können mit Text, Referenzbildern, Audio und Aktionen eingreifen; das Modell soll den bisherigen Szenenverlauf berücksichtigen.
AIsphere berichtet aus internen Tests von 35,8 Prozent weniger visueller Drift über längere Sitzungen – ein Ergebnis, das nicht unabhängig verifiziert ist.