PixVerse R2 ma działać jak audiowizualny model świata: zamiast zwracać gotowy klip, podtrzymuje scenę, którą użytkownik może na bieżąco zmieniać. Sesję można sterować tekstem, obrazami referencyjnymi, dźwiękiem i działaniami.
Opublikowane przezEdytowane za pomocą GPT-6 LunaObrazy wygenerowane za pomocą GPT Image 2
Research answer

Create a landscape editorial hero image for this Studio Global article: What is AIsphere’s PixVerse R2, when was it released, and how does it let users create and explore continuous audiovisual worlds through tex. Article summary: AIsphere’s PixVerse R2 is a real-time audiovisual “world model”: instead of producing a finished video clip, it generates a scene that keeps running and responds to the user. AIsphere published an R2 technical overview i. Topic tags: general, general web. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake numbers, clic
PixVerse R2 ma zmienić generowanie wideo z jednorazowego tworzenia klipu w ciągłą, interaktywną sesję. Użytkownik może w jej trakcie podawać tekst, obrazy, dźwięk i działania, a model ma dalej generować zsynchronizowany obraz i dźwięk, uwzględniając wcześniejszy przebieg sceny. AIsphere ogłosiła R2 22 września 2026 roku; doniesienia z Chin podają 23 września jako datę formalnej premiery. W sierpniu firma opublikowała omówienie techniczne modelu. 1
5
9
W typowym generatorze wideo wpisuje się prompt i czeka na gotowy materiał. R2 ma działać inaczej: scena pozostaje aktywna, a użytkownik może dalej na nią wpływać. Według opisów PixVerse system przyjmuje tekst, obrazy referencyjne, audio i sterowanie działaniami. Doniesienia wymieniają też ruch przypominający sterowanie klawiaturą WASD oraz polecenia, które mogą zmienić postać, dodać przedmiot albo przekształcić otoczenie w trakcie generowania. 1
6
Kluczowe jest to, by nowe polecenie zmieniało bieżącą scenę i jej dalszy przebieg, zamiast uruchamiać osobny, niezwiązany z nią klip. R2 ma wykorzystywać historię sesji i aktualne sterowanie do generowania kolejnego fragmentu z zsynchronizowanym obrazem i dźwiękiem. AIsphere deklaruje, że model przenosi wydarzenia z sesji dalej i stara się zachowywać relacje między postaciami, obiektami oraz przestrzenią. 1
3
6
W Zero Mark, interaktywnej grze filmowej stworzonej przez Xiaolongbao, ta sama scena może potoczyć się inaczej zależnie od wyboru gracza. Podanie stworzeniu smoka zamiast liścia wywołuje inną reakcję — przykład pokazuje, jak decyzja może zmienić dalszy ciąg sceny. 12
W osobnej demonstracji występuje cyfrowa postać Eve. Według opisu reaguje ona na pytania gracza i rozwój fabuły, korzystając z głosu, osobowości, pamięci oraz stanu relacji, tak by zachować spójną tożsamość w kolejnych wymianach. To przykłady zamierzonego sposobu interakcji, a nie niezależne testy pokazujące, jak niezawodnie system działa w długich sesjach. 6
AIsphere opisuje R2 jako system oparty na dwóch głównych elementach. Omni Causal AR to część odpowiadająca za modelowanie świata: przetwarza różne typy wejścia i rozwija scenę w czasie, wykorzystując jej bieżący stan jako kontekst dla kolejnych zdarzeń. Real-Time Acceleration ma pozwolić uruchomić te możliwości w interaktywnym tempie. 1
9
13
Pozostałe rozwiązania mają pomagać w zachowaniu ciągłości, obsłudze różnych rytmów interakcji i ograniczaniu kosztu obliczeń:
AIsphere poinformowała, że w wewnętrznych testach R2 zmniejszył dryf obrazu w długiej sesji o 35,8 proc. To rezultat podany przez firmę, a nie niezależnie zweryfikowana miara skuteczności we wszystkich zastosowaniach. 2
Dostępne źródła nie przedstawiają porównywalnego, niezależnego benchmarku opóźnień, liczby klatek na sekundę ani jakości. PixVerse opisuje R2 jako model działający w czasie rzeczywistym i zaprojektowany z myślą o dłuższej spójności, ale przedstawione materiały nie pokazują, jak radzi sobie w różnych scenach, przy różnych sposobach sterowania ani podczas długotrwałego użytkowania. Demonstracje ilustrują pomysł — same nie rozstrzygają, jak niezawodnie system będzie działał w szerszym użyciu. 1
3
PixVerse zaprezentowało R1 w styczniu 2026 roku jako wcześniejszy krok w stronę stale generowanego, interaktywnego wideo. R2 jest przedstawiane jako rozwinięcie tego pomysłu, nastawione na obsługę większej liczby rodzajów wejścia i dłuższe zachowywanie stanu sceny. PixVerse Game Engine łączy generowane na żywo wideo z agentami AI i mechanikami gier, co wskazuje na kierunek obejmujący doświadczenia z rolami, zasadami i zmieniającym się stanem świata. 14
18
Dostępne źródła pozwalają opisać kierunek rozwoju produktu, ale nie dostarczają wystarczająco dobrze udokumentowanej wypowiedzi, by przypisać CEO Wang Changhu bardziej konkretną wizję interaktywnych światów.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
PixVerse R2 ma działać jak audiowizualny model świata: zamiast zwracać gotowy klip, podtrzymuje scenę, którą użytkownik może na bieżąco zmieniać.
PixVerse R2 ma działać jak audiowizualny model świata: zamiast zwracać gotowy klip, podtrzymuje scenę, którą użytkownik może na bieżąco zmieniać. Sesję można sterować tekstem, obrazami referencyjnymi, dźwiękiem i działaniami. Model ma zachowywać stan sceny, postacie i relacje między obiektami.
W wewnętrznych testach AIsphere odnotowała spadek dryfu obrazu w długiej sesji o 35,8 proc.; nie jest to wynik niezależnego benchmarku.