PixVerse przedstawia R2 i rozwija model świata w czasie rzeczywistym ku trwałym, grywalnym światom
Generowanie wideo AI zwykle jest procesem jednorazowym. Model dostaje prompt, tworzy zamknięty klip i zatrzymuje się. Aby coś zmienić, użytkownik musi zacząć od nowa, z nowym promptem i nowym klipem. Każdy wynik jest zamknięty i osobny.
Model świata w czasie rzeczywistym działa inaczej. Zamiast zwracać klip, generuje świat, który działa dalej, gdy użytkownik jest w środku. Po tym świecie można poruszać się na żywo. Nowe wejście dociera, gdy model wciąż generuje, i zmienia to, co dzieje się dalej. Świat nie resetuje się między akcjami i utrzymuje swój stan przez całą sesję, zachowując spójność tym dłużej, im dłużej sesja trwa.
W styczniu 2026 PixVerse przedstawił pierwszy na świecie model świata w czasie rzeczywistym, R1. R1 pokazał, że ten paradygmat jest wykonalny: wideo może stać się ciągłym, interaktywnym strumieniem audiowizualnym, a nie stałym plikiem wyjściowym.
Dziś uruchamiamy R2, aktualizację modelu świata w czasie rzeczywistym. Utrzymuje spójność w znacznie dłuższych sesjach, pamięta, co wydarzyło się w sesji, i niesie to dalej. Do tego samego działającego świata przyjmuje też tekst, referencje, audio i sterowanie akcjami.
Świat, który pamięta i odpowiada
Zasadnicza zmiana w R2 dotyczy tego, co potrafi zrobić wejście. W zwykłym wideo AI i we wcześniejszych wersjach generowania w czasie rzeczywistym wejście wpływa na bieżącą chwilę, a potem ta chwila mija. Następna akcja zaczyna się od zera. Świat niczego nie przenosi dalej.
W R2 wejście utrzymuje się. Prompt, akcja albo sygnał audio nie zmieniają tylko bieżącej klatki. Aktualizują działający stan świata i kształtują to, co następuje: jak postać zachowa się później, jak rozwiąże się sytuacja i jak środowisko rozwija się wraz z sesją. Wcześniejsza akcja pozostaje prawdziwa później w tej samej sesji.
Eksploruj żywy świat. Gracz wchodzi do wygenerowanego świata i porusza się po nim w czasie rzeczywistym, sterując postacią klawiszami WASD i przesuwając kamerę strzałkami. Prompty zmieniają świat w trakcie ruchu, dodając elementy i przekształcając otoczenie. Postać wchodzi w interakcję z otoczeniem z poczuciem logiki fizycznej, a każde wejście buduje na poprzednim, zamiast zaczynać od zera.
Kształtuj historię. Świat może rozwinąć fabułę, która ugina się pod tym, co robi gracz. W Zero Mark, interaktywnej grze filmowej zbudowanej na R2 przez twórcę Xiaolongbao, stworzenie zagradza drogę i prosi o prezent. Ofiarowanie mu smoka albo liścia prowadzi do naprawdę różnych reakcji. Historia rozgałęzia się od wejścia, zamiast iść z góry napisaną ścieżką, a model generuje każdy wynik na żywo.

W Zero Mark to samo spotkanie idzie dwiema ścieżkami: ofiarowanie stworzeniu smoka i ofiarowanie liścia daje różne reakcje, generowane na żywo.
Postacie, które odpowiadają w kontekście. Postacie w świecie potrafią zrozumieć gracza i odpowiadać w rytmie historii. W jednej interaktywnej historii zbudowanej przez twórczynię Jade Wu na R2 gracze rozmawiają z postacią o imieniu Eve, która zachowuje tożsamość i pamięć przez całą rozmowę, wydobywa wskazówki i popycha fabułę. Jej odpowiedzi, wyraz twarzy i ruch śledzą zarówno dotychczasową rozmowę, jak i miejsce, do którego doszła historia. Utrzymuje spójną tożsamość przez wiele wymian, zamiast się resetować. Mniej przypomina skryptowaną postać niezależną, a bardziej kogoś, kto cię zna i nadąża za tym, co się dzieje.
Problem skalowania i odpowiedź R2
Inaczej niż przy generowaniu stałego klipu, gdzie model dostaje jeden prompt i ustalony odcinek czasu do wypełnienia, świat, który działa dalej, nie ma takiej granicy. Musi robić kilka rzeczy naraz, ciągle, bez załamania:
- Zachować spójność w czasie. Postać, miejsce i zasady świata muszą pozostać te same. Każda dodatkowa sekunda działania to kolejna okazja do dryfu.
- Przyjmować wejście w trakcie generowania. Model nie może zatrzymać się, żeby pomyśleć. Nowe sterowanie dociera, gdy świat jest w ruchu, i musi zostać włączone bez zatrzymania.
- Pamiętać i korygować. Model musi nieść dalej to, co już się wydarzyło, a gdy w długiej sesji narastają drobne błędy, poprawiać je, zamiast je potęgować.
- Robić to wszystko na żywo. Budżet opóźnienia musi pozostać na tyle ciasny, by doświadczenie było interaktywne.
Pod tymi wymaganiami leży głębsze napięcie. Zwykły sposób, by model był wystarczająco szybki do czasu rzeczywistego, to go uprościć, a zwykły sposób, by był zdolniejszy, to uczynić go cięższym i wolniejszym. Szybkość i zdolność ciągną w przeciwne strony. Standardowy sposób, w jaki dziedzina budowała te systemy, pogłębia problem: długi łańcuch osobnych etapów treningu, z których każdy przekazuje wynik następnemu, a jakość i stabilność słabną przy każdym przekazaniu.
Odpowiedź R2 polega na tym, by przestać wymuszać wybór między szybkością a zdolnością i podzielić pracę na dwa etapy zbudowane na tej samej podstawie. Omni Causal AR jest silnikiem zdolności i działa jak ciągle trenowany szkielet. Rozwija jeden model przyczynowy, który uczy się dalej na większej ilości danych, większej liczbie typów wejścia, większej liczbie zadań i dłuższych horyzontach czasu, kumulując zdolność w jednym miejscu, zamiast tracić ją na przekazaniach.
Warstwa akceleracji w czasie rzeczywistym bierze następnie ten sam model i kompresuje go do działania na żywo, zamiast trenować od zera osobny szybki model. Dzięki temu wzrost zdolności nie odbywa się już kosztem szybkości.

Jak R2 zastępuje konwencjonalny wieloetapowy potok treningu, w którym jakość spada przy każdym przekazaniu, jednym ciągle trenowanym modelem skompresowanym do użycia w czasie rzeczywistym.
Wokół tych dwóch etapów leży zestaw celowych decyzji inżynierskich, które pozwalają każdemu wzrostowi zdolności dojść do produktu w czasie rzeczywistym. Pełny raport techniczny PixVerse R2 zawiera architekturę i szczegóły ewaluacji.
„Duże modele językowe pokazały, że skalowanie jest niezawodną drogą do zdolności” — powiedział Changhu Wang, współzałożyciel i CEO PixVerse. „R2 jest naszym przykładem, że modele świata w czasie rzeczywistym mogą iść podobną drogą: przy właściwej architekturze model może stawać się zdolniejszy, nie rezygnując z interakcji w czasie rzeczywistym. Z czasem tak narzędzie do tworzenia staje się środowiskiem, do którego ludzie mogą wejść i które mogą kształtować.”
Od modelu świata do grywalnych gier
R2 przeszedł od demonstracji badawczej do czegoś, na czym można budować prawdziwe produkty. PixVerse Game Engine, uruchomiony po raz pierwszy w lipcu 2026, działa teraz na R2.

Chow Li, szef PixVerse Games, prezentuje silnik gier PixVerse w czasie rzeczywistym na Tech in Asia Conference, wrzesień 2026.
Prezentując na Tech in Asia Conference we wrześniu, szef gier PixVerse, Chow Li, ujął to jako zmianę tego, czym może być gra. Elementy, które tradycyjnie czyniły grę grą — postacie, światy i wybory gracza — przestają być stałymi zasobami zbudowanymi z góry. Gracz może teraz powiedzieć, czego chce, i zobaczyć, że to się dzieje, a doświadczenie nabiera kształtu przez grę, zamiast być napisane wcześniej. Tworzenie świata i granie w niego stają się tym samym aktem.

Jaden Xie, współzałożyciel i prezes PixVerse, mówi na panelu podczas Google AI App Day w Singapurze, wrzesień 2026.
Na panelu Google AI App Day w Singapurze współzałożyciel i prezes Jaden Xie wskazał postępy modeli wideo jako silny napęd następnej fali gier natywnych dla AI. „To, co ekscytuje, to rzeczy, które twórcy budują na naszym modelu świata, odkąd w lipcu otworzyliśmy betę” — powiedział Jaden. „Wierzymy, że nasze modele wideo pomogą większej liczbie twórców wprowadzać pomysły w życie.”
Dostępność
Zbiór tych światów jest już otwarty do eksploracji na world.pixverse.video.
O PixVerse
PixVerse to globalna platforma generowania wideo AI, której ufa ponad 150 milionów użytkowników w ponad 177 krajach. Dzięki zestawowi własnych modeli rozwijanych w całości wewnętrznie PixVerse pozwala każdemu tworzyć wideo o jakości filmowej z promptu, zdjęcia albo klipu. W styczniu 2026 PixVerse uruchomił R1, pierwszy na świecie model świata w czasie rzeczywistym, zamieniając wideo w nieskończony, ciągły i interaktywny strumień. R2 buduje na tej podstawie i skaluje model świata w czasie rzeczywistym tak, by prowadził dłuższe, bardziej spójne sesje. Zespoły PixVerse działają w Azji i w USA. Firma powstała w 2023 z zobowiązaniem, by wideo stało się uniwersalnym językiem ludzkiej ekspresji. W marcu 2026 PixVerse zamknął rundę Series C i uzyskał status jednorożca. Więcej informacji: pixverse.ai.
Powiązane materiały
- PixVerse R2: Skalowanie modeli świata Omni w czasie rzeczywistym
- Analiza architektury PixVerse Game Engine: Gry interaktywne w czasie rzeczywistym
- PixVerse uruchamia R1: pierwszy model świata AI w czasie rzeczywistym
- Eksploruj światy R2
Oficjalne źródło: PixVerse.