Blogs

PixVerse R2: het schalen van realtime omni-wereldmodellen

Laatst bijgewerkt op
PixVerse R2: het schalen van realtime omni-wereldmodellen

PixVerse R1 introduceerde en leverde het eerste realtime videowereldmodel, en veranderde videogeneratie van een eenmalige levering van een vaste clip in een continu draaiende wereld. Het model kan gebruikersinvoer blijven ontvangen, de wereldtoestand in realtime bijwerken en gesynchroniseerde audio en video streamen die consistent blijven met de interactie. R1 liet zien dat dit technische paradigma kan werken.

PixVerse R2 beantwoordt de volgende vraag: hoe een realtime videowereldmodel blijft schalen. R2 richt zich op twee doelen. Ten eerste bouwt het een dynamische wereld die over lange horizonten een uniforme toestand kan vasthouden, door volledige spatiotemporele priors om te zetten in wereldevolutie die alleen vooruit in de tijd beweegt. Ten tweede internaliseert het voortdurend fysieke causaliteit en interactiesignalen uit tekst, referentie, audio en actie in één enkel model, zodat de wereld tegelijk kan genereren, controle kan ontvangen en de toestand kan bijwerken terwijl gesynchroniseerde audio en video worden gestreamd.

Rond die doelen zet R2 groei in het model, de data, de taken, de controlesignalen en de tijdschaal om in winst in generatiekwaliteit, consistentie over lange afstand en multimodale controle.


Totaalkader

R2 vouwt het systeem samen tot twee kernlagen: Omni Causal AR en Real-Time Acceleration. Omni Causal AR blijft hoogwaardige, multimodale wereldgeneratie met een lange horizon uitbreiden. Real-Time Acceleration neemt die capaciteiten zo verliesloos mogelijk over binnen een strikt budget voor interactielatentie. Het pad is helder: verhoog het capaciteitsplafond van het wereldmodel en versnel die capaciteit vervolgens naar een realtime, interactief werkbereik.

Oudere pijplijnen voor lange video en realtime ketenden doorgaans veel trainingsfasen: een bidirectioneel model omzetten naar een AR-model, een distillatiedocent bouwen uit een taakspecifiek bidirectioneel model, DMD-distillatie uitvoeren en daarna self-rollout DMD toevoegen om de kloof tussen training en inferentie te dichten. Elke fase moest capaciteit opnieuw migreren, doelen opnieuw afstemmen en de dataverdeling opnieuw fitten. Beeldkwaliteit, beweging, het volgen van condities en stabiliteit op lange horizon konden tijdens die overdrachten eroderen. Naarmate de schaal van model, data en taken groeide, splitste de meerfasige pijplijn het optimalisatiedoel en stegen zowel de trainingskosten als de systeemcomplexiteit.

Oude meerfasige pijplijn versus het schalen van wereldmodellering door PixVerse R2

Figuur 1. Oude meerfasige pijplijn versus het schalen van wereldmodellering door PixVerse R2. R2 brengt capaciteitsuitbreiding en realtime distillatie samen in Omni Causal AR en een realtime versnellingslaag, en verenigt modellering van meerdere taken, meerdere signalen en lange video in één kader.

PixVerse R2 stelt een uniform trainingsparadigma voor realtime wereldmodellen voor. In plaats van capaciteit herhaaldelijk te migreren over veel modellen en taakfasen, reduceert het de complexe pijplijn tot twee processen die kunnen blijven schalen: een Omni Causal AR die een uniforme wereldtoestand vasthoudt continu voortrainen, en die vervolgens rechtstreeks distilleren tot een versneld model dat in realtime kan genereren en daarbij ruimtelijke consistentie en modellering op lange horizon overerft.

Minder fasegrenzen verminderen het capaciteitsverlies dat voortkomt uit onafhankelijke docenten, taakafstemming en herhaalde modeloverdrachten. Nieuwe data, taken, controlesignalen en modelschaal kunnen directer worden omgezet in het vermogen tot realtime wereldmodellering.

Fase 1: continue pretraining van Omni Causal AR. R2 behandelt bidirectionele generatiepriors en AR voor lange video niet langer als twee losgekoppelde fasen. Het traint continu een uniforme Omni Causal AR bovenop de capaciteit van het bidirectionele model. Dynamische chunks geven verschillende datavormen een gedeelde temporele representatie: het model kan hoogwaardige korte video en multimodale data uit bidirectionele pretraining opnemen, en het kan uitbreiden naar continue lange video en interactietrajecten met meerdere beurten. Beeldkwaliteit, audiovisuele expressie, generatie op lange horizon en controle met meerdere signalen kunnen binnen één model schalen in plaats van via herhaalde conversies opnieuw te worden gemigreerd.

Fase 2: distilleer een realtime versnellingslaag uit de geschaalde Omni Causal AR. Continue pretraining geeft Omni Causal AR tegelijk hoogwaardige generatie, stabiele toestandsoverdracht op lange horizon en echte causale rollout. R2 gebruikt vervolgens dezelfde Omni Causal AR voor zowel de ODE-initialisatie van de student als de distillatiedocent, zodat docent, student en echte AR-inferentie een consistente causale modelleringsbasis delen. Realtime distillatie wordt “versnelling in weinig stappen van een bestaand wereldmodel”, niet “een wereld met lange horizon opnieuw leren”.


Omni Causal AR

R2 zet het pad voort van multimodale invoer, autoregressieve generatie en realtime-interactie dat R1 al heeft gevalideerd, en concentreert die capaciteiten vervolgens in één uniforme trainingsroute voor Omni Causal AR. Omni Causal AR zet volledige spatiotemporele generatiepriors om in overdracht van wereldtoestand die alleen vooruit in de tijd beweegt. Via causalisatie en continue pretraining behoudt het model beeld-, bewegings-, audio- en multimodaal semantisch vermogen, terwijl het leert de volgende gesynchroniseerde audiovisuele chunk alleen uit de geschiedenis te voorspellen.

Naarmate de trainingsobjecten uitbreiden van onafhankelijke korte video’s naar continue lange video’s en interactietrajecten met meerdere beurten, bouwt het model geleidelijk causaliteit op lange termijn op tussen historische wereldtoestand, huidige interactie-invoer en toekomstige wereldevolutie.

Het model ontvangt tegelijk een tekstprompt, multimodale referenties, actiesignalen (bijvoorbeeld WASD of continue besturing) en audio, en het geeft gesynchroniseerde video en audio terug. Tijdens een run kunnen verschillende besturingssignalen het model blijven binnenkomen en de latere wereldtoestand veranderen. R2 reageert niet alleen op een eenmalige conditie; het kan tegelijk genereren, besturing ontvangen en de wereld bijwerken.

Om causale generatie binnen dezelfde wereld over een lange run te houden, pakt R2 vier problemen aan: de verdelingskloof tussen training en inferentie, robuustheid tegen een ruisachtige geschiedenis, coördinatie van langetermijn- en recent geheugen, en correctie van fouttoestanden. Hybrid Teacher / Diffusion Forcing laat het model zich aanpassen aan zowel schone als ruisachtige geschiedenis. Multi-Timescale Memory slaat gezamenlijk wereldankers, recente dynamiek en objecttoestand op. Een Error Bank brengt mislukte toestanden terug in de training. Samen vormen ze een trainingslus voor langetermijnwereldtoestand en verminderen ze drift in beeld, personage, beweging, audiovisuele relatie en besturingsrespons in de loop van de tijd.

PixVerse R2 Omni Causal AR multimodale besturing en gesynchroniseerde audiovisuele uitvoer

Figuur 2. PixVerse R2 Omni Causal AR. Het model kan tijdens een run verschillende besturingssignalen blijven ontvangen. Op elk interactiemoment sluit het actieve signaal aan op een dynamisch audiovisueel chunk met de bijpassende granulariteit en stuurt het het volgende video- en audiosegment aan.

Dynamische chunkgeneratie

Verschillende besturingssignalen leven op verschillende tijdschalen. Prompts en referenties beschrijven doorgaans volledige semantiek of langere gebeurtenissen. Actie (WASD) heeft fijnmazige, directe toestandsfeedback nodig. Audio draagt tegelijk semantiek, ritme en temporele synchronisatie. Als elke invoer in een tijdseenheid met vaste lengte wordt gedwongen, moet het model vaak reactiesnelheid afwegen tegen volledigheid van expressie.

Dynamic Chunk is hoe R2 die interactietijdschalen verenigt. R2 splitst audiovisuele sequenties adaptief op de semantische grens en de duur van het huidige besturingssignaal, met een maximale chunkgrootte die rekenkracht en trainingsstabiliteit begrenst. Korte chunks verbeteren de reactieprecisie voor actie en lokale instructies. Lange chunks behouden de volledige structuur van gebeurtenissen, beweging en audiovisuele semantiek. Verschillende taken en besturingssignalen kunnen één causale generatie-interface delen zonder de modelstructuur te wisselen.

Hybrid Teacher Forcing / Diffusion Forcing

De kernspanning in long-horizon AR is dat de trainingsgeschiedenis meestal schoner is, terwijl de echte runtimegeschiedenis de eigen ruis en lokale fouten van het model bevat. Alleen trainen op schone geschiedenis kan het kwaliteitsplafond per stap verhogen, maar het model te gevoelig maken voor kleine afwijkingen. Alleen trainen op verstoorde geschiedenis kan beeldkwaliteit, beweging en besturingsrespons schaden.

R2 mengt schone geschiedenis en ruisachtige geschiedenis in één trainingsproces. Schone geschiedenis stabiliseert het kwaliteitsplafond van de wereldevolutie. Ruisachtige geschiedenis laat het model zich vooraf aanpassen aan imperfecte toestanden die het in productie zal zien. De complementaire training verkleint de kloof tussen training en inferentie, zodat het model een hoogwaardig volgend wereldsegment kan genereren en blijft doorrollen wanneer de geschiedenis al een kleine fout bevat.

Causal Attention Mask en Relative Temporal RoPE beperken samen welke geschiedenis de huidige toestand mag lezen en waar die geschiedenis in het huidige venster zit. Attention Mask dwingt strikte causale zichtbaarheid af. Temporal RoPE groeit niet onbegrensd mee met een globaal blok-ID; het wordt opnieuw geïndexeerd op relatieve slot binnen het huidige attentionvenster. Wanneer het rollende venster vooruitgaat, blijft de echte tijd vorderen, maar sink memory, recente geschiedenis en de huidige chunk blijven gemapt op een stabiel, begrensd relatief positiebereik.

Hybrid teacher forcing en diffusion forcing causale attention mask en relative temporal RoPE

Figuur 3. Geünificeerde causale attention mask en relative temporal RoPE voor Hybrid Teacher / Diffusion Forcing. Bovenaan staat de causale zichtbaarheid voor de twee geschiedenisconstructies. Onderaan worden representatieve queries gemapt op Q/K-blokken, relatieve slots en RoPE-ID’s, en wordt getoond dat echte blok-ID’s blijven vorderen terwijl de tijdcoördinaten binnen het venster begrensd blijven.

Geheugen op meerdere tijdschalen

Langetermijnwereldmodellering kan niet simpelweg alle geschiedenis onthouden. Onbegrensde geschiedenis laat de kosten voor rekenkracht en geheugen snel stijgen; te sterk bijsnijden laat personage-identiteit, scèneopzet en sleutelgebeurtenissen vallen. R2 bouwt een geheugensysteem op meerdere schalen uit Sink Memory, Rolling History en een Object KV Cache.

  • Sink Memory slaat langetermijnankers op, zoals personage, scène, stijl en wereldregels.
  • Rolling History richt zich op recente actie, pose, camera en omgevingsverandering, zodat lokale toestand natuurlijk kan aansluiten.
  • Object KV Cache hergebruikt en comprimeert al berekende representaties van geschiedenis op objectniveau en houdt de toestanden die latere evolutie daadwerkelijk beïnvloeden binnen een beperkt budget.

Samen geven de drie langetermijnstabiliteit van identiteit, continuïteit van beweging op korte afstand en beheersbare runtimekosten, en ze verminderen personagedrift, scènesprongen, flikkering tussen chunks en gebroken actie.

Error Bank

Ernstige drift in een AR-wereldmodel begint vaak bij een kleine vroege fout die in de geschiedenis wordt geschreven en daarna wordt overgenomen. R2 bouwt een Error Bank die representatieve foutgeschiedenissen opslaat als herbruikbare samples en ze tijdens de training met een vaste frequentie terugspeelt in de normale geschiedenis. Het model leert niet langer alleen hoe het vanuit een ideale toestand verdergaat; het leert ook hoe het geschiedenis die al is afgedreven herkent, opneemt en herstelt.

In gefaseerde evaluatie daalde de langetermijnmetriek voor helderheidsdrift van 0.201 naar 0.129, een daling van ongeveer 35,8%. Van 29 langereekssamples verbeterden er 20, en alle 5 samples die expliciet stil moesten blijven, verminderden foutieve beweging.


Realtimeversnelling

De realtimeversnelling van R2 leert een long-horizon wereld niet opnieuw aan binnen een model met weinig stappen. Ze versnelt een wereldmodel dat al langdurig stabiel kan draaien. De versnellingslaag vertrekt vanuit het voortdurend voorgetrainde Omni Causal AR en gebruikt dat zowel voor de ODE-initialisatie van de student als voor de distillatieleraar, zodat leraar, student en echte AR-inferentie een consistente causale trajectverdeling delen.

Dat geünificeerde causale startpunt vermindert de afhankelijkheid van afstemming in de stijl van Self-Forcing en Rolling Forcing. Realtimeversnelling kan zich richten op de problemen die snelheid met weinig stappen daadwerkelijk introduceert: DDMD met adversarial regularization behandelt conditie-uitlijning, generatieverdeling en realisme tijdens distillatie; block-sparse attention comprimeert de rekenkracht voor lange context; en een piramidepad verlaagt de kosten van generatie op hoge resolutie.

DDMD met adversarial regularization

Bij generatie in ultrawenig stappen zijn conditie-uitlijning, distributiematching en realisme niet hetzelfde optimalisatieprobleem. R2 is gebaseerd op DDMD en introduceert daarnaast adversarial regularization uit DMD2. Drie trainingssignalen komen samen in één student: conditie-uitlijning versterkt de besturing, distributiematching behoudt de leraarsverdeling, en adversarial regularization verankert echte data, zodat weinig samplingstappen zowel een nauwkeurige interactierespons als een geloofwaardige wereld kunnen behouden.

Block-sparse attention

R2 gebruikt block-sparse attention op spatiotemporele tokensequenties. Het model splitst Q, K en V in rekenblokken, schat snel in welke key/value-blokken elk queryblok het meest nodig heeft, behoudt alleen de verbindingen met de hoogste score en voert exacte softmax-attention uit op die geselecteerde blokken. Routing op blokniveau is geen willekeurige pruning; het concentreert rekenkracht op de sterke afhankelijkheden tussen de huidige multimodale besturing, recente beweging en de belangrijkste wereldtoestand.

Door het model tijdens de training aan te passen aan de spaarzame verbindingsstructuur verhoogt R2 de attentiesparsity tot boven 90%, terwijl beeldkwaliteit, actiecontinuïteit, conditievolging en long-horizon stabiliteit in de huidige evaluatie zonder duidelijke daling behouden blijven.

Piramide-distillatie met ultrawenig stappen

Alle wereldmodellering vanaf nul in een ruimte met hoge resolutie doen verspilt rekenkracht aan globale structuur die een lagere resolutie al kan bepalen. R2 organiseert generatie als één of twee fasen met lage resolutie plus een fase met hoge resolutie. De fasen met lage resolutie leggen scène-indeling, beweging van het onderwerp en camerastructuur vast. De fase met hoge resolutie herstelt textuur, randen en lokaal detail. Het pad van grof naar fijn vermindert herhaalde rekenkracht op hoge resolutie en behoudt tegelijk sterkere structurele stabiliteit en detail.


Conclusie en grenzen

PixVerse R1 stelde het eerste realtime videowereldmodel voor en bracht het uit. Daarmee toonde het dat video kan verschuiven van offline vaste content naar een dynamische wereld die in realtime kan interacteren en kan blijven draaien. PixVerse R2 lost vervolgens op hoe dat paradigma blijft schalen: een geünificeerd Omni Causal AR draagt groeiende data, taken, modaliteiten en tijdschalen, en Real-Time Acceleration brengt volledige wereldmodelleringscapaciteit naar realtime-inferentie met weinig stappen.

R2 is geen capaciteitsupgrade op één punt. Het is een geünificeerd trainingspad voor de volgende generatie realtimewereldmodellen. R1 maakte realtime videowereldmodellen werkelijkheid. R2 plaatst ze in een geünificeerde, schaalbare, voortdurend verbeterende fase.

Binnen een strikt budget voor realtime rekenkracht en interactielatentie heeft de huidige kwaliteit van één generatie nog ruimte om te verbeteren ten opzichte van toonaangevende offline videomodellen, vooral in complex scènedetail, natuurlijkheid van beweging, fysieke consistentie en stabiliteit over lange runs. Die gaten weerspiegelen vaker de huidige schaalfase van R2 dan een plafond van het framework zelf.


Vroege toegang

Op 23 augustus 2026 beschreef dit rapport PixVerse R2 als gesloten test. Op 22 september 2026 kondigde PixVerse aan dat een verzameling van deze werelden openstaat om te verkennen op world.pixverse.video. Zie de R2-lanceringsaankondiging.

Die aankondiging opent geen onbeperkte API-toegang. Het PixVerse-wereldmodel R2-ervaringsformulier blijft de aanvraagroute voor vroege ervaring en API-toegang.


Gerelateerde bronnen

Werelden uit de aankondiging van 22 september 2026 staan open om te verkennen op world.pixverse.video. API-toegang wordt nog steeds aangevraagd via het formulier hierboven. Je kunt vandaag ook creëren met PixVerse V6 en R1.