PixVerse presenta R2 e porta il modello di mondo in tempo reale verso mondi persistenti e giocabili
La generazione di video con IA è di solito un processo singolo. Un modello riceve un prompt, genera una clip fissa e si ferma. Per modificare qualcosa, l’utente deve ricominciare con un nuovo prompt e una nuova clip. Ogni risultato è chiuso e separato.
Un modello di mondo in tempo reale funziona in modo diverso. Invece di restituire una clip, genera un mondo che continua a girare mentre l’utente è al suo interno. Il mondo è navigabile in tempo reale. Un nuovo input arriva mentre il modello sta ancora generando e cambia ciò che accade dopo. Il mondo non si azzera tra un’azione e l’altra e mantiene il proprio stato per tutta la sessione, restando coerente più a lungo dura la sessione.
A gennaio 2026 PixVerse ha presentato R1, il primo modello di mondo in tempo reale. R1 ha dimostrato che il paradigma era praticabile: il video poteva diventare un flusso audiovisivo continuo e interattivo, non un output fisso.
Oggi lanciamo R2, un aggiornamento del modello di mondo in tempo reale. Resta coerente su sessioni molto più lunghe, ricorda ciò che accade dentro una sessione e lo porta avanti, e accoglie testo, riferimenti, audio e controlli di azione nello stesso mondo in esecuzione.
Un mondo che ricorda e risponde
Il cambiamento centrale di R2 è ciò che l’input riesce a fare. Nel video IA ordinario, e nelle versioni precedenti della generazione in tempo reale, l’input agisce sul momento corrente e poi quel momento passa. L’azione successiva ricomincia da zero. Il mondo non porta nulla avanti.
In R2 l’input persiste. Un prompt, un’azione o un segnale audio non modificano solo il fotogramma corrente. Aggiornano lo stato in esecuzione del mondo e danno forma a ciò che segue: come un personaggio si comporterà più tardi, come si risolve una situazione e come l’ambiente si sviluppa mentre la sessione continua. Un’azione precedente resta vera più avanti nella stessa sessione.
Esplorare un mondo vivo. Un giocatore entra in un mondo generato e lo attraversa in tempo reale, controllando un personaggio con i tasti WASD e spostando la camera con le frecce. I prompt cambiano il mondo mentre il giocatore avanza, aggiungendo elementi e alterando l’ambiente. Il personaggio interagisce con ciò che lo circonda con un senso di logica fisica, e ogni input si costruisce sul precedente invece di ripartire da zero.
Dare forma alla storia. Il mondo può sviluppare una trama che si piega a ciò che fa il giocatore. In Zero Mark, un gioco-film interattivo costruito su R2 dal creator Xiaolongbao, una creatura blocca il percorso e chiede un dono. Offrirle un drago o una foglia produce risposte davvero diverse. La storia si ramifica dall’input invece di seguire un percorso scritto in anticipo, e il modello genera ogni esito dal vivo.

In Zero Mark lo stesso incontro prende due strade: offrire alla creatura un drago oppure una foglia produce risposte diverse, generate dal vivo.
Personaggi che rispondono nel contesto. I personaggi del mondo possono capire un giocatore e rispondere al passo con la storia. In una storia interattiva costruita dalla creator Jade Wu su R2, i giocatori parlano con un personaggio di nome Eve, che mantiene identità e memoria lungo la conversazione, fa emergere indizi e fa avanzare la trama. Le sue risposte, l’espressione e il movimento seguono sia la conversazione fin lì sia il punto raggiunto dalla storia. Mantiene un’identità coerente attraverso molti scambi invece di azzerarsi, e somiglia meno a un personaggio non giocante scritto a copione e più a qualcuno che vi conosce e segue ciò che sta accadendo.
Il problema della scala e la risposta di R2
A differenza della generazione di una clip fissa, in cui il modello riceve un solo prompt e un intervallo di tempo fisso da riempire, un mondo che continua a girare non ha quel confine. Deve fare più cose insieme, in modo continuo, senza rompersi:
- Restare coerente nel tempo. Personaggio, luogo e regole del mondo devono restare gli stessi. Ogni secondo aggiuntivo di esecuzione è un’altra occasione di deriva.
- Accettare input a metà generazione. Il modello non può fermarsi a pensare. Nuovi controlli arrivano mentre il mondo è in movimento e vanno integrati senza interrompere.
- Ricordare e correggere. Il modello deve portare avanti ciò che è già accaduto e, quando piccoli errori si accumulano in una sessione lunga, correggerli invece di sommarli.
- Fare tutto questo dal vivo. Il budget di latenza deve restare abbastanza stretto da far sentire l’esperienza interattiva.
Sotto questi requisiti c’è una tensione più profonda. Il modo usuale per rendere un modello abbastanza veloce per il tempo reale è semplificarlo, e il modo usuale per renderlo più capace è renderlo più pesante e più lento. Velocità e capacità tirano in direzioni opposte. Il modo standard con cui il campo ha costruito questi sistemi aggrava il problema: una lunga catena di fasi di addestramento separate, ciascuna che passa il risultato alla successiva, con qualità e stabilità che si erodono a ogni passaggio.
La risposta di R2 è smettere di forzare una scelta tra velocità e capacità e dividere il lavoro in due fasi costruite sulla stessa base. Omni Causal AR è il motore della capacità e agisce come una spina dorsale addestrata in modo continuo. Fa crescere un singolo modello causale che continua a imparare su più dati, più tipi di input, più compiti e orizzonti temporali più lunghi, accumulando capacità in un solo punto invece di degradarla nei passaggi.
Lo strato di accelerazione in tempo reale prende poi quello stesso modello e lo comprime per farlo girare dal vivo, invece di addestrare da zero un modello veloce separato. Così i guadagni di capacità non arrivano più a spese della velocità.

Come R2 sostituisce la pipeline di addestramento convenzionale a più fasi, in cui la qualità si erode a ogni passaggio, con un singolo modello addestrato in continuo e compresso per l’uso in tempo reale.
Intorno a queste due fasi c’è un insieme di scelte ingegneristiche mirate che fanno arrivare ogni guadagno di capacità al prodotto in tempo reale. Il rapporto tecnico completo di PixVerse R2 include l’architettura e i dettagli di valutazione.
«I grandi modelli linguistici hanno mostrato che la scala è una strada affidabile verso la capacità», ha detto Changhu Wang, cofondatore e CEO di PixVerse. «R2 è il nostro caso che i modelli di mondo in tempo reale possono seguire una strada simile: con l’architettura giusta, un modello può diventare più capace senza rinunciare all’interazione in tempo reale. Nel tempo, è così che uno strumento di creazione diventa un ambiente in cui le persone possono entrare e che possono plasmare.»
Dal modello di mondo a giochi giocabili
R2 è passato da una dimostrazione di ricerca a qualcosa su cui si possono costruire prodotti reali. Il PixVerse Game Engine, lanciato per la prima volta a luglio 2026, ora gira su R2.

Chow Li, responsabile di PixVerse Games, presenta il motore di gioco in tempo reale di PixVerse alla Tech in Asia Conference, settembre 2026.
Presentando alla Tech in Asia Conference a settembre, il responsabile dei giochi di PixVerse, Chow Li, lo ha inquadrato come un cambiamento di ciò che un gioco può essere. Gli elementi che tradizionalmente facevano di un gioco un gioco — personaggi, mondi e le scelte di un giocatore — smettono di essere asset fissi costruiti in anticipo. Un giocatore può ora dire ciò che vuole e vederlo accadere, e l’esperienza prende forma attraverso il gioco invece di essere scritta prima. Creare il mondo e giocarlo diventano lo stesso atto.

Jaden Xie, cofondatore e presidente di PixVerse, parla a un panel al Google AI App Day di Singapore, settembre 2026.
A un panel del Google AI App Day a Singapore, il cofondatore e presidente Jaden Xie ha indicato i progressi dei modelli video come un forte motore per la prossima ondata di giochi nativi dell’IA. «Ciò che entusiasma è ciò che i creator stanno costruendo sul nostro modello di mondo da quando abbiamo aperto la beta a luglio», ha detto Jaden. «Crediamo che i nostri modelli video permetteranno a più creator di dare vita alle proprie idee.»
Disponibilità
Una raccolta di questi mondi è ora aperta all’esplorazione su world.pixverse.video.
Informazioni su PixVerse
PixVerse è una piattaforma globale di generazione video con IA, scelta da oltre 150 milioni di utenti in più di 177 Paesi. Con una suite di modelli proprietari sviluppati interamente in casa, PixVerse permette a chiunque di creare video di qualità cinematografica da un prompt, una foto o una clip. A gennaio 2026 PixVerse ha lanciato R1, il primo modello di mondo in tempo reale, trasformando il video in un flusso infinito, continuo e interattivo. R2 si appoggia a quella base e scala il modello di mondo in tempo reale per sessioni più lunghe e più coerenti. I team sono distribuiti tra Asia e Stati Uniti. PixVerse è stata fondata nel 2023 con l’impegno di rendere il video la lingua universale dell’espressione umana. A marzo 2026 PixVerse ha chiuso il round Series C, raggiungendo lo status di unicorno. Per maggiori informazioni, visitare pixverse.ai.
Risorse correlate
- PixVerse R2: Scalare modelli di mondo Omni in tempo reale
- Analisi di PixVerse Game Engine: Gaming interattivo in tempo reale
- PixVerse lancia R1: il primo modello di mondo AI in tempo reale
- Esplora i mondi R2
Fonte ufficiale: PixVerse.