PixVerse R2: Menskalakan Model Dunia Omni Masa Nyata
PixVerse R1 memperkenalkan dan mengeluarkan model dunia video masa nyata yang pertama, mengubah penjanaan video daripada penghantaran sekali bagi klip tetap kepada dunia yang berjalan secara berterusan. Model ini boleh terus menerima input pengguna, mengemas kini keadaan dunia dalam masa nyata, dan menstrim audio serta video yang disegerakkan dan kekal konsisten dengan interaksi. R1 menunjukkan bahawa paradigma teknikal ini boleh berfungsi.
PixVerse R2 menjawab soalan seterusnya: bagaimana model dunia video masa nyata terus diskala. R2 menumpukan pada dua matlamat. Pertama, ia membina dunia dinamik yang dapat memegang keadaan bersatu merentas ufuk panjang, menukar prior spatiotemporal penuh kepada evolusi dunia yang hanya bergerak ke hadapan dalam masa. Kedua, ia terus menghayati kausaliti fizikal dan isyarat interaksi daripada teks, rujukan, audio, dan tindakan ke dalam satu model, supaya dunia boleh menjana, menerima kawalan, dan mengemas kini keadaan pada masa yang sama sambil menstrim audio dan video yang disegerakkan.
Di sekitar matlamat itu, R2 menukar pertumbuhan dalam model, data, tugas, isyarat kawalan, dan skala masa kepada peningkatan dalam kualiti penjanaan, kekonsistenan jarak jauh, dan kawalan multimodal.
Rangka Kerja Keseluruhan
R2 meruntuhkan sistem kepada dua lapisan teras: Omni Causal AR dan Pecutan Masa Nyata. Omni Causal AR terus memperluas penjanaan dunia berkualiti tinggi, multimodal, dan berufuk panjang. Pecutan Masa Nyata mewarisi keupayaan itu sehilang mungkin di bawah bajet latensi interaksi yang ketat. Laluan ini jelas: naikkan siling keupayaan model dunia, kemudian pecutkan keupayaan itu ke dalam julat operasi masa nyata dan interaktif.
Talian paip video panjang dan masa nyata yang lebih lama biasanya merantai banyak peringkat latihan: menukar model dwiarah kepada model AR, membina guru penyulingan daripada model dwiarah khusus tugas, menjalankan penyulingan DMD, kemudian menambah DMD self-rollout untuk menutup jurang latihan-inferens. Setiap peringkat perlu memindahkan semula keupayaan, menjajarkan semula objektif, dan memadankan semula taburan data. Kualiti gambar, gerakan, pematuhan syarat, dan kestabilan ufuk panjang boleh terhakis semasa pemindahan itu. Apabila skala model, data, dan tugas berkembang, talian paip berbilang peringkat memecahkan sasaran pengoptimuman dan menaikkan kedua-dua kos latihan serta kerumitan sistem.

Rajah 1. Talian paip berbilang peringkat lama berbanding pemodelan dunia penskalaan PixVerse R2. R2 menumpu pengembangan keupayaan dan penyulingan masa nyata ke dalam Omni Causal AR dan lapisan pecutan masa nyata, menyatukan pemodelan berbilang tugas, berbilang isyarat, dan video panjang dalam satu rangka kerja.
PixVerse R2 mencadangkan paradigma latihan bersatu untuk model dunia masa nyata. Daripada berulang kali memindahkan keupayaan merentas banyak model dan peringkat tugas, ia mengurangkan talian paip yang kompleks kepada dua proses yang boleh terus diskala: terus melatih Omni Causal AR yang memegang keadaan dunia bersatu, kemudian menyulingnya terus ke dalam model dipercepat yang boleh menjana dalam masa nyata sambil mewarisi kekonsistenan ruang dan pemodelan ufuk panjang.
Sempadan peringkat yang lebih sedikit mengurangkan kehilangan keupayaan yang datang daripada guru bebas, penjajaran tugas, dan pemindahan model yang berulang. Data, tugas, isyarat kawalan, dan skala model baharu boleh ditukar dengan lebih langsung kepada keupayaan pemodelan dunia masa nyata.
Peringkat 1: pra-latihan berterusan Omni Causal AR. R2 tidak lagi menganggap prior penjanaan dwiarah dan AR video panjang sebagai dua peringkat yang terputus. Ia terus melatih Omni Causal AR bersatu di atas keupayaan model dwiarah. Chunk dinamik memberi bentuk data yang berbeza perwakilan temporal yang dikongsi: model boleh menyerap video pendek berkualiti tinggi dan data multimodal daripada pra-latihan dwiarah, dan ia boleh berkembang kepada video panjang berterusan serta trajektori interaksi berbilang pusingan. Kualiti gambar, ekspresi audiovisual, penjanaan ufuk panjang, dan kawalan berbilang isyarat boleh diskala dalam satu model dan bukannya dipindahkan semula melalui penukaran berulang.
Peringkat 2: suling lapisan pecutan masa nyata daripada Omni Causal AR yang diskala. Pra-latihan berterusan memberi Omni Causal AR penjanaan berkualiti tinggi, pemindahan keadaan ufuk panjang yang stabil, dan pelancaran kausal sebenar pada masa yang sama. R2 kemudian menggunakan Omni Causal AR yang sama untuk kedua-dua pemulaan ODE pelajar dan guru penyulingan, supaya guru, pelajar, dan inferens AR sebenar berkongsi asas pemodelan kausal yang konsisten. Penyulingan masa nyata menjadi “pecutan beberapa langkah bagi model dunia sedia ada,” bukan “mempelajari semula dunia berufuk panjang.”
Omni Causal AR
R2 meneruskan laluan input multimodal, penjanaan autoregresif, dan interaksi masa nyata yang telah disahkan R1, kemudian menumpukan keupayaan itu ke dalam laluan latihan Omni Causal AR yang disatukan. Omni Causal AR menukar prior penjanaan spatiotemporal penuh kepada pemindahan keadaan dunia yang hanya bergerak ke hadapan dalam masa. Melalui kausalisasi dan pra-latihan berterusan, model mengekalkan keupayaan gambar, gerakan, audio, dan semantik multimodal sambil belajar meramal chunk audiovisual disegerakkan seterusnya daripada sejarah sahaja.
Apabila objek latihan berkembang daripada video pendek bebas kepada video panjang berterusan dan trajektori interaksi berbilang pusingan, model secara beransur membina kausaliti jangka panjang antara keadaan dunia sejarah, input interaksi semasa, dan evolusi dunia masa depan.
Model ini serentak menerima gesaan teks, rujukan multimodal, isyarat tindakan (contohnya WASD atau kawalan berterusan), dan audio, lalu mengeluarkan video dan audio yang disegerakkan. Isyarat kawalan yang berbeza boleh terus masuk ke model semasa satu larian dan mengubah keadaan dunia yang kemudian. R2 bukan sekadar bertindak balas terhadap syarat sekali tembakan; ia boleh menjana, menerima kawalan, dan mengemas kini dunia pada masa yang sama.
Untuk mengekalkan penjanaan kausal dalam dunia yang sama sepanjang larian panjang, R2 menangani empat masalah: jurang taburan latihan-inferens, keteguhan terhadap sejarah bising, penyelarasan memori jangka panjang dan terkini, serta pembetulan keadaan ralat. Hybrid Teacher / Diffusion Forcing membolehkan model menyesuaikan diri kepada sejarah bersih dan bising. Multi-Timescale Memory menyimpan bersama sauh dunia, dinamik terkini, dan keadaan objek. Error Bank membawa keadaan gagal kembali ke dalam latihan. Bersama-sama, ia membentuk gelung latihan untuk keadaan dunia jangka panjang dan mengurangkan hanyutan dalam gambar, watak, gerakan, hubungan audio-visual, dan tindak balas kawalan dari semasa ke semasa.

Rajah 2. PixVerse R2 Omni Causal AR. Model boleh terus menerima isyarat kawalan yang berbeza semasa satu larian. Pada setiap saat interaksi, isyarat aktif sejajar dengan ketulan audiovisual dinamik pada granulariti yang sepadan dan memacu segmen video serta audio seterusnya.
Penjanaan ketulan dinamik
Isyarat kawalan yang berbeza wujud pada skala masa yang berbeza. Gesaan dan rujukan biasanya menerangkan semantik penuh atau peristiwa yang lebih panjang. Tindakan (WASD) memerlukan maklum balas keadaan yang berbutir halus dan serta-merta. Audio membawa semantik, irama, dan penyegerakan masa sekaligus. Jika setiap input dipaksa ke dalam unit masa berpanjang tetap, model sering terpaksa mengimbangi kelajuan tindak balas dengan kelengkapan ungkapan.
Dynamic Chunk ialah cara R2 menyatukan skala masa interaksi itu. R2 secara adaptif membahagikan jujukan audiovisual mengikut sempadan semantik dan tempoh isyarat kawalan semasa, dengan saiz ketulan maksimum yang mengekang pengiraan dan kestabilan latihan. Ketulan pendek meningkatkan ketepatan tindak balas untuk tindakan dan arahan setempat. Ketulan panjang mengekalkan struktur penuh peristiwa, gerakan, dan semantik audiovisual. Tugas dan isyarat kawalan yang berbeza boleh berkongsi satu antara muka penjanaan kausal tanpa menukar struktur model.
Hybrid Teacher Forcing / Diffusion Forcing
Ketegangan teras dalam AR ufuk panjang ialah sejarah latihan biasanya lebih bersih, manakala sejarah masa jalan sebenar mengandungi hingar model sendiri dan ralat setempat. Latihan hanya pada sejarah bersih boleh menaikkan siling kualiti satu langkah tetapi menjadikan model terlalu sensitif terhadap sisihan kecil. Latihan hanya pada sejarah terganggu boleh menjejaskan kualiti gambar, gerakan, dan tindak balas kawalan.
R2 mencampurkan sejarah bersih dan sejarah bising dalam satu proses latihan. Sejarah bersih menstabilkan siling kualiti evolusi dunia. Sejarah bising membolehkan model menyesuaikan diri lebih awal kepada keadaan tidak sempurna yang akan dilihatnya semasa penggunaan. Latihan yang saling melengkapi mengecilkan jurang latihan-inferens, supaya model boleh menjana segmen dunia seterusnya yang berkualiti tinggi dan terus maju apabila sejarah sudah mengandungi ralat kecil.
Causal Attention Mask dan Relative Temporal RoPE bersama-sama mengekang sejarah mana yang boleh dibaca oleh keadaan semasa dan di mana sejarah itu berada dalam tetingkap semasa. Attention Mask menguatkuasakan keterlihatan kausal yang ketat. Temporal RoPE tidak membesar tanpa batas dengan ID blok global; ia diindeks semula mengikut slot relatif di dalam tetingkap perhatian semasa. Apabila tetingkap bergolek bergerak ke hadapan, masa sebenar terus maju, tetapi memori sink, sejarah terkini, dan ketulan semasa kekal dipetakan kepada julat kedudukan relatif yang stabil dan terhad.

Rajah 3. Topeng perhatian kausal bersatu dan RoPE temporal relatif untuk Hybrid Teacher / Diffusion Forcing. Bahagian atas menunjukkan keterlihatan kausal bagi dua pembinaan sejarah. Bahagian bawah memetakan pertanyaan wakil kepada blok Q/K, slot relatif, dan ID RoPE, menunjukkan bahawa ID blok sebenar terus maju manakala koordinat masa dalam tetingkap kekal terhad.
Memori berbilang skala masa
Pemodelan dunia jangka panjang tidak boleh sekadar mengingati semua sejarah. Sejarah tanpa batas menaikkan kos pengiraan dan memori dengan cepat; pemotongan berlebihan menggugurkan identiti watak, susunan adegan, dan peristiwa utama. R2 membina sistem memori berbilang skala daripada Sink Memory, Rolling History, dan Object KV Cache.
- Sink Memory menyimpan sauh jangka panjang seperti watak, adegan, gaya, dan peraturan dunia.
- Rolling History menumpukan pada tindakan, pose, kamera, dan perubahan persekitaran terkini supaya keadaan setempat boleh bersambung secara semula jadi.
- Object KV Cache menggunakan semula dan memampatkan perwakilan sejarah peringkat objek yang sudah dikira, mengekalkan keadaan yang benar-benar mempengaruhi evolusi kemudian dalam bajet yang terhad.
Ketiganya bersama-sama memberikan kestabilan identiti jangka panjang, kesinambungan gerakan jarak dekat, dan kos masa jalan yang boleh dikawal, serta mengurangkan hanyutan watak, lompatan adegan, kelipan antara ketulan, dan tindakan yang terputus.
Error Bank
Hanyutan serius dalam model dunia AR sering bermula daripada ralat awal yang kecil yang ditulis ke dalam sejarah lalu diwarisi. R2 membina Error Bank yang menyimpan sejarah ralat wakil sebagai sampel boleh guna semula dan memainkannya semula ke dalam sejarah biasa pada kadar yang ditetapkan semasa latihan. Model bukan lagi hanya belajar cara meneruskan daripada keadaan ideal; ia juga belajar cara mengenali, menyerap, dan membaiki sejarah yang sudah hanyut.
Dalam penilaian berperingkat, metrik hanyutan kecerahan jangka panjang jatuh daripada 0.201 kepada 0.129, kira-kira penurunan 35.8%. Daripada 29 sampel jujukan panjang, 20 bertambah baik, dan kesemua 5 sampel yang secara jelas sepatutnya kekal pegun mengurangkan gerakan yang salah.
Pecutan Masa Nyata
Pecutan masa nyata R2 tidak mempelajari semula dunia ufuk panjang di dalam model beberapa langkah. Ia mempercepatkan model dunia yang sudah boleh berjalan dengan stabil untuk masa yang lama. Lapisan pecutan bermula daripada Omni Causal AR yang dipralatih secara berterusan dan menggunakannya untuk pengawalan ODE pelajar serta guru penyulingan, supaya guru, pelajar, dan inferens AR sebenar berkongsi taburan trajektori kausal yang konsisten.
Titik permulaan kausal bersatu itu mengurangkan kebergantungan pada penalaan gaya Self-Forcing dan Rolling Forcing. Pecutan masa nyata boleh menumpukan pada masalah yang benar-benar diperkenalkan oleh kelajuan beberapa langkah: DDMD dengan regularisasi adversarial mengendalikan penjajaran syarat, taburan penjanaan, dan realisme semasa penyulingan; perhatian jarang blok memampatkan pengiraan konteks panjang; dan laluan piramid menurunkan kos penjanaan resolusi tinggi.
DDMD dengan regularisasi adversarial
Dalam penjanaan langkah ultra-sedikit, penjajaran syarat, pemadanan taburan, dan realisme bukan masalah pengoptimuman yang sama. R2 berasaskan DDMD dan seterusnya memperkenalkan regularisasi adversarial daripada DMD2. Tiga isyarat latihan bertemu dalam satu pelajar: penjajaran syarat mengukuhkan kawalan, pemadanan taburan mengekalkan taburan guru, dan regularisasi adversarial menambat data sebenar, supaya beberapa langkah pensampelan boleh mengekalkan kedua-dua tindak balas interaksi yang tepat dan dunia yang boleh dipercayai.
Perhatian jarang blok
R2 menggunakan perhatian jarang blok pada jujukan token ruang-masa. Model membahagikan Q, K, dan V kepada blok pengiraan, dengan cepat menganggarkan blok kunci/nilai mana yang paling diperlukan oleh setiap blok pertanyaan, mengekalkan hanya sambungan skor tertinggi, dan menjalankan perhatian softmax tepat pada blok terpilih itu. Penghalaan peringkat blok bukan pemangkasan rawak; ia menumpukan pengiraan pada kebergantungan kuat antara kawalan multimodal semasa, gerakan terkini, dan keadaan dunia utama.
Dengan menyesuaikan model kepada struktur sambungan jarang semasa latihan, R2 menaikkan kejarangan perhatian melebihi 90% sambil mengekalkan kualiti gambar, kesinambungan tindakan, pematuhan syarat, dan kestabilan ufuk panjang tanpa penurunan yang jelas dalam penilaian semasa.
Penyulingan piramid langkah ultra-sedikit
Melakukan semua pemodelan dunia dari awal dalam ruang resolusi tinggi membazirkan pengiraan pada struktur global yang sudah boleh ditentukan oleh resolusi lebih rendah. R2 mengatur penjanaan sebagai satu atau dua peringkat resolusi rendah serta satu peringkat resolusi tinggi. Peringkat resolusi rendah menetapkan susun atur adegan, gerakan subjek, dan struktur kamera. Peringkat resolusi tinggi memulihkan tekstur, tepi, dan butiran setempat. Laluan kasar-ke-halus memotong pengiraan resolusi tinggi yang berulang sambil mengekalkan kestabilan struktur dan butiran yang lebih kukuh.
Kesimpulan dan Had
PixVerse R1 mencadangkan dan melancarkan model dunia video masa nyata yang pertama, menunjukkan bahawa video boleh bergerak daripada kandungan tetap luar talian kepada dunia dinamik yang boleh berinteraksi dalam masa nyata dan terus berjalan. PixVerse R2 kemudian menyelesaikan cara paradigma itu terus berskala: Omni Causal AR bersatu membawa data, tugas, modaliti, dan skala masa yang berkembang, dan Real-Time Acceleration membawa keupayaan pemodelan dunia penuh ke dalam inferens beberapa langkah masa nyata.
R2 bukan naik taraf keupayaan satu titik. Ia ialah laluan latihan bersatu untuk generasi seterusnya model dunia masa nyata. R1 menjadikan model dunia video masa nyata suatu kenyataan. R2 meletakkannya ke dalam peringkat bersatu, boleh skala, dan sentiasa bertambah baik.
Di bawah bajet pengiraan masa nyata dan kependaman interaksi yang ketat, kualiti penjanaan tunggal semasa masih ada ruang untuk bertambah baik berbanding model video luar talian terkemuka, terutamanya dalam butiran adegan kompleks, kelaziman gerakan, kekonsistenan fizikal, dan kestabilan sepanjang larian panjang. Jurang itu lebih kerap mencerminkan peringkat penskalaan semasa R2 daripada siling rangka kerja itu sendiri.
Akses Awal
Setakat 23 Ogos 2026, laporan ini menggambarkan PixVerse R2 sebagai ujian tertutup. Pada 22 September 2026, PixVerse mengumumkan bahawa koleksi dunia ini terbuka untuk diteroka di world.pixverse.video. Lihat pengumuman pelancaran R2.
Pengumuman itu tidak membuka akses API tanpa sekatan. Borang pengalaman model dunia PixVerse R2 kekal sebagai laluan permintaan untuk pengalaman awal dan akses API.
Sumber Berkaitan
- PixVerse R1 Dijelaskan: Model Dunia Video AI Masa Nyata
- Selaman Mendalam Enjin Permainan PixVerse
- PixVerse Mengemas Kini R1 dengan Dunia Dikongsi
- Panduan Penjanaan Video AI Masa Nyata
- PixVerse Menutup Sambungan Siri C
Dunia daripada pengumuman 22 September 2026 terbuka untuk diteroka di world.pixverse.video. Akses API masih diminta melalui borang di atas. Anda juga boleh mencipta dengan PixVerse V6 dan R1 hari ini.