PixVerse-R1: модель світу реального часу наступного покоління
PixVerse-R1: модель світу реального часу наступного покоління
Анотація
Ми представляємо PixVerse-R1, модель світу реального часу наступного покоління, побудовану на нативній мультимодальній базовій моделі. Ця система забезпечує генерацію відео в реальному часі, де візуальний вміст миттєво й плавно реагує на введення користувача. Подолавши властиву затримку та обмеження фіксованої довжини традиційних відеоробочих процесів, PixVerse-R1 перетворює генерацію відео на нескінченний, безперервний та інтерактивний візуальний потік. Це значна еволюція у створенні, переживанні та поширенні аудіовізуальних медіа, що позначає зміну парадигми в бік інтелектуальних інтерактивних медіа, здатних миттєво адаптуватися відповідно до наміру користувача.
Готові спробувати R1? Перегляньте наше оголошення про запуск PixVerse R1, щоб отримати практичну інформацію, та як отримати інвайт-код, щоб отримати доступ до R1.
1. Вступ
Ландшафт цифрових медіа принципово зміщується від статичного, попередньо відрендереного контенту до динамічних інтерактивних досвідів. Звичайні продакшен-конвеєри історично були обмежені високою затримкою та кліпами фіксованої довжини, створюючи дихотомію між створенням контенту та споживанням у реальному часі.
Щоб усунути ці обмеження, ми представляємо нову архітектуру моделі світу, яка об’єднує нативну мультимодальну базову модель, авторегресійний механізм узгодженості та рушій миттєвого відгуку. Цей уніфікований підхід дає змогу спільно обробляти просторово-часові патчі разом із текстовими та аудіоданими, фактично розбираючи традиційні силоси обробки медіа. Завдяки розгортанню системи, здатної до нескінченного стримінгу через авторегресійний механізм і рушій миттєвого відгуку, згенерований світ залишається фізично узгодженим на довгих горизонтах за низьких обчислювальних витрат.
Ключова можливість: використовуючи цю архітектуру, наша система досягає прориву в продуктивності, генеруючи відео високої роздільності до 1080P у реальному часі. Ця можливість підвищує візуальну точність і уможливлює ігри, створені для ШІ, та інтерактивне кіно, де середовища й наративи динамічно еволюціонують у відповідь на взаємодію користувача. У ширшому сенсі це дає змогу генеративним системам функціонувати як сталі інтерактивні світи, а не як скінченні медіаартефакти, вказуючи на траєкторію до безперервних, станутримуючих та інтерактивних аудіовізуальних симуляцій.
2. Технічна архітектура
2.1 Omni: нативна мультимодальна базова модель
Щоб досягти загальних можливостей, ми вийшли за межі традиційних конвеєрів генерації, спроєктувавши повністю наскрізну нативну мультимодальну базову модель.
- Уніфіковане представлення: Omni-модель об’єднує різноманітні модальності (текст, зображення, відео, аудіо) в безперервний потік токенів, що дає їй змогу приймати довільні мультимодальні входи в межах єдиного каркаса.
- Наскрізне навчання: уся архітектура навчається на гетерогенних задачах без проміжних інтерфейсів, що запобігає поширенню помилок і забезпечує надійну масштабованість.
- Нативна роздільність: у цьому каркасі ми використовуємо навчання на нативній роздільності, щоб уникати артефактів, типово пов’язаних із кадруванням або зміною розміру.
Крім того, модель інтерналізує внутрішні фізичні закони та динаміку реального світу, навчаючись на величезному корпусі відеоданих реального світу. Це фундаментальне розуміння дає системі змогу синтезувати узгоджений, чутливий «паралельний світ» у реальному часі.
Omni-модель ефективно масштабується, функціонуючи не просто як генеративний рушій, а як піонерський крок до побудови симуляторів фізичного світу загального призначення. Розглядаючи задачу симуляції як єдину наскрізну парадигму генерації, ми сприяємо дослідженню світів, згенерованих ШІ, у реальному часі та на довгому горизонті.

Рисунок 1. Наскрізна архітектура нашої нативної мультимодальної базової моделі Omni; уніфікований дизайн дає Omni-моделі змогу приймати довільні мультимодальні входи та одночасно генерувати аудіо й відео.
2.2 Пам’ять: узгоджений нескінченний стримінг через авторегресійний механізм
На відміну від стандартних методів дифузії, обмежених скінченними кліпами, PixVerse-R1 інтегрує авторегресійне моделювання, щоб уможливити нескінченний безперервний візуальний стримінг, і включає механізм уваги з доповненням пам’яті, щоб згенерований світ залишався фізично узгодженим на довгих горизонтах.
- Нескінченний стримінг: формулюючи синтез відео як авторегресійний процес, модель послідовно передбачає наступні кадри, щоб досягти безперервного, необмеженого візуального стримінгу.
- Часова узгодженість: механізм уваги з доповненням пам’яті зумовлює генерацію поточного кадру латентними представленнями попереднього контексту, забезпечуючи фізичну узгодженість світу на довгих горизонтах.

Рисунок 2. Інтегроване авторегресійне моделювання з базовою моделлю Omni.
2.3 1080P у реальному часі: рушій миттєвого відгуку
Хоча ітеративне знешумлення зазвичай забезпечує високу якість, його обчислювальна щільність часто заважає роботі в реальному часі. Щоб розв’язати це й досягти генерації в реальному часі у високій роздільності (до 1080P), ми перебудували конвеєр у рушій миттєвого відгуку.
IRE оптимізує процес семплінгу завдяки таким удосконаленням:
- Згортання часової траєкторії: реалізуючи Direct Transport Mapping як структурний пріор, мережа безпосередньо передбачає чистий розподіл даних. Це скорочує кроки семплінгу з десятків до лише 1–4, створюючи спрощений шлях, необхідний для наднизької затримки.
- Ректифікація гайденсу: ми обходимо накладні витрати семплінгу Classifier-Free Guidance, зливаючи умовні градієнти в модель-учня.
- Адаптивна розріджена увага: це зменшує надлишковість далекосяжних залежностей, даючи ущільнений обчислювальний граф, який додатково сприяє реалізації генерації 1080P у реальному часі.

Рисунок 3. Рушій миттєвого відгуку складається з трьох модулів: згортання часової траєкторії, ректифікація гайденсу та навчання адаптивної розрідженої уваги.
3. Застосування та соціальний вплив
PixVerse-R1 запроваджує новий генеративний медіум: аудіовізуальні системи реального часу, безперервні та зі станом. На відміну від попередньо відрендереного відео, цей медіум працює як сталий процес, що миттєво реагує на намір користувача, де генерація та взаємодія тісно пов’язані. Цей новий медіум уможливлює широкий клас інтерактивних систем, включно з, але не обмежуючись:
-
Інтерактивні медіа
- Ігри, створені для ШІ, та інтерактивні кінематографічні досвіди
- VR/XR у реальному часі та імерсивні симуляції
-
Творчі та освітні системи
- Адаптивне медіамистецтво та інтерактивні інсталяції
- Середовища навчання й тренування в реальному часі
-
Симуляція та планування
- Експериментальні дослідження та дослідження сценаріїв
- Промислові, сільськогосподарські та екологічні симуляції
Окрім конкретних застосувань, PixVerse-R1 функціонує як безперервний симулятор аудіовізуального світу, скорочуючи відстань між людським наміром і відповіддю системи та уможливлюючи нові форми спільної творчості людини й ШІ в сталих цифрових середовищах.
4. Висновок
PixVerse-R1 запроваджує генеративний каркас реального часу, який долає властиві обмеження традиційних відеоробочих процесів завдяки архітектурним інноваціям у мультимодальній обробці та миттєвому відгуку. Забезпечуючи узгоджену генерацію в реальному часі, ця модель позначає значну еволюцію у створенні та переживанні аудіовізуальних медіа. Зсув до затримки реального часу уможливлює перехід від споживання статичного контенту до взаємодії з динамічним середовищем, надаючи масштабований обчислювальний субстрат для застосунків від ігор, створених для ШІ, до складних промислових симуляцій. Долаючи розрив між наміром користувача та миттєвим візуальним зворотним зв’язком, система встановлює новий рубіж для інтерактивного моделювання світів і середовищ співпраці людини та ШІ.
5. Обмеження
Хоча PixVerse-R1 пропонує значні переваги моделювання, зберігаються два основні обмеження щодо часової точності та фізичної достовірності:
- Накопичення часових помилок: у тривалих послідовностях дрібні помилки передбачення можуть накопичуватися, потенційно підриваючи структурну цілісність симуляції.
- Компроміс між фізикою та обчисленнями: щоб успішно досягти генерації в реальному часі, було зроблено конкретні жертви щодо складності генерації. Відповідно, може бути певний ступінь втрати в точному відтворенні деяких фізичних законів порівняно з моделями нереального часу.