Блоги

PixVerse R1: архітектура та бачення моделі світу реального часу наступного покоління

Востаннє оновлено
PixVerse R1: архітектура та бачення моделі світу реального часу наступного покоління

PixVerse R1 — перша розгорнута в продакшені модель світу реального часу: система, що генерує безперервне інтерактивне відео, а не ізольовані кліпи. Ця стаття розглядає технічну архітектуру, яка робить R1 можливим, філософію дизайну за його розробкою та те, як модель дозріла від початкового релізу.

Проблема, яку розв’язує R1

Стандартна генерація ШІ-відео йде за шаблоном запит–відповідь: надіслати промпт, дочекатися обробки, отримати статичний кліп. Цей робочий процес дає вражаючі окремі результати, але накладає фундаментальне обмеження: згенерований контент інертний. Ви його дивитеся; ви в ньому не перебуваєте.

R1 спроєктовано з нуля, щоб усунути це обмеження. Замість скінченного відеофайлу R1 генерує стійкий інтерактивний візуальний потік — світ, який існує й еволюціонує у відповідь на введення користувача в реальному часі.

Це не поступове вдосконалення генерації кліпів. Це інша обчислювальна задача з іншими архітектурними вимогами, і вона потребує іншого способу оцінювання якості. Відповідність промпту та опрацьованість кожного кліпу й далі важливі для разових відео, але світову модель оцінюють за затримкою, пам’яттю та тим, наскільки добре вона тримається разом протягом тривалої сесії.

Трикомпонентна архітектура

Архітектура R1 складається з трьох взаємопов’язаних систем, кожна з яких розв’язує конкретну задачу генерації світу в реальному часі:

1. Базова модель Omni

Основою R1 є омнінативна мультимодальна модель, яка обробляє візуальні, аудіо- та інтеракційні дані в межах єдиної архітектури. На відміну від конвеєрних підходів, які спрямовують різні модальності через окремі моделі й згодом об’єднують їхні результати, Omni Foundation виконує міжмодальне міркування всередині себе, розглядаючи текст, зображення, відео та аудіо як один безперервний потік токенів, а не як чотири окремі завдання, зшиті разом.

Така уніфікована обробка є необхідною для роботи в реальному часі. Багатомодельні конвеєри додають затримку в кожній точці передавання, і кожне передавання — це також місце, де можуть проникати помилки, коли інформацію перекладають між системами. Коли вимога — час відгуку менше секунди, ці мілісекунди складаються в помітну затримку, а втрати під час перекладу — у видимі артефакти. Навчання Omni Foundation від початку до кінця на даних нативної роздільності, а не на обрізаних чи змінених за розміром входах, усуває обидві проблеми в джерелі: немає міжмодельної затримки, яку треба усувати, і немає шва, де припущення однієї моделі стикаються з припущеннями іншої.

2. Авторегресійний механізм із доповненням пам’яті

Генерація світу в реальному часі вимагає, щоб система пам’ятала те, що вона вже згенерувала. Якщо користувач дивиться ліворуч, досліджує кімнату, а потім знову дивиться праворуч, раніше згенерований вміст має залишатися на місці — узгодженим із тим, що було відрендерено кілька миттєвостей тому, а не тихо перегенерованим у щось трохи інше.

Механізм уваги з доповненням пам’яті R1 підтримує стан середовища вздовж часової шкали генерації. Це реалізовано як авторегресійний процес: кожен новий кадр зумовлений не лише поточним входом, а й накопиченою пам’яттю всього раніше згенерованого вмісту, а не вибирається як незалежна подія так, як це було б для окремого кліпу.

Результатом є узгодженість на довгому горизонті — згенерований світ залишається самоузгодженим протягом тривалих сесій, навіть коли користувачі досліджують, взаємодіють і повертаються до раніше згенерованих ділянок. Це також найскладніша відкрита дослідницька проблема в цій галузі: незалежні роботи щодо інтерактивних відеомоделей світу вказували на накопичення помилок передбачення та недостатню пам’ять як на центральні перешкоди для тривалої інтерактивної генерації, а дизайн пам’яті R1 побудований безпосередньо навколо цього режиму відмови, а не в обхід нього.

3. Рушій миттєвого відгуку

Найвимогливіший з технічного погляду компонент. Стандартні дифузійні моделі потребують десятків кроків семплінгу, щоб створити один кадр — надто повільно для взаємодії в реальному часі. Рушій миттєвого відгуку R1 скорочує це до жменьки кроків семплінгу на кадр завдяки трьом узгодженим методам:

  • Згортання часової траєкторії стискає процес дифузії, використовуючи часову надлишковість: послідовні кадри в безперервному відеопотоці мають значну спільну візуальну складову. Замість того щоб генерувати кожен кадр з нуля, рушій використовує структурний пріор — фактично відображення в бік чистого розподілу виходу — тож стан попереднього кадру виконує більшу частину роботи, різко скорочуючи кількість нових потрібних кроків семплінгу.
  • Ректифікація гайденсу вбудовує ефект classifier-free guidance безпосередньо в саму модель генерації, тож системі не потрібно виконувати окремий прохід гайденсу поверх кожного кроку семплінгу.
  • Адаптивна розріджена увага відсікає надлишкові далекосяжні залежності в обчисленні уваги, зберігаючи обчислювальний граф легшим у міру того, як сесія триває, замість того щоб він важчав із кожним додатковим кадром контексту.

Цей підхід обмінює невелику кількість візуальної новизни на кадр на величезний виграш у швидкості генерації — саме той компроміс, який потрібен для взаємодії в реальному часі, де часова плавність важливіша за те, наскільки будь-який окремий кадр відрізняється від попереднього.

Компроміси дизайну

Архітектура R1 передбачає свідомі компроміси, які відображають її пріоритети реального часу:

Накопичення помилок — авторегресійна генерація накопичує дрібні помилки з часом. Кожен кадр спирається на попередній, і недоліки можуть складатися. R1 пом’якшує це за допомогою періодичних механізмів корекції в системі пам’яті, але в тривалих сесіях усе одно може проявлятися поступовий дрейф у сталості об’єктів або структурі сцени порівняно з неавторегресійною генерацією.

Стеля роздільності — обмеження реального часу накладають практичні межі роздільності. Вища роздільність потребує більше обчислень на кадр, що безпосередньо тисне на бюджет генерації в реальному часі. Початкова дослідницька архітектура R1 цілила в 1080p у реальному часі як стелю цього компромісу; роздільність, фактично доступна через певну поверхню, усе ще залежить від шляху доступу, оскільки вебдосвід, сесія спільного світу та партнерська кінцева точка API можуть відкривати різні межі. Кожен, хто планує продакшен-інтеграцію, має звіряти поточні цифри з живим продуктом, а не вважати одну величину фіксованою для кожної поверхні.

Різноманітність проти узгодженості — згортання часової траєкторії, яке забезпечує швидкість, також означає, що послідовні кадри візуально корельовані сильніше, ніж у стандартній генерації. Це бажана поведінка для сталого світу (узгодженість потрібна), але це означає, що R1 дає менше візуальної різноманітності на одиницю генерації порівняно з моделлю на основі кліпів.

Ці компроміси — інженерні вибори, а не обмеження. R1 оптимізується під іншу цільову функцію, ніж моделі генерації кліпів, і її дизайн точно відображає цей пріоритет.

Де R1 стоїть поруч із V6 і C1

PixVerse тепер охоплює дві різні творчі задачі, і варто прямо сказати, яка модель відповідає на яке питання. Якщо результат — це файл: соціальний кліп, продуктове відео, кінематографічний кадр, експорт із зображення у відео — PixVerse V6 і PixVerse C1 створені для такого робочого процесу, з керуванням на рівні промпту та кадру, націленим на готовий результат для завантаження. Якщо результат — це досвід, який продовжує відповідати після початку генерації: гра, шар прямого ефіру, XR-сцена, спільний багатокористувацький простір — це територія R1, і примусове використання моделі на основі кліпів у цій ролі не вловлює суті того, для чого існує модель світу.

Простий спосіб утримати цю відмінність: обирайте V6 або C1, коли вам потрібно щось експортувати; оцінюйте R1, коли вам потрібно, щоб щось продовжувало працювати.

Застосування

Архітектура R1 уможливлює категорію застосунків, які моделі на основі кліпів принципово не можуть обслуговувати:

  • Інтерактивні розваги — ігри, створені для ШІ, інтерактивне кіно та наративи, що генеруються в реальному часі, коли гравці роблять вибір
  • Навчання та симуляція — імерсивні середовища на основі сценаріїв, що генеруються на вимогу, включно з промисловими, сільськогосподарськими та екологічними симуляціями
  • Живий контент і спільні світи — стримінгові досвіди, що адаптуються до внеску аудиторії, та багатокористувацькі середовища, де учасники взаємодіють у тому самому згенерованому просторі
  • Творче та освітнє дослідження — відкрита генерація світів для митців і дизайнерів, а також адаптивні середовища навчання та тренування

Чесна оцінка R1

Оскільки моделі світу все ще є новою категорією, варто назвати практичні застереження поряд із можливостями: тривалі сесії все ще можуть дрейфувати, точність фізики свідомо обмінюється на швидкість, а доступна роздільність і функції різняться залежно від шляху доступу (вебдосвід порівняно з партнерським API). Порівняння бенчмарків з іншими моделями світу мають сенс лише тоді, коли вони враховують тривалість сесії, тип взаємодії та роздільність — а не лише одну заголовну цифру.

Погляд уперед

R1 — це перший крок у дослідницькому напрямі, який, на переконання PixVerse, визначатиме наступну еру контенту, згенерованого ШІ. Від першого запуску модель уже перейшла від дослідницької архітектури до живого вебдосвіду, партнерського шляху та API, а також розширених функцій спільних світів — свідчення того, що напрям розбудовується, а не лишається разовою демонстрацією. У міру зростання обчислювальної ефективності та продовження архітектурних інновацій якість, роздільність і складність світів, згенерованих у реальному часі, зростатимуть — потенційно наближаючись до точності попередньо відрендереного контенту за збереження інтерактивності в реальному часі.

Перехід від «ШІ генерує контент, який ви дивитеся» до «ШІ генерує світи, у яких ви перебуваєте» вже триває. R1 — це те місце, де він починається.

Пов’язані матеріали

→ Спробуйте R1 на PixVerse